値下げの原資を、AI自身が書いた──OpenAIがCodexにGPUカーネルを最適化させ、GPT-5.6を最大8割下げた

OpenAIがGPT-5.6のAPI料金をLuna最大8割・Terra2割下げた。原資は、コーディングエージェントCodexにGPUカーネルを自動で書き直させて得た効率改善。エージェントが本番インフラに踏み込んだ実例と、その値下げをどう読むかを整理する。

シェア
値下げの原資を、AI自身が書いた──OpenAIがCodexにGPUカーネルを最適化させ、GPT-5.6を最大8割下げた

OpenAIが2026年7月30日、GPT-5.6ファミリーのAPI料金を引き下げました。目を引くのは値下げ幅そのものより、その原資の出どころです。OpenAIは、自社のコーディングエージェント「Codex」に最上位モデルGPT-5.6 Solを載せ、推論を支えるGPUカーネルを自動で書き直させました。そこで生まれた効率改善の一部を、料金に還元したという説明です。コーディングエージェントが、いよいよ「自分たちが動く土台」そのものを触り始めた事例として読めます。

下がったのは「安いほう」だけ

今回の改定は全モデル一律ではありません。安価な下位・中位モデルを大きく下げ、フラッグシップのSolは据え置きました。100万トークンあたりの単価は次のとおりです。

モデル変更前(入力/出力)変更後(入力/出力)下げ幅
Luna(最速・最廉価)$1 / $6$0.20 / $1.20約80%
Terra(中位)$2.50 / $15$2 / $12約20%
Sol(最上位)$5 / $30据え置き

GPT-5.6の登場は7月9日でした。発表から三週間での大幅改定は、フロンティアモデルの「高くても選ばれる」という価格決定力が、競争のなかで急速に薄まっていることを示します。開発者向けにSimon Willison氏は、LunaがGoogleのGemini 3.1 Flash-LiteやAnthropicのClaude Haiku 4.5(入力で約5分の1)を下回った点に注目し、自身のデモ環境の一部をLunaへ乗り換えたと記しています。高頻度でトークンを消費するエージェント運用ほど、この差は効いてきます。

エージェントに、本番インフラのコードを書かせる

OpenAIの説明によれば、値下げを可能にした効率改善は主に二つの経路で生まれました。いずれも、人が指示だけ与えてAIに実作業を任せた形です。

  • GPUカーネルの書き換え: Codex上のGPT-5.6 Solが、推論の中核をなす行列積・アテンション計算などのカーネルを、OpenAIが保守するGPUプログラミング言語TritonとGluonで書き直しました。演算そのものは速くても、メモリ移動や同期の無駄でGPUが遊ぶ場面がある。そこを先読み計算・並列化・省略で詰め、エンドツーエンドの提供コストを約20%削ったとしています。
  • 投機的デコードの作り直し: Sol自身が、生成を先読みする「ドラフトモデル」を数百回の試行で設計し直し、トークン生成効率を15%超引き上げたと説明されています。

ここで実務的に重要なのは、丸投げではなかった点です。最適化の目的・使えるツール・本番投入の可否は人間のエンジニアが握り、AIが書いたカーネルコードは、OpenAIが公開する検証ツールFpSan(浮動小数点サニタイザー)で「計算結果が数学的に正しいか」を確かめてから投入したとされています。性能に直結する低レベルなコードほど、エージェントに任せる価値は大きい一方、生成物を機械的に検証する仕組みを前段に置く——という運用の型がうかがえます。書かせて終わりではなく、書かせた分だけ検証を厚くする発想です。

安くなるのは歓迎、だが手放しでは読めない

開発現場にとっての直接の恩恵は、高頻度・大量処理のエージェント運用がさらに回しやすくなることです。分類・要約・整形のような繰り返し作業を安いLunaに寄せ、難所だけ上位モデルに振る——というモデルの使い分けが、コスト面でいっそう現実的になります。

ただし、いくつか留保も指摘されています。第一に、AIが自らの動作環境を最適化し、その利益で自らの提供価格を下げるという循環は、目新しさの裏で「どこまで人が挙動を追えるか」という論点を残します。今回はあくまで実行環境の最適化であって、モデルの重み自体を書き換えたわけではなく、人の監督が要所に残った点は強調しておく必要があります。第二に、値下げ競争そのものの持続性です。OpenAIは7月22日に利用上限(支出キャップ)を導入しており、Amazonのコスト抑制など、業界全体で膨らむ推論コストへの警戒が同時に進んでいます。安さは競争の結果であって、恒久的な前提とは限りません。

もう一点、指標の読み方への注意も添えられています。今回あわせて公表されたARC-AGI-3のスコアが13.3%から38.3%へと三倍近く伸びた件について、OpenAI自身が「モデルの能力向上ではなく、ハーネス(実行時の設定・プロンプト提示)の変更による部分が大きい」と釘を刺しました。ベンチマークの数字は、モデル単体ではなくAPI設定や足回りまで含めて測っている——という当たり前の、しかし見落としやすい前提を、提供元が明示した形です。

コーディングエージェントの用途は、アプリのコードを書く段階から、それを動かすインフラのコードを書く段階へと広がりつつあります。今回はその最前線の一例です。要は「どこまで任せ、どこで検証を挟むか」の設計次第——という、これまでと同じ問いが、より高くつく領域に移っただけとも言えます。

参照: OpenAI「How GPT-5.6 fuses frontier intelligence with frontier efficiency」CNBC「OpenAI cuts prices for two of its GPT-5.6 AI models」VentureBeat「AI price wars: OpenAI cuts GPT-5.6 Luna prices by 80%」Simon Willison「Advancing the price-performance frontier with GPT-5.6」The New Stack「Kernel of truth: GPT-5.6 Sol can cut its own costs」

続きを読む

「一時間を超える処理」を待てるようにした──Codex 0.152が、MCPの出力量と実行時間に“上限のつまみ”を付け、計画ツールを既定オフに回した

「一時間を超える処理」を待てるようにした──Codex 0.152が、MCPの出力量と実行時間に“上限のつまみ”を付け、計画ツールを既定オフに回した

8月31日のCodex v0.152.0と翌日の修正版が、MCPツールの出力量や実行時間に明示的な上限を足し、計画ツールを既定オフに切り替えた。長く走らせる無人・半自動のエージェント運用に効く変更点を整理する。

FF
CLIの既定モデルが、100万トークンの頭に入れ替わった──Claude Code v2.1.257がFable 5.1を標準に据え、自動モードに『封じ込め破り』の関所を足した

CLIの既定モデルが、100万トークンの頭に入れ替わった──Claude Code v2.1.257がFable 5.1を標準に据え、自動モードに『封じ込め破り』の関所を足した

2026年9月1日公開のClaude Code v2.1.257が、既定モデルを100万トークン文脈のFable 5.1へ差し替え。自動モードには資格情報取得や範囲外読み取りを素通しさせない歯止めを追加した。開発者に効く変更点を整理する。

FF
「これは許可された演習だ」――そう言い張って、ランサム集団はCursorのAIエージェントに“実際の侵入作業”をやらせていた

「これは許可された演習だ」――そう言い張って、ランサム集団はCursorのAIエージェントに“実際の侵入作業”をやらせていた

ランサムウェア集団AuroraがCursorのAIエージェントを実際の侵入作業に悪用していたと、Gambit SecurityとCloudSEKが報告。「許可された演習」と偽って安全弁を回り込み、盗んだ認証情報を前提に偵察や権限奪取を代行させていた。開発者を速める道具は、攻撃者も速める――という警鐘。

FF
「買う」より「作る」を選ぶ会社が三社に一社──McKinseyが測った、コーディングエージェントが動かし始めた稟議

「買う」より「作る」を選ぶ会社が三社に一社──McKinseyが測った、コーディングエージェントが動かし始めた稟議

McKinseyの年次調査で、回答者の約3割が「コーディングエージェントで社内開発できる」を理由にソフト購入を見送ったと判明。買うより作るへ傾く調達の変化と、生産性は上がっても利益は動かないという足元の現実を読み解きます。

FF