エージェントの「待ち時間」を14倍削る――OpenAIがCerebrasで、GPT-5.6 Solを毎秒750トークンで走らせる
OpenAIがCerebras製ハードで、フルサイズのGPT-5.6 Solを最大毎秒750トークン(標準の14倍)で走らせる「Ultrafast」をAPI限定プレビュー。賢さはそのまま速さだけを別料金の階層に切り出した。エージェントの往復ループに効く一方、価格未公表や「速い=正しいではない」という但し書きも開発者目線で整理する。
コーディングエージェントを使っていて一番こたえるのは、モデルが答えを書き終えるまでの「待ち」ではないでしょうか。計画を立て、コードを直し、テストを回し、結果を読んでまた直す――エージェントはこの往復を何十回とこなします。その一回ごとに生成の待ち時間が乗るため、体感の遅さは積み重なります。OpenAIが公開した新しい提供階層「Ultrafast(超高速)」は、この待ちに正面から手を入れるものです。半導体スタートアップCerebrasの技術を使い、GPT-5.6 Sol を最大で毎秒750トークン――標準の最大14倍の速度で走らせます。まずはAPIの限定プレビューとして、一部の顧客に提供が始まりました。
「賢さはそのまま、速さだけ14倍」の中身
ポイントは、軽量な別モデルに切り替えたわけではないことです。動くのはフルサイズのGPT-5.6 Sol そのもので、精度を落とさずに生成速度だけを引き上げています。標準の提供では毎秒およそ50トークン程度とされるので、750トークンはおおよそ14倍にあたります。
速さを生むのはCerebrasのウェハースケール・エンジンという独特なハードウェアです。通常のGPU推論では、巨大なモデルの重みをメモリとの間で何度もやり取りする帯域がボトルネックになります。Cerebrasはウェハー1枚に44GBのSRAMを載せ、重みをチップ上に置いたまま、トークンを層から層へ途切れさせずに流す設計だと説明しています。この土台があるのは、OpenAIとCerebrasが今年結んだ100億ドル規模の提携です。
速さは、いま「別料金の階層」になった
今回の発表で見逃せないのは、OpenAIが速度を課金の対象として切り出した点です。クラウド事業者が性能に応じて値付けをするのと同じ発想で、同じ賢さのモデルでも「どれだけ速く返すか」で料金の階層が分かれます。Ultrafastの料金はまだ公表されていませんが、既存の階層構成を見れば位置づけは読み取れます。
| 階層 | 生成速度の目安 | 料金の目安(100万トークンあたり 入力/出力) |
|---|---|---|
| 標準(Standard) | 毎秒 約50トークン | $5 / $30 |
| 高速(Fast) | 標準の約2.5倍 | 標準の約2倍 |
| 超高速(Ultrafast) | 最大 毎秒750トークン(標準の最大14倍) | 未公表・限定プレビュー |
つまり「速さは手に入るが、その速さには相応の対価がつく」という構図です。プレビュー段階のため、GPT-5.6 Sol のみが対象で、提供先も選ばれた顧客に絞られています。OpenAIは容量が増え次第、対象を広げるとしています。
ベンチマークで見える「時間の圧縮」
速度の効きめは、長い処理ほど大きく出ます。OpenAIとCerebrasが挙げた測定値がわかりやすい例です。
| 指標 | 結果 |
|---|---|
| Humanity's Last Exam(2,500問) | GPT-5.6 Sol Ultrafast が11時間11分で完走。Claude Fable 5 の78時間27分に対し、同等の精度でおよそ7倍速い |
| GDP-Val(経済的に価値ある知的作業) | 品質を落とさず、全体で約5.6倍の高速化 |
| スループット比較(Artificial Analysis) | Fable 5 の約11倍、Fast モードの Opus 4.8 の約5倍 |
数日がかりだった評価が半日で終わる、という水準の変化です。これはベンチマークに限った話ではありません。エージェントのように「生成→実行→また生成」を延々と繰り返すワークロードでは、生成が速くなるほどループ全体の壁時計時間が縮みます。夜間にバッチで回していた作業を、日中に対話しながら進められるようになる、という質的な違いにつながります。
開発現場から見た使いどころ
OpenAIとCerebrasは、速さが効く領域として次のような場面を挙げています。
- 対話的なコーディング: 手を止めずに提案を受け取り、その場で試す。エージェントの応答待ちが短いほど「人が主導権を握ったまま回す」感覚に近づく。
- 多段のエージェント処理: 計画・実装・テスト・レビューを自律的に繰り返す工程。一手ごとの待ちが積み上がるため、速度改善の恩恵が最も大きい。
- 障害対応・原因調査: 本番のインシデントで、ログや状態を読ませて仮説を出させる。数分の差が判断の速さに直結する。
- セキュリティの脅威検知・金融や法務の分析: 大量のテキストを短時間で読み解く用途。
飛びつく前に見ておきたい但し書き
速さは魅力的ですが、いくつか冷静に置いておきたい点があります。
- 速いことと正しいことは別: 生成が14倍速くなっても、出力の正しさが14倍になるわけではありません。エージェントが誤ったコードを書けば、それが速く量産されるだけです。レビューとテストの網は、むしろこれまで以上に重要になります。
- 速さがボトルネックとは限らない: 実際の開発では、生成そのものよりもツール実行やファイル入出力、ネットワーク待ちが律速になる場面も少なくありません。生成を速くしても全体が同じ倍率で速くなるとは限らない点は見積もっておくべきです。
- 料金という新しい変数: 速さが別階層の課金になったことで、「どこまでの速さに、いくら払うか」という判断が新たに増えます。価格が未公表の現時点では、費用対効果はまだ読めません。
- 供給の集中: この速度は特定ベンダーの専用ハードウェアに支えられています。限定プレビューで容量が絞られている点も含め、特定の供給元への依存が強まる構図には留意しておきたいところです。
それでも、「同じ賢さのまま速さだけを買える」という選択肢が正式な階層として現れたこと自体が、この一手の意味です。エージェントを回し続ける現場にとって、待ち時間は生産性とコストの両方に効く数字です。速さがいくらで手に入るのか――プレビューの次に出てくる値札が、実運用に載せるかどうかの分かれ目になります。
参照: Previewing Ultrafast mode(OpenAI) / Accelerating GPT-5.6 Sol Ultrafast(Cerebras) / The Decoder / Help Net Security / MLQ News