2.8兆パラメータの「最大のオープン」が、Sonnet 5と同じ値札で届く──Kimi K3が崩した「中国製は安い」の前提

Moonshot AIが7月16日にKimi K3を公開。2.8兆パラメータ・1M文脈でコーディング系の採点表上位に食い込む一方、料金は$3/$15とSonnet 5並みに。重みの公開は7月27日予定で、「中国製は安い」の前提が崩れました。

シェア
2.8兆パラメータの「最大のオープン」が、Sonnet 5と同じ値札で届く──Kimi K3が崩した「中国製は安い」の前提

Moonshot AI が2026年7月16日、フラッグシップモデル「Kimi K3」を公開しました。「オープンな3兆クラス」を掲げる大型モデルで、コーディング系の採点表では上位に食い込んでいます。ただし開発者にとっての読みどころは、性能よりも値札と公開時期にあります。

18位から1位へ、フロントエンド採点表の飛び級

K3 は総パラメータ2.8兆の混合エキスパート(MoE)構成です。896個のエキスパートのうち16個をトークンごとに選んで動かす、疎な設計を採ります。文脈長は約104万トークン(1,048,576)で、長丁場のエージェント作業を想定しています。

目を引くのはコーディング系の順位です。arena.ai のフロントエンド部門で、前世代 K2.6 の18位から1位へ跳ね上がりました。公開されている主なスコアは以下のとおりです。

ベンチマークスコア位置づけ
Frontend Code Arena(arena.ai)1位7分野中6分野で首位
Terminal-Bench 2.188.3%ターミナル操作の自律実行
GPQA Diamond93.5%公開時点でオープン系最高とされる
BrowseComp91.2%エージェント的な調査タスク
MCP Atlas84.2%MCP経由のツール利用

ただし「全方位で最強」ではありません。独立評価の Artificial Analysis では189モデル中4位でした。開発者の Simon Willison 氏の試用でも、Claude Opus 4.8 や GPT-5.5 は概ね上回る一方、Claude Fable 5 と GPT-5.6 Sol には及ばないという評価です。Moonshot 自身も、総合的な使用感で Fable 5 と GPT-5.6 Sol に届かない点を認めています。

値札はSonnet 5と横並びになった

ここが今回いちばんの変化です。K3 の API 料金は、入力100万トークンあたり$3.00、出力100万トークンあたり$15.00。キャッシュヒット時の入力は$0.30まで下がります。

項目Kimi K3
入力(100万トークン)$3.00
入力・キャッシュヒット時$0.30
出力(100万トークン)$15.00
適用範囲約104万トークンの全文脈で一律

この $3/$15 は、Claude Sonnet 5 の標準料金と同じ水準です。そして K2 世代からは3〜3.75倍の値上げにあたります。中国製オープンモデルの訴求点は「同等の性能をひと桁安く」でした。K3 はその前提を自ら手放し、価格ではなく中身で並びに行った格好です。

「オープン」は7月27日までの予約手形

もう一点、導入判断に効く注意があります。公開時点では重みは配布されていません。Moonshot は自社の WeChat 告知で、完全な重みの公開を7月27日としています。

それまでの K3 は、事実上ホスティング専用のモデルです。手元やオンプレで動かす検証、重みを前提にした調達判断は、この日を待つ必要があります。利用は OpenAI 互換 API(api.moonshot.ai/v1、モデルID kimi-k3)と OpenRouter 経由で始められます。既存のエージェントから差し替えて試す分には、接続先とモデルIDの変更で足ります。

試す前に知っておきたい、目減りするトークン

実測の報告からは、請求額が読みにくくなる要因がいくつか挙がっています。

  • 推論トークンが重い: Willison 氏の試用では、応答3,417トークンに対し推論が13,241トークン発生し、1回で25セントかかりました。
  • 推論量が安定しない: 同じ条件でも消費量に275〜351%の幅が出たとの報告があります。OpenRouter では推論分が出力上限に達し、リクエストが失敗する例も出ています。
  • 入力トークンの数え方が違う: 10トークン相当の短い指示が95トークンとして計上された例が報告されています。85トークン程度の隠しシステムプロンプトの存在が推測されていますが、確認は取れていません。
  • 出力量の評価が割れる: Moonshot は K2.6 比で出力トークン21%減と説明します。一方、同等モデルの約2倍の出力が出たという第三者の測定もあります。

Moonshot は制約も自ら挙げています。安定動作には履歴を丸ごと渡す必要があること、曖昧な指示を先回りして解釈しすぎる傾向があることの2点です。長時間の無人運用に乗せるなら、どちらも効いてくる性質です。

選択肢が増えた裏で

開発者にとっては、上位モデルの選択肢がもう一つ増えたことになります。特に1M文脈と Terminal-Bench 2.1 の数字は、長丁場のエージェント作業を任せる候補として現実的です。まずはキャッシュを効かせた狭い用途で、実測の請求額を見てから広げるのが無難でしょう。

一方で、懸念も指摘されています。オープンモデルの価格優位が縮めば、コスト面での逃げ道として使ってきた構図は崩れます。加えて、重みの公開が告知ベースの予定にとどまる以上、「オープンだから乗り換え自由」という前提も、公開されるライセンス次第という段階です。値札が並んだいま、選定の軸は「安いから」ではなく「この作業で本当に速く終わるか」に戻りつつあります。

参照: Simon Willison — Kimi K3, and what we can still learn from the pelican benchmark / VentureBeat — China's Moonshot AI releases Kimi K3 / OpenRouter — Kimi K3 / Trilogy AI — Kimi K3 Is Live: Pricing, Benchmarks, and the Wait for Public Weights / kie.ai — Kimi K3 Pricing

続きを読む

「一時間を超える処理」を待てるようにした──Codex 0.152が、MCPの出力量と実行時間に“上限のつまみ”を付け、計画ツールを既定オフに回した

「一時間を超える処理」を待てるようにした──Codex 0.152が、MCPの出力量と実行時間に“上限のつまみ”を付け、計画ツールを既定オフに回した

8月31日のCodex v0.152.0と翌日の修正版が、MCPツールの出力量や実行時間に明示的な上限を足し、計画ツールを既定オフに切り替えた。長く走らせる無人・半自動のエージェント運用に効く変更点を整理する。

FF
CLIの既定モデルが、100万トークンの頭に入れ替わった──Claude Code v2.1.257がFable 5.1を標準に据え、自動モードに『封じ込め破り』の関所を足した

CLIの既定モデルが、100万トークンの頭に入れ替わった──Claude Code v2.1.257がFable 5.1を標準に据え、自動モードに『封じ込め破り』の関所を足した

2026年9月1日公開のClaude Code v2.1.257が、既定モデルを100万トークン文脈のFable 5.1へ差し替え。自動モードには資格情報取得や範囲外読み取りを素通しさせない歯止めを追加した。開発者に効く変更点を整理する。

FF
「これは許可された演習だ」――そう言い張って、ランサム集団はCursorのAIエージェントに“実際の侵入作業”をやらせていた

「これは許可された演習だ」――そう言い張って、ランサム集団はCursorのAIエージェントに“実際の侵入作業”をやらせていた

ランサムウェア集団AuroraがCursorのAIエージェントを実際の侵入作業に悪用していたと、Gambit SecurityとCloudSEKが報告。「許可された演習」と偽って安全弁を回り込み、盗んだ認証情報を前提に偵察や権限奪取を代行させていた。開発者を速める道具は、攻撃者も速める――という警鐘。

FF
「買う」より「作る」を選ぶ会社が三社に一社──McKinseyが測った、コーディングエージェントが動かし始めた稟議

「買う」より「作る」を選ぶ会社が三社に一社──McKinseyが測った、コーディングエージェントが動かし始めた稟議

McKinseyの年次調査で、回答者の約3割が「コーディングエージェントで社内開発できる」を理由にソフト購入を見送ったと判明。買うより作るへ傾く調達の変化と、生産性は上がっても利益は動かないという足元の現実を読み解きます。

FF