2.8兆パラメータの「最大のオープン」が、Sonnet 5と同じ値札で届く──Kimi K3が崩した「中国製は安い」の前提

Moonshot AIが7月16日にKimi K3を公開。2.8兆パラメータ・1M文脈でコーディング系の採点表上位に食い込む一方、料金は$3/$15とSonnet 5並みに。重みの公開は7月27日予定で、「中国製は安い」の前提が崩れました。

シェア
2.8兆パラメータの「最大のオープン」が、Sonnet 5と同じ値札で届く──Kimi K3が崩した「中国製は安い」の前提

Moonshot AI が2026年7月16日、フラッグシップモデル「Kimi K3」を公開しました。「オープンな3兆クラス」を掲げる大型モデルで、コーディング系の採点表では上位に食い込んでいます。ただし開発者にとっての読みどころは、性能よりも値札と公開時期にあります。

18位から1位へ、フロントエンド採点表の飛び級

K3 は総パラメータ2.8兆の混合エキスパート(MoE)構成です。896個のエキスパートのうち16個をトークンごとに選んで動かす、疎な設計を採ります。文脈長は約104万トークン(1,048,576)で、長丁場のエージェント作業を想定しています。

目を引くのはコーディング系の順位です。arena.ai のフロントエンド部門で、前世代 K2.6 の18位から1位へ跳ね上がりました。公開されている主なスコアは以下のとおりです。

ベンチマークスコア位置づけ
Frontend Code Arena(arena.ai)1位7分野中6分野で首位
Terminal-Bench 2.188.3%ターミナル操作の自律実行
GPQA Diamond93.5%公開時点でオープン系最高とされる
BrowseComp91.2%エージェント的な調査タスク
MCP Atlas84.2%MCP経由のツール利用

ただし「全方位で最強」ではありません。独立評価の Artificial Analysis では189モデル中4位でした。開発者の Simon Willison 氏の試用でも、Claude Opus 4.8 や GPT-5.5 は概ね上回る一方、Claude Fable 5 と GPT-5.6 Sol には及ばないという評価です。Moonshot 自身も、総合的な使用感で Fable 5 と GPT-5.6 Sol に届かない点を認めています。

値札はSonnet 5と横並びになった

ここが今回いちばんの変化です。K3 の API 料金は、入力100万トークンあたり$3.00、出力100万トークンあたり$15.00。キャッシュヒット時の入力は$0.30まで下がります。

項目Kimi K3
入力(100万トークン)$3.00
入力・キャッシュヒット時$0.30
出力(100万トークン)$15.00
適用範囲約104万トークンの全文脈で一律

この $3/$15 は、Claude Sonnet 5 の標準料金と同じ水準です。そして K2 世代からは3〜3.75倍の値上げにあたります。中国製オープンモデルの訴求点は「同等の性能をひと桁安く」でした。K3 はその前提を自ら手放し、価格ではなく中身で並びに行った格好です。

「オープン」は7月27日までの予約手形

もう一点、導入判断に効く注意があります。公開時点では重みは配布されていません。Moonshot は自社の WeChat 告知で、完全な重みの公開を7月27日としています。

それまでの K3 は、事実上ホスティング専用のモデルです。手元やオンプレで動かす検証、重みを前提にした調達判断は、この日を待つ必要があります。利用は OpenAI 互換 API(api.moonshot.ai/v1、モデルID kimi-k3)と OpenRouter 経由で始められます。既存のエージェントから差し替えて試す分には、接続先とモデルIDの変更で足ります。

試す前に知っておきたい、目減りするトークン

実測の報告からは、請求額が読みにくくなる要因がいくつか挙がっています。

  • 推論トークンが重い: Willison 氏の試用では、応答3,417トークンに対し推論が13,241トークン発生し、1回で25セントかかりました。
  • 推論量が安定しない: 同じ条件でも消費量に275〜351%の幅が出たとの報告があります。OpenRouter では推論分が出力上限に達し、リクエストが失敗する例も出ています。
  • 入力トークンの数え方が違う: 10トークン相当の短い指示が95トークンとして計上された例が報告されています。85トークン程度の隠しシステムプロンプトの存在が推測されていますが、確認は取れていません。
  • 出力量の評価が割れる: Moonshot は K2.6 比で出力トークン21%減と説明します。一方、同等モデルの約2倍の出力が出たという第三者の測定もあります。

Moonshot は制約も自ら挙げています。安定動作には履歴を丸ごと渡す必要があること、曖昧な指示を先回りして解釈しすぎる傾向があることの2点です。長時間の無人運用に乗せるなら、どちらも効いてくる性質です。

選択肢が増えた裏で

開発者にとっては、上位モデルの選択肢がもう一つ増えたことになります。特に1M文脈と Terminal-Bench 2.1 の数字は、長丁場のエージェント作業を任せる候補として現実的です。まずはキャッシュを効かせた狭い用途で、実測の請求額を見てから広げるのが無難でしょう。

一方で、懸念も指摘されています。オープンモデルの価格優位が縮めば、コスト面での逃げ道として使ってきた構図は崩れます。加えて、重みの公開が告知ベースの予定にとどまる以上、「オープンだから乗り換え自由」という前提も、公開されるライセンス次第という段階です。値札が並んだいま、選定の軸は「安いから」ではなく「この作業で本当に速く終わるか」に戻りつつあります。

参照: Simon Willison — Kimi K3, and what we can still learn from the pelican benchmark / VentureBeat — China's Moonshot AI releases Kimi K3 / OpenRouter — Kimi K3 / Trilogy AI — Kimi K3 Is Live: Pricing, Benchmarks, and the Wait for Public Weights / kie.ai — Kimi K3 Pricing

続きを読む

締めた手綱を、2日で少し緩める──Claude Code v2.1.219が入れ子サブエージェントを「既定で深さ3」へ戻し、ワークフローに「15体未満」の目安を入れた

締めた手綱を、2日で少し緩める──Claude Code v2.1.219が入れ子サブエージェントを「既定で深さ3」へ戻し、ワークフローに「15体未満」の目安を入れた

Claude Code v2.1.219が、2日前に既定オフにした入れ子サブエージェントを「既定で深さ3」へ戻し、動的ワークフローに「15体未満」の目安を新設。自律性と安全性の綱引きと、無人運用での当てどころを整理します。

FF
一度こしらえた拡張を、別のエージェントで使い回す──Copilot CLIがOpen Plugin SpecとMCP設定を取り込み、砂場は「既定で締める」側へ

一度こしらえた拡張を、別のエージェントで使い回す──Copilot CLIがOpen Plugin SpecとMCP設定を取り込み、砂場は「既定で締める」側へ

GitHub Copilot CLI の最新版が、ベンダー中立の「Open Plugin Spec」と MCP 設定ファイルを読み込めるようになった。他のエージェント向けに作った拡張がそのまま持ち込める一方、OSサンドボックスの初期値は締める方向へ動いた。

FF
キーボードから手を離し、口でエージェントを回す──OpenAIがCodex/Workに載せた「全二重」音声操作と、その速さが呼ぶ取りこぼし

キーボードから手を離し、口でエージェントを回す──OpenAIがCodex/Workに載せた「全二重」音声操作と、その速さが呼ぶ取りこぼし

OpenAIがChatGPTデスクトップに音声操作を配信。全二重のGPT-Liveで、声だけでCodex/Workの複数エージェントを回せる。段取りは速くなるが、口頭指示の曖昧さと文字起こしのズレという新しい取りこぼしも。

FF
Fable 5級の知能を、据え置きの値段で回す──Claude Opus 5が「長時間エージェントのOpus」を作り直した

Fable 5級の知能を、据え置きの値段で回す──Claude Opus 5が「長時間エージェントのOpus」を作り直した

Anthropicが7月24日にClaude Opus 5を公開。据え置きの$5/$25で公開最上位Fable 5に迫る性能を打ち出し、Claude Codeの既定Opusも置き換え。料金・ベンチ・エージェント運用の変化と留保点を整理します。

FF