キーボードから手を離し、口でエージェントを回す──OpenAIがCodex/Workに載せた「全二重」音声操作と、その速さが呼ぶ取りこぼし

OpenAIがChatGPTデスクトップに音声操作を配信。全二重のGPT-Liveで、声だけでCodex/Workの複数エージェントを回せる。段取りは速くなるが、口頭指示の曖昧さと文字起こしのズレという新しい取りこぼしも。

シェア
キーボードから手を離し、口でエージェントを回す──OpenAIがCodex/Workに載せた「全二重」音声操作と、その速さが呼ぶ取りこぼし

OpenAI が 2026年7月23〜24日にかけて、ChatGPT のデスクトップアプリ(macOS / Windows)に音声操作「ChatGPT Voice」を配信しました。ねらいは雑談ではありません。開発者が声だけで、ChatGPT Work や Codex の複数エージェントに指示を出し、コードを書かせることです。今回はこの機能が開発の段取りをどう変えるか、そして声で流し込むがゆえの落とし穴を整理します。

声が「実行係」から切り離されている

中核は、7月8日に登場した音声モデル「GPT-Live」です。聞きながら同時に話せる全二重(フルデュプレックス)方式で、従来の「話す→止まる→返す」という交互のやり取りを不要にしました。相づちの『了解です』を挟みながら、こちらの発話を遮らずに指示を受け取ります。

ポイントは、この音声の層と、実際に手を動かす実行エンジンが分かれている点です。GPT-Live は会話だけを受け持ち、重い推論やコード生成は背後のモデルと Work / Codex のエージェントに渡します。声で仕事を「始める・優先順位を変える・止める・振り直す」あいだも、エージェントは裏で走り続け、詰まりや完了を音声か画面で報告します。

OpenAI のデモでは、開発者が一つの音声指示で新しいスレッドを立て、プルリクエストを作り、バグの根本原因を突き止める流れが示されました。手はキーボードから離れたまま、指示だけが声で流れていきます。

Codexアプリ側で何が変わったか

同時に配信された Codex アプリ更新(26.715)では、音声に加えてローカルプロジェクトの扱いが広がりました。変更点は次の2つです。

  • 音声操作の追加: GPT-Live を使い、デスクトップアプリの Chat / Work / Codex をまたいで声で作業を進められる。
  • 複数フォルダのプロジェクト: 1つのローカルプロジェクトに関連する複数フォルダを含められる。主フォルダを1つ指定し、そこが新規チャット・Git 操作・AGENTS.md / skills / config.toml の自動検出の起点になる。副フォルダはファイル検索・読み書きの対象として残る。

macOS では「画面コンテキスト(Appshots)」を有効にすると、開いているウィンドウの内容を共有して文脈に含められます。声の指示に、いま見ている画面の状況を重ねられるということです。

使える範囲と前提

提供対象と動作条件は以下の通りです。導入前に、自分のプランと環境が当てはまるかを確認してください。

項目内容
対象プランPlus / Pro / Business / Edu / Enterprise
対応環境macOS・Windows のデスクトップアプリ、および iOS の Remote 経由
権限の範囲いま選んでいる Work / Codex コンテキストに既に許可された道具・権限の範囲内で動く
同時実行開ける音声会話は一度に1つ

音声は Computer Use(コンピュータ操作)や事前許可済みのツール、ローカルファイルと連携します。新しく無制限の権限が生えるわけではなく、既存の許可の上に「声」という入口が足された、という理解が近いでしょう。

段取りが「並べて待つ」から「話しながら回す」へ

これまでのエージェント運用は、指示文を打ち込み、複数タスクを並べ、結果を待つ形が基本でした。今回の音声操作は、そこに「走らせたまま口頭で優先順位を差し替える」動きを持ち込みます。手を止めずに複数エージェントへ割り込みをかけられる点が、実務での違いになりそうです。

ビジネス面では、レビュー・PR 作成・デバッグといった定型の受け渡しにかかる手間が下がる見込みです。席を立っても iOS の Remote から声で様子を確かめられるため、待ち時間の使い方も変わります。作業の起点がエディタから「声」に一部移ることで、開発者一人が同時に見られるエージェントの数を押し上げる方向に働きます。

速く手放せるからこそ増える取りこぼし

利便性の裏で、声ならではのリスクも指摘されています。煽らずに、導入時の注意点として押さえておきたい点を挙げます。

  • 文字起こしのズレ: 発話が重なったり雑音が入ると、音声と文字起こしが食い違うことがある。合意した用語や条件を音声記録だけに頼らず、タスク本体にテキストで残すのが無難とされる。
  • 曖昧な指示の伝播が速い: 声は受け渡しの摩擦を下げる一方、あいまいな口頭指示が複数タスクへ一気に広がる速さも上げる。手戻りが連鎖しやすい構造になりうる。
  • データ保持: 音声クリップは30日間保持されるとされ、削除やアーカイブの扱いは運用ルールでの確認が要る。
  • 画面共有の文脈: 画面コンテキストを使う場面では、共有した内容が指示に混ざる。開くウィンドウや外部由来の表示には従来同様の注意が要る。

権限が既存コンテキストの範囲に閉じている点は歯止めになりますが、「速く手放せる」こと自体が、確認の抜けを生みやすくします。声で回す前に、条件はテキストで固定しておく——この一手間が効きそうです。

まとめ

今回の更新は、コーディングエージェントの操作面を「打つ」から「話す」へ広げるものです。全二重の音声で複数エージェントを並走させる体験は、段取りの速度を確かに上げます。一方で、口頭指示の曖昧さと記録のズレという新しい取りこぼしも連れてきます。まずは限定した作業で音声を試し、重要な条件はテキストに落とす運用から始めるのが現実的でしょう。

参照: OpenAI 公式発表(X)TechCrunch9to5MacXenoSpectrumCodex changelog(ChatGPT Learn)

続きを読む

締めた手綱を、2日で少し緩める──Claude Code v2.1.219が入れ子サブエージェントを「既定で深さ3」へ戻し、ワークフローに「15体未満」の目安を入れた

締めた手綱を、2日で少し緩める──Claude Code v2.1.219が入れ子サブエージェントを「既定で深さ3」へ戻し、ワークフローに「15体未満」の目安を入れた

Claude Code v2.1.219が、2日前に既定オフにした入れ子サブエージェントを「既定で深さ3」へ戻し、動的ワークフローに「15体未満」の目安を新設。自律性と安全性の綱引きと、無人運用での当てどころを整理します。

FF
一度こしらえた拡張を、別のエージェントで使い回す──Copilot CLIがOpen Plugin SpecとMCP設定を取り込み、砂場は「既定で締める」側へ

一度こしらえた拡張を、別のエージェントで使い回す──Copilot CLIがOpen Plugin SpecとMCP設定を取り込み、砂場は「既定で締める」側へ

GitHub Copilot CLI の最新版が、ベンダー中立の「Open Plugin Spec」と MCP 設定ファイルを読み込めるようになった。他のエージェント向けに作った拡張がそのまま持ち込める一方、OSサンドボックスの初期値は締める方向へ動いた。

FF
Fable 5級の知能を、据え置きの値段で回す──Claude Opus 5が「長時間エージェントのOpus」を作り直した

Fable 5級の知能を、据え置きの値段で回す──Claude Opus 5が「長時間エージェントのOpus」を作り直した

Anthropicが7月24日にClaude Opus 5を公開。据え置きの$5/$25で公開最上位Fable 5に迫る性能を打ち出し、Claude Codeの既定Opusも置き換え。料金・ベンチ・エージェント運用の変化と留保点を整理します。

FF
「どのモデルで書くか」を選ぶ手をAIに預ける──Cursor Routerが突く、エージェントを回し続けるモデル代

「どのモデルで書くか」を選ぶ手をAIに預ける──Cursor Routerが突く、エージェントを回し続けるモデル代

Cursorが7月22日、リクエストごとに使うAIモデルを自動で選ぶCursor Routerを発表。Opus固定より最大50%安いとされる一方、どのモデルで書いたか見えにくい等の懸念も。コスト・仕組み・注意点を整理する。

FF