キーボードから手を離し、口でエージェントを回す──OpenAIがCodex/Workに載せた「全二重」音声操作と、その速さが呼ぶ取りこぼし

OpenAIがChatGPTデスクトップに音声操作を配信。全二重のGPT-Liveで、声だけでCodex/Workの複数エージェントを回せる。段取りは速くなるが、口頭指示の曖昧さと文字起こしのズレという新しい取りこぼしも。

シェア
キーボードから手を離し、口でエージェントを回す──OpenAIがCodex/Workに載せた「全二重」音声操作と、その速さが呼ぶ取りこぼし

OpenAI が 2026年7月23〜24日にかけて、ChatGPT のデスクトップアプリ(macOS / Windows)に音声操作「ChatGPT Voice」を配信しました。ねらいは雑談ではありません。開発者が声だけで、ChatGPT Work や Codex の複数エージェントに指示を出し、コードを書かせることです。今回はこの機能が開発の段取りをどう変えるか、そして声で流し込むがゆえの落とし穴を整理します。

声が「実行係」から切り離されている

中核は、7月8日に登場した音声モデル「GPT-Live」です。聞きながら同時に話せる全二重(フルデュプレックス)方式で、従来の「話す→止まる→返す」という交互のやり取りを不要にしました。相づちの『了解です』を挟みながら、こちらの発話を遮らずに指示を受け取ります。

ポイントは、この音声の層と、実際に手を動かす実行エンジンが分かれている点です。GPT-Live は会話だけを受け持ち、重い推論やコード生成は背後のモデルと Work / Codex のエージェントに渡します。声で仕事を「始める・優先順位を変える・止める・振り直す」あいだも、エージェントは裏で走り続け、詰まりや完了を音声か画面で報告します。

OpenAI のデモでは、開発者が一つの音声指示で新しいスレッドを立て、プルリクエストを作り、バグの根本原因を突き止める流れが示されました。手はキーボードから離れたまま、指示だけが声で流れていきます。

Codexアプリ側で何が変わったか

同時に配信された Codex アプリ更新(26.715)では、音声に加えてローカルプロジェクトの扱いが広がりました。変更点は次の2つです。

  • 音声操作の追加: GPT-Live を使い、デスクトップアプリの Chat / Work / Codex をまたいで声で作業を進められる。
  • 複数フォルダのプロジェクト: 1つのローカルプロジェクトに関連する複数フォルダを含められる。主フォルダを1つ指定し、そこが新規チャット・Git 操作・AGENTS.md / skills / config.toml の自動検出の起点になる。副フォルダはファイル検索・読み書きの対象として残る。

macOS では「画面コンテキスト(Appshots)」を有効にすると、開いているウィンドウの内容を共有して文脈に含められます。声の指示に、いま見ている画面の状況を重ねられるということです。

使える範囲と前提

提供対象と動作条件は以下の通りです。導入前に、自分のプランと環境が当てはまるかを確認してください。

項目内容
対象プランPlus / Pro / Business / Edu / Enterprise
対応環境macOS・Windows のデスクトップアプリ、および iOS の Remote 経由
権限の範囲いま選んでいる Work / Codex コンテキストに既に許可された道具・権限の範囲内で動く
同時実行開ける音声会話は一度に1つ

音声は Computer Use(コンピュータ操作)や事前許可済みのツール、ローカルファイルと連携します。新しく無制限の権限が生えるわけではなく、既存の許可の上に「声」という入口が足された、という理解が近いでしょう。

段取りが「並べて待つ」から「話しながら回す」へ

これまでのエージェント運用は、指示文を打ち込み、複数タスクを並べ、結果を待つ形が基本でした。今回の音声操作は、そこに「走らせたまま口頭で優先順位を差し替える」動きを持ち込みます。手を止めずに複数エージェントへ割り込みをかけられる点が、実務での違いになりそうです。

ビジネス面では、レビュー・PR 作成・デバッグといった定型の受け渡しにかかる手間が下がる見込みです。席を立っても iOS の Remote から声で様子を確かめられるため、待ち時間の使い方も変わります。作業の起点がエディタから「声」に一部移ることで、開発者一人が同時に見られるエージェントの数を押し上げる方向に働きます。

速く手放せるからこそ増える取りこぼし

利便性の裏で、声ならではのリスクも指摘されています。煽らずに、導入時の注意点として押さえておきたい点を挙げます。

  • 文字起こしのズレ: 発話が重なったり雑音が入ると、音声と文字起こしが食い違うことがある。合意した用語や条件を音声記録だけに頼らず、タスク本体にテキストで残すのが無難とされる。
  • 曖昧な指示の伝播が速い: 声は受け渡しの摩擦を下げる一方、あいまいな口頭指示が複数タスクへ一気に広がる速さも上げる。手戻りが連鎖しやすい構造になりうる。
  • データ保持: 音声クリップは30日間保持されるとされ、削除やアーカイブの扱いは運用ルールでの確認が要る。
  • 画面共有の文脈: 画面コンテキストを使う場面では、共有した内容が指示に混ざる。開くウィンドウや外部由来の表示には従来同様の注意が要る。

権限が既存コンテキストの範囲に閉じている点は歯止めになりますが、「速く手放せる」こと自体が、確認の抜けを生みやすくします。声で回す前に、条件はテキストで固定しておく——この一手間が効きそうです。

まとめ

今回の更新は、コーディングエージェントの操作面を「打つ」から「話す」へ広げるものです。全二重の音声で複数エージェントを並走させる体験は、段取りの速度を確かに上げます。一方で、口頭指示の曖昧さと記録のズレという新しい取りこぼしも連れてきます。まずは限定した作業で音声を試し、重要な条件はテキストに落とす運用から始めるのが現実的でしょう。

参照: OpenAI 公式発表(X)TechCrunch9to5MacXenoSpectrumCodex changelog(ChatGPT Learn)

続きを読む

「一時間を超える処理」を待てるようにした──Codex 0.152が、MCPの出力量と実行時間に“上限のつまみ”を付け、計画ツールを既定オフに回した

「一時間を超える処理」を待てるようにした──Codex 0.152が、MCPの出力量と実行時間に“上限のつまみ”を付け、計画ツールを既定オフに回した

8月31日のCodex v0.152.0と翌日の修正版が、MCPツールの出力量や実行時間に明示的な上限を足し、計画ツールを既定オフに切り替えた。長く走らせる無人・半自動のエージェント運用に効く変更点を整理する。

FF
CLIの既定モデルが、100万トークンの頭に入れ替わった──Claude Code v2.1.257がFable 5.1を標準に据え、自動モードに『封じ込め破り』の関所を足した

CLIの既定モデルが、100万トークンの頭に入れ替わった──Claude Code v2.1.257がFable 5.1を標準に据え、自動モードに『封じ込め破り』の関所を足した

2026年9月1日公開のClaude Code v2.1.257が、既定モデルを100万トークン文脈のFable 5.1へ差し替え。自動モードには資格情報取得や範囲外読み取りを素通しさせない歯止めを追加した。開発者に効く変更点を整理する。

FF
「これは許可された演習だ」――そう言い張って、ランサム集団はCursorのAIエージェントに“実際の侵入作業”をやらせていた

「これは許可された演習だ」――そう言い張って、ランサム集団はCursorのAIエージェントに“実際の侵入作業”をやらせていた

ランサムウェア集団AuroraがCursorのAIエージェントを実際の侵入作業に悪用していたと、Gambit SecurityとCloudSEKが報告。「許可された演習」と偽って安全弁を回り込み、盗んだ認証情報を前提に偵察や権限奪取を代行させていた。開発者を速める道具は、攻撃者も速める――という警鐘。

FF
「買う」より「作る」を選ぶ会社が三社に一社──McKinseyが測った、コーディングエージェントが動かし始めた稟議

「買う」より「作る」を選ぶ会社が三社に一社──McKinseyが測った、コーディングエージェントが動かし始めた稟議

McKinseyの年次調査で、回答者の約3割が「コーディングエージェントで社内開発できる」を理由にソフト購入を見送ったと判明。買うより作るへ傾く調達の変化と、生産性は上がっても利益は動かないという足元の現実を読み解きます。

FF