ChatGPT 読了 6 分

「もう他の方法ではやり取りしたくない」——ChatGPT Voiceがデスクトップに来て、仕事の音声操作が現実になった

Shiritomo編集部 @shiritomoAI_jp 2026年7月24日 更新
「もう他の方法ではやり取りしたくない」——ChatGPT Voiceがデスクトップに来て、仕事の音声操作が現実になった

「数週間使って、もう他の方法ではやり取りしたくない」。
OpenAI社員のGuinness Chen氏が、ChatGPT Voiceのデスクトップ版についてそう投稿しました。

2026年7月23日、OpenAIはChatGPT Voiceのデスクトップアプリ版を世界的に展開しました。
macOSとWindows、Plus以上のプランが対象で、声だけでパソコンを操作し、複数のAIエージェントを同時に指揮できるようになります。

声でパソコンを動かす、AIエージェントに仕事を任せる——そんな働き方に関心があるSNS担当者やAI活用者にとって、この記事はその中身と実力を知る手がかりになるはずです。

先に結論をまとめると:

  • ChatGPT Voiceがデスクトップアプリに搭載され、Chat・Work・Codexの3画面で声によるエージェント操作が可能になった
  • 支えるのは「GPT-Live」という同時発話・同時聞き取り技術で、AIが人の話を遮らずに、話しながら考え、作業を調整する
  • 同じ日にAnthropicもClaudeの音声モードを強化しており、声を軸にしたAI各社の競争が本格化している

デスクトップで何が変わったのか

今回のアップデートの中心は、ChatGPTのデスクトップアプリに音声機能が統合されたことです。
これまでスマートフォンのアプリが主戦場だった音声対話が、パソコン作業の現場に持ち込まれました。

Xでは発表直後から反応が広がっています。

投稿にある通り、ChatGPT WorkやCodex上で動く複数のエージェントに、声だけで指示を出せるのが今回の目玉です。
資料を作りながら「ここを直しておいて」と話しかける、コードを書かせながら別のタスクを口頭で追加する——そうした並行作業が、キーボードから手を離さずにできるようになります。

ただ、この機能を支えている技術がどういうものなのかは、名前だけではわかりません。
そこで一次情報を確かめてみました。

なぜ「声」が今、勝負どころなのか

ChatGPT Voiceの土台になっているのは「GPT-Live」という音声技術です。
9to5MacやFortuneの報道によると、OpenAIは7月8日から一般ユーザー向けのChatGPTアプリで、フルデュプレックス(人とAIが同時に聞き、同時に話せる通信方式)型の音声機能を段階的に展開していました。
そして7月9日には、これまで別アプリだったコーディング専用ツール「Codex」をChatGPTデスクトップアプリに統合すると発表しています。

つまり今回の発表は、単発の新機能ではなく、7月に入ってから積み上げてきた「音声」と「エージェント統合」という2つの流れが、デスクトップという場所で合流したものです。

「同時に聞いて話す」とは具体的にどういうことか

従来の音声アシスタントは、ユーザーが話し終えるのを待ってから応答する「ターン制」でした。
GPT-Liveはこの順番待ちを崩し、こちらが話している途中でも文脈を理解して割り込んで返答できます。
海外のユーザーからも、この体感の違いを指摘する声が上がっていました。

(日本語訳:ChatGPT Voiceがデスクトップに来た。
「チャットボットに話しかける」んじゃない。
仕事をしながら話す。
思考の途中で割り込める。
バックグラウンドでエージェントを動かす。
キーボードから手が離れない。)

Anthropicも同時に動いた——声を巡る競争の構図

見逃せないのは、同じ7月23日にAnthropicもClaudeの音声モードを強化したと伝えられている点です。
Anthropicは今年に入ってから、Claudeの音声モードを段階的に多言語対応させてきており、対応言語を18言語まで広げたと報じられています。
今回はこの流れがさらに全プランへ広がったとみられます。

OpenAIとAnthropicが同じタイミングで音声機能を前面に出したのは偶然ではなさそうです。
チャット画面を見て文字を打つという操作自体が、AIとの主戦場ではなくなりつつあるということでしょう。

Shiritomo編集部の考察:音声UIは「見る」時間を奪い合う土俵になる

これまでのAI活用の主戦場は、プロンプトの書き方や画面上でのやり取りでした。
しかし音声操作が定着すると、競争の軸は「いかに自然に、手を止めずに使わせるか」に移ります。
SNS運用や資料作成の現場でも、通勤中や移動中に音声で下書きを進め、パソコンの前に座ったときには仕上げだけをする、という働き方が現実味を帯びてきました。

一方で、過去の音声アシスタント(SiriやGoogleアシスタント)は「便利そうで実際にはあまり使われない」という壁にぶつかった経緯があります。
今回のGPT-Liveが従来と違うのは、単なる音声入力ではなく、複数のAIエージェントを同時に制御する「指揮台」として設計されている点です。
単発の質問応答ではなく、継続的なタスク管理に組み込まれることで、これまでの音声UIが超えられなかった壁を越えられるかが今後の焦点になりそうです。
SNS運用担当者としては、まずは通知確認や下書き作成など、リスクの低い作業から音声操作を試してみる価値があるでしょう。

まとめ

ChatGPT Voiceのデスクトップ展開は、音声を単なる入力手段から「複数エージェントの指揮台」へと引き上げる一歩でした。
同日のAnthropicの動きも合わせると、声を軸にしたAI競争はここから本格化しそうです。

さらに深掘りしたい方へ