ChatGPT音声エージェントとは|任せられる仕事の境界
「移動中に、声だけで資料の下書きまで進められたらいいのに」——スマートフォンでAIを使うとき、誰もが一度は思うことです。
結論から言うと、2026年9月23日の更新で「音声で仕事を起動する」ことはできるようになりましたが、「音声で承認する」ことはできません。実行の引き金は声に移り、承認は画面に残ったままです。この線引きを理解しないまま導入すると、便利さではなく事故を先に引き当てます。
株式会社Fyveは中小企業のAI導入を月額で伴走しており、私自身も24時間稼働のAIエージェントを日常的に運用しています。この記事では、今回の更新で何が変わったのかを一次報道ベースで整理したうえで、実際に業務を任せる側の視点から「任せてよい仕事」と「任せてはいけない仕事」の境界をお伝えします。
結論:変わったのは「起動」であって「承認」ではない
先に要点を3行でまとめます。
- 音声が仕事の入口になった:会話しながらメール・カレンダー・Slackなどの連携アプリを呼び出し、資料作成やブラウザ操作まで声で始められるようになりました
- 承認は画面に残った:音声での承認は用意されておらず、実行の可否は画面上で人が判断します
- 連携=全権委任ではない:アプリをつないでも、そのアカウントの全てに手が届くようになるわけではありません
この3つは別々の仕様のように見えて、ひとつの設計思想で貫かれています。「起動のコストは下げるが、不可逆な操作の責任は人に残す」という考え方です。私が無人運用のジョブを組むときに辿り着いた結論とほぼ同じで、正直なところ、この線の引き方は妥当だと感じました。
2026年9月23日の更新は3つある
報道は「音声でエージェント機能が使えるようになった」と一括りにされがちですが、実際には性質の違う3つの更新が同時に出ています。分けて理解したほうが、自社に関係あるかどうかを判断しやすくなります。
① 音声の中身がGPT-6世代のモデルになった
ChatGPTの音声機能が、OpenAIがGPT-6として展開している3つのモデル——Astra・Sol・Luna——で動くようになりました。Astraは以前から提供されていた上位モデルで、今回は中位のSolと小型のLunaがGPT-6世代に引き上げられた、という位置づけです。
実務上の意味は「音声の応答が賢くなる可能性がある」という以上に、どのモデルが使われるかがプランとワークスペース設定で変わるという点にあります。同じ会社の中でも、契約プランが違えば音声の挙動が揃わないということです。社内で使い方を標準化したい場合は、ここを最初に確認してください。
② プラグイン・連携アプリが会話中に使えるようになった
これが今回の中でもっとも生活を変える部分です。音声で会話している最中に、アカウントに紐づいたプラグインや連携アプリを呼び出せるようになりました。報道で例として挙がっているのはメール・カレンダー・Slackです。
対応範囲はWeb・iOS・Androidで、話している内容に対する文字の回答はチャット側に残るため、後から読み返せます。「声で聞いて、文字で確認する」という二重化がされている形です。
音声そのものの料金や仕組みについては、以前に音声対話モデル側の視点で整理しています。聞きながら話す音声AIの料金と落とし穴もあわせてご覧ください。
③ ChatGPT Workが音声で動くようになった
ChatGPT Workは、チャットの返答ではなく資料・シート・Webアプリなど「完成した成果物」まで仕上げるエージェント機能です。これがWebとモバイルの両方で音声から使えるようになりました。
Work自体の機能や頼み方の型については、ChatGPT Workとは?できること・使い方・Chatとの違いで詳しく整理しています。今回の更新は、そのWorkに「声」という入口が増えた、と捉えるのが正確です。
観点 | 更新前 | 2026年9月23日以降 |
|---|---|---|
音声のモデル | 従来世代が中心 | GPT-6のAstra・Sol・Lunaが対象(プラン依存) |
会話中の連携アプリ | 使えない | メール・カレンダー・Slack等を呼び出せる |
Workの起動 | 文字入力から | Web・モバイルで音声から起動できる |
実行の承認 | 画面で操作 | 変わらず画面で操作(音声では承認できない) |

プラン別に「何ができるか」がはっきり分かれている
今回の更新は全ユーザーに同じものが降ってくるわけではありません。報道されている範囲では、次のように分かれています。
プラン | 音声から使えるもの |
|---|---|
Plus / Pro | モバイルのWorkタブ。資料作成、メールの下書き、Slackの要約に加え、サイト構築・プレゼン作成・クラウドブラウザ・財務まわりの機能にも音声から到達できる |
Free / Go | プラグインと連携アプリの操作 |
つまり「成果物を作らせる」レイヤーに音声で入れるのは有料プランで、無料・低価格帯は「つないだアプリを声で操作する」ところまで、という切り分けです。
加えて、利用できるモデルや上限はプランとワークスペース設定によって変わり、Workについては段階的な展開とされています。社内の全員が同じ日に同じ機能を使えるとは限らない、という前提で展開計画を立ててください。
料金と利用時間の上限は、ここでは断定しません
音声の利用時間の上限や超過時の扱いについては、参照した媒体によって記述が割れていました。具体的には、同じ「1分あたりのクレジット消費」の話が、ある媒体ではBusiness Standardの超過分として、別の媒体ではBusiness Premiumの条件として書かれています。
本記事は2026年9月24日時点の公開情報にもとづいていますが、この点については私が公式ページで直接確認できていないため、数字を断定して書きません。契約前には必ず、その時点の公式の料金ページとヘルプページでご確認ください。
これは慎重すぎる態度に見えるかもしれませんが、他社サービスの料金を又聞きで書いて外すのは、読者が実際に損をする種類の間違いです。私たちは社内ルールとして「公式で自分の目で確認した数字だけを書く」を徹底しています。
いちばん重要なのは「音声では承認できない」という仕様
今回の更新で、実務上もっとも意味が大きいのはここだと考えています。
音声で会話しながら連携アプリを呼び出せるようになりましたが、その操作を実行してよいかどうかの承認は、音声では行えません。画面上で承認する必要があります。
「便利さが半減するのでは」と感じるかもしれません。しかし、これは制限ではなく設計です。音声は聞き間違い・言い間違いが構造的に混入する入力手段で、周囲の会話を拾う可能性もあります。その経路に「送信」「支払い」「公開」といった取り消せない操作の最終判断を載せるのは、単純に危険です。
連携しても、アカウント全部に手が届くわけではない
もうひとつ押さえておきたいのが権限の扱いです。アプリを連携しても、それだけで音声がそのアカウントの全てにアクセスできるようになるわけではありません。既存の権限設定と利用上限がそのまま引き継がれます。
言い換えると、音声対応は「新しい入口」であって「新しい権限」ではないということです。すでにメール連携を許可しているなら音声からも届きますし、許可していないなら音声でも届きません。導入時に確認すべきなのは音声の設定画面ではなく、その手前にある連携アプリの権限設定です。
この考え方は音声に限った話ではありません。メールやカレンダーをAIに任せる際の権限設計については、AIにメール・予定を任せる境界の作り方で体系的に整理しています。
私の無人運用も、結局この形に落ち着いた
私は中古のMac miniを常駐サーバーにして、AIエージェントを毎日決まった時刻に自動実行させています。記事の執筆、ニュースの収集、定型作業の変換といったジョブが、人が寝ている間に動く仕組みです。
この運用を組み立てる過程で何度か設計を変えましたが、最終的に固まったのは次の形でした。
- 実行は完全に自動化する:起動・調査・生成までは人が介在しない
- 公開・送信の直前に機械のゲートを置く:あらかじめ定めた基準と照合し、満たさないものは自動的に差し止める
- 差し止まったものは人の画面に残す:黙って消えることがないようにする
成果物を作らせるところまでは自動でよく、外に出る瞬間だけは判断を人に戻す。この線引きを外すと、品質の低いものが世に出るか、逆に人の確認待ちが積み上がって自動化の意味が消えるかのどちらかになります。
今回のOpenAIの仕様は、まさにこの線と同じ位置に引かれています。音声は起動を軽くするために使い、承認は画面という重い経路に残す。偶然ではなく、自動化を実務で回すと辿り着く場所なのだと思います。

これまでの音声活用は「入力」だった。今回から「起動」になる
ここは実感として大きい変化なので、自分の使い方を例に説明します。
3つの音声入力ツールを用途で使い分けてきた
私はこれまで、音声をキーボードの代わりとして使ってきました。1つのツールに絞らず、用途別に3つを併用しています。
- 速度最優先のツール:反応が速く、AIへの指示を連続で投げるときに使う
- 整形品質最優先のツール:長文のメールや提案書の下書き、記事の初稿など、そのまま文章として成立してほしいときに使う
- オフライン処理のツール:機密を含む打ち合わせメモなど、クラウドに送りたくない内容に使う
「1つに絞る」より「用途別に切り分ける」ほうが結局速い、というのが実運用での結論です。各ツールの精度・料金の比較は音声入力AI比較|評判・精度・料金で選ぶ完全ガイドにまとめています。
重要なのは、これらはすべて「文字を打つ手間を省く」道具だったということです。出てくるのはテキストで、そのテキストを何に使うかは人が決めていました。
「起動」になると、必要になるものが変わる
今回の更新で音声は、テキストを生む道具から処理を走らせる引き金に変わります。ここで必要になるものが2つ増えます。
1つは言い直しのコストです。入力なら誤変換を目で見て直せますが、起動は走り出してから気づくことになります。「何を頼むか」を口に出す前に決めておく習慣が要ります。
もう1つは作業の粒度です。音声は長い仕様を伝えるのに向きません。「先方への返信を下書きして」のように、一文で言い切れる大きさに仕事を割っておくことが前提になります。逆に言えば、普段から業務が細かく定義されている組織ほど、この機能の恩恵を受けやすいということです。
中小企業が音声で任せてよい仕事・任せてはいけない仕事
ここからは、実際に社内展開する前提での判断基準です。
任せてよい仕事の条件は「取り消せること」
- 下書きの生成:メールの返信案、議事メモからの資料起こし。出てきたものを人が読んでから使うので、間違っても損害が出ません
- 要約・整理:Slackスレッドや長いメールの要点抽出。読む手間を減らすだけで、外部への影響がありません
- 調べものの起票:移動中に思いついた調査を投げておき、デスクに戻ってから結果を読む。時間の使い方として素直に効きます
共通しているのは、成果物が社内に留まり、人が読んでから次に進むという点です。
任せてはいけない仕事の条件は「不可逆であること」
- 送信・投稿・公開:メールの送信、SNSへの投稿、Webサイトの更新。取り消せないか、取り消しても痕跡が残ります
- 支払い・契約に関わる操作:金額が動くもの、対外的な約束になるもの
- 機密を含む口述:取引先名や個人情報を声に出すこと自体が、周囲に聞かれるリスクを持ちます。移動中・カフェ・共有スペースでは特に注意が必要です
3つ目は見落とされがちですが、私は音声運用でもっとも現実的なリスクはここだと考えています。システム側の権限設計をどれだけ固めても、声に出した情報は周囲に届きます。機密を含む内容はオフライン処理の音声入力ツールに回すか、そもそも声で扱わないという運用ルールを先に決めてください。
音声で頼むときの「言い方の型」
文字入力と音声では、通る頼み方が変わります。キーボードなら長い仕様を書き連ねても成立しますが、声は違います。ここは社内展開でつまずきやすいので、型として共有しておくことをおすすめします。
型1:対象 → 動詞 → 出力先の順で言う
音声で伝わりやすいのは、何を・どうして・どこに出すかを短く言い切る形です。
- ❌ 「昨日の打ち合わせの件なんだけど、先方が言っていた納期の話を踏まえて、あとで送る返信の下書きを作っておいてほしくて、できれば丁寧めの文体で」
- ⭕ 「昨日の打ち合わせのメモから、納期確認の返信を下書きして」
前者は情報としては豊かですが、途中で条件が増えるため意図が拡散します。後者のように一文で言い切り、細かい調整は出てきた下書きを見てから文字で指示するほうが、結果的に速くなります。
型2:条件は「後出し」にする
最初から完璧な指示を口頭で組み立てようとしないでください。まず粗く起動し、返ってきたものに対して「もう少し短く」「敬語を強めに」と足していくほうが、音声では圧倒的に扱いやすくなります。
これは対話型AI全般に言えることですが、音声では特に効きます。言い直しのコストが、書き直しのコストより高いからです。
型3:固有名詞は避けるか、言い換える
音声認識は固有名詞に弱く、社名や人名は高い確率で誤変換されます。加えて前述のとおり、機密の観点でも声に出すべきではありません。
「○○株式会社への返信」ではなく「昨日の打ち合わせ先への返信」のように、文脈で特定できる言い方に置き換える。これは精度とセキュリティの両方に効く、実務的に価値の高い習慣です。
時間帯別の使いどころ——移動時間を実作業に変える
抽象論だけでは導入判断が難しいので、私が現実的だと考えるシナリオを3つ挙げます。いずれも「手が塞がっていて、画面は見られないが、頭は空いている」時間帯が対象です。
朝の移動中:その日の起点をつくる
出社前や現場への移動中に、Slackの未読スレッドの要約を頼み、返信が必要なものだけを下書きさせます。オフィスに着いた時点で「読む」工程が終わっており、判断だけから1日を始められます。
ここで重要なのは、下書きまでで止めることです。送信は席に着いてから画面で行う。移動中に送信まで済ませたくなりますが、その1分の短縮のために誤送信のリスクを取る価値はありません。
訪問先からの帰り道:記憶が新しいうちに起票する
打ち合わせ直後は、内容を最も正確に覚えている時間帯です。ここで議事メモを口述し、資料の下書きや見積もりの叩き台まで起動しておきます。
この使い方は、従来は「メモアプリに吹き込んで、あとで自分が清書する」だった工程が、そのまま成果物まで進む点に価値があります。清書という最も気力を要する工程が消えるため、後回しにして記憶が薄れる、という失敗が減ります。
ただし、取引先が特定できる情報は声に出さない。これは繰り返しますが、運用ルールとして最初に決めるべき部分です。
移動の合間:調べものを走らせておく
「あの制度の最新の条件を調べておいて」といった調査は、結果を見るのが後でよい典型的な仕事です。音声で起動し、デスクに戻って読む。通話を切ってもタスクが継続する仕様は、まさにこの使い方を想定したものだと考えられます。
逆に言えば、その場で結果を見て判断したい仕事は音声に向きません。画面を見られない状況で起動しているのだから当然ですが、ここを混同すると「音声は使えない」という誤った結論になります。
通話を切った後も仕事は続く——非同期前提で設計する
もうひとつ、運用に効く仕様があります。音声での会話を終了しても、走り始めた未完了のタスクはテキスト側で継続するという挙動です。
これは地味ですが重要で、「移動中に声で起動し、オフィスに戻ってデスクトップで続きを確認する」という使い方が成立します。逆に言えば、通話を切ったら止まると思い込んでいると、意図せず走り続けているタスクに気づけません。
社内展開する際は、次の2点をルール化しておくことをおすすめします。
- 音声で起動したタスクは、その日のうちに画面で結果を確認する
- 起動したまま放置したタスクがないか、週に一度は履歴を見る
なお、音声の機能自体にも範囲の制限があります。動画や画面共有には対応しておらず、ライブラリに保存したファイルを自動で参照することもできません(手動で添付することは可能です)。「画面を見せながら相談する」使い方はまだできない、と理解しておいてください。
使用量は「チャットの残り」ではなくエージェント系の枠を見る
音声からWorkを起動するようになると、避けて通れないのが使用量の話です。
ここで多くの方が誤解するのが、「ChatGPTの使用量」と聞いてチャットの残り回数を思い浮かべてしまう点です。実際には、上限が設定されているのはエージェント系の機能であり、音声からWorkを呼ぶ使い方はこちらの枠を消費します。
音声で気軽に起動できるようになるということは、気軽に枠を消費できるようになるということでもあります。私自身、AI関連の月額コストが体感より増えていた時期があり、原因を調べると「平均」で把握していて「いまの実額」を見ていなかったことでした。
導入初月は、次の運用をおすすめします。
- 週に1回、管理画面で使用量の消化ペースを確認する
- 面(モバイル・Web・デスクトップ等)ごとの内訳を見て、音声経由がどれだけ食っているかを把握する
- 上限に近づいたときの選択肢(追加購入・プラン変更・待つ)を、あらかじめ社内で決めておく
なお、使用量の表示には反映の遅れがあります。リアルタイムの数字だと思って判断しないでください。
導入前チェックリスト
社内で音声エージェントを使い始める前に、次の7点を確認してください。
- プランの確認:自社の契約でWorkタブが音声から使えるか(Plus / Pro かどうか)
- ワークスペース設定の確認:管理者側で連携アプリや音声機能が制限されていないか
- 連携アプリの権限棚卸し:メール・カレンダー・Slackに、どこまでの権限を許可しているか
- 承認フローの明文化:送信・公開・支払いは必ず画面で承認する、と文書化する
- 口述禁止情報の定義:取引先名・個人情報など、声に出さない情報を先に決める
- 未完了タスクの確認ルール:通話終了後に走り続けるタスクをどう追うか
- 使用量のモニタリング担当:誰が、どの頻度で消化ペースを見るか
このうち4番目と5番目は、ツールの設定では担保できません。人の運用ルールとして決めるしかない部分です。逆にここさえ決まっていれば、音声エージェントは移動時間を実作業時間に変える強力な道具になります。
よくある質問
無料プランでも音声で仕事を任せられますか
Free / Go では、連携したプラグインやアプリを音声で操作するところまでです。資料やプレゼンを作らせる Workタブへの音声アクセスは Plus / Pro が対象とされています。「まず試したい」という目的なら無料でも感触はつかめますが、成果物を作らせる体験は有料プランでないと得られないとお考えください。
音声で承認できないのは、いずれ改善されますか
将来の仕様変更について私は断定できません。ただ、仮に音声承認が可能になったとしても、不可逆な操作については画面承認を社内ルールとして残すことをおすすめします。ツールが許すことと、自社が許すべきことは別だからです。
画面を見せながら相談することはできますか
現時点ではできません。音声機能は動画や画面共有に対応しておらず、保存済みファイルを自動で参照することもありません(手動での添付は可能です)。「この画面のここが分からない」という相談の仕方は、まだ成立しないと理解してください。
セキュリティ上、最初に確認すべきことは何ですか
音声の設定ではなく、連携アプリの権限設定です。音声は入口が増えただけで、権限そのものは既存の設定を引き継ぎます。メール・カレンダー・Slackに何をどこまで許可しているかを棚卸しすることが先決です。
社内に展開する順番のおすすめはありますか
「下書きを作らせる用途」から始めてください。成果物が社内に留まり、人が必ず読んでから次に進むため、失敗しても損害になりません。ここで各自が言い方の型をつかんでから、連携アプリを使う用途に広げるのが安全な順序です。
まとめ
2026年9月23日の更新で、ChatGPTの音声は「文字を打つ代わり」から「仕事を起動する引き金」に変わりました。
押さえるべき要点を改めて整理します。
- 更新は3つ:音声モデルのGPT-6世代化、会話中の連携アプリ利用、Workの音声対応
- Plus / Proはモバイルの Workタブまで、Free / Go はプラグインと連携アプリまで
- 音声では承認できない。実行の可否は画面で判断する
- 連携は「新しい入口」であって「新しい権限」ではない
- 通話を切っても未完了タスクはテキストで続く
- 料金・利用時間の上限は媒体によって記述が割れているため、契約前に公式ページで確認する
音声で任せられる範囲が広がるほど、「何を任せないか」を決めておくことの価値が上がります。私の経験では、AI導入がうまくいかない会社の多くは機能を理解していないのではなく、任せない範囲を決めていないために毎回判断が揺れています。
どの業務から音声に載せ、どこに承認を残すか。自社の業務に当てはめて整理したい場合は、株式会社Fyveの専属AI活用顧問サービスで、業務の棚卸しから一緒に設計しています。
※本記事は2026年9月24日時点の公開情報にもとづいています。機能の提供範囲・料金・上限は変更される可能性があるため、導入判断の際は必ず最新の公式情報をご確認ください。
Workにしかできない仕事は、2つだけ

同じ仕事をChatにも投げた結果と、Work固有に残った2つ(全26ページ)
Workに投げていた仕事、Chatでも同じものが返ってきます。見積の比較表、提案スライド、アンケートの集計レポート——3つとも同じ指示文で両方に出して、時間を測りました。Work固有だとよく言われる5つも、公式ドキュメントと実機で1つずつ確かめています。両方に課金して毎日どちらも使っている立場から、測った数字をそのまま出します。
- 3つの仕事を両方に投げた記録——出力・かかった時間・直した箇所
- 定期実行は普通のチャットから登録できる(実機で確認)
- Workを選ぶ理由になった2つと、ならなかった3つ
- 自分の仕事で15分で確かめる手順。この資料は信じなくて大丈夫です
メールアドレス登録で他にも様々な資料を閲覧できます








+6PDF 15点・合計400ページ + すぐ使えるzip素材 3点
どれも登録後の受け取りページから、まとめてダウンロードできます。
毎週配信の無料ニュースレター「AIネイティブ超研究」の購読特典です。メール登録後すぐ、受け取りページのご案内が届きます。そこにはこの資料に加えて、過去の特典もすべてまとめて置いてあります。あわせて、AI活用に関するお知らせやお役に立てそうなご案内をお送りすることがあります。解除はいつでも1クリック。