Gemini 3.8 Flash TTSとは|1分の料金と選び方
「読み上げ音声をAIで作りたいが、原稿1本でいくらかかるのか見当がつかない」——音声合成を業務に入れようとすると、最初につまずくのはこの見積もりです。
結論から言うと、Gemini 3.8 Flash TTSの費用は原稿の文字数ではなく、できあがる音声の「再生時間」でほぼ決まります。入力したテキストの料金は出力音声の70分の1以下で、実務上は誤差です。そして単価は2026年12月31日までの導入価格で、2027年1月1日から倍になります。
株式会社Fyveは、中小企業の業務にAIを組み込む仕事をしています。私たちは音声を「読ませる」側はすでに日常業務に入れていますが、「喋らせる」側はまだ入れていません。その線引きをどこで動かすかという視点で、2026年9月23日に発表されたこの2モデルを料金から読み解きます。
結論:Gemini 3.8 Flash TTSの料金で押さえる3点
細かい仕様に入る前に、見積もりに必要な3点だけ先に置きます。
- 費用は再生時間で決まる:課金の主役は出力される音声トークンです。1分の音声で約1,920トークン(1秒32トークン換算)。原稿の文字数がいくら増えても、費用に効くのは「何分の音声になったか」です
- 単価は期間限定:Flash TTSは出力$9.00/100万トークン、Flash-Liteは$6.00。どちらも2026年12月31日までで、2027年1月1日から倍額($18.00/$12.00)になります
- 2モデルの差は出力単価1.5倍:入力単価は同じ$0.50で、違うのは出力だけです。声を設計したいならFlash TTS、量を捌きたいならFlash-Liteという分かれ方になります
「新しいTTSが出た」という見出しだけで予算を組むと、この3点をすべて落とします。以下で根拠を示します。
Gemini 3.8 Flash TTSとは|2026年9月23日に出た2つのモデル
Googleは2026年9月23日、テキスト読み上げ(TTS=Text To Speech)に特化した2つのモデル「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」の提供開始を公式ブログで発表しました。プレビューではなく、発表当日から一般提供されています。
公式は「これまでで最も表現力のある音声生成モデル」と位置づけています。これまでのTTSが「用意された声の中から選ぶ」ものだったのに対し、文章で声そのものを設計できる点が今回の変更の中心です。
2つのモデルの役割分担
同時に2つ出たので混乱しやすいのですが、想定用途ははっきり分かれています。
- Gemini 3.8 Flash TTS:声の設計とキャラクター作りに寄せた上位モデル。ゲーム・オーディオブック・ポッドキャストなど、1本の作品として作り込む用途。セリフを行単位で演出できます
- Gemini 3.8 Flash-Lite TTS:大量処理とコスト効率に寄せたモデル。吹き替え・音声コンテンツの量産・音声エージェントなど、同じ処理を数を打って回す用途
「作品を作る」のがFlash TTS、「同じ処理を大量に流す」のがFlash-Liteという理解で、実務上はほぼ間違いません。
スペック(公式ドキュメントで確認できた範囲)
項目 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
モデルID |
|
|
対応言語 | 130言語 | 101言語 |
プリセット音声 | 30種(Kore・Puck・Charon・Zephyr など)+拡張ボイスライブラリ | |
話者数 | シングル話者は全モデル対応。マルチ話者はプリセット音声で最大2名 | |
出力形式 | 既定はWAV(24kHz・モノラル・16bit PCM)。ストリームはヘッダなしPCM、G.711のmulaw/alawも選択可 | |
サンプルレート | 24000/16000/8000 Hz から選択 | |
提供形態 | API経由のみ(モデルの重みは公開されない) | |
提供チャネルはGemini API・Google AI Studio・Gemini Enterprise・Gemini Notebook・Google Vidsです。Flash-Lite TTSはGoogle Vidsの音声機能も担っています。
⚠️ 発表文と仕様書で数字の粒度が違う
ここは見積もりの前に知っておいたほうがいい点です。公式ブログと公式ドキュメントで、同じ項目の数字が揃っていません。
- 言語数:ブログは「100以上の言語と方言」。ドキュメントは「Flash TTS 130/Flash-Lite 101」
- 音声数:ブログは「2,000以上のすぐ使える音声」。ドキュメントは「プリセット30種+拡張ライブラリに数百」
矛盾ではなく、ブログが総計や上限を丸めて語り、ドキュメントがモデル単位で書いているという粒度の差です。社内の稟議や提案書に載せる数字は、必ずドキュメント側を採ってください。ブログの丸めた数字を根拠に「101言語しかなかった」と後から言われるのは、こちらが損をするだけです。

料金表(2026年9月24日時点)
以下はGemini API公式料金ページで2026年9月24日時点に確認した数字です。すべて100万トークンあたりの米ドル建てで、税や為替は含みません。契約前には必ず最新の公式価格ページでご確認ください。
モデル | 入力(テキスト) | 出力(音声) | 2027年1月1日から |
|---|---|---|---|
Gemini 3.8 Flash TTS | $0.50 | $9.00 | $1.00/$18.00 |
Gemini 3.8 Flash-Lite TTS | $0.50 | $6.00 | $1.00/$12.00 |
(参考)Gemini 2.5 Flash TTS Preview | $0.50 | $10.00 | — |
(参考)Gemini 3.8 Live(音声対話) | $3.00($0.005/分) | $12.00($0.018/分) | — |
読み取れることが3つあります。
1. 前世代のプレビュー版より安くなっている
比較対象として残っているGemini 2.5 Flash TTS Previewは出力$10.00です。新しいFlash TTSは$9.00、Flash-Liteは$6.00なので、表現力を上げたうえで単価は下がっています。しかもプレビュー版には無料枠がありませんでしたが、新しい2モデルには無料枠があります。
2. 2027年1月1日に倍額になる
ここが最重要です。$9.00/$6.00という単価には「2026年12月31日まで」という期限が公式ページに明記されており、2027年1月1日から$18.00/$12.00になります。
これは3.8ファミリーで繰り返されている型です。私たちは9月初旬に、汎用モデルのGemini 3.8 Flashでまったく同じ構造(導入価格が2027年から倍額)を確認して記事にしています。TTSでも同じことが起きたという読み方が正確で、「TTSだけ特別に安い」わけではありません。
見積もりで私たちが守っているルールは単純です。半年以上使い続ける前提の仕組みは、最初から2027年価格で見積もる。導入価格で予算を組むと、年明けに「同じ処理なのに請求が倍になった」という説明を自分でする羽目になります。
3. バッチ処理は半額
即時応答が要らない処理なら、バッチAPI経由で単価が50%引きになります。Flash TTSで出力$4.50、Flash-Liteで$3.00です(いずれも2026年内)。
読み上げ音声の生成は、そもそも即時性が要る処理ではありません。記事や資料の音声化のように「夜のうちに作っておけばいい」ものは、最初からバッチに寄せるのが正解です。ここを分けるだけで音声まわりの費用は半分になります。
🔴 費用は「文字数」ではなく「再生時間」で決まる
料金表を見ても「で、原稿1本でいくらなのか」は分かりません。ここを換算できるかどうかが、見積もりを立てられるかどうかの分かれ目です。
音声トークンの換算式
Geminiの公式ドキュメントは、音声を1秒あたり32トークンとして数えると説明しています。この換算で並べると次のようになります。
音声の長さ | 音声トークン | Flash TTS(2026年内) | Flash-Lite(2026年内) | Flash-Lite(2027年〜) |
|---|---|---|---|---|
1分 | 1,920 | $0.017 | $0.012 | $0.023 |
10分 | 19,200 | $0.17 | $0.12 | $0.23 |
60分 | 115,200 | $1.04 | $0.69 | $1.38 |
1時間の音声で約100〜160円(1ドル150円換算)です。感覚的には「思ったより安い」という水準で、ここで止まると判断を誤ります。効いてくるのは本数です。
入力テキストの料金は出力の70分の1以下
日本語の読み上げは1分あたり300〜350字が目安なので、1時間の音声は原稿にして18,000〜21,000字ほどになります。これを入力単価$0.50/100万トークンで計算すると約$0.01です(日本語1文字を1トークンと置いた多めの見積もりです。公式ドキュメントが示すのは英語で1トークン約4文字という目安のみで、日本語の換算は明記されていません)。
同じ1時間の出力が$0.69〜$1.04ですから、入力側は出力側の70分の1から100分の1にしかなりません。
これが実務上いちばん効く事実です。見積もりを原稿の文字数で立ててはいけません。文字数を削っても費用はほとんど減りません。費用を減らしたいなら、削るべきは「読み上げる長さ」そのものか、モデルの選択か、バッチ化です。
⚠️ 公式の「分あたり」表記と換算が一致しない
ここは正直に書いておきます。上の換算には、公式ページの記載どうしで合わない部分があります。
公式料金ページは音声対話モデルのGemini 3.8 Liveについて「$12.00/100万トークン、または$0.018/分」と併記しています。ところが$12.00で$0.018になるトークン数を逆算すると1分あたり1,500トークン、つまり1秒あたり25トークンです。先ほどの32トークン/秒と一致しません。
加えて、公式ドキュメントで「1秒32トークン」と書かれているのは入力音声の換算としてであり、TTSの出力音声トークンをどう数えるかは、音声生成のドキュメントには明記されていませんでした(2026年9月24日時点)。
したがって実務上の扱いはこうなります。
- 概算は32トークン/秒で置く。上振れ側に倒れるので、予算が足りなくなる事故が起きません
- 確定値はAPIレスポンスの使用量メタデータから取る。実際に1本流して、返ってきたトークン数を単価に掛けるのが唯一正確です
- 「分いくら」の数字を稟議書に断定で書かない。公式が併記している分単価と、トークン換算の結果が食い違う以上、レンジで出すのが誠実です
音声入力の側では、1秒あたりのトークン数を明快な換算式として公開しているモデルもあります。換算式が公開されているかどうかで見積もりの精度が変わる、という話は別の記事で扱っています。
記事1本を音声化すると実際いくらか
具体例で出します。9,000字の記事を読み上げると、1分325字換算で約28分の音声になります(この読み上げ速度は公式が示す数字ではなく、一般的な日本語ナレーションの速度として私が置いた前提です。実際の長さは原稿と話速で変わります)。
- Flash-Lite(2026年内・バッチなし):約$0.32=約48円
- Flash TTS(2026年内・バッチなし):約$0.48=約73円
- Flash-Lite(2027年以降・バッチ利用):約$0.32=約48円
最後の行が示すとおり、2027年の倍額はバッチ化でちょうど相殺できます。今のうちにバッチ前提で設計しておけば、値上げの影響をゼロにできるということです。100本の記事を音声化しても5,000円前後に収まります。

FlashとFlash-Liteのどちらを選ぶか
入力単価が同じで出力単価だけ1.5倍違うので、判断は「声の作り込みにお金を払う価値があるか」の一点に集約されます。
やりたいこと | 推奨 | 理由 |
|---|---|---|
ブランドの専用ナレーターを1体作り込む | Flash TTS | 声の設計と行単位の演出が上位モデルの担当。作る回数自体は少ないので単価差は効かない |
記事・マニュアルを大量に音声化する | Flash-Lite | 同じ処理の反復。本数で効く出力単価が3分の2で済む |
多言語の吹き替えを量産する | Flash-Lite | 公式が吹き替え量産を想定用途として名指ししている |
キャラクターに演技をさせる | Flash TTS | 間の取り方・感情・方言の切り替え・相づちまで行単位で指示できる |
101言語に自分の使う言語が入っているか怪しい | Flash TTS | 130言語と対応幅が広い。日本語はどちらも対応 |
迷ったらFlash-Liteから始めるのが安全です。品質が足りなければFlash TTSに上げればよく、モデルIDを差し替えるだけで済みます。逆に「とりあえず上位で」と始めると、本数が伸びたときに1.5倍の単価がそのまま効いてきます。
なお品質面では、第三者のHume AIによるVoice Design Benchmarkで、Flash TTSが71.4で総合1位、アクセント再現が60.8と報告されています。同じくOverall Quality IndexではFlash TTSが1位、Flash-Liteが2位です。日本語を含む6言語のブラインド比較でも上位に入ったとされています。
運用に乗せる前に見る4つの制約
料金の次に効いてくるのが制約条件です。ここを知らずに設計すると、作り直しになります。
1. カスタム音声には保存の上限と期限がある
設計・複製した音声を保存する場合、1プロジェクトあたり200音声まで、有効期限は1年です。保存しない設定で使う場合は、発行される音声キーの有効期限が7日になります。
「ブランドの声」を作るつもりなら、1年ごとの更新作業が発生することを運用設計に織り込んでください。担当者が代わったあとに期限が切れて音声が出なくなる、というのは十分に起こり得ます。
2. 声の複製には本人の同意録音が要る
既存の声を複製する機能は、約30秒のサンプル音声で動きます。ただし声の持ち主による口頭の同意録音が必要で、参照音声の話者と一致するか検証されます。勝手に他人の声を取り込むことはできない設計です。
そして日本の事業者にとって重要なのは提供地域です。AI Studio経由の声の複製は、イリノイ州・テキサス州・EEA(欧州経済領域)・英国・スイス・インドでは利用できません。裏を返せば日本は対象地域に含まれます。欧州法人と共同で進める案件では、こちらでは動いて向こうでは動かないという差が出ます。
3. 生成音声には電子透かしが入る
Gemini Audioが生成した音声にはすべてSynthIDによる電子透かしが埋め込まれ、さらにC2PAの来歴情報も付与されます。人間の耳には分かりませんが、AI生成音声として検出可能な状態が維持されます。
これは制約というより前提です。「AIが作った音声だと分からないようにしたい」という要望には、この機能がある限り応えられません。営業段階でここを曖昧にすると後で揉めます。生成音声を使うこと自体は問題ないので、最初から開示する運用にしておくほうが早いです。
4. API経由でしか使えない
モデルの重みは公開されておらず、自社サーバーでの動作はできません。社内規程で外部APIへのデータ送信が制限されている環境では、原稿テキストを送る時点で引っかかる可能性があります。読み上げさせたい原稿に機密が含まれる業務では、まずそこの可否から確認してください。
私たちが「音声出力」をまだ業務に入れていない理由
ここまで料金と制約を整理したうえで、私たちの現時点の立場を書いておきます。
私たちが中小企業の現場に入れてきたのは音声入力です。打ち合わせを録音してテキスト化し、そのまま議事録や提案資料に落とす流れは日常的に回しています。介護や保育の記録を音声で取る仕組みも同じ系統です。音声を「読ませる」側は、確実に工数を減らします。
一方で音声出力は、まだ業務の標準には入れていません。理由は品質でも料金でもなく、音声は相手の時間を拘束するからです。28分の音声を聞くのに28分かかりますが、同じ内容のテキストなら5分で読めます。社内向けの情報伝達では、たいていテキストのほうが速い。安くなっても、読み手の時間は安くなりません。
では、どこでなら入れる価値があるのか。私たちが線を引いているのは次の3つです。
- 聞くしかない導線:運転中・作業中・視覚に制約がある利用者など、そもそもテキストを読めない状況
- 多言語化:既存コンテンツを別言語の音声に展開する。人間のナレーターを言語数だけ手配する場合と比べると、費用の桁が変わります
- 電話の一次応答:ただしこれは読み上げではなく音声対話の領域で、料金構造も別物です
3つ目については、同じGemini 3.8ファミリーでも音声対話モデルは費用の効き方がまったく違います。読み上げと対話を同じ予算感で考えると外します。
よくある質問
無料で試せますか
両モデルとも無料枠が用意されています(2026年9月24日時点)。前世代のGemini 2.5 Flash TTS Previewには無料枠がなかったので、ここは改善点です。まずAI Studioの音声プレイグラウンドで声を作ってみて、要件を満たすか確認してからAPI実装に進むのが手順として無駄がありません。
日本語の品質はどうですか
Googleは日本語を含む6言語(日本語・ブラジルポルトガル語・ベトナム語・現代標準アラビア語・メキシコスペイン語・ヒンディー語)のブラインド比較で上位に入ったとしています。ただしこれは発表側の提示する結果です。自社の原稿で1本作って聞いてから判断してください。専門用語や社名の読み間違いは、ベンチマークのスコアには出てきません。
2人以上の会話音声は作れますか
マルチ話者はプリセット音声で最大2名までです。3人以上の座談会形式を1回の生成で作ることはできないので、話者ごとに生成して編集で合成する設計になります。
どの形式で音声が返ってきますか
既定はWAV(24kHz・モノラル・16bit)です。電話系のシステムに組み込むなら8kHzのmulaw/alawも選べるので、受け側の要件に合わせて指定してください。
結局いくら予算を取ればいいですか
月に何分の音声を作るかを先に決めてください。月60分ならFlash-Liteで100円前後、月10時間でも1,000円前後(2026年内・1ドル150円換算)です。音声生成そのものの費用は、ほとんどの中小企業にとって意思決定の材料になりません。実際に効いてくるのは原稿を誰が書くか、読み間違いを誰が確認するか、という人の工数のほうです。
まとめ
Gemini 3.8 Flash TTSとFlash-Lite TTSの料金について、判断に必要な点を整理します。
- 2026年9月23日に一般提供開始。プレビューではありません
- 費用は再生時間で決まる。入力テキストの料金は出力音声の70分の1以下で、文字数を削っても費用は減りません
- 1時間の音声で$0.69〜$1.04(2026年内・1ドル150円換算で約100〜160円)
- 2027年1月1日から倍額。半年以上使う仕組みは最初から2027年価格で見積もる。バッチ化(50%引き)でちょうど相殺できます
- モデル選択は出力単価1.5倍の差。迷ったらFlash-Liteから始めて、足りなければ上げる
- 制約は保存上限200音声・1年TTL、複製には本人の同意録音、SynthID透かし、API専用。日本は声の複製の対象地域に含まれます
そして最後にもう一度。音声にする価値があるかどうかは、料金では決まりません。読めば5分で済む内容を28分の音声にするのは、安くても損です。株式会社Fyveが音声出力を業務の標準に入れていないのはその理由で、逆に「聞くしかない導線」がある業務なら、この価格帯は十分に実用の範囲に入っています。
※本記事の料金はすべて2026年9月24日時点にGemini API公式料金ページで確認した数字です。単価・提供条件は変更される可能性があるため、契約前には公式価格ページで最新の条件をご確認ください。
AIを使う会社と、使わない会社。
その差は、開き始めています。
ここ数年でAIは急速に進化し、正しく導入できている企業とそうでない企業とでは、業務効率や人件費に大きな差が生まれ始めています。「AI導入に興味はあるが、実際に何ができて、どこから手をつければいいか分からない」——そんな方は、まずこの無料プレゼントに目を通してみてください。
