AI最新情報 読了 8 分

「使いやすそう」――Googleの新音声AI「Gemini 3.8 Flash TTS」は文章だけで声を設計できる

Shiritomo編集部 @shiritomoAI_jp 2026年9月25日 更新
「使いやすそう」――Googleの新音声AI「Gemini 3.8 Flash TTS」は文章だけで声を設計できる

「ナレーションっぽさはまだ残るけど声タイプによってはかなり使いやすそう」。
9月24日、AIキャラクター開発者として知られるtegnike氏がXに投稿したこの一言に、388件の「いいね」と229件の「ブックマーク」が集まりました。
声優をキャスティングせず、文章を打つだけでオリジナルの声が作れる時代がいよいよ来たのか——きっかけは、Googleが発表した新しい音声生成AIです。

SNSでの発信やポッドキャスト、動画のナレーションを自分たちで作っている人にとっては、収録の手間やコストに直結する話です。
何ができるようになったのか、実際どこまで使えそうなのかを調べました。

先に結論をまとめると:
– Googleが音声生成AI「Gemini 3.8 Flash TTS」と軽量版「Flash-Lite TTS」を発表。
自然言語のプロンプトだけで声質・アクセント・話し方をゼロからデザインできます
– 100以上の言語・方言に対応し、既存の声ライブラリも、Google公式ブログによれば2,000種類以上。
第三者機関のベンチマークでは発音の安定性部門で首位に立ちました
– 声を複製(クローン)するには本人の同意録音が必須で、生成した音声にはAI検出用の透かし「SynthID」が組み込まれる仕組みです

声を「選ぶ」から「作る」に変えた発表

Googleは日本時間9月24日未明、公式Xアカウントで新しい音声生成モデル「Gemini 3.8 Flash TTS」と、より軽量な「Gemini 3.8 Flash-Lite TTS」を発表しました。
同社の公式ブログによると、これまでの音声合成AIが用意された声の中から選ぶスタイルだったのに対し、今回のモデルは年齢・アクセント・声質といった特徴を文章で指定するだけで、声そのものをゼロから作り出せるのが最大の特徴です。

Flash TTSはゲームやオーディオブック、ポッドキャストといった作り込んだキャラクター表現向け、Flash-Liteは大量のダビングや音声エージェントなど、コストを抑えた量産向けという役割分担になっています。
セリフの一行ごとにトーンやアクセント、間の取り方を指示できるほか、笑い声やため息、息をのむ音といった言葉以外の演技も制御できるとされています。

音声生成を、まるで創造性あふれるスタジオに変える——シンプルなプロンプトだけで100以上の言語にわたってオリジナルの声をゼロからデザインでき、トーンやアクセント、間の取り方までセリフ単位で指示できる、という趣旨の投稿です。

ただ、公式発表の言葉だけでは「実際にどれだけ自然な声が作れるのか」までは分かりません。
第三者の評価と、実際に触ったユーザーの反応を確かめてみました。

声はどこまで自然に、そして安全に作れるのか

ベンチマークでの評価はどうだったのか?

音声AIの評価機関Artificial Analysisは、Gemini 3.8 Flash TTSが同社の「発音の頑健性ベンチマーク」で89.5%のスコアを記録し首位デビューしたと報告しています。
前バージョンのGemini 3.1 Flash TTS(88.1%)や競合のSpaceXAI TTS(87.6%)を上回る結果です。
また、複数の音声AIを比較する「プロバイダー音声アリーナ」ではEloレーティング1,265で2位につけました。

Gemini 3.8 Flash TTSは、同社の「発音の頑健性ベンチマーク」で首位デビューし、「プロバイダー音声アリーナ」でも2位につけた、という趣旨の投稿です。

日本語ではどれくらい使えるのか?

数値のベンチマークだけでは、日本語での使い勝手までは見えてきません。
冒頭で紹介したtegnike氏は、実際にGemini 3.8 Flash TTSを日本語で試した結果を投稿しています。

「ナレーションっぽさはまだ残るけど声タイプによってはかなり使いやすそう」という評価から読み取れるのは、万能ではないものの、声のタイプを選べば実用レベルに近づいているという手応えです。
この投稿には53,000件超のインプレッションが集まっており、日本の開発者・クリエイター層の関心の高さがうかがえます。

声を複製されて悪用されない仕組みはあるのか?

自分そっくりの声を作れるということは、悪用のリスクも気になるところです。
この点についてGoogleの公式発表は、声のクローン(複製)機能を使う際、声の持ち主本人による同意録音の提出が必須で、参照する話者の声と一致しなければ音声を生成できない仕組みになっていると説明しています。
さらに、生成されたすべての音声クリップには、AIが作った音声であることを判別できる透かし技術「SynthID」が組み込まれます。
この透かしは人の耳では聞き取れないものの、機械的な検出は可能とされています。

同意確認の仕組みがある一方、実際の運用でどこまで厳格にチェックされるのか、悪用を完全に防げるのかは、公開情報だけでは判断がつきません。
今後の実例が積み上がるまでは、注視が必要な部分でしょう。

無料で試すには?

Google AI Studio上でGemini 3.8 Flash TTSを試すことができ、音声のデザインから台本ごとの演技指示までを行える専用のプレイグラウンドが用意されています。
開発者向けAPIの料金は、2026年内はFlash TTSが出力100万トークンあたり9ドル、Flash-Liteが6ドルと案内されており、前世代の「Gemini 3.1 Flash TTS Preview」(20ドル)よりも値下げされた形です。
2027年1月からは標準料金としてそれぞれ18ドル・12ドルに上がる予定とされています。
個人が短いナレーションを試す程度であれば、AI Studio上での無料の範囲でも十分に感触をつかめそうです。

Shiritomo編集部の考察:SNS運用者が見ておくべきは「声の統一感」

これまで動画やポッドキャストのナレーションを内製しようとすると、声優への発注か、既製の合成音声かの二択になりがちでした。
Gemini 3.8 Flash TTSが面白いのは、ブランドやキャラクターごとに「声のトーン」を文章で定義し、複数のコンテンツで使い回せる点です。
SNS運用でいえば、投稿ごとに担当者が変わっても同じ「声」で動画ナレーションを統一できるようになる可能性があります。
一方で、同意録音という仕組みがある以上、社員や出演者本人の声をクローンして使う場合は、社内での許諾フローを先に整えておく必要が出てきそうです。
技術が使えるようになった瞬間に運用ルールが追いついていないと、後から揉める典型的なパターンなので、導入を検討するなら「誰の声を、誰の同意で使うか」を先に決めておくことをおすすめします。

まとめ

Googleが発表した「Gemini 3.8 Flash TTS」は、声を選ぶ道具から声を作る道具へと踏み出した新しい音声生成AIです。
ベンチマークでの評価も高く、日本語でも早速試したユーザーから前向きな反応が出ている一方、同意確認や透かし技術の実効性は今後の運用で見極める必要がありそうです。

さらに深掘りしたい方へ