Googleから、文字を読み上げる新しい音声AI「Gemini 3.8 text-to-speech」が登場しました。SNSや開発者の間で「声の演技力が格段に上がった」「言葉だけで好きな声を作れる」と大きな話題を集めています。
ひとことで言うと何ができるAI?
Gemini 3.8 text-to-speechは、「普段使っている言葉で指示を出すだけで、思い通りの声と演技を作り出せる音声AI」です。
身近な例でいうと、「台本を渡して細かく指示を出せる、とても器用な声優さん」のような存在です。たとえば「少し低い声で」「悲しそうにため息をつきながら」「早口で」と伝えるだけで、イメージにぴったりの声で文章を読み上げてくれます。
これまでの音声読み上げと比べて、私たちの身の回りでは以下のような変化が起こります。
- あらかじめ用意された声から選ぶだけでなく、ゼロから好きな声を作れる
- 笑い声やため息、相づちなどを混ぜた、自然な会話の演技ができる
- 動画のナレーションや音声ガイドが、より聞き取りやすく感情豊かになる
Gemini 3.8 text-to-speechとは?
Gemini 3.8 text-to-speechは、米Googleが発表した最新の音声生成AIモデルです。文章(テキスト)を音声に変換する技術のことを、専門用語で「Text-to-Speech(テキスト・トゥ・スピーチ、略してTTS)」と呼びます。
ChatGPTなどの文章を作るAI(テキストAI)とは異なり、このモデルは「書かれた文章を、指定された声色や感情を込めて声として出力すること」に特化しています。
今回の発表では、用途に合わせて以下の2つのモデルが用意されました。
| モデル名 | 得意なこと | 想定される使われ方 |
|---|---|---|
| Gemini 3.8 Flash TTS | 細かな声の作り込みや感情豊かな演技 | ゲーム、オーディオブック、ポッドキャスト |
| Gemini 3.8 Flash-Lite TTS | コストを抑えた大量の音声生成 | 動画の大量吹き替え、音声案内エージェント |
より細かな演出を楽しみたいときはFlash、費用を抑えて大量に音声を作りたいときはFlash-Liteというように使い分けができます。
なぜここまで話題になっているのか
これまでの音声読み上げAIは、「30種類程度の決められた声の中から好きなものを選ぶ」という使い方が一般的でした。しかし、Googleの公式発表(英語)によると、Gemini 3.8 text-to-speechでは言葉で指示するだけで新しい声をゼロから作り出せるようになりました。
また、海外のテック系ニュースサイトTechTargetの解説記事(英語)では、音声AI単体を提供するサービスと比べて、GoogleのGeminiファミリーという一つの共通基盤でさまざまなAI機能がつながる点が、企業にとって大きな利点になると分析されています。
第三者機関による音声の品質テスト(Hume AIの音声デザインベンチマーク)でもFlash TTSが総合1位を獲得しており、人間が聞き比べて評価するテスト(Voice Arena)でも日本語をはじめとする主要言語で高い評価を得ています。
主な特徴とできること
Gemini 3.8 text-to-speechには、これまでの音声AIにはなかった便利な特徴がいくつもあります。
1. 言葉の指示だけで新しい声を作る(声の生成)
「元気なDJ風の声」「落ち着いたナレーター」「架空の生き物の声」といった特徴を普段の言葉(プロンプト)で指定するだけで、全く新しいオリジナルの声を作り出せます。作成した声は保存しておくことができるため、長期にわたるプロジェクトでも声質が変わってしまう心配がありません。
2. 30秒の録音から声を再現する(ボイスレプリケーション)
自分自身の声や、権利を持っている声の30秒ほどの音声サンプルを読み込ませることで、その人の話し方を再現して文章を読ませることができます。なりすましを防ぐため、本人が口頭で同意した録音を一緒に提出し、声が一致するか確認する安全対策が取られています。
3. セリフごとに細かな演技をつける
台本の1行ごとに、舞台のト書きのように指示を書き込むことができます。話す速さや感情をコントロールできるほか、以下のような表現も可能です。
- 「はぁ」「ふぅ」といったため息や、息をのむ音
- 「あはは」などの笑い声
- 「うん」「そうですね」といった自然な相づち
- 1つの台本から2人の登場人物が会話する音声の作成
数時間に及ぶ長い文章であっても、声の調子や自然な間合いを保ちながら読み上げを続けられるとされています。
4. 豊富な言語と音声のバリエーション
ITmedia NEWSの報道によると、Flash TTSは130言語、Flash-Lite TTSは101言語に対応しており、どちらも日本語をサポートしています。地域ごとのアクセント(方言や訛り)を含む2000種類以上の音声ライブラリも用意されています。
5. AIで作ったことが分かる安全対策
作られた音声には、人間の耳には聞こえない電子透かし技術「SynthID(シンスアイディー)」が埋め込まれます。これにより、後からその音声がAIで作られたものかどうかを判別できます。声を再現する機能には、データの出自を証明する「C2PA」という認証情報も付与されます。
自分に関係ある? 向いている人と向いていない人
Gemini 3.8 text-to-speechは、普段プログラミングをしない人にとっても身近なツールに組み込まれていきます。
向いている人・恩恵を受ける人
- 動画や音声を配信しているクリエイター: 自分の動画に自然なナレーションをつけたり、オリジナルのキャラクターボイスを作りたい人
- 社内資料や教材を作るビジネスパーソン: 長い資料をわかりやすい音声解説に変換したり、説明動画を作りたい人
- 音声案内やゲームを作りたい開発者: 表現力豊かな会話エージェントを自社サービスに組み込みたい人
現時点では向いていない人
- リアルタイムでAIと声の雑談・通話がしたい人: 今回のモデルは「渡した原稿を読み上げる」ためのものです。リアルタイムで会話をする用途には、兄弟モデルである「Gemini 3.8 Live」などが適しています。
使い方・始め方
ここからは、実際に触ってみたい人向けの使い方です。読み飛ばしても全体像は分かります。
プログラミングをせずに使う場合
Googleが提供するサービスを通じて利用できます。
- Gemini Notebook: メモや資料をまとめるツールです。「Studio」の「音声解説」機能で、Flash TTSの高品位な音声を利用できます。
- Google Vids: AIを活用した動画作成ツールです。Flash-Lite TTSを使ったナレーションの作成が可能です。
開発者として使う場合
- Google AI Studio: Web画面上でモデルの挙動を手軽にテストできます。
- Gemini API: プログラムから呼び出して利用できます。Agora、LiveKit、Pipecat、Vercelといった外部プラットフォームからもGemini API経由で利用可能です。
料金と知っておくべき注意点
利用料金(Gemini API)
有料プランにおけるテキスト入力と音声出力の利用料金は以下の通りです(100万トークンあたりの価格)。トークンとは、AIが文字や音声を処理する際の細かな単位のことです。
| モデル名 | 入力(テキスト) | 出力(音声) |
|---|---|---|
| Gemini 3.8 Flash TTS | 0.5ドル | 9ドル |
| Gemini 3.8 Flash-Lite TTS | 0.5ドル | 6ドル |
※上記の料金は2026年12月31日までの特別価格であり、2027年1月1日からは2倍になる予定です。なお、無料枠も用意されているほか、後からまとめて処理する方式(Batch / Flex)を使うと半額で利用できます。
利用時の注意点と地域制限
GIGAZINEの紹介記事でも触れられている通り、30秒の音声から声を再現する「ボイスレプリケーション」機能は、他人の声を勝手に真似できないよう厳しい制限があります。映画やアニメの音声をそのまま抜き出して再現することはできません。
また、Google AI Studioにおけるボイスレプリケーション機能は、法規制などの関係から、米国の特定州(イリノイ州・テキサス州)、欧州経済領域(EEA)、英国、スイス、インドでは利用できないと案内されています。
ライブラリの声の音色や速さをプロンプトで微調整する「ボイスリミックス」機能については、公式発表で「近日提供予定(Coming soon)」とされており、順次追加される見込みです。
まとめ
- 言葉の指示だけでゼロから声を作れる、新しい音声読み上げAI
- ため息や笑い声、相づちなどの細かな演技指示ができ、自然な会話劇も作れる
- 日本語を含む100以上の言語に対応し、2000種以上の声が使える
- Gemini NotebookやGoogle Vidsなど、普段使うGoogle製品からも利用できる
これまでの機械的な読み上げから一歩進み、思い通りのキャラクターやナレーションを誰でも手軽に生み出せる時代になりつつあります。
よくある質問
プログラミングができない人でも使えますか?
はい、使えます。Googleのツール「Gemini Notebook」の音声解説機能や、動画作成ツール「Google Vids」などを通じて、難しいプログラムを書かずに新機能の音声を利用できます。
無料で試すことはできますか?
開発者向けのGemini APIには無料枠が用意されています。また、Google AI Studioの画面上でも音声モデルを体験することが可能です。
どのような声を作ることができますか?
「低い声」「ロボットの声」「架空の生き物の声」など、普段使っている言葉(日本語など)で特徴を入力するだけで、ゼロから声を作り出せます。さらに30秒の録音音声があれば、本人の同意を得た上でその声を再現することもできます。
日本語には対応していますか?
はい、日本語にしっかり対応しています。「Gemini 3.8 Flash TTS」は130言語、「Gemini 3.8 Flash-Lite TTS」は101言語に対応しており、どちらも日本語のテキストを自然に読み上げさせることができます。



