Google⁠⁠、音声生成モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリース ―100以上の言語と方言の音声を表現力豊かに生成

Googleは2026年9月23日、テキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」をリリースした。

Gemini 3.8 Flash TTSは自然言語プロンプトを使用して、100以上の言語と方言でキャラクターやアクセント、声の特徴をカスタマイズし、新しい音声をゼロから作成できる。メキシコスペイン語、ケベックフランス語、スコットランド英語などの地域的なバリエーションを含む、幅広い言語に対応した2,000種類以上の音声ライブラリを持っており、30秒の音声サンプルがあれば、一貫性のある音声プロファイルを再現する。

また近日公開予定の機能として、プロンプトを使って音声ライブラリから選んだ声の音色、ピッチ、ペース、アクセントを微調整して音声を合成できるリミックス機能が搭載される。たとえば「アメリカ南部なまりを加える」といった指定で好みの音声を生成する。

Gemini 3.8 Flash-Lite TTSは、大量の処理が可能でコスト効率の高い音声生成を実現する。大量の吹き替えやオーディオコンテンツ制作、トーン、ペース、表現のニュアンスを細かく制御できる音声エージェント向けに最適化されている。

どちらのモデルも自然言語で台詞ごとにトーンや演技を指示でき、タイミングを指定して演技させることも可能。また長時間連続した音声でも音声の品質やペース、キャラクターの音色を維持し、ずれを最小限に抑える。さらに「笑い」「⁠ため息」「⁠息を呑む」といった言語化できない音声や「mhm」など聞き手側の相づちを使ってリアルな会話の質感を加えることができる。

こうした特徴により、Gemini 3.8 FlashとFlash-Lite TTSは各種の音声AIベンチマークでも好成績をおさめ、voicearena.comで行われたブラインド方式の人間による評価では、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA⁠)⁠、メキシコスペイン語、ヒンディー語といったグローバル言語において、競合製品の中でトップクラスの評価を得ている。

一方、近年懸念されている声優などの声の権利の保護、本人確認の遵守、コンテンツの透明性確保を徹底するため、音声の生成や複製には厳格な安全対策が講じられているという。たとえば音声複製を行う際に「同意確認」が必要である。これによりユーザーは音声を作成する前に、参照する話者(声の所有者)本人による口頭での同意録音を提出しなければならない。また、Gemini Audioモデルで生成されるすべての音声にはSynthIDの透かしが埋め込まれる。透かしは音声出力に直接織り込まれており、AIが生成した音声が識別可能な状態であることを確認でき、誤情報の拡散防止に役立つとしている。詳しくはGemini 3.8 Audioのモデルカードを参照。

今回発表の2モデルは順次ユーザに展開される予定で、Gemini 3.8 Flash TTSはGemini Notebookで、Gemini 3.8 Flash-Lite TTSはGoogle Vidsで試すことができる。

また両モデルとも開発者向けにはGoogle AI Studioで試したり、Gemini API経由で利用が可能。企業ユーザー向けにはGemini EnterpriseのAPI経由で近日公開予定となっている。

おすすめ記事

記事・ニュース一覧