Google、音声生成モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を発表のアイキャッチ画像

Gemini Google 新情報・新機能

Google、音声生成モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を発表

※本記事は広告が含まれる場合があります。

出典:X(@GoogleAIStudio)

Googleは2026年9月23日、テキストから音声を生成する「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。声のカスタマイズやセリフごとの演出に対応する、2つのモデルの特徴を紹介します。

みつた

こんにちは。Googleが音声生成モデル「Gemini 3.8 Flash TTS」と「Flash-Lite TTS」を発表しました。細かな声の演出と大量制作にそれぞれ対応し、音声複製には本人の口頭同意が必要です。両モデルはGemini APIとGoogle AI Studioで提供を開始します。

この記事のチェックポイント

  • Flash TTSは、自然言語による声の設計やセリフごとの細かな演出に対応
  • Flash-Lite TTSは、大量の吹き替えや音声コンテンツ制作などを想定
  • 音声複製には声の持ち主による口頭の同意録音が必要。生成音声にはSynthIDの透かしを付与
  • 両モデルはGemini APIとGoogle AI Studioで提供を開始

目的の異なる2つの音声生成モデル

「Gemini 3.8 Flash TTS」は、キャラクターの声づくりや音声表現の細かな演出を重視したモデルです。自然言語の指示を使い、役柄、アクセント、声の特徴を指定して新しい声を作れます。Googleによると、100以上の言語・方言にわたって声を設計でき、2,000以上の声を収録したライブラリも利用できます。

一方、「Gemini 3.8 Flash-Lite TTS」は、大量の吹き替えや音声コンテンツの制作、音声エージェントなどに向けたモデルです。大量利用時のコスト効率を重視しながら、声のトーンや話す速さなどを調整できます。

セリフ単位で演出を指定

両モデルは、セリフごとに話し方を指示できます。台本に演出指示を書き込み、ペースや感情表現を調整できるほか、笑い声やため息、相づちといった要素も加えられます。1つの台本から、2人の話者による会話を生成する機能にも対応します。

Flash TTSでは、自分の声、または利用する権利のある声の30秒の音声サンプルから、声の特徴を再現できます。また、作成したカスタム音声を保存・管理できます。

音声複製には同意確認、生成音声には透かし

Googleは、音声を複製する際には、参照音声の話者と一致する声の持ち主による、口頭の同意録音が必要だと説明しています。また、Gemini Audioモデルが生成するすべての音声には、AI生成音声であることを検出できるよう、SynthIDの透かしを付与します。

提供先はモデルごとに異なる

両モデルは、開発者向けにGemini APIとGoogle AI Studioで提供が始まります。企業向けには、Gemini EnterpriseのAPIを通じて今後提供する予定です。

一般向けの提供先は異なり、Flash TTSはGemini Notebook、Flash-Lite TTSはGoogle Vidsで利用できます。なお、Google AI Studioでの音声複製機能は、イリノイ州、テキサス州、欧州経済領域(EEA)、英国、スイス、インドでは利用できません。

-Gemini, Google, 新情報・新機能