We’re introducing Gemini 3.8 Live and 3.8 Live Extended Thinking – our best conversational AI.
— Google DeepMind (@GoogleDeepMind) September 15, 2026
The models talk, think, and handle tasks in the background without breaking your flow. 🧵 pic.twitter.com/nifcYx1C6L
Introducing our most advanced Gemini Audio models yet 🗣
— Google AI (@GoogleAI) September 15, 2026
Gemini 3.8 Live and 3.8 Live Extended Thinking let you speak, collaborate, and execute tasks seamlessly, meaning conversing with AI just got a lot more natural.
So, what’s the difference between these two models? Let’s… pic.twitter.com/Dfy7j4zxOh
Googleは2026年9月15日、リアルタイムの音声対話に対応する「Gemini 3.8 Live」と、複雑な多段階タスク向けの「Gemini 3.8 Live Extended Thinking」を発表しました。前者は低遅延で流動的な対話、後者は音声応答を続けながら行うバックグラウンド推論を重視したモデルです。

- Gemini 3.8 Liveは、低遅延の音声エージェントやリアルタイム対話向けの標準的な選択肢です。
- Gemini 3.8 Live Extended Thinkingは、複雑な多段階問題に必要なバックグラウンド推論を重視しています。
- 両モデルともテキスト、画像、音声、動画を入力でき、テキストと音声を出力します。
- 入力トークン上限は131,072、出力トークン上限は65,536で、Live APIや検索グラウンディング、関数呼び出しに対応します。
- Gemini APIとGoogle AI Studioをはじめ、モデルに応じてGemini Live、Search Live、Google Workspaceなどへ展開されます。
Gemini 3.8 Liveシリーズとは
Googleは2026年9月15日、音声によるリアルタイム対話モデルとして、次の2モデルを発表しました。
- Gemini 3.8 Live:会話の流動性、低遅延、コスト効率、規模を重視
- Gemini 3.8 Live Extended Thinking:複雑なタスク、高度な推論、多段階の問題解決を重視
Googleは、両モデルをこれまでで最も高度なライブ対話モデルと位置付けています。音声を使った複雑なタスクの実行に向けて、知能と並列推論を強化したと説明しています。
Gemini 3.8 Liveの特徴
Gemini 3.8 Liveは、推論による遅延を避けたい低遅延の音声エージェントや、リアルタイム対話向けの標準的な選択肢です。モデルコードはgemini-3.8-liveです。
映像を踏まえたリアルタイム対話
視覚入力をほぼリアルタイムで処理し、映像の文脈を会話へ反映します。Googleが示した利用例には、視覚情報を使った従業員のオンボーディング支援や、盤面を見ながらチェスを進める対話があります。
会話中の言語切り替え
97の対応言語を自動検出し、会話の途中でも言語を切り替えられます。
非同期の関数呼び出し
ツールやAPIの呼び出しをバックグラウンドで実行しながら、会話を継続できます。モデルは依頼を受け付けたことを伝え、処理が終わるまで対話を続けられます。
APIでは非同期実行のbehavior: NON_BLOCKINGがデフォルトです。後方互換性のため、ツール宣言でbehavior: BLOCKINGを設定すれば同期ブロッキング方式も利用できます。
インターリーブ推論に対応
Thinking機能としてインターリーブ推論をサポートします。一方、thinkinglevelはGemini 3.8 Liveではサポートされません。セッション設定ではthinkinglevelまたはthinking_configを省略する必要があります。
Gemini 3.8 Live Extended Thinkingの特徴
Gemini 3.8 Live Extended Thinkingは、リアルタイム音声対話の最中に、より高度なバックグラウンド推論を必要とする複雑な多段階問題向けのモデルです。モデルコードはgemini-3.8-live-extended-thinkingです。
推論と音声応答を同時に進行
バックグラウンド推論や非同期ツール呼び出しを処理しながら、継続的に音声応答をストリーミングします。
Googleは、モデルが「確認します」といった早い段階の音声応答で依頼を受け付け、複数段階のタスクについて進捗を説明しながら処理を進められるとしています。紹介された例には、スケッチと音声フィードバックからのReactコンポーネント作成や、複数段階の予約処理があります。
Thinkingレベルを設定可能
thinkingconfigを使用し、バックグラウンド推論のthinkinglevelを次の3段階から設定できます。
lowmediumhigh
MINIMALはサポートされません。
関数呼び出しは非同期のみ
関数呼び出しはbehavior: NON_BLOCKINGによる非同期のノンブロッキング実行だけをサポートします。同期ブロッキング方式を指定するとエラーになります。また、関数スケジューリング設定には対応していません。
主要仕様の比較
| 項目 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| モデルコード | gemini-3.8-live | gemini-3.8-live-extended-thinking |
| 主な用途 | 低遅延の音声エージェント、リアルタイム対話 | 複雑な多段階問題、高度なバックグラウンド推論 |
| 入力 | テキスト、画像、音声、動画 | テキスト、画像、音声、動画 |
| 出力 | テキスト、音声 | テキスト、音声 |
| 入力トークン上限 | 131,072 | 131,072 |
| 出力トークン上限 | 65,536 | 65,536 |
| 音声生成 | 対応 | 対応 |
| Live API | 対応 | 対応 |
| 関数呼び出し | 対応 | 非同期のみ対応 |
| 検索グラウンディング | 対応 | 対応 |
| Thinking | インターリーブ推論に対応 | 対応 |
| キャッシュ | 非対応 | 非対応 |
| コード実行 | 非対応 | 非対応 |
| ファイル検索 | 非対応 | 非対応 |
| Google Mapsグラウンディング | 非対応 | 非対応 |
| 画像生成 | 非対応 | 非対応 |
| 構造化出力 | 非対応 | 非対応 |
| URLコンテキスト | 非対応 | 非対応 |
| Batch API | 非対応 | 非対応 |
両モデルの安定版モデルコードは、それぞれgemini-3.8-liveとgemini-3.8-live-extended-thinkingです。ドキュメントの最終更新日は2026年9月15日(UTC)です。
Extended Thinking利用時の状態管理
Gemini 3.8 Live Extended Thinkingでは、turnComplete: trueを受信しても、モデルがアイドル状態になったとは限りません。バックグラウンド推論やツール呼び出しが続いている場合があるため、クライアントは後続のサーバーメッセージを受信し続ける必要があります。
現在の状態は、受信メッセージのinteraction_statusで確認します。
IN_PROGRESS:ユーザー入力の処理、バックグラウンド推論、非同期ツール呼び出しの応答待ちなどが進行中IDLE:すべての処理、推論、ツール呼び出しが完了し、ユーザー入力を待っている状態
両モデルとも、sendclientcontentをセッション全体で利用でき、userまたはmodelの明示的なロールを指定できます。turn_complete=trueを設定すると、進行中の生成は直ちに中断されます。
Gemini 3.1 Flash Liveからの移行ポイント
Gemini 3.1 Flash Live PreviewからGemini 3.8 Liveへ移行する場合は、モデル文字列をgemini-3.1-flash-live-previewからgemini-3.8-liveへ変更します。
また、Gemini 3.8 Liveではプロアクティブ音声が常時有効です。proactiveaudio: falseを設定するとエラーになります。Affective dialogueはAPIから削除されているため、enableaffective_dialogの設定もコードから取り除く必要があります。
ターンの対象範囲は、デフォルトでTURNINCLUDESAUDIOACTIVITYANDALLVIDEOです。動画フレームは標準でモデルに送信されるため、コンテキストとコストを管理するには必要な場合だけフレームを送るよう案内されています。
Googleが公表した評価結果
Googleによると、Gemini 3.8 Live Extended ThinkingはArtificial AnalysisのSpeech to Speech Quality Indexで82.6を記録し、総合1位となりました。また、エージェント型タスクではτ-Voiceで68.6%、Sierraのτ-Voice-bankingベンチマークで35.1%、Big Bench Audioで97.7%を記録しています。
Gemini 3.8 LiveはSpeech Agent Arenaで2位となりました。ServiceNowの音声エージェント向けベンチマークEVA-Benchでは、会話品質と正確性のバランスを取りながら、複雑なワークフローにおけるパレートフロンティアを押し広げたとGoogleは説明しています。この評価はGemini Enterprise Agent Platform上のLive APIで実施されました。
開発者・企業向けの連携
Gemini Live APIは、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsなどの開発者向けプラットフォームで利用されています。これらのプラットフォームが複雑なリアルタイムメディアストリーミング基盤を管理することで、開発者はユーザー体験の構築に集中できます。
GoogleはSalesforce、Genspark、Lumerisとも提携しています。
提供先
Gemini 3.8 Live
2026年9月15日から、次の提供先への展開が始まりました。
- 開発者向け:Gemini API、Google AI Studio
- 企業向け:Gemini Enterpriseでプライベートプレビュー。Gemini Enterprise for Customer Experienceにも提供予定
- 一般向け:Search Live
Gemini 3.8 Live Extended Thinking
同日から、次の提供先への展開が始まりました。
- 開発者向け:Gemini API、Google AI Studio
- 企業向け:Gemini Enterpriseでプライベートプレビュー。Gemini Enterprise for Customer ExperienceとGoogle Workspaceのビジネス顧客にも提供予定
- 一般向け:Gemini Live、Google AI ProおよびUltra加入者向けのWorkspace内Docs、すべてのGoogle AI加入者向けのGmailとKeep
AI生成音声にはSynthIDを適用
GoogleのAI製品が生成するすべての音声には、SynthIDのウォーターマークが付与されます。音声出力へ直接組み込まれる知覚できないウォーターマークで、AI生成コンテンツを検出可能な状態にし、誤情報の防止に役立てる仕組みです。
まとめ
Gemini 3.8 Liveは、低遅延で流動的なリアルタイム音声対話と、会話を止めない非同期処理を重視したモデルです。Gemini 3.8 Live Extended Thinkingは、会話を中断せず、高度なバックグラウンド推論と複雑な多段階タスクを処理するモデルです。
開発時には、両モデルにおける関数呼び出し方式の違いや、Extended Thinkingのinteraction_statusを使った状態管理に注意が必要です。