音声で依頼した作業をバックグラウンドで進めながら、会話を続けるAIモデルの提供が始まった。Googleによると、Gemini 3.8 Live Extended Thinkingは推論と発話を同時に進め、複数段階の作業の進捗も声で伝える。
外部処理を進めながら音声で応答する
Googleが提供する音声対話モデルGemini 3.8 Liveは、ツールやAPIの呼び出しをバックグラウンドで実行する。Googleによると、処理の完了を待つ間も依頼を受け付けたことを伝え、利用者との会話を続けることができる。
複雑な作業向けのGemini 3.8 Live Extended Thinkingは、推論と発話を同時に進める。「確認します」といった短い応答に続き、複数段階の作業が進む過程を声で説明するため、バックグラウンドの処理中も会話が途切れないとしている。
映像の文脈を取り込み、97言語を切り替える
会話への入力には音声に加えて映像も使う。Googleによると、Gemini 3.8 Liveは映像をほぼリアルタイムで処理し、その視覚的な情報を応答の文脈へ取り込む。
言語も会話中に自動で検出する。対応する97言語の間で切り替えることができ、映像の処理とともに、進行中の会話から応答に必要な情報を受け取る。
タスク完了率と音声対話の品質を別々に評価
Googleが公表したExtended Thinking版のタスク完了率は、音声エージェントの評価であるτ-Voiceで68.6%、Sierraの銀行業務向け評価τ-Voice-bankingで35.1%だった。両者は異なる評価であり、完了率はそれぞれの評価対象に対応する。
音声対話の品質評価では、Artificial AnalysisのSpeech to Speech Quality Indexで82.6を記録し、総合1位になったとGoogleは公表している。推論能力についても、Big Bench Audioで97.7%を記録したとしている。
開発者向け提供を開始、企業向けは非公開プレビュー
Googleは両モデルの開発者向け提供をGemini APIと開発環境Google AI Studioで開始した。会話と並行して外部処理を実行するモデルを、開発者が利用するための提供経路が開かれた。
企業向けサービスのGemini Enterpriseでは、両モデルを非公開プレビューとして提供している。企業向けの提供段階は、このプレビューに位置付けられる。