AI

Googleの音声AI、推論と発話を同時に進める

この記事のポイント

  1. 実現したこと

    Googleによると、音声対話モデルGemini 3.8 Liveは、会話を続けながらツールやAPIを実行できる。

  2. 実現の仕組み

    Extended Thinking版は推論と発話を同時に進め、複数段階の作業中も進捗を声で伝える。

  3. 得られた結果

    Google公表のExtended Thinking版のタスク完了率は、τ-Voiceで68.6%、銀行業務向けのτ-Voice-bankingで35.1%だった。

  4. 従来との違い

    両モデルの開発者向け提供がGemini APIとGoogle AI Studioで始まった。

明るい机でスマートフォンに話しかける人物。人物と端末の間には短い音声波形があり、端末から幾何学的な処理の記号が奥の汎用コンピューターへ続き、会話とバックグラウンド処理の並行を示している。
AI生成画像

音声で依頼した作業をバックグラウンドで進めながら、会話を続けるAIモデルの提供が始まった。Googleによると、Gemini 3.8 Live Extended Thinkingは推論と発話を同時に進め、複数段階の作業の進捗も声で伝える。

外部処理を進めながら音声で応答する

Googleが提供する音声対話モデルGemini 3.8 Liveは、ツールやAPIの呼び出しをバックグラウンドで実行する。Googleによると、処理の完了を待つ間も依頼を受け付けたことを伝え、利用者との会話を続けることができる。

複雑な作業向けのGemini 3.8 Live Extended Thinkingは、推論と発話を同時に進める。「確認します」といった短い応答に続き、複数段階の作業が進む過程を声で説明するため、バックグラウンドの処理中も会話が途切れないとしている。

映像の文脈を取り込み、97言語を切り替える

会話への入力には音声に加えて映像も使う。Googleによると、Gemini 3.8 Liveは映像をほぼリアルタイムで処理し、その視覚的な情報を応答の文脈へ取り込む。

言語も会話中に自動で検出する。対応する97言語の間で切り替えることができ、映像の処理とともに、進行中の会話から応答に必要な情報を受け取る。

タスク完了率と音声対話の品質を別々に評価

Googleが公表したExtended Thinking版のタスク完了率は、音声エージェントの評価であるτ-Voiceで68.6%、Sierraの銀行業務向け評価τ-Voice-bankingで35.1%だった。両者は異なる評価であり、完了率はそれぞれの評価対象に対応する。

音声対話の品質評価では、Artificial AnalysisのSpeech to Speech Quality Indexで82.6を記録し、総合1位になったとGoogleは公表している。推論能力についても、Big Bench Audioで97.7%を記録したとしている。

開発者向け提供を開始、企業向けは非公開プレビュー

Googleは両モデルの開発者向け提供をGemini APIと開発環境Google AI Studioで開始した。会話と並行して外部処理を実行するモデルを、開発者が利用するための提供経路が開かれた。

企業向けサービスのGemini Enterpriseでは、両モデルを非公開プレビューとして提供している。企業向けの提供段階は、このプレビューに位置付けられる。