これは日本語版です。韓国語版と 英語版もご覧いただけます。

Gemini 3.8 Liveを読み解く:リアルタイム音声AIが「会話するエージェント」へ

2026-09-23 · AI · 日本 · Zoogom編集部

#Gemini 3.8 Live#音声AI#AIエージェント#Live API#SynthID

音声波形やカメラの映像、外部ツールがリアルタイムAIエージェントへ集約されるイメージ

Googleが2026年9月15日に発表した「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」は、AIの声をより人間らしくするだけの更新ではない。音声と映像から状況を把握し、会話を続けながら外部ツールを呼び出し、必要であれば複数段階の推論をバックグラウンドで進めることが中心に据えられている。

変化の要点は、音声AIの役割が「質問を聞いて答える」ことから、「対話を保ちながら作業を進める」ことへ広がった点にある。ただし、会話が自然になれば、それだけで実用的なエージェントになるわけではない。実際の導入では、権限管理、処理の中断、ツール実行結果の確認、データの保存範囲といった仕組みが、声の滑らかさと同じくらい重要になる。

要点

  1. Gemini 3.8 Liveは応答の速さと自然な会話を重視し、Live Extended Thinkingは時間のかかる推論や複数段階の作業を想定している。
  2. 標準モデルはテキスト、画像、音声、動画を入力でき、関数呼び出しや検索との連携にも対応する一方、一般的なテキストモデルが備えるすべての機能を利用できるわけではない。
  3. 実運用の品質は、声の自然さだけでなく、中断への対応、外部操作の検証、権限の範囲、記録の保持期間によって決まる。

2つのモデルは何が違うのか

Gemini 3.8 LiveとExtended Thinkingを遅延やツール利用、会話の流れ、用途別に比較した図

2つのモデルについて評価項目、特徴、選択基準を整理した比較図

標準モデルの識別子はgemini-3.8-liveである。Googleの開発者向け資料では、入力上限が131,072トークン、出力上限が65,536トークンとされている。入力にはテキスト、画像、音声、動画を利用でき、出力はテキストまたは音声に対応する。

関数呼び出し、Live API、Google検索に基づく情報の補強には対応する。一方、キャッシュ、コード実行、ファイル検索、画像生成、構造化出力は、この標準モデルでは非対応として記載されている。したがって、「Gemini」という名称だけを見て、ほかのモデルで使える機能もすべて利用できると考えるべきではない。

Live Extended Thinkingは、リアルタイムの音声セッションを維持しながら、より複雑な推論やツール処理を裏側で進める構成だ。時間のかかる処理中に完全な沈黙へ入るのではなく、作業を続けていることを短い音声で伝えられる。サーバー側では処理中と待機状態が区別され、1回の依頼に対して複数の音声応答が返る可能性がある。

そのため、利用者に聞こえる返答が終わったことと、依頼された作業そのものが完了したことは同じではない。アプリを開発する側は、音声の再生状態だけで完了を判断せず、バックグラウンド処理の状態も確認する必要がある。

非同期ツール呼び出しが会話を変える

音声による依頼が認識、推論、外部ツール、確認、検証済みの完了へ進む流れ

従来型の音声アシスタントは、話を聞き、1回返答し、そのやり取りを終える構造が中心だった。Gemini 3.8 Liveでは、外部ツールを非同期で動かしている間も、セッションを応答可能な状態に保つことが想定されている。

たとえば旅行支援では、フライトを検索し、カレンダーと照合している途中で、利用者が日付や条件を変更することがある。非同期処理なら、検索を進めながら変更を受け付けられる。ただし、自然に見える会話の裏側では、次のような制御が欠かせない。

Googleの資料では、Gemini 3.8 Liveの非同期実行は標準動作とされており、明示的にブロッキングとして宣言したツールを除き、処理中も会話を止めない設計になっている。

以前のGemini 3.1 Flash Liveプレビューから移行する開発者は、モデル名を差し替えるだけでは不十分だ。標準の3.8 Liveでは従来のthinking_level設定を受け付けないと説明されているため、関数呼び出しの動作とセッション設定をあらためて確認する必要がある。

97言語への対応は、品質が一律という意味ではない

Googleは、Gemini 3.8 Liveが対応する97言語を会話中に自動検出し、自然に切り替えられるとしている。日本語と英語が混ざる問い合わせ、外国語を使う旅行者への案内、多言語の教育やサポートなどでは有用になり得る。

ただし、対応言語の数は、すべての言語や利用環境で同じ精度が得られることを保証しない。日本語で評価するなら、少なくとも次の点を個別に試す必要がある。

また、APIやGoogle AI Studioで利用できる機能が、Geminiアプリ、Search Live、Google Workspaceなどに同じタイミングで提供されるとは限らない。今回の資料から日本国内の各製品における具体的な提供状況までは確定できないため、実際の画面、契約プラン、プレビュー表記を製品ごとに確認するのが安全だ。

音声とカメラはプライバシーの範囲を広げる

音声と映像が同意確認、端末内処理、クラウド推論、ツール権限、保存管理を通るイメージ

リアルタイムの音声エージェントは、文字入力型のチャットボットよりも多くの周辺情報を受け取る可能性がある。マイクには本人の発言だけでなく、近くにいる人の会話や生活音も入る。カメラには書類、顔、位置を推測できる情報、社内画面などが映り込むことがある。

さらに外部ツールを接続すれば、カレンダー、メール、顧客情報、予約履歴、取引記録なども処理対象になり得る。導入前には、少なくとも以下を明文化したい。

Googleは、自社のAI製品を通じて生成された音声に、人には聞き取りにくいSynthIDウォーターマークを埋め込むと説明している。これは生成音声の出所を確認する手がかりにはなるが、内容の正確性、著作権上の利用許可、適切な用途まで保証するものではない。人間の声と誤認され得る場面では、AI音声であることを利用者に知らせる表示も必要になる。

ベンチマークと実際の導入成果は分けて考える

Googleは、Live Extended Thinkingが音声品質、エージェント作業、音声推論に関する複数の評価で高い結果を示したと発表している。ただし、これはGoogleが提示した条件と評価セットに基づく結果であり、独立した検証結果ではない。

コールセンター、教室、車内、ゲームのボイスチャットなどには、それぞれ異なる雑音、通信状況、割り込み、例外処理がある。実環境では、単純な正答率だけでなく、次の指標も合わせて見るべきだ。

求めるバランスは用途によって変わる。ゲームキャラクターや簡単なナビゲーションでは即時性が重要になりやすい。一方、予約、購入、金融、医療に関わる案内では、多少会話が遅くなっても、確認と検証可能な完了を優先すべきだ。

どのような用途に向くのか

Gemini 3.8 Liveは、リアルタイムのカスタマーサポート、対話型の学習支援、ゲームキャラクター、通訳、車載機器やスマートグラスのインターフェースなど、会話を途切れさせずに進める必要がある用途と相性がよい。複数の条件を比較し、検索や外部ツールを順番に使う作業では、Live Extended Thinkingが候補になる。

反対に、一括で処理する音声の文字起こし、文書要約、厳密なJSON生成、長期間にわたるファイル検索などは、別のモデルや従来型の処理パイプラインのほうが単純で安定する場合がある。音声を使う機能だからといって、すべてをLive APIへ移す必要はない。

実用上の結論

Gemini 3.8 Liveの重要な点は、AIがより人間らしく話すことだけではない。利用者と会話しながら外部ツールを動かし、変更や割り込みを受け入れ、処理状態を伝えながら作業を完了できる設計にある。

導入を判断するときは、デモ音声の自然さだけで評価しないほうがよい。まず小さな対象業務を選び、中断、キャンセル、重複防止、最終確認、権限、ログ、失敗時の復旧を含めて試すべきだ。音声で「完了しました」と答えたかではなく、依頼された操作が実際に、正しく、安全に完了したかを確認できることが、実用的なエージェントの条件になる。

出典と利用について

本稿は、一次出典であるGoogleの公式発表と、関連する開発者向け資料に記載された仕様、制限、提供方針を照合し、独自の構成と表現で解説したものです。公式の図表や製品画面、長い引用文は再掲していません。また、Googleが公表したベンチマーク結果を、あらゆる実環境で同じ成果が得られることの証明としては扱っていません。

出典: Google · 独自の画像・図版を含みます