Google、リアルタイム音声対話モデルGemini 3.1 Flash Liveを公開
「生成AIニュースメモ」は、生成AIの最新ニュースを要点3行+詳細メモで記録していくシリーズです。関連するG検定キーワード解説への内部リンク付きで、最新動向のキャッチアップと試験の時事対策に使えます。
- 1GoogleがGemini 3.1 Flash LiveをGemini Live API経由でプレビュー提供開始し、低遅延の音声・視覚エージェントを構築可能に
- 2騒音下でのタスク完了率、複雑なシステム指示への追従、対話の自然さと低遅延性が向上
- 390を超える言語でリアルタイムのマルチモーダル会話に対応し、デザインツールStitchや高齢者向けデバイスAtoなどが活用
Googleは2026年3月26日(米国時間)、新モデルGemini 3.1 Flash Liveを、Google AI StudioのGemini Live APIを通じてプレビュー提供開始しました。周囲の世界を処理するだけでなく、会話のスピードで応答できるリアルタイムの音声・視覚エージェントの構築を支援するモデルで、レイテンシ、信頼性、より自然に聞こえる対話における段階的な飛躍だとしています。騒がしい実環境でのタスク完了率や複雑なシステム指示への追従が向上し、90を超える言語でリアルタイムのマルチモーダル会話に対応します。
主な改善点
- ▸騒音下でのタスク完了率向上 — 交通やテレビといった環境音と関連する発話をより正確に聞き分けることで背景ノイズを効果的に除去し、ライブ会話中の外部ツール起動や情報提供の信頼性を大幅に改善
- ▸指示追従の強化 — 複雑なシステム指示への追従が大幅に向上し、会話が予想外の展開になってもエージェントが運用上のガードレール内に留まる
- ▸自然で低遅延な対話 — 2.5 Flash Native Audioと比べてレイテンシが改善し、ピッチやペースといった音響的ニュアンスの認識も向上して、リアルタイム会話がより滑らかで自然に
- ▸多言語対応 — リアルタイムのマルチモーダル会話を90超の言語でサポート
リアルタイムの対話では、わずかなレイテンシでもユーザーが期待する会話の自然な流れが損なわれるとし、新モデルはトーン、強調、意図をより良く理解することで、次世代の音声ファーストAIに必要な品質を届けるとしています。
実アプリでの活用事例
- ▸Stitch — 音声によるバイブデザインを実現。エージェントがキャンバスや選択中の画面を見て、デザイン批評やバリエーション作成などを行う
- ▸Ato — 高齢者向けのAIコンパニオンデバイスで、多言語能力を活かして日々の会話を利用者の本当のつながりに変える
- ▸Weekendチーム — 同チームのRPGで、強いキャラクター性と人間らしい話しぶりをゲームマスターに組み込み、劇場的な演出を加えている
エコシステムと利用開始方法
Live APIは本番環境向けに構築されていますが、ライブ動画ストリームからオンデマンドの通話まで多様な入力への対応が求められるため、WebRTCのスケーリングやグローバルなエッジルーティングが必要なシステムにはパートナー統合の活用を推奨しています。
Gemini 3.1 Flash LiveはGemini APIとGoogle AI Studioで提供中で、モデルIDはgemini-3.1-flash-live-previewです。開発者向けドキュメントでは、多言語対応、ツール使用と関数呼び出し、長時間の会話を管理するセッション管理、一時トークンといった機能が解説されており、構築例集、コーディングエージェント向けのLive API Skill、Google GenAI SDKのサンプルコードも用意されています。
関連キーワードの解説記事で、背景となる技術・概念を確認できます。
このニュースの月のまとめ号があります。その月の生成AIニュースの全体傾向と、G検定試験風の理解度チェック問題を1本にまとめています。
