生成AIニュース
【生成AIニュースメモ】OpenAI、ChatGPT音声モードを支える新音声モデル「GPT-Live」を発表(2026/7/9)

OpenAIは2026年7月8日、AIとの会話を実際の会話により近づける新世代の音声モデル「GPT-Live」を発表しました。聞くことと話すことを同時に行える全二重アーキテクチャを基盤とし、相づちや素早い応答、考える時間を静かに待つといった対話上の判断を1秒に何度も行えます。検索や深い推論が必要な質問はバックグラウンドのGPT-5.5などに委任し、会話の流れを保ったまま結果を返します。同日からGPT-Live-1とGPT-Live-1 miniが世界中のChatGPTユーザーへ順次展開され、APIへの提供も近日予定されています。

続きを読む
生成AIニュース
【生成AIニュースメモ】OpenAI、推論・翻訳・文字起こし対応の音声モデル3種をAPIに追加(2026/5/8)

OpenAIは2026年5月7日、APIに3つの音声モデルを追加したと発表しました。GPT-5クラスの推論能力を初めて備えた音声モデル「GPT-Realtime-2」、70以上の入力言語から13の出力言語へ話者のペースを保ったまま翻訳する「GPT-Realtime-Translate」、発話中にリアルタイムで文字起こしする「GPT-Realtime-Whisper」です。単純な応答の往復にとどまらず、聞き、推論し、翻訳し、文字起こしし、会話の進行と同時に行動できる音声インターフェースの実現を狙っています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Google、リアルタイム音声対話モデルGemini 3.1 Flash Liveを公開(2026/3/27)

Googleは2026年3月26日(米国時間)、新モデルGemini 3.1 Flash Liveを、Google AI StudioのGemini Live APIを通じてプレビュー提供開始しました。周囲の世界を処理するだけでなく、会話のスピードで応答できるリアルタイムの音声・視覚エージェントの構築を支援するモデルで、レイテンシ、信頼性、より自然に聞こえる対話における段階的な飛躍だとしています。騒がしい実環境でのタスク完了率や複雑なシステム指示への追従が向上し、90を超える言語でリアルタイムのマルチモーダル会話に対応します。

続きを読む