生成AIニュース
【生成AIニュースメモ】xAI、Grokの音声認識・音声合成APIを提供開始(2026/4/18)

xAIは2026年4月17日(米国時間)、音声認識API「Grok Speech to Text(STT)」と音声合成API「Grok Text to Speech(TTS)」の2つの単体音声APIを発表しました。Grok VoiceやTesla車両、Starlinkのカスタマーサポートを支えるものと同じ技術スタック上に構築されており、音声エージェントやリアルタイム文字起こしツール、アクセシビリティソリューション、ポッドキャストなど、あらゆるアプリケーションへ高品質な音声機能を簡単に組み込めるようにするものです。料金は競合より低い水準に設定されています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Google、最も低コストな動画生成モデルVeo 3.1 Liteを公開(2026/4/1)

Googleは2026年3月31日(米国時間)、同社で最も費用対効果の高い動画生成モデル「Veo 3.1 Lite」を発表しました。Veo 3.1 Fastの50%未満のコストで同じ速度を保ち、開発者が大量の動画を扱う高ボリュームなアプリケーションを構築できるようにするモデルで、これによりVeo 3.1モデルファミリーが出揃い、ニーズに応じた柔軟な使い分けが可能になるとしています。同日からGemini APIとGoogle AI Studioの有料ティアで利用でき、4月7日にはVeo 3.1 Fastの値下げも予定しています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Google、リアルタイム音声対話モデルGemini 3.1 Flash Liveを公開(2026/3/27)

Googleは2026年3月26日(米国時間)、新モデルGemini 3.1 Flash Liveを、Google AI StudioのGemini Live APIを通じてプレビュー提供開始しました。周囲の世界を処理するだけでなく、会話のスピードで応答できるリアルタイムの音声・視覚エージェントの構築を支援するモデルで、レイテンシ、信頼性、より自然に聞こえる対話における段階的な飛躍だとしています。騒がしい実環境でのタスク完了率や複雑なシステム指示への追従が向上し、90を超える言語でリアルタイムのマルチモーダル会話に対応します。

続きを読む
生成AIニュース
【生成AIニュースメモ】Google、音楽生成モデルLyria 3を開発者向けにプレビュー公開(2026/3/26)

Google DeepMindは2026年3月25日(米国時間)、音楽生成モデルLyria 3とLyria 3 Proを、Gemini APIとGoogle AI Studioの新しいオーディオ体験を通じて開発者向けパブリックプレビューとして提供開始したと発表しました。Lyria 3は深い音楽的理解と構造的な一貫性の両立を狙って設計されており、ボーカルやバース、コーラスを含む高忠実度の楽曲を、最初の音から最後まで音楽的な一貫性を保って生成するアプリを開発者が構築できるとしています。生成された全トラックにはSynthID電子透かしが埋め込まれます。

続きを読む
生成AIニュース
【生成AIニュースメモ】OpenAI、小型モデルGPT-5.4 miniとGPT-5.4 nanoを公開(2026/3/18)

OpenAIは2026年3月17日(米国時間)、これまでで最も高性能な小型モデルと位置づけるGPT-5.4 miniとGPT-5.4 nanoを公開しました。両モデルはGPT-5.4の強みの多くを受け継ぎながら、高い処理量に対応する高速かつ効率的なモデルとして設計されています。GPT-5.4 miniはコーディング、推論、マルチモーダル理解、ツール利用でGPT-5 miniから大きく性能を向上させて2倍以上高速に動作し、GPT-5.4 nanoは速度とコストを最重視するタスク向けの最小・最低コスト版です。miniはAPI、Codex、ChatGPTで、nanoはAPIで利用できます。

続きを読む