生成AIニュース
【生成AIニュースメモ】OpenAI、文字起こし新モデル「GPT-Transcribe」など2種をAPIに追加(2026/7/29)

OpenAIは、音声をテキストに変換する新しい文字起こしモデル「GPT-Transcribe」と「GPT-Live-Transcribe」をAPIに追加しました。前者は録音済みファイルやバッチ処理の非同期文字起こしに、後者は低遅延のライブ文字起こしに最適化されています。両モデルとも文脈の理解力が高められており、短いフレーズ、数字、専門用語、背景ノイズの大きい音声など、実環境で精度が落ちやすい条件に強いことが特徴とされています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Liquid AI、日本語向けの音声・言語モデル2種を公開(2026/6/6)

Liquid AIは2026年6月6日、日本語向けの新モデル2つを公開しました。「LFM2.5-Audio-1.5B-JP」は同社初の日本語音声モデルで、日本語で話しかけると日本語の音声で応答するエンドツーエンド構成です。「LFM2.5-1.2B-JP-202606」は日本語言語モデルの最新版で、広範な日本語ベンチマークで最高性能を達成したとしています。どちらのモデルも公開当日からHugging Faceで利用できます。

続きを読む
生成AIニュース
【生成AIニュースメモ】xAI、Grokの音声認識・音声合成APIを提供開始(2026/4/18)

xAIは2026年4月17日(米国時間)、音声認識API「Grok Speech to Text(STT)」と音声合成API「Grok Text to Speech(TTS)」の2つの単体音声APIを発表しました。Grok VoiceやTesla車両、Starlinkのカスタマーサポートを支えるものと同じ技術スタック上に構築されており、音声エージェントやリアルタイム文字起こしツール、アクセシビリティソリューション、ポッドキャストなど、あらゆるアプリケーションへ高品質な音声機能を簡単に組み込めるようにするものです。料金は競合より低い水準に設定されています。

続きを読む
生成AIニュース
【生成AIニュースメモ】Microsoft AI、音声・画像のMAIモデル3種をFoundryで提供開始(2026/4/3)

Microsoft AIは2026年4月2日(米国時間)、自社開発のAIモデル「MAI-Transcribe-1」「MAI-Voice-1」「MAI-Image-2」の3種をMicrosoft FoundryとMAI Playgroundで提供開始したと発表しました。音声認識のMAI-Transcribe-1は業界標準のFLEURSベンチマークで主要25言語において最先端の精度を達成し、音声生成のMAI-Voice-1には数秒の音声からカスタム音声を作成する機能が加わり、画像生成のMAI-Image-2は同等品質のまま2倍以上の生成速度を実現しています。いずれも競争力のある価格で提供されます。

続きを読む
生成AIニュース
【生成AIニュースメモ】OpenAIがAssistants APIの新バージョンをリリース(2024/4/18)

OpenAIは、Assistants APIに新機能と改善を加え、新しいAPIバージョン「OpenAI-Beta: assistants=v2」へとベータ版を移行すると発表しました。主な更新内容は以下の通りです。 機能 […]

続きを読む