📰 生成AIニュースメモ

Thinking Machines、リアルタイム対話AI「インタラクションモデル」を発表

🗓 2026年5月12日#Thinking Machines#マルチモーダルAI#リアルタイム対話

「生成AIニュースメモ」は、生成AIの最新ニュースを要点3行+詳細メモで記録していくシリーズです。関連するG検定キーワード解説への内部リンク付きで、最新動向のキャッチアップと試験の時事対策に使えます。

⚡ 3行まとめ
  1. 1音声・映像・テキストを連続的に取り込み、リアルタイムに考え応答する「インタラクションモデル」の研究プレビューを発表
  2. 2200ミリ秒単位のマイクロターン設計により、割り込み・同時発話・時間認識などを外付けの仕組みなしにモデル自体が実現
  3. 3公開モデルTML-Interaction-Smallは知能と応答性の組み合わせで最先端の性能を主張、数カ月以内に限定プレビュー開始予定

Thinking Machines Labは2026年5月11日(米国時間)、人間同士のような自然なやり取りをAIと実現する「インタラクションモデル」の研究プレビューを発表しました。外部の仕組みに頼らずモデル自体が対話を扱う設計で、音声・映像・テキストを連続的に取り込みながら、リアルタイムに考え、応答し、行動します。同社は、知能と応答性を組み合わせた性能で最先端を達成したとし、対話能力は知能と一緒にスケールすべきであり、後付けで扱うべきではないという考えを示しています。

課題認識: 協働のボトルネック

同社は、AI業界がAIの自律的なタスク遂行を最重要の能力として扱ってきた結果、人間がループに残る形の利用にモデルもインターフェースも最適化されていないと指摘します。実際の仕事の多くでは要件を事前にすべて指定して任せきりにはできず、人間が確認やフィードバックを挟む協働が成果につながるものの、現在のターン制の仕組みでは、ユーザーの入力が終わるまでモデルは何も知覚せず、モデルの生成中は新しい情報を受け取れないという狭い伝達路しかないと分析しています。

既存のリアルタイム音声システムの多くは、発話区間検出(VAD)などの部品を組み合わせた外付けのハーネスで対話らしさを実現していますが、同社はこうした手作りの仕組みは汎用能力の進歩に追い越されるとし、対話能力が知能とともにスケールするには、それをモデル自体に組み込む必要があると主張しています。

実現される機能

  • 対話管理 — 話者が考え中か、発言を譲っているか、言い直しているか、応答を求めているかをモデルが暗黙的に追跡し、別部品の対話管理を不要にする
  • 音声・視覚での割り込み — ユーザーの発話終了を待たず、文脈に応じてモデル側から口を挟める
  • 同時発話 — ユーザーとモデルが同時に話せる(ライブ翻訳など)
  • 時間認識 — モデルが経過時間を直接把握できる
  • 並行処理 — 会話を続けながら検索・Webブラウズ・UI生成を同時に行い、結果を会話に織り込む

アーキテクチャ

  • マイクロターン設計 — 200ミリ秒分の入力処理と200ミリ秒分の出力生成を連続的に交互に実行し、人工的なターン境界をなくす
  • エンコーダーレスの早期融合 — 音声はdMel表現を軽量な埋め込み層で、画像は40×40のパッチをhMLPで取り込み、音声出力はフローヘッドで生成。全コンポーネントをTransformer本体とゼロから共同訓練
  • 背景モデルとの分業 — 即答できない深い推論・ツール使用・長時間の作業は非同期の背景モデルに委譲。対話モデルは応対を続けながら、結果を適切なタイミングで会話に統合し、両者は文脈を共有する
  • 推論の最適化 — 200ミリ秒ごとの細かい処理向けにストリーミングセッションを実装し、その一部を推論ライブラリSGLangに還元。学習側と推論側のビットレベル一致もオーバーヘッド5%未満で実装
  • 安全性 — 音声合成で自然な口調の拒否応答データを作成し、自動レッドチーミングで長時間の音声対話でも頑健性を確保

ベンチマーク結果

公開されたモデル「TML-Interaction-Small」は、対話品質を測るFD-bench v1.5で平均77.8を記録し、GPT-realtime-2.0やGemini-3.1-flash-live-previewなどの比較対象を上回ったとしています。ターン間の応答遅延は0.40秒で比較対象中最速、知能面でもAudio MultiChallengeで43.4と、思考なし(instant)モデルの中では最高と報告しています。

また、指定した時刻に発話できるかを測るTimeSpeak、ユーザーと同時に話す必要があるCueSpeakという内製ベンチマークや、映像の変化への能動的な反応を測るRepCount-A・ProactiveVideoQA・Charadesでの評価も公開し、既存モデルはこれらのタスクを意味のある水準でこなせなかったとしています。

制約と今後の計画

  • 長時間セッション — 連続する音声・映像は文脈を急速に消費するため、非常に長いセッションの文脈管理は引き続き取り組み中
  • 通信環境 — 低遅延のストリーミングには安定した接続が必要で、接続が悪いと体験が大きく劣化する
  • モデル規模 — 現在のTML-Interaction-Smallは総パラメータ2,760億・アクティブ120億のMoE。より大規模なモデルは年内のリリースを計画
  • 提供予定 — 数カ月以内に限定的な研究プレビューを開始し、その後年内に対象を拡大。対話性研究を促す研究助成の開始も予定
📚 このニュースをG検定の知識につなげる

関連キーワードの解説記事で、背景となる技術・概念を確認できます。

📅 月刊「G検定時事対策」で総ざらい

このニュースの月のまとめ号があります。その月の生成AIニュースの全体傾向と、G検定試験風の理解度チェック問題を1本にまとめています。

🎓 2026年5月号を読む →
🔗 出典(一次ソース)
https://thinkingmachines.ai/blog/interaction-models/
※本記事は一次情報をもとに要約・再構成したものです。詳細は出典をご確認ください。