📰 生成AIニュースメモ

Black Forest Labs、マルチモーダル基盤モデル「FLUX 3」を発表

🗓 2026年7月24日#Black Forest Labs#動画生成#基盤モデル

「生成AIニュースメモ」は、生成AIの最新ニュースを要点3行+詳細メモで記録していくシリーズです。関連するG検定キーワード解説への内部リンク付きで、最新動向のキャッチアップと試験の時事対策に使えます。

⚡ 3行まとめ
  1. 1画像・動画・音声を単一アーキテクチャで同時学習するマルチモーダル基盤モデル
  2. 2音声付き動画を最長20秒まで一度に生成。初期評価で主要動画モデルを上回る選好率
  3. 3ロボットの行動予測にも展開。オープンウェイト版「FLUX 3 Dev」の公開も計画

Black Forest Labsは2026年7月23日、新しいマルチモーダル基盤モデル「FLUX 3」を発表し、早期アクセスの提供を開始しました。画像・動画・音声を統一アーキテクチャの中で同時に学習するモデルで、各モダリティは同じ現実を異なるセンサーで捉えた投影であり、同時に学べば相互の制約(音は衝突と一致し、動きは質量に従い、未来は過去から続く)からより多くを学べる、という原則に基づいて構築されています。物理環境とデジタル環境を横断して知覚・予測・行動する「実世界の視覚知能」を開発するという同社ミッションの一里塚と位置づけられています。

技術基盤

FLUX 3は、マルチモーダルな生成と理解を同一アーキテクチャ内で効率的に整合させる同社の手法「Self-Flow」の上に構築されており、計算資源とデータを大幅にスケールアップして動画・画像・音声を同時に訓練しました。その結果、モダリティを混在させ、テキストプロンプトからも、画像・動画などの参照入力からも、画像や「動画+音声」を統合的に生成できます。

動画生成: 音声付き20秒・幅広い制御

  • テキストからの動画生成(text-to-video)
  • 画像からの動画生成(image-to-video) — 開始フレームからの継続(アニメーション)と、視覚参照としての画像利用の両方
  • video-to-video — 参照クリップの中心要素(同じキャラクターなど)を新しいシーンや文脈へ引き継ぐ
  • 入力した動画・音声からの生成的な継続、キーフレーム間の制御された遷移(keyframe-to-video)
  • 多言語の対話、従来の映画的な出力を超える幅広いスタイル・アスペクト比
  • 個々のクリップをエージェント的に連結した、複数ショットの長尺シーケンス
  • 強力なタイポグラフィ生成とアニメーションデザイン

すべての出力にネイティブの音声生成が付き、1回の生成で最長20秒の動画を作れます。10秒・720pのtext-to-videoによる初期評価では、Grok Imagine Videoに対して最大69%、Kling v3 Proに60%、Happy Horse v1に59%、Happy Horse 1.1に57%、Seedance 2.0とGemini Omni Flashに52%、Runway Gen-4.5に77%、Luma Ray 3.2に93%の比較で選好されました。モデルとハーネスは開発中のため結果は暫定で、早期アクセス期間中のさらなる改善を見込むとしています。特に人間の表情の描写、音と物理イベントの対応付け、多言語対応に強く、視覚参照によってキャラクターの一貫性を保った数分間のシーケンスも作成できるとしています。

画像生成と行動予測

画像については、ミッドトレーニング段階の暫定評価で従来のFLUXから大幅な改善を示しており、複雑なプロンプトの処理とテキスト生成が大きく向上し、幅広いスタイルと多言語の高精度テキスト描画に対応します。画像生成の早期アクセスは数週間以内に開始予定です。

さらにFLUX 3の世界理解は行動(Action)予測にも拡張されています。Self-Flowでの初期研究をスケールアップしてネイティブな行動予測をFLUX 3に直接統合する路線と、事前学習済みの動画バックボーンを「動力学を理解した基盤」として少量のタスク固有データで特化型行動モデルをファインチューニングする路線の2本立てです。後者では、mimic roboticsが最初期のパートナーとして早期アクセスを得ており、FLUX 3のバックボーンとmimicのロボット学習の専門性を組み合わせた動画-行動モデル「FLUX-mimic」を共同開発、Audiの実際の生産タスクでテストされています。

提供計画

  • FLUX 3 Video — APIとプライベートウェイトアクセスによる動画・音声の生成と編集(早期アクセス開始済み)
  • FLUX-mimic / FLUX 3 Action — 選ばれた研究・商用パートナー経由の行動予測(mimic roboticsから開始)
  • FLUX 3 Image — APIとプライベートウェイトアクセスによる画像合成・編集
  • FLUX 3 Dev — コンテンツ制作(動画・音声・画像)と行動予測のためのマルチモーダルバックボーンのオープンウェイト公開

各機能は、円滑な展開・フィードバック収集・厳格な安全性テストのための早期アクセス期間を経て順次提供され、いずれも同一のマルチモーダルフローマッチングモデルから構築されます。技術的詳細も追って公開予定です。次世代モデルでは、知覚・行動・言語の予測を同一の統一モデルにまとめることを目標に掲げています。

📚 このニュースをG検定の知識につなげる

関連キーワードの解説記事で、背景となる技術・概念を確認できます。

🔗 出典(一次ソース)
https://bfl.ai/blog/flux-3
※本記事は一次情報をもとに要約・再構成したものです。詳細は出典をご確認ください。