Black Forest Labs(BFL)は7月23日、画像生成に加え、音声付きの最大20秒動画を単一プロンプトから生成できる「FLUX 3」を発表しました。動画と音声を含むマルチモーダルのフロンティアモデルで、複数モダリティを別々のモデルで組み合わせるのではなく、同一アーキテクチャで共同学習したとしています。
同社はFLUX 3を「視覚インテリジェンス」と位置づけ、創作、シミュレーション、メディア制作、ロボティクスのアプリケーションをつなぐ能力だと説明しました。
FLUX 3は4つの製品ラインで提供され、動画(FLUX 3 Video)とアクション(FLUX 3 Action)は現在、申請と承認が必要なゲート型の「Early Access」で提供を開始しました。
一方、画像(FLUX 3 Image)は今後数週間で展開し、一般提供に進む見通しです。
ただし現時点で、BFLは価格やSLA、評価手法、ベンチマークの詳細、比較に使われたサンプル数などを公開していません。
またFLUX 3は重みのダウンロードやオープンソースライセンスでの提供はなく、より高速でオープンな重み版は年内に到着するとしています。
動画生成については、BFLが発表した予備的な嗜好評価で、10秒720pのテキストからの動画生成においてFLUX 3が競合より高い割合で選ばれたとしていますが、これは初期候補の評価で、出荷モデルの性能を直接示すものではないとしています。
さらに、FLUX 3 Videoは生成動画にネイティブ音声が付くほか、画像からの動画化、動画からの動画生成、音声を含む継続生成、キーフレーム制御、複数言語の対話などの機能を挙げています。
同社は動画とロボット行動の統合にも取り組み、FLUX 3を基盤にした動画アクションモデル「FLUX-mimic」も発表し、スイスのMimic Roboticsと連携するとしています。
参照元:2026/07/24 「Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start」 https://venturebeat.com/technology/black-forest-labs-launches-flux-3-capable-of-generating-images-and-20-second-video-with-audio-but-in-limited-release-to-start
この記事へのリアクション
このニュースをどう受け止めましたか?



コメント