Black Forest LabsがFLUX 3を公開し動画・音声・動作予測を統合

Black Forest Labs(BFL)はマルチモーダル基盤モデル「FLUX 3」を公開しました。
FLUX 3は画像、動画、音声を1つのアーキテクチャで学習し、同一の重みで動画生成、音声生成、さらにアクション予測まで行える点が特徴です。
同社は、画像は空間構造、動画は時間と物理的ダイナミクス、音声は機械的出来事と音の因果関係をそれぞれ補完すると説明しています。
そのため各モダリティを「同じ現実の損失的な投影」として扱い、相互に整合するよう学習させたとしています。
FLUX 3の基盤には、マルチモーダルの生成と理解を単一構成で整列させる「Self-Flow」を採用しています。
Self-Flowはフローマッチングと自己教師ありの特徴再構成を組み合わせ、GitHub上の参照実装ではApache-2.0で公開されています。
BFLは、動画は最大20秒のクリップを音声付きで生成できるとし、テキストからの動画生成や画像からの動画生成、参照クリップからの動画生成、キーフレームからの制御生成、入力動画と音声の継続生成に対応するとしています。
また、人の表情や音と物理イベントの結び付けが強みだと報告しました。
予備的な人間の嗜好評価では、10秒のテキスト対動画(720p、音声)でFLUX 3がLuma Ray 3.2に93%、Runway Gen-4.5に77%で選ばれたとしています。
一方で他モデルとの比較では52%前後まで下がるケースもありました。
同社は実験用のチェックポイントとしてImageNet 256×256の研究モデルを示し、FLUX 3では同アプローチで計算資源とデータ量を大幅に拡大したと述べています。

参照元:2026/07/27 「Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction」 https://www.marktechpost.com/2026/07/26/black-forest-labs-releases-flux-3-a-multimodal-flow-model-for-image-video-audio-and-robot-action-prediction/

この記事へのリアクション

このニュースをどう受け止めましたか?

Reader Reaction

このニュース、みなさんはどう感じましたか?ぜひコメント欄であなたの声を聞かせてください。

※本記事に掲載している情報は公開時点のものです。最新情報は公式発表等をご確認ください。

ぜひコメントを添えてシェアお願いします。
  • URLをコピーしました!
  • URLをコピーしました!

アンケート

悩み相談をするなら、どちらに打ち明けたいですか?

回答者数:2人 投票期間:2026/04/16〜2026/07/27
回答はお一人様1回までです。


PR:実務直結の稼げるAIスキルを学べる

DMM 生成AI CAMP

AIを使いこなす側か、使われる側か。今がキャリアの分岐点。

全コース学び放題
入会金・教材費0円
最低契約期間なし・いつでも解約OK

受講生同士が繋がれるコミュニティ

Google検索で 3min AI を優先表示できます

Google検索の「優先ソース」に追加すると、通信ニュースを検索した際に、3min AIの記事が見つけやすくなります。

※Googleの設定画面が開きます。表示されたサイトにチェックを入れると、優先ソースとして設定できます。

Google検索の優先ソースに追加する

コメント

コメントする

CAPTCHA


日本語が含まれない投稿は無視されますのでご注意ください。(スパム対策)

目次