MiniMaxが汎用マルチモーダル動画モデルH3をAPI提供、2K・4〜15秒でステレオ音声生成

MiniMaxは2026年7月31日、汎用のマルチモーダル生成モデル「MiniMax H3」を公開しました。
同社はH3を、テキスト、画像、動画、音声を1つの統一コンテキストとして読み込み、ネイティブのステレオ音声付き動画を返すモデルだと説明しています。
出力仕様は2K解像度で、長さは4〜15秒の整数秒に限定されます。
従来の動画生成はテキストから動画、画像から動画、参照フレーム、主題参照、モーション参照、編集などを別モデルで組み合わせることが多かったとし、H3はそれらを自然言語で関係付ける事前学習パラダイムに統合したとしています。
提供形態は、API経由では利用可能で、ユーザーの手元の環境での自前実行は現時点では不可とされています。
モデルIDは「MiniMax-H3」で、APIと消費者向けアプリ「Hailuo AI」で利用できます。
APIではテキストからの生成、最初・最後のフレームを用いた画像からの生成、参照生成の3つの入口が用意され、非同期の3段階フローでタスク作成後に結果URLを取得します。
参照入力は画像最大9枚、動画最大3本(各2〜15秒、合計15秒以下)、音声最大3本で、音声単独は受け付けません。
ファイルは動画50MB以下、画像30MB以下、音声15MB以下で、動画形式はH.264/H.265、画像はJPG/PNG/WEBP/HEIC/HEIF、音声はWAV/MP3に対応しています。
同社はH3の技術として、関係性を記述するコンテキスト表現、H3-VAEによる有効シーケンス長の4倍向上、生成と理解を分けたOmni Transformer、低解像度出力を文脈内で再生成する仕組みを挙げています。
広告、ブランディング、EC、プロダクトデザイン、UI/UX、ゲーム、映画の事前可視化、リテール向けカタログ制作などへの活用を想定しています。

参照元:2026/08/01 「MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio」 https://www.marktechpost.com/2026/08/01/minimax-releases-minimax-h3-an-omni-modal-video-model-that-generates-15-second-2k-clips-with-native-stereo-audio/

この記事へのリアクション

このニュースをどう受け止めましたか?

Reader Reaction

このニュース、みなさんはどう感じましたか?ぜひコメント欄であなたの声を聞かせてください。

※本記事に掲載している情報は公開時点のものです。最新情報は公式発表等をご確認ください。

ぜひコメントを添えてシェアお願いします。
  • URLをコピーしました!
  • URLをコピーしました!

アンケート

悩み相談をするなら、どちらに打ち明けたいですか?

回答者数:2人 投票期間:2026/04/16〜2026/08/02
回答はお一人様1回までです。


PR:実務直結の稼げるAIスキルを学べる

DMM 生成AI CAMP

AIを使いこなす側か、使われる側か。今がキャリアの分岐点。

全コース学び放題
入会金・教材費0円
最低契約期間なし・いつでも解約OK

受講生同士が繋がれるコミュニティ

Google検索で 3min AI を優先表示できます

Google検索の「優先ソース」に追加すると、通信ニュースを検索した際に、3min AIの記事が見つけやすくなります。

※Googleの設定画面が開きます。表示されたサイトにチェックを入れると、優先ソースとして設定できます。

Google検索の優先ソースに追加する

コメント

コメントする

CAPTCHA


日本語が含まれない投稿は無視されますのでご注意ください。(スパム対策)

目次