一枚の続きを、映像と音で
この記事にはアフィリエイト広告が含まれます。
MiniMax H3の使い方|ComfyUI導入・公開モデル・音声付き動画

MiniMax H3は、テキスト、画像、動画、音声を入力に、映像とステレオ音声を同時生成する動画モデルです。ComfyUIではT2VA、FL2VA、Ref2VAで入力方法が変わり、モデル、CLIP、Video VAE、Audio VAEを揃えて生成します。
- 公開元
- MiniMaxAI
- 主な出力
- 映像+ステレオ音声
- 公式ホスト型
- 最大15秒・2K
- 公開H3-Base
- 768p基準
- H3-Regenerate-2K
- 重み非公開・API利用
- 基本資料
- Base用/Reference用プロンプトガイド
最初に決めるのは、何を残して動かすか
お気に入りの絵から始めたいならI2V、開始と終わりが決まっているならFL2VA、人物を参考に別の場面を作りたいならRef2VAを検討します。画像は一コマ目なのか、配役の資料なのか。ここを揃えてからテンプレートを選ぶと、接続やプロンプトの迷いが減ります。
H3で変わるところ
映像だけでなく、台詞、環境音、音楽を同じ場面記述の中で扱います。見た目だけの短い単語列より、人物、場所、時間変化、カメラ、発話者、音の順に場面を記述する方が公式ガイドの考え方に沿います。
ComfyUIで必要な接続
T2VA/FL2VA/Ref2VAから入力方法を選び、モデル、CLIP、Video VAE、Audio VAE、Samplerを接続します。出力後は顔、手、音声、開始・終端、継ぎ目を通常速度で確認します。
モデル・LoRA・マージを分ける
量子化、pruned、Turbo LoRA、表現LoRA、FL2VA/Ref2VA hybrid、完全fine-tuneは役割が違います。ファイル名だけでなく、対象モード、loader、sampler、license、出力で確かめる条件を確認します。
動かした後の困りごとから探す
顔や手が変わるなら入力と動作を切り分け、参考動画の構造を渡したいならControlNet、高解像度へ仕上げたいならアップスケーラーを検討します。どれも万能な修復ではありません。まず一つの短い出力で、直したい箇所を明確にしてから追加します。
Music 3と合わせて、一つの短い作品にする
H3だけでも音声付き動画を作れます。一方、曲を先に決めて同じ音源のまま映像を編集したいなら、Music 3で曲を作り、H3の短いカットを組む方法があります。最初から長いMVを狙わず、開始・変化・着地のある15秒から考えてみてください。掲載画像は既存のAIポートレートであり、H3の生成結果ではありません。

公開や販売の前に、H3そのものの条件を確認
H3には独自のCommunity Licenseがあり、地域や利用形態で確認する条件が異なります。Comfyの現行H3案内はローカル生成物の商用利用に商用ライセンスが必要と説明しています。元モデルの契約と、実際に使うサービスの案内を照合してください。Music 3や追加LoRAの条件をH3へ流用せず、用途の可否が曖昧なら提供元へ確認します。
よくある質問
MiniMax H3は画像生成モデルですか?
主用途は動画生成です。テキストや画像などを入力に使い、映像と音声を出力します。
公式のプロンプト資料はありますか?
あります。Base系とReference系の2種類の公式ガイドが公開されています。
Turbo LoRAは公式モデルに含まれますか?
MiniMaxAIの基本モデルとは別の高速化用公開物です。配布元と対象モデルを確認して追加します。
