動画生成の接続を、組む
この記事にはアフィリエイト広告が含まれます。
MiniMax H3をComfyUIで動かす方法|T2VA・FL2VA・Ref2VA接続
最初からTurbo、複数LoRA、長尺化を全部入れず、入力モードを一つ選び、標準グラフで映像と音声が出るところまで確認します。その後にAddGuide、Reference、Turboを一つずつ足します。
- 最初の分岐
- T2VA/FL2VA/Ref2VA
- 必須部品
- Model・CLIP・Video VAE・Audio VAE
- 実機再現
- FL2VA BASE20・24fps・124f
- 任意コマ固定
- core MiniMaxH3AddGuide
1. 入力モードを一つ選ぶ
文字だけならT2VA、開始または終了フレームを固定するならFL2VA、人物・場面・動き・声などを参照するならRef2VAから始めます。複数の目的を同時に満たしたいときだけ、AddGuideや互換性を確認したhybridモデルへ進みます。
2. 最小グラフを通す
Diffusion model、Qwen系CLIP、Video VAE、Audio VAE、conditioning、sampler、decode、saveを接続します。この共有環境で再現済みの一例はpruned INT8 ConvRot、Sage、res_multistep/simple、20 steps、denoise 1.0、24fps、124 framesです。これは唯一の正解ではなく、比較の基準点です。
3. 開始状態を肯定形で書く
最初のShot文の冒頭に、frame 1でカメラに何が見えるかを肯定形で書きます。『正面を向かない』だけではなく、『frame 1では背中がカメラへ向き、すでに奥へ歩き始めている』のように開始状態を直接記述します。
4. AddGuideを必要なコマへ置く
ComfyUI coreのMiniMaxH3AddGuideは画像、短い動画、音声、音声付き動画を任意のピクセルフレームへ固定でき、連結して複数アンカーを置けます。開始画の再固定や中間キーフレームは一度に増やさず、基準出力とのA/Bで効果を見ます。
5. 最後にTurboやLoRAを足す
標準構成が通った後、同一入力・シード・尺・解像度のままTurboまたは表現LoRAを一つだけ追加します。映像の動き、顔・手、台詞、環境音、生成時間、VRAMを同じ記録へ残します。
よくある質問
最初はどのワークフローを選びますか?
参照素材がなければT2VA、開始画があるならFL2VA、人物や声など複数の参照があるならRef2VAです。
Referenceとキーフレームは同時に使えますか?
ComfyUI core上では併用可能です。ただし使用モデルとノード版を記録し、実出力で確認します。
22フレームと39フレームのどちらを使いますか?
単発のAddGuide位置とContinuation overlapは別問題です。AV継続では39fが音声latentの整数境界に乗ります。この値を他の構成へそのまま当てはめず、使う入力と出力で確かめてください。
