動画の構造を、下書きから渡す
この記事にはアフィリエイト広告が含まれます。
MiniMax H3 ControlNet|動画の動きを指定する方法
ControlNetは、参考動画の見た目をそのまま複製する機能ではありません。輪郭、奥行き、骨格など、残したい構造だけを下書きにしてH3へ渡します。2026年8月31日、MiniMax H3 Fun ControlNetの実装がComfyUI本体へマージされました。公式実装、公開されているApplyノードとweight、出力で確認する必要がある画質や速度を分けて見ます。
- 1つのweight
- Canny・Depth・HED・MLSD・Pose
- 必要な部品
- Applyノード+pruned int8 weight
- 公式ComfyUI
- 2026年8月31日にmasterへマージ
- 出力で見る
- 画質・速度・音声
ControlNetはH3へ渡す動きの下書き
プロンプトだけでは『右手をこの軌道で上げる』『人物をこの奥行きに保つ』といったフレームごとの構造を固定しにくいことがあります。ControlNetは、元動画から輪郭、距離、骨格などを抜き出し、生成中のH3へ追加条件として渡します。たとえるなら、役者へ言葉だけで演技を頼む代わりに、振付、立ち位置、舞台図を書いた薄い下書きを渡す方法です。下書きの上にどんな人物、衣装、照明、質感を描くかはプロンプトと参照画像の役目です。
Unionは5種類の定規を一本の工具箱にまとめたもの
MiniMax-H3-Fun-Controlnet-Unionは、Canny、Depth、HED、MLSD、Poseの制御と動画inpaintingを一つのチェックポイントで扱います。制御ごとに別weightを入れ替えるのではなく、入力する制御動画の種類を変えます。たとえるなら、線、奥行き、柔らかな輪郭、建築線、骨格という5本の定規を、一つの工具箱から選んで使う設計です。公式モデルカードではcontrol branchがH3の50ブロック中5か所へ接続されます。
Cannyはくっきりした輪郭をなぞる
Cannyは明暗が急に変わる場所を細い線として抽出します。物体の外周、顔の向き、手や小物の形を明確に残したい時が候補です。たとえるなら、元動画へトレーシング紙を重ね、輪郭をペンでなぞってH3へ渡す方法です。線が多すぎる素材では背景の細部まで強く縛りやすいため、しきい値と入力の整理が必要です。
Depthは手前と奥の距離を地図にする
Depthは、カメラに近い場所と遠い場所を濃淡などで表した距離情報です。人物の立ち位置、腕を前へ伸ばす動き、室内の奥行き、カメラへ近づく動きを残したい時が候補です。たとえるなら、平面の映像へ舞台の高さと距離を書き込んだ地形図です。色や顔の同一性は距離図だけでは伝わらないため、プロンプトやReferenceToVideoと役割を分けます。
HEDは髪や服を含む柔らかな境界を見る
HEDもエッジを扱いますが、Cannyより物体全体の境界や柔らかな線を拾いやすい方式です。髪、布、影を含む構図を残したい時の比較候補です。たとえるなら、定規で引いた細線ではなく、鉛筆で形の流れまで描いたラフスケッチです。入力によっては不要な陰影も線になるため、Cannyと同じseedで比較して選びます。
MLSDは建物や室内の直線を守る
MLSDは長い直線を抽出するため、壁、窓、机、廊下、建物などの形を保つ用途に向きます。たとえるなら、映像から建築士が定規で引く設計線だけを取り出す方法です。人物の曲線や細かな表情を指定する道具ではありません。直線の少ない自然風景や人体だけの動画では、渡せる情報が少なくなります。
Poseは役者の骨格と振付を渡す
Poseは頭、肩、肘、手首、腰、膝などの関節位置を骨格として渡します。人物のダンス、手振り、立ち上がりなど、身体の動作を別の見た目へ移したい時が候補です。たとえるなら、衣装や顔を描かず、役者の振付メモだけを渡す方法です。指、表情、服の揺れなど骨格に含まれない情報は、別の条件やプロンプトで補います。
現在のComfyUI接続順
ComfyUI本体では、MiniMaxH3FunControlNetApplyはmodel、model_patch、vaeなどを受け取り、MODELを返します。旧構成のpositive/control_net入力とは接続が違います。新しい公式構成ではModelPatchLoaderから追加weightを渡します。同じノード名でも端子が変わっているため、旧グラフの線をそのまま差し替えず、入力名を確認してください。画質、速度、音声は使うモデルと設定で出力を確認します。
- 制御動画を用意する
生成したい長さ、幅、高さに合わせた動画を用意し、Canny、Depth、HED、MLSD、Poseのいずれかへ前処理します。
- weightを読み込む
Comfy-Orgの配布案内に従って対応weightをmodels/model_patchesへ置き、ModelPatchLoaderで選びます。pruned版とbase modelの互換性も確認します。
- Applyノードへ接続する
H3のmodel、読み込んだmodel_patch、video VAE、前処理済みcontrol_videoをMiniMaxH3FunControlNetApplyへ渡します。
- 出力MODELを生成側へ渡す
ApplyのMODEL出力をH3の生成側へ渡します。プロンプトのconditioning経路は別に保ち、短い比較で映像と音声を確認します。
公式6.8GB版とpruned版を混ぜない
Alibaba PAIの公式チェックポイントは約6.8GBのcontrol branchで、完全なMiniMax H3 baseの上に読み込む設計です。Kijaiのpruned版は、pruned H3向けに変換された別のチェックポイントで、公開ファイルはbf16約4.22GBとint8_convrot約2.3GBです。たとえるなら、同じ車種名でも純正エンジン用部品と軽量改造エンジン用部品で取付規格が違う状態です。ファイル名だけで交換せず、base modelとweightの組を確認します。
公式ComfyUIへ入った。使う前に組み合わせを確認する
ComfyUI公式PR #15975は2026年8月31日にmasterへマージされました。H3 Fun ControlNetをmodel patchとして読み込み、互換性を確認してApplyノードでH3へ渡す実装です。たとえるなら、これまで別売りの変換アダプターだったものが、工具箱の標準区画へ入った状態です。使うComfyUIがマージ後の版か、base modelとweightの組が合うか、制御動画で音声まで保てるかを出力で確認してください。
strengthは下書きを押さえる手の強さ
strengthはControlNetの影響量で、現在のノードは0.0〜10.0を受け付け、既定値は1.0です。大きくすれば必ず良くなるわけではありません。たとえるなら、下書きの紙を強く押さえるほど線はずれにくくなりますが、強すぎるとH3が衣装や構図を自然に描き直す余地まで減ります。まず1.0を基準に、0.5、0.75、1.0などを同じseedで比較します。
startとendは撮影中のどこまで振付を守らせるか
start_percentとend_percentは、拡散計算のどの区間へControlNetを効かせるかを0.0〜1.0で指定します。既定値は開始0.0、終了1.0です。たとえるなら、リハーサルの最初から最後まで振付師を舞台袖に立たせるか、前半だけ形を固めて後半は役者へ自由を渡すかを決める設定です。開始を遅らせて音声が回復した第三者の一条件もありますが、入力と構成が違えば同じ結果にはなりません。
音声を壊していないか、映像とは別に確認する
H3は映像と音声を同じ生成へ含めるため、映像の構造が合っていても音声が無音、途切れ、長さ違いになる可能性があります。ControlNetが映像区間だけへ作用する実装か、出力にstereo audioが残るか、映像時間と音声時間が一致するかを確認します。たとえるなら、振付を直した後に録音テープまで切れていないか別室で聞き直す工程です。
VRAMはweight容量だけでは決まらない
追加weightのファイル容量はVRAMの目安の一部ですが、base model、text encoder、VAE、制御動画の解像度と長さ、中間テンソル、precision、offloadでも変わります。公式モデルカードは完全なtransformerとQwen3-VLを同時にGPUへ載せる構成が80GBへ収まらないためoffloadを案内しています。pruned int8 weightが2.3GBでも、追加VRAMが2.3GBだけとは限りません。たとえるなら、工具箱の重さだけでなく、作業台、材料、途中の部品を広げる場所も必要です。
最初の比較は一つの制御だけで行う
DepthとPoseなどを重ねる前に、一種類だけでControlNetなし、strength 0.5、1.0の三条件を同じseed、prompt、base model、解像度、フレーム数で比べます。元の制御動画、前処理後の動画、出力動画を横に並べ、輪郭一致、人物位置、手足、顔、背景、音声、所要時間、最大VRAMを記録します。たとえるなら、調味料を全部入れて味を直すのではなく、一つずつ足して何が効いたか確かめる方法です。
公式資料で確認できること
公式資料から、1つのweightが5種類の制御とinpaintingを扱うこと、公式weightがcontrol branchのみであること、24fpsと17k+5のフレーム規則、guidance_scale 1.0の指定を確認できます。Applyノードとpruned int8 weightは公開されています。Canny・Depth・HED・MLSD・Poseごとの画質、速度、最大VRAM、音声保持は、使うモデルと設定で出力を確認してください。
よくある質問
ControlNetを使えば元動画と同じ人物になりますか?
なりません。ControlNetが主に渡すのは輪郭、奥行き、骨格などの構造です。人物の顔や衣装を保つには、プロンプトやReferenceToVideoなどの参照条件を別に使います。
CannyとHEDはどちらを使いますか?
輪郭を細く明確に固定したい時はCanny、髪や服を含む柔らかな境界まで残したい時はHEDが比較候補です。同じ入力とseedで両方を生成して選びます。
人物のダンスにはPoseだけで十分ですか?
Poseは関節の動きには強い候補ですが、指、表情、服、背景までは骨格に含まれません。顔や衣装の参照、Depthやプロンプトとの役割分担が必要です。
weightはどこへ置きますか?
9月8日確認のComfy-Org配布案内ではComfyUI/models/model_patches/です。現行本体のModelPatchLoaderを使い、base modelとweightの互換性を確認します。旧controlnetフォルダー・ControlNetLoaderの手順と混同しないでください。
公式ComfyUIへもう入っていますか?
はい。PR #15975が2026年8月31日にComfyUIのmasterへマージされました。ただし、既存のローカル環境には更新が必要です。更新後も、base modelとweightの組、control video、音声を含む短いテストで動作を確認してください。
strengthは高いほど動きを再現できますか?
影響は強くなりますが、画づくりの自由度や自然さを失う場合があります。1.0を基準に複数値を同じseedで比較します。
音声付き動画でも使えますか?
設計上はH3の映像生成へ追加条件を渡します。出力の音声有無、長さ、同期は映像とは別に確認してください。
24GB VRAMで動きますか?
第三者のRTX 4090実践例はありますが、設定と実装が異なります。pruned weight、offload、解像度、フレーム数などで必要量が変わるため、24GBで必ず動くとは断定しません。
