公式実装と作者公開物を確認
この記事にはアフィリエイト広告が含まれます。
MiniMax H3高速化の方法|Turbo・量子化・SageAttention比較
H3を速くする方法は一つではありません。1ステップを軽くするSageAttention、モデルを軽くする量子化、ステップ数を減らすTurbo LoRA、確認表示を軽くするTiny VAEを分けて選びます。
- 4-step
- 反復回数を減らす
- SageAttention
- Attention計算を最適化
- INT8/FP8
- 重みの計算形式を軽量化
- Tiny VAE
- 途中プレビューを軽量化
最も大きく変わるのはステップ数
標準構成より4-step系は反復回数を大幅に減らせます。ただし映像4-stepと音声4-stepを同じにする必要はなく、作者の設定を起点に4、6、8ステップを比較します。
SageAttentionは重ね掛けしない
ComfyUIの起動オプションでSageAttentionを有効にしている場合、同じ目的のPatch Sage Attentionノードを重ねると速くなるとは限りません。どちらか一方で計測します。
速さの記録方法
モデル、LoRA、映像ステップ、音声ステップ、長さ、解像度、Attention方式、所要時間、最大VRAMを一組で残します。別条件の秒数だけを比べません。
よくある質問
MiniMax H3を一番速くする方法は?
まず4-step Turbo LoRAが大きな候補です。その上で量子化やAttention最適化を一つずつ比較します。環境により最速構成は変わります。
4ステップ、6ステップ、8ステップのどれが良いですか?
速度だけなら少ない方が有利ですが、映像と音声の品質が変わります。作者推奨の4-stepを起点に、6と8を同じ入力で比較します。
SageAttentionとPatch Sage Attention KJは両方使いますか?
同じ処理を二重に適用しないよう、起動オプションかノードのどちらか一方から試します。
Tiny VAEで生成そのものも速くなりますか?
主目的は途中プレビューの軽量化です。最終生成全体の高速化とは分けて考えます。
量子化とTurboはどちらが速いですか?
作用する場所が違います。量子化は1ステップの負荷、Turboはステップ数を主に減らすため、同一条件で個別と併用を測ります。
