ファイルを揃えて、短い一曲へ
この記事にはアフィリエイト広告が含まれます。
MiniMax Music 3をComfyUIで動かす|必要ファイルと最初の一曲

Music 3を試したいのに、配布ファイルが多くて止まっていませんか。ComfyUIでは、曲の説明を読む部品、音を組み立てる部品、音声へ戻す部品を揃えます。全部の精度違いを集める必要はありません。公式テンプレートが求める組を選び、まず短い出力を最後まで聴くところから始めます。公式手順と、使う環境で必要になる確認項目を分けて説明します。
- 入り口
- Template Library → Audio
- 必要部品
- DiT・Text Encoder・VAE
- 基本入力
- Caption+Lyrics
- 手元の速度
- 未測定
最初は公式テンプレートから始める
ComfyUIをバックアップしたうえで更新し、Template LibraryのAudioからMiniMax Music 3を探します。表示されない場合は公式チュートリアルのDownload Workflowを利用します。赤いノードが出たら、すぐに同名のカスタムノードを追加するのではなく、ComfyUIの版と起動時の読み込みエラーを確認してください。公式は本体のネイティブ対応を案内しています。
三つの部品は、作曲メモ・演奏・録音の役割
Text EncoderはCaptionとLyricsから音楽の条件を作り、DiTは音声の中間表現を組み立て、VAEはそれを聴ける音に戻します。たとえるなら、依頼書を譜面へ整理する担当、演奏を組み立てる担当、最後に音源へ仕上げる担当です。三つは別の役割なので、H3の動画用VAEや他の音楽モデルのファイルで代用しません。
保存先は三か所。精度違いは必要なものだけ
Comfy-Orgの再梱包モデルには複数の精度が並んでいます。低VRAM向けに案内される組では、以下のファイルをそれぞれ配置します。DiTのFP16版などへ変える場合は、テンプレートの選択欄も合わせます。拡張子を含めた名前を確認し、別モデルを同じ名前へ変更して読み込ませることは避けてください。
- models/diffusion_models/
minimax_music3_dit_int8_convrot.safetensors。音声を組み立てるDiTです。
- models/text_encoders/
minimax_music3_text_encoder_pruned_int8_convrot.safetensors。曲の説明と歌詞を処理します。
- models/vae/
minimax_music3_dav.safetensors。最後に音声へ戻すVAEです。
最初の実行で変更するのは、曲の内容と短い尺
テンプレートの接続と基本値を控え、CaptionとLyricsを入れます。歌なら短い自作の一番とサビ、BGMなら楽器と場面を絞った説明を使います。max_durationは曲の尺を指定する欄で、公式テンプレートの説明は60秒を既定例としています。これは必ずその秒数ぴったりで終わる保証ではありません。最初から長尺を狙わず、生成・保存・再生までがつながるかを確認します。

VRAM不足は、モデル容量だけを見ても解決しない
VRAMはGPUの作業机です。ファイル容量は収納する箱の大きさであり、作業中には途中の音声や計算結果も机へ広がります。INT8の選択、短い尺、他のGPUアプリの終了を一つずつ比べます。tiled_decodeは音声を小分けに戻す方法で、机を節約する代わりに境界の音を確認する必要があります。元モデルの公式ページにある低VRAMの例はDiffusersなど別の実装も含みます。その数値をComfyUIの必要量へ読み替えず、使うComfyUI構成で必要量と速度を確認してください。
止まった場所で、調べる先を変える
ファイルが選べないなら配置と再読み込み、ノードが赤いなら本体の版と起動ログ、生成中のメモリ不足なら尺と精度、最後の保存だけが失敗するなら保存ノードの接続と出力先を調べます。最初から全ファイルを再ダウンロードする必要はありません。エラー文、止まったノード、変更前後の設定を一緒に控えると、同じ失敗を繰り返しにくくなります。
ComfyUIで動くことと、APIで動くことは別
外部サービスのAPIを呼び出すノードも存在しますが、この手順は公開モデルをローカルで動かす公式経路です。クラウドAPIの料金や利用権を引き継ぐものではありません。逆にAPIキー入力欄がある構成では、送信先と契約を確認してください。現在のMusic APIには新規提供停止の告知があるため、以前の無料API例を導入手順へ混ぜません。
完成の判定は、保存された音を最後まで聴いてから
進捗表示が終わっても、無音、途中切れ、極端な音量差、意図しない声があれば採用できません。出力ファイルを別のプレイヤーでも再生し、冒頭・中盤・終端を確認します。動画へ使うなら実際の台詞と重ねて聴いてください。モデル名、ファイル名、尺、seed、Caption、Lyricsと採用理由を一緒に残すと、後から同じ方向へ作り直せます。
よくある質問
モデルを全部ダウンロードしますか?
いいえ。選んだテンプレートに必要なDiT・Text Encoder・VAEを揃えます。複数の精度をすべて集める必要はありません。
8GBのGPUで動きますか?
量子化やオフロードを使う構成例はありますが、RAM、尺、実装でも変わります。8GBでの生成可否や所要時間は、使う構成で確認してください。
H3と同じモデルファイルですか?
別です。Music 3用の三部品を使います。H3の動画VAEや音声VAEを代わりに選びません。
ローカル生成の音楽は自由に配れますか?
元モデルのCommunity Licenseと入力素材、公開先の条件を確認してください。変換版ページの短いライセンスタグだけでは判断しません。
