MiniMax-H3 RefModsを使ってみた

人物のリファレンスファイルを作ることができます

今回もXから情報を得ました

 MiniMax H3関連の情報をXで調べているときに以下のポストで知りました。

ハカセ アイ(Ai-Hakase)生成AI・ComfyUI on Twitter / X

さらにWeb上の情報を調べて下記のWebサイトの記事を見ました。

LoRAではない。MiniMax H3のキャラクター固定を変える「RefMod」が面白い|PIYO

数枚から数十枚の画像データで人物のリファレンスファイル(RefModファイル)を作成します。動画生成時に作成したRefModファイルを読み込んでやると,Ref2VAで毎回参照画像を入力しなくても人物を固定できて,生成時間の高速化や省メモリ化につながるとのことです。
RefModファイルの作成もLoRAのように時間をかけて学習する必要がないので,私の環境でも利用できるのではないかと期待して使ってみることにしました。

RefModファイル作成用ワークフロー構築

 早速RefModを使うためのカスタムノードをインストールしました。

h3-center/docs/MINIMAX_H3_REFMODS_INSTALLATION_AND_USAGE_GUIDE.md · malcolmrey/various at main

ここまではいつも通りでしたが,画像データからリファレンスファイルを作成する方法がまったくわかりませんでした。参考になりそうなワークフローを見つけることもできず,とりあえずWebで調べてみると,GoogleのAI,Geminiさんが教えてくれました。

s.jpg

これを参考にしてワークフローを作ることにしました。Geminiに教えてもらったCreate H3 RefModノードは入力できるVAEノードが映像のみだったので,映像と音声の両方が入力できるCreate H3 RefMod Masterノードを使うことにし,映像と音声のVAEノードを接続しました。
このノードの設定項目を見ると,Geminiが教えてくれたfolderという項目がありませんでした。元画像を入れたフォルダを指定することができるようにLoad H3 RefMod Folderノードを追加し,Create H3 RefMod Masterノードのrefs_bundleに接続しました。
音声のリファレンスを作成する場合は,音声を読み込むノードを追加してCreate H3 RefMod Masterノードのaudioに接続しました。Web上の情報を見ると音声のRefModファイル作成はおすすめされていないようです。

ss.jpg

ノードを設定する

 Create H3 RefMod Masterノードの設定も最初はよくわからなかったので,色々試しながら確認していきました。
現在は以下の動画を参考にして次のように設定しています。記載していない項目はデフォルトのままです。

【いまMinimax H3で大流行】LoRA学習はもう不要!?数十秒で顔固定できる新技術「RefMod」で推しキャラの動画生成が自由自在になるComfyUI神ワークフロー配布|T2V対応

  • name RefModファイルのファイル名です。ファイル名を変更しないと生成する度に上書きされるので,注意が必要です。私は何回も上書きしてしまいました。
  • mode Full Referenceにしています。
  • concept_type Identityにしています。Genericでも大丈夫だと思います。
  • ref_resolusion 1024にしています。
  • max_tokens 8192にしています。

生成ボタンを押すと10~30秒くらいでRefModファイルを作成します。保存場所は~comfyui/models/refmod/内です。デフォルトでは映像と音声のRefModファイルは別々に作成されますが,save_layoutという項目をbundleにすると1つのファイルになるようです。

FL2VAのワークフローに組み込んで動画生成する

 こちらはカスタムノードをインストールするときに参考にしたWebサイトに接続の仕方が記載されいたので,作成していたFL2VAのワークフローに追加してみました。
Load H3 RefModsノードとApply H3 RefModsノードを配置し,お互いのmodsを接続します。Apply H3 RefModsノードをMiniMax H3 Image to VideoノードとBasic Guiderノードの間に入れてConditioningを順番につないでいけば完成です。

sss.jpg

ノードの設定は,Load H3 RefModsノードのmod1~mod8に読み込むRefModファイルを指定し,Apply H3 RefModsノードのoverrideをtrueに変更して生成しました。
プロンプトには

subject_definitions:
<Subject 1> (ここに服装や髪形などの情報を入力する)

のように入れておくとRefModファイルを参照してくれるようです。背景や服装,髪形を変更して5秒の動画を生成してテストしました。プロンプトの内容によっては参照画像がそのまま出ることもありましたが,人物を固定して動画を生成することができました。
今回テストをやってみて感じたことは,RefModはお手軽に作成できてなかなか使えるものだということです。今後も活用していきたいです。

この記事へのコメント

コメントはまだありません。

コメントを送る

必須
 
※ メールアドレスは公開されません
任意
必須
Loading...  画像の文字を入力してください
9
10
11
12
13
14
15
16