MiniMax H3 開源影片模型部署教學:最低 8G 顯示卡也能跑(附完整設定與實測)

MiniMax H3 開源影片模型部署教學:最低 8G 顯示卡也能跑(附完整設定與實測)

重點速讀<br>- H3 是 MiniMax 開源的全模態影片生成系統,畫面與原生立體聲同步生成。<br>- 最低 8G VRAM 可跑,但 12G VRAM + 32G 系統記憶體是比較舒服的起點。<br>- 部署前務必把 ComfyUI 升級到 0.27 以上版本。<br>- 音訊 VAE 必須使用 fp32,用 fp16 會沒聲音或音畫不同步。<br>- 提示詞要寫「分鏡」而不是堆關鍵詞,角色一致性交給 Ref2VA。

目錄

  1. MiniMax H3 是什麼
  2. 顯示卡要多少才夠
  3. 部署前準備:升級 ComfyUI
  4. 模型下載與放置
  5. 載入工作流與第一次生成
  6. 實測技巧:怎麼把片子拍好看
  7. 常見問題排查
  8. 資源下載
  9. 常見問題 FAQ

一、MiniMax H3 是什麼

這兩年玩過的開源影片模型不算少,說實話大部分最後都被我刪掉了:要麼模型太大、一般電腦跑不動;要麼能跑,但畫面容易崩,聲音還得另外處理。這次 MiniMax 開源的 H3,確實讓我改觀。

H3 不是單純的「文生影片」模型,而是把文字、圖像、影片、音訊、角色參考、鏡頭運動整合在同一套工作流裡的全模態生成系統。官方在 8 月 3 日正式開源,架構換成 H3-Context-IR,跟之前的 Hailuo 01、Hailuo 02 完全不是同一套東西。

項目 規格
輸出長度 4 至 15 秒,最高 2K 解析度
音訊 與影片同步生成,32kHz 立體聲
語言 支援中、英、日、韓、法等 11 種語言口型與語音
榜單表現 Artificial Analysis 影片編輯能力第一,文生影片與圖生影片分列第二、第三(依公開資料整理)
角色功能 Ref2VA 角色參考,最多 9 張參考圖

官方開源之外,社群也發布了最佳化版本,自由度更高,適合進階玩家。使用時請注意遵守法律與平台規範,不要用於侵權或違規內容。

二、顯示卡要多少才夠

網路上「8G 也能跑」的說法沒有錯,但要看你想跑到什麼程度。以下整理目前社群公開的實測資料:

配置 實測結果
12G VRAM + 32G 系統記憶體 + NVMe 5 秒 480p、20 步,接近 5 分鐘
雙卡各 32G(合計 64G)+ 約 384G 系統記憶體 5 秒 1344×768、50 步,約 9.3 分鐘

為什麼 12G VRAM 能跑動 40 多 G 的模型?因為 ComfyUI 使用按層動態排程:需要哪一層就把哪一層搬進 VRAM,其餘留在記憶體與硬碟。所以 VRAM 不夠不會直接報錯,只會變慢。

8G 能不能跑?能,但要靠更激進的量化(Q2、Q3)與大量 offload,出片時間明顯拉長,低量化對畫質的損傷也實打實存在。如果你是 8G 卡,建議:系統記憶體 32G 起跳、硬碟必須是 NVMe,並從 480p、20 步、5 秒開始試,不要一上來就衝 720p。

三、部署前準備:升級 ComfyUI

這一步跳過的話,後面全是坑。H3 需要 ComfyUI 0.27 或更高版本,舊版本沒有對應的原生節點。

項目 下載
ComfyUI 最新版 官方下載:【點選前往】
備用整合包 【點選前往】(含社群工作流與節點)

如果你已經安裝 ComfyUI 桌面版,務必升級到最新版,否則看不到 MiniMax H3 開源模型。整合包使用者,直接用啟動器的「更新」功能更新,完成後啟動一次並確認右下角版本號。

四、模型下載與放置

模板中心目前提供 3 種 MiniMax H3 開源模型:文生影片、圖生影片、影片轉影片,可以依需求下載。生成解析度建議先設小一點,速度會快很多;之後可以用高畫質放大工具提升到 1080、2K 甚至 4K。

官方原生路線的模型放置方式:

型別 檔案 放置目錄
主模型 MiniMax-H3-FL2VA-Q4_K_M.gguf(依 VRAM 選量化) models/unet/
文字編碼器 qwen3vl_32b_minimax_h3_Q4_K_M.gguf models/text_encoders/
影片 VAE minimax_h3_video_vae_fp16.safetensors models/vae/
音訊 VAE minimax_h3_audio_vae_fp32.safetensors models/vae/

量化版本怎麼選:

VRAM 建議量化
24G 以上 Q8 或官方 INT8 / NVFP4
16G Q5 或 Q4
12G Q4
8G Q3,或混合精度的 Q2 版本

注意一個細節:音訊 VAE 必須是 fp32 版本,用 fp16 會出現音畫不同步或完全沒聲音。如果你走官方原生路線,模型權重需要同時放在 models/MiniMax-H3/(單檔案)與 models/diffusers/MiniMax-H3/(分片版本,含 config.json)兩個目錄,缺一個都會報錯。

社群最佳化版目前也有 3 個版本,47.97G 是 BF16 滿血版,對 VRAM 要求較高;消費級顯示卡建議選較小的量化版,例如 24.55G 的版本,實測效果也很不錯。另有更小的 NVFP4 量化版,適合 8G VRAM 使用者。

五、載入工作流與第一次生成

GGUF 模型倉庫一般會附帶對應的工作流 JSON(例如 MiniMax FL2V GGUF (WORKFLOW).json),下載後直接拖進 ComfyUI 介面即可載入。官方原生路線則可在模板瀏覽器中直接選 H3 官方工作流。

載入後檢查以下節點:

  • Unet Loader (GGUF):選擇你下載的主模型
  • CLIP Loader (GGUF):選擇 qwen3vl 文字編碼器
  • VAE Loader:注意有兩個,影片 VAE 與音訊 VAE 分別對應,不要接反
  • 解析度與幀數:第一次先設 480p、5 秒

節點全部變綠、沒有報紅,就可以點生成。第一次跑會很慢,因為要從硬碟載入權重,8G 到 12G VRAM 的機器做 5 秒 480p、20 步,先做好等 8 到 15 分鐘的心理準備;第二次開始會快很多,因為部分權重已快取在記憶體中。

六、實測技巧:怎麼把片子拍好看

跑通只是開始,真正決定出片品質的是提示詞。H3 跟以前的模型不一樣,它真的能聽懂鏡頭語言。

提示詞要寫「分鏡」,不要寫「標籤」。以前 SD 那套關鍵詞堆砌在 H3 上效果很一般,H3 更吃完整的場景描述加鏡頭排程。

不好的寫法:

一個女人,咖啡館,下雨,電影感,8k,高質量

好的寫法:

黃昏的咖啡館靠窗位置,窗外下著小雨。一位穿米色針織衫的女性正低頭攪拌咖啡,鏡頭從她的手部特寫緩慢上搖至面部,她抬頭看向窗外,嘴角微微上揚。暖色調室內燈光,窗外冷色調環境光形成對比。背景音:雨聲、咖啡杯輕碰聲、隱約的爵士樂。

差別在於第二種把畫面、動作、鏡頭運動、光線、聲音全部交代清楚。H3 的音訊與畫面一起生成,你不寫聲音,它就自己猜,猜出來的往往不是你要的。

鏡頭運動直接使用術語:推、拉、搖、移、跟、升降,H3 都能理解;英文的 dolly in、pan left、crane shot、handheld 也支援。想要穩定的運鏡就寫明白,別指望它讀心。

角色一致性靠 Ref2VA。在 Ref2VA 區塊餵入同一個角色的多張參考圖(最多 9 張,建議 3 到 5 張不同角度),再配一段語音參考,就能做出跨鏡頭同一個人、同一個聲音的連續片段。實測下來,參考圖的品質比數量重要,5 張清晰的正側面照,效果遠好過 9 張模糊圖。

單次最長 15 秒是硬限制。想做長片就用尾幀接首幀的方式串接:第一段的最後一幀匯出,作為第二段的首幀輸入,配合 Ref2VA 鎖定角色,就能做出連貫的多鏡頭內容。

七、常見問題排查

問題 解法
報錯找不到節點 ComfyUI 版本太舊,或沒有安裝 ComfyUI-GGUF
載入模型時爆 VRAM 崩潰 換更低的量化版本,並在啟動參數加上 –lowvram
生成出來沒有聲音 檢查音訊 VAE 是否用了 fp16,必須改用 fp32
畫面有了但音畫不同步 多半是影片 VAE 與音訊 VAE 接反,回到工作流檢查連線
速度慢到無法接受 確認模型放在 NVMe 固態硬碟;機械硬碟會讓 offload 慢十倍
畫面崩壞、人物變形 多半是量化太狠,Q2、Q3 的畫質損傷客觀存在,建議加 VRAM 或降解析度

八、資源下載

項目 說明 下載
ComfyUI 最新版 需 0.27 以上 【官方下載】/【備用】
H3 官方模型 文生影片、圖生影片、影片轉影片 【模板中心】/【備用】
社群最佳化版 BF16 滿血版與量化版 【Hugging Face】/【整合包】/【網盤】
最佳化版工作流 節點與工作流 JSON 【點選下載】/【網盤】/【備用】
NVFP4 量化版 適合 8G VRAM 【Hugging Face】/【整合包】
影片高畫質放大工具 提升到 1080 / 2K / 4K 【網盤下載】/【備用下載】

九、常見問題 FAQ

Q:8G 顯示卡真的能跑嗎?

A:能跑,但要使用 Q2、Q3 量化並搭配大量 offload。建議系統記憶體 32G 起跳、使用 NVMe,並從 480p、20 步、5 秒開始測試。

Q:為什麼音訊 VAE 一定要用 fp32?

A:fp16 音訊 VAE 會造成音畫不同步或完全沒有聲音,這個坑踩過一次就會記住。

Q:沒用過 ComfyUI 可以入門嗎?

A:可以,但建議先把 ComfyUI 升級到 0.27 以上,並依工作流檢查 Unet、CLIP 與兩個 VAE 節點是否正確。

Q:一次只能生成 15 秒嗎?

A:單次最長 15 秒是硬限制,可以用尾幀接首幀搭配 Ref2VA,串接出多鏡頭且角色一致的更長影片。

總結

  • H3 讓開源影片模型第一次在可控性上追平閉源產品,音畫同步生成與跨鏡頭角色一致是最有感的升級。
  • 12G VRAM 是比較舒服的起點,8G 能跑但需要耐心,先從低解析度與少步數開始。
  • 三個最容易踩雷的地方:ComfyUI 版本、音訊 VAE 用 fp32、提示詞寫分鏡。

延伸閱讀:

*免責聲明:本文為個人實測分享,模型資訊、數據與收費請以 MiniMax 官方公告為準;請遵守法律與平台規範。*

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *