MiniMax Music 3 開源實測:一句歌詞生成 5 分鐘完整歌曲,本地部署教學

AI 音樂生成進入新時代

過去要創作一首完整的歌曲,需要詞曲創作、編曲、錄音、混音等繁複流程。如今,MiniMax 最新開源的音樂生成模型 MiniMax Music 3,只要輸入一句歌詞或一段文字描述,就能生成一首長達 5 分鐘的完整歌曲,包含人聲演唱、旋律與伴奏。

更令人興奮的是,這款模型採用 Apache 2.0 授權,開放模型權重,可免費商用。無論是音樂製作人快速打樣、內容創作者製作背景音樂,或是想嘗試 AI 創作的玩家,都能在自己的電腦上本地部署。

MiniMax Music 3 是什麼?

MiniMax Music 3 是 MiniMax 推出的音樂生成模型,核心特色包括:

  • 一次生成最長 5 分鐘的完整歌曲,結構穩定、音質一致
  • 支援人聲演唱、旋律、編曲與伴奏的完整輸出
  • 以 8B 全域語言模型掌握長程音樂結構,0.6B 區域模型處理細節
  • 採用 Flow Matching 與 Flow-VAE 技術,輸出 32kHz 16-bit 立體聲
  • Apache 2.0 開源授權,可免費商用

硬體需求

全精度模型在 24GB 顯存內即可運行;若搭配 CPU offloading,最低 8GB 顯存也能跑得動,只是生成速度會較慢。一般建議至少 12GB 以上顯存,體驗較流暢。

本地部署教學

步驟一:安裝或更新 ComfyUI

ComfyUI 已原生支援 MiniMax Music 3。若你已安裝過 ComfyUI,請務必更新到最新版本,否則無法辨識模型。可從官方網站下載最新版 ComfyUI。

步驟二:下載模型檔案

MiniMax Music 3 需要 4 個模型檔案,分別放入對應目錄:

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   ├── minimax_music3_dit_fp16.safetensors  # 全精度,顯存充足推薦
│   │   └── minimax_music3_dit_int8_convrot.safetensors  # 低顯存優化
│   ├── text_encoders/
│   │   └── minimax_music3_text_encoder_pruned_int8_convrot.safetensors
│   └── vae/
│       └── minimax_music3_dav.safetensors

模型可從 Hugging Face 的 Comfy-Org/MiniMax-Music-3 或 MiniMaxAI/MiniMax-Music3 下載。

步驟三:載入工作流

在 ComfyUI 的 Template Library 中,選擇 Audio 分類下的 MiniMax Music 3 工作流,或直接下載官方範例工作流 JSON 拖入介面。

步驟四:輸入歌詞與曲風描述

工作流有兩個關鍵輸入:

  • Caption:描述曲風、情緒、速度、配器與編曲
  • Lyrics:歌詞,可用 [intro]、[verse]、[chorus]、[bridge]、[outro] 等段落標籤標記結構

步驟五:生成與輸出

點擊執行後,模型會生成完整歌曲並輸出為音檔,可直接用於打樣、配樂或內容製作。

提示詞撰寫技巧

要獲得理想的歌曲,提示詞的結構化描述很重要。Caption 負責描述「聽起來像什麼」,Lyrics 負責提供「歌詞與段落結構」,兩者缺一不可。以下提供兩個不同風格的完整範例,你可以直接套用或改寫。

範例一:輕快流行舞曲

適合想生成節奏明快、記憶點強烈的流行歌。重點是明確標示 BPM、曲風、配器與副歌的「洗腦句」。

# 音樂描述 / Caption
一首輕快的現代中文流行舞曲,約 108 BPM,旋律簡單好記、容易上口。
主歌節奏輕盈,副歌加入層層和聲,整體明亮、溫暖、帶點懷舊感。
使用現代流行鼓組、飽滿的低音、明亮的合成器與電鋼琴,
副歌要有強烈記憶點,讓聽眾聽一次就能哼唱。

# 歌詞 / Lyrics
[Intro]
今晚的風 吹過你的臉
燈亮了一點 心跳快一點

[Verse 1]
城市的霓虹還沒睡
我們沿著街一直追
你說今天不想回
我說那就再走一回

[Pre Chorus]
別問明天會怎樣
別管時間有多忙
這一刻就在身旁
就讓心跳替我們回答

[Chorus]
今晚別睡 別睡 別睡
讓月亮陪我們到天黑
今晚別睡 別睡 別睡
有你在身邊 什麼都對

[Bridge]
如果時間真的會停
我希望停在這裡

[Outro]
今晚別睡……
別睡……
再愛一回……

範例二:抒情慢歌

適合想生成情感濃厚、催淚的抒情歌。重點是描述聲音質感(溫柔、帶點哽咽)、編曲的鋪陳層次,以及情緒高峰的位置。

# 音樂描述 / Caption
一首情感真摯的中文抒情慢歌,約 72 BPM,女聲主唱。
歌聲溫暖、細膩、帶點氣聲與脆弱感,像是在安靜地訴說一段故事。
前奏只用鋼琴與空間感,主歌貼近聽眾,副歌加入弦樂與和聲,
情緒在最後一段副歌達到高峰,結尾回到只有鋼琴與輕聲呢喃。

# 歌詞 / Lyrics
[Intro]
窗外的雨 下了一整夜
我突然想起 你說過的話

[Verse 1]
小時候總覺得 家門永遠不會關
總以為長大以後 就能走得很遠很遠

[Chorus]
你還在等我回家嗎
還會不會站在門前
像小時候一樣 等我喊一聲媽媽

[Bridge]
我終於明白 你想要的從來不多
不是禮物 不是電話
你只是想知道 有人會想起你

[Outro]
我想回家……
這一次 我真的回家了……

提示:段落標籤越完整,歌曲結構越穩定;歌詞與曲風描述越具體,生成結果越貼近你的想像。建議先從範例改寫,再逐步加入自己的創意。

實測心得

根據實際測試,24GB 顯存環境下,生成 60 秒歌曲約需 20 秒,生成 4~5 分鐘的完整歌曲約需 1~2 分鐘。生成品質已達到「可聽」的水準,人聲自然、編曲完整,對獨立音樂人或內容創作者來說非常實用。

結語

MiniMax Music 3 讓 AI 音樂創作門檻大幅降低。開源、免費商用、本地部署,三大優勢讓它成為目前最值得嘗試的 AI 音樂工具之一。如果你對 AI 創作有興趣,不妨下載模型親自體驗,說不定你的下一首熱門歌曲,就是由 AI 幫你完成。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *