生活分享

MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌

MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。

更新日期: 閱讀時間約 8 分鐘

插圖:兩張分別代表音樂描述與歌詞的卡片,箭頭匯入中央圓形裡的聲波,再輸出成右側的音檔卡片
圖片:Mokaair (© Mokaair)

MiniMax 的音樂生成用一段描述加一段歌詞做出一首帶人聲與編曲的完整歌曲,但入口換了位置:官方文件寫明,自 2026 年 8 月 20 日起,付費的音樂與歌詞生成 API 不再開放給新使用者,免費版音樂 API 停止提供,改請使用者用 MiniMax Audio 網頁服務,或取用 Hugging Face 上的開源權重 MiniMax Music 3。搜「」或「音樂 」找到它的人,先看入口在哪裡。

這篇照官網文件走一遍:在哪裡動手、描述與歌詞各自要寫什麼、段落有哪幾種、一首歌多長、輸出什麼格式、費用怎麼算、API 最小呼叫長什麼樣,音檔能不能商用與著作權要注意什麼。條款沒有明講的部分直接寫「以官網為準」。

入口:官方現在把音樂生成放在哪裡

開發者文件的音樂生成說明頁與 API 參考頁掛著同一則公告:付費的 Music Generation 與 Lyrics Generation API 不再開放給新使用者,既有付費使用者可繼續使用;免費版的 music-3.0-free、music-2.6-free、music-cover-free 停止提供。公告給了兩條替代路徑。

  • 一般使用者:用 MiniMax Audio 網頁服務。官方為這個功能另寫了一份「MiniMax Audio 音樂創作使用條款」,生效日 2025 年 6 月 19 日,涵蓋 AI 生成音樂與 AI 生成歌詞。
  • 開發者或想自架的人:取用 Hugging Face 上的開源權重 MiniMax Music 3,官方自架文件教你用 SGLang-Omni 起服務,再透過語音端點送出歌詞與描述。
  • 既有付費使用者:端點與參數規則都還在,只是新帳號不再開通,以官網為準。

海螺(Hailuo AI)的 App 或網站裡有沒有獨立的音樂分頁、台灣的 App Store 與 Google Play 上架狀況,官方說明頁沒有寫,本站也無法從台灣以外的環境確認實際畫面,以官網為準。想先弄清楚這個品牌底下有哪些產品,先看下面這篇。

音樂描述與歌詞怎麼寫

模型吃兩份輸入:提示詞欄位 prompt 放音樂描述,lyrics 放要唱出來的字。官方把 prompt 定義為「描述音樂的風格、情緒與使用情境」,做有人聲的歌時選填、長度 0 到 2,000 個字元;把 is_instrumental 設成 true 做純演奏曲時改為必填、1 到 2,000 個字元,歌詞可以不給。另有 lyrics_optimizer ,設成 true 又沒給歌詞時會照描述自動生一份。

描述不要只丟「抒情流行」這種標籤。模型卡建議寫成三段式的結構化描述(Structured Caption),讓模型跟得到曲子隨時間的發展:

  • Global Metadata:曲風與次曲風、BPM、調性與音階、情緒推進、聆聽情境、製作質感。
  • Vocal Details:人聲性別、音色、演唱方式、和聲與背景人聲、人聲效果。
  • Arrangement:主次樂器、各段落樂器的進出、律動、低音聲部、打擊與空間效果。

歌詞欄位做有人聲的歌時必填,長度 1 到 3,500 個字元,行與行之間用換行分隔。官方列出 14 種段落標記,每個標記各自占一行,完整清單附在下面的範例裡。歌詞生成 API 回傳的歌詞也帶標記,可直接貼進 lyrics;兩份文件列的寫法略有出入,以你呼叫的那一支為準。

範例:一組音樂描述與一段帶段落標記的歌詞 · text
音樂描述(prompt 欄位,可直接用英文寫,模型對英文樂理詞彙的辨識較穩)
Genre: acoustic pop. BPM: 96. Key: C major. Warm and intimate, building gently into the chorus.
Vocals: soft female lead, close and breathy, light stacked harmonies in the chorus.
Arrangement: fingerpicked guitar and soft piano; brushed drums and upright bass enter in the chorus.

歌詞(lyrics 欄位,段落標記各自占一行,行與行之間用 \n 分隔)
[Verse]
清晨的光穿過松林
街角安靜得只剩呼吸
[Chorus]
世界慢慢地開始呼吸
把昨天的雨收進口袋

音樂生成 API 文件列出的 14 種段落標記
[Intro] [Verse] [Pre Chorus] [Chorus] [Interlude] [Bridge] [Outro]
[Post Chorus] [Transition] [Break] [Hook] [Build Up] [Inst] [Solo]
流程圖:音樂描述與歌詞兩份輸入,經過模型與音檔設定,產出音檔並在發布前檢查
從左到右看:兩份輸入各有字數上限,中間決定模型與音檔設定,右邊是取回音檔與發布前要做的事。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

流程圖分成五個方塊。左側兩個輸入方塊:音樂描述 prompt 寫風格、情緒、樂器與人聲,長度 0 到 2,000 個字元,純演奏曲時改為必填;歌詞 lyrics 用 14 種段落標記,每個標記各占一行,長度 1 到 3,500 個字元,也可以讓 API 代寫。兩者一起進入中間的模型與音檔設定方塊:模型選 music-3.0,取樣率 44100,位元率 256000,格式可選 mp3、wav 或 pcm。接著到右上的生成與取回方塊:模型卡寫原生最長 5 分鐘,output_format 選 url 時連結 24 小時後失效,也可以改用 hex 直接取回。最後往下到右下的發布前檢查方塊:標示這是 AI 生成、投入的聲音要先取得授權、商用範圍以官網條款為準、浮水印與識別資訊不要移除。

長度、格式與取樣率

長度方面,MiniMax Music 3 的模型卡寫的是原生支援最長五分鐘的完整歌曲,並在這個長度內維持主題、節奏、人聲特徵與編曲推進,撐得住前奏、主歌、副歌、橋段與尾奏的完整結構。自架文件另外提醒,服務框架容許的上限比五分鐘再長一點,但那是框架限制、不是模型多出來的能力。

音檔格式由 audio_setting 決定:取樣率可選 16000、24000、32000、44100,位元率可選 32000、64000、128000、256000,格式可選 mp3、wav、pcm。取回方式由 output_format 決定,url 給一條 24 小時後失效的連結,要盡快下載;hex 直接回傳十六進位字串,開啟串流時只支援 hex。自架開源權重那條路線輸出 32 kHz、16 位元立體聲 WAV。

資料查證於 2026 年 9 月,來源為 MiniMax 官方 API 文件、定價頁與 Hugging Face 模型卡。
項目官網數字或規則
目前主力模型music-3.0,2026 年 7 月 16 日列入模型發布紀錄
音樂描述 prompt0 到 2,000 個字元;純演奏曲時必填,1 到 2,000 個字元
歌詞 lyrics有人聲時必填,1 到 3,500 個字元;段落標記 14 種
單首長度模型卡:原生支援最長五分鐘
取樣率16000、24000、32000、44100
位元率32000、64000、128000、256000
音檔格式mp3、wav、pcm;自架開源權重輸出 32 kHz、16 位元立體聲 WAV
取回方式output_format 選 url 或 hex;url 連結 24 小時後失效
翻唱參考音檔6 秒到 6 分鐘、最大 50 MB、常見音訊格式
速率限制音樂生成 RPM 120、並行連線 20
API 價格Music-3.0 與 Music-2.6 每首 0.15 美元(最長 5 分鐘);歌詞生成每首 0.01 美元

費用與免費額度

API 這一側,定價頁已把音樂模型全部標成 Discontinued(停止提供),價格仍列在頁上:Music-3.0 與 Music-2.6 每首 0.15 美元、單首最長 5 分鐘,歌詞生成每首 0.01 美元;翻唱的前處理步驟官方註明不計費。這是給既有付費使用者看的價目。

MiniMax Audio 這一側走點數制。官方訂閱服務條款寫:免費使用者登入後可拿到每日限時的免費點數;Starter 每月 5 美元、含每月 100,000 點;Standard 每月 30 美元、含每月 1,000,000 點;也可單次加值,每 1,000,000 點 30 美元,最低 5 美元。2026 年 2 月 12 日以後買的點數有效期兩個月,之前的維持兩年,月費附的點數每個自然月月底歸零,生成失敗或未過審會自動退點。一首歌扣多少點,條款沒有列,以官網為準。

API 最小呼叫範例

既有付費帳號要接 API,最小的一次呼叫就是一個 POST:帶模型名稱、描述、歌詞與音檔設定。金鑰用環境變數讀,不要寫進程式碼。回應裡 status 是 2 代表完成,extra_info 附上音檔長度、取樣率、聲道數與檔案大小。

最小呼叫:把描述與歌詞送進音樂生成端點 · python
import os
import requests

# 金鑰放環境變數,不要寫進程式碼:export MINIMAX_API_KEY="..."
api_key = os.environ["MINIMAX_API_KEY"]

payload = {
    "model": "music-3.0",
    "prompt": "Indie folk, melancholic, introspective, longing, solitary walk, coffee shop",
    "lyrics": "[verse]\n街燈閃爍 夜風嘆息\n[chorus]\n推開木門 香氣散開",
    "audio_setting": {"sample_rate": 44100, "bitrate": 256000, "format": "mp3"},
    "output_format": "url",
}

response = requests.post(
    "https://api.minimax.io/v1/music_generation",
    headers={"Content-Type": "application/json", "Authorization": f"Bearer {api_key}"},
    json=payload,
)
print(response.json())

沒有付費帳號又想用程式跑的人走開源權重那條路。官方自架文件把模型與框架版本都釘死,服務起來後用共用的語音端點,歌詞放 input、描述放 instructions。這條路要 NVIDIA CUDA 顯示卡,模型檔案約 57.4 GB,不是一般筆電跑得動的規模。

自架開源權重:起好服務後送出一次生成請求 · bash
# 先照官方自架文件用 SGLang-Omni 起服務,再送出歌詞與音樂描述
curl http://127.0.0.1:8000/v1/audio/speech \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "MiniMaxAI/MiniMax-Music3",
    "input": "[Verse]\nMorning light filtering through the pine\n[Chorus]\nSoftly the world begins to breathe",
    "instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.",
    "response_format": "wav",
    "max_new_tokens": 750,
    "stream": false
  }' \
  --output minimax_music3.wav

商用、上架與著作權

輸出音檔能不能商用,兩份條款要分開看。MiniMax 的 App 與網站服務條款寫「我們不主張使用者投入內容與使用者生成內容的所有權」,但同時要求你授權 MiniMax 一份免權利金、永久、不可撤回、全球、非專屬的授權,範圍含重製、修改、發布、散布與取得收益,終止後仍存續。條款沒有另寫「輸出可自由商用」這句,所以上架串流平台或用在客戶案子前,商用範圍以官網條款為準。

自架開源權重是另一套規則。MiniMax-Music3 採用自家的社群授權(COMMUNITY LICENSE),允許使用、修改與再散布,商用另有兩條要求:在商業產品或服務介面上明顯標示「MiniMax-Music3」;你與關係企業由這些產品取得的年度總營收超過 2,000 萬美元時要先取得官方書面授權。著作權這塊,官方條款寫到的只有下面幾條:

  • 投入內容必須是原創或已取得合法權利,不得侵害第三方的智慧財產權或人格權。
  • 投入內容若包含任何個人的聲音,必須擁有完整合法權利或取得權利人授權。
  • 禁止用途明文包含冒充他人或誤稱關係、損害名譽、散布不實或誤導資訊。
  • 官方可能在輸出嵌入識別資訊或浮水印,不得擅自更改或移除;你有責任標示輸出是 AI 生成。
  • 開源權重的可接受使用政策同樣要求:公開散布生成內容要揭露是機器生成,未經同意不得冒充他人。

同一件事其他家也在做,Google 把 Lyria 放進 Gemini 就是一例;各家的長度、費用與授權規則不一樣,要比就照官網一項一項比對。另一邊的選擇看 。想補背景知識,與 兩篇夠用。

MiniMax 底下的其他生成功能,本站另有三篇:

  • 生活分享

    本機跑 Stable Diffusion 與 Flux:ComfyUI 入門

    ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。

  • 生活分享

    MiniMax 語音合成:中文配音、有聲書與影片旁白

    把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。

  • 生活分享

    MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片

    海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。

  • 生活分享

    Figma AI 功能怎麼評估:設計生成、資料與交接

    Figma AI 已包含對話式設計代理、獨立 AI 工具及與外部工具連接的工作方式,不能只沿用早期 First Draft 教學。本文以原創共享廚房預約頁為例,整理功能與席位、設計系統、內容訓練、聊天可見性及 MCP 寫入的檢查方式,並說明 beta 與 AI 點數的現況。附步驟、比較表及原創圖解,協助評估可編輯成果與交接責任,不把生成畫面當成已完成的服務。

最新旅遊情報攻略

資料來源

生活分享