生活分享

MiniMax 語音合成:中文配音、有聲書與影片旁白

把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。

更新日期: 閱讀時間約 8 分鐘

以幾何圖形畫成的插圖:一張寫著文字的卡片,經過一段聲音波形,指向一副簡化的耳機
圖片:Mokaair (© Mokaair)

MiniMax 的 Speech 系列把文字變成音檔。官方文件寫它支援 40 種語言與 300 多個系統音色,同步合成單次上限 10,000 字元,非同步長文單次上限 1,000,000 字元。要做中文配音、有聲書或影片旁白,你真正要決定的只有三件事:走網頁版還是 API、挑哪一個音色、怎麼調。如果你是搜「配音 」找工具的,成品好不好也就看這三件事。

這篇把當天在官網查到的規格整理成可以照做的步驟:兩條路的最小操作、音色怎麼找、情緒與停頓怎麼寫、輸出格式與取樣率、費用與免費額度、聲音複製的驗證與授權規則,還有有聲書的分段做法。模型改版很快,動手前再開一次官方文件。

兩條路:網頁版與 API

網頁版叫 MiniMax Audio,登入後貼文字、挑音色、試聽、下載,適合一次做一兩段、邊聽邊改。API 走開放平台,申請金鑰後用 HTTP 或 WebSocket 呼叫,適合整批文章或整本書。介面以官網當天為準。

  1. 在開放平台申請金鑰,存進環境變數。
  2. 選 model:音質取向用 hd,速度與成本取向用 turbo。
  3. 準備 voice_id:系統音色、複製音色或設計出來的音色。
  4. 把文字與參數 POST 到同步端點 t2a_v2。
  5. 回傳的 audio 是十六進位字串;output_format 設 url 就直接拿連結。
同步語音合成的最小呼叫(金鑰用環境變數) · bash
# 金鑰放環境變數,不要寫死在程式碼或前端
export MINIMAX_API_KEY="your-key"

curl --location 'https://api.minimax.io/v1/t2a_v2' \
  --header "Authorization: Bearer ${MINIMAX_API_KEY}" \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "speech-2.8-hd",
    "text": "第一段唸完停一下<#0.6#>再接第二段。",
    "language_boost": "Chinese",
    "output_format": "url",
    "subtitle_enable": true,
    "voice_setting": {
      "voice_id": "Chinese (Mandarin)_Radio_Host",
      "speed": 1,
      "vol": 1,
      "pitch": 0
    },
    "audio_setting": {
      "sample_rate": 44100,
      "bitrate": 128000,
      "format": "mp3",
      "channel": 1
    }
  }'

語言與中文:官方寫了什麼、沒寫什麼

非同步長文說明頁寫模型「完整支援全球 40 種常用語言」,清單第 1 項是 Chinese、第 2 項是 Cantonese。同步 API 的 language_boost 也有 Chinese 與 Chinese,Yue(粵語),共 40 個語言選項再加一個 auto。

繁體與台灣口音則要說清楚:音色清單與 API 文件當天都查不到「繁體中文」或「台灣口音」這幾個字,中文分類只有 Chinese (Mandarin) 與 Cantonese,官方沒有任何承諾,以官網為準。要用在台灣的作品上,先拿自己的稿子試唸一段。

挑音色與調參數

系統音色清單頁把 voice_id 列成表格,當天數下來 332 個,標成 Chinese (Mandarin) 的 34 個、Cantonese 的 6 個。也可以用 Get Voice API 列出帳號能用的音色;複製的音色要先成功合成過一次才查得到。清單裡沒有合用的,就用音色設計(試聽上限 500 字元)或快速聲音複製(試聽上限 1,000 字元)自己生。

列出帳號可用的音色 · bash
# 列出這個帳號現在能用的音色
curl --location 'https://api.minimax.io/v1/get_voice' \
  --header "Authorization: Bearer ${MINIMAX_API_KEY}" \
  --header 'Content-Type: application/json' \
  --data '{ "voice_type": "all" }'
  • 語速 speed:0.5 到 2,預設 1.0。
  • 音量 vol:大於 0 到 10,預設 1.0。
  • 音調 pitch:-12 到 12,預設 0 是原本音高。
  • 情緒 emotion:happy、sad、angry、fearful、disgusted、surprised、calm、fluent、whisper 共 9 個值,預設由模型自動挑;whisper 在 speech-2.8 系列不支援。
  • 停頓:文字裡插入 <#x#>,x 是秒數,範圍 0.01 到 99.99,最多兩位小數,不能連著用兩個。
  • 讀音:半形括號包住漢語拼音、IPA 或粵拼,指定破音字與專有名詞怎麼唸。
  • 語氣詞:只有 speech-2.8 系列支援,(laughs)、(sighs)、(breath) 這類標記直接寫進文字。

speech-2.8 是官網說明裡最新的一代,發布日寫 2026 年 1 月 23 日。先用預設值整段唸一次,只在明顯不對的地方調一個參數,比一次調四個容易找出原因。

從文字到音檔的五步驟流程圖,標出每一步要決定的參數與官網數字
由左到右走一次:選音色、調參數、產生、試聽、輸出;下方兩格是長文路線與聲音複製的規則。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

五個步驟的流程圖。第一步選音色:系統音色 332 個,其中中文普通話 34 個、粵語 6 個,也可以自建複製音色。第二步調參數:語速 0.5 到 2、音量 0 到 10、音調 -12 到 12、情緒 9 種可選,停頓可自訂秒數。第三步產生:同步單次上限 10,000 字元,超過 3,000 字改用串流,模型選 hd 或 turbo。第四步試聽:複製音色的試聽文字上限 1,000 字元,設計音色 500 字元,不對先換音色。第五步輸出:mp3、wav、flac 等格式,取樣率 8,000 到 44,100,下載連結有效 24 小時,可加字幕時間戳。左下方是長文與有聲書路線:非同步 API 單次上限 1,000,000 字元,建立任務後拿 task_id,完成再用 file_id 下載,下載網址有效 9 小時,可回句級字幕時間戳。右下方是聲音複製的規則:需通過個人或企業驗證,上傳錄音 10 秒到 5 分鐘、20 MB 以內,168 小時(7 天)未使用即刪除,第一次合成才收 1.5 美元。最下方提醒兩件事:要複製的聲音必須取得權利人授權,官網禁止冒充任何人;輸出請標示 AI 生成,價格與規格以官網當天頁面為準。

輸出格式與有聲書工作流

format 支援 mp3、pcm、flac、wav、opus 等七種,預設 mp3;sample_rate 可選 8000 到 44100 之間的六段;bitrate 只對 mp3 有效;channel 填 1 是單聲道。output_format 選 url 時連結有效 24 小時。打開 subtitle_enable 可以拿字幕時間戳,影片旁白對軸很好用。

同步 API 單次上限 10,000 字元,超過 3,000 字元文件建議改用串流。整本書用非同步長文 API:單次上限 1,000,000 字元,建立任務拿 task_id,完成後用 file_id 下載,網址有效 9 小時。文件另註明無效字元比例超過 10% 會直接回錯誤,從排版軟體複製的稿子送出前先清一次。

  • 一章一個任務,檔名對上章節編號,重做不用重跑整本。
  • 段落之間用換行分段,文件寫段落分隔就是換行字元。
  • 標點決定呼吸,超長句先斷成短句再送。
  • 章名之後、對白之前插 <#x#> 標記,不要靠多打空白。
  • 專有名詞與破音字用 pronunciation_dict 做整本統一替換。
建立非同步長文任務(一章一個任務) · python
"""一章一個非同步任務;金鑰讀環境變數 MINIMAX_API_KEY。"""
import os
import requests

api_key = os.environ["MINIMAX_API_KEY"]
payload = {
    "model": "speech-2.8-hd",
    "text": open("chapter-01.txt", encoding="utf-8").read(),
    "language_boost": "Chinese",
    "voice_setting": {"voice_id": "Chinese (Mandarin)_Radio_Host", "speed": 1, "vol": 1, "pitch": 0},
    "audio_setting": {"audio_sample_rate": 44100, "bitrate": 128000, "format": "mp3", "channel": 1},
}
resp = requests.post(
    "https://api.minimax.io/v1/t2a_async_v2",
    headers={"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"},
    json=payload,
    timeout=60,
)
print(resp.json())  # 取回 task_id,輪詢狀態,完成後用 file_id 下載

費用與免費額度

開放平台依用量計價,語音合成照字元算。音色設計 3 美元、快速聲音複製 1.5 美元,都是第一次拿去合成才收費,不是產生當下就收;試聽音檔另外照字元計費,兩份官方頁面的單價不同,以官網為準。

網頁版走訂閱:付費條款寫 Starter 每月 5 美元含 100,000 點、Standard 每月 30 美元含一百萬點,每月贈送的點數月底到期。開放平台另有一份語音訂閱表,數字不一樣(Standard 每月 30 美元 300,000 點),兩份對應不同產品,付款前先確認自己在哪一邊。免費額度只查到一句:免費使用者登入後可獲得每日限時的免費額度;官網沒有台幣定價,也沒有台灣可用性的專門說明,以官網為準。

來源為官方定價頁與 API 文件,查證日 2026 年 9 月 14 日。
模型或功能用途官網數字
speech-2.8-hd最高音質,支援語氣詞標記100 美元/百萬字元
speech-2.8-turbo同樣功能,速度與成本取向60 美元/百萬字元
speech-2.6 與 speech-02 系列舊版,hd 與 turbo 兩種100 或 60 美元/百萬字元
同步語音合成 T2A一次一段,可串流單次上限 10,000 字元
非同步長文 T2A整本書一次送單次上限 1,000,000 字元
音色設計 Voice Design用文字描述生成新音色3 美元/個音色
快速聲音複製用錄音複製音色1.5 美元/個音色
語音辨識 Speech-to-Text把錄音轉成文字0.38 美元/小時
系統音色清單可直接使用的音色332 個

聲音複製、商用與標示

技術規定:上傳的錄音支援 mp3、m4a、wav,長度至少 10 秒、最長 5 分鐘,檔案不超過 20 MB,另可上傳 8 秒以內的示範音訊提高相似度。API 總覽頁寫得更直接:聲音複製需要個人或企業驗證。複製與設計出來的音色都是暫時的,168 小時(7 天)內沒被合成 API 用過就會刪除。

授權規定寫在服務條款:輸入內容必須是你的原創或你已取得必要、有效且合法的權利;若包含任何個人的聲音,你必須擁有完整合法權利或取得權利人授權。禁止事項列了九項,包含誹謗他人、冒充任何人或虛稱關係、侵害未成年人權益、散布不實或誤導資訊。

輸出能不能商用?條款沒有一句直接寫「可以商用」。使用者生成內容那一節寫「我們不主張對使用者投稿與使用者生成內容的所有權」,同時要你授權 MiniMax 一份免權利金、永久、不可撤銷、全球、非專屬的授權;另一節寫個人非商業使用,但該節開頭已註明只涵蓋你造訪當下網站上既有的內容。條款也寫 MiniMax 可能在輸出裡嵌入識別碼或浮水印,未經授權不得移除,你也有責任清楚標示 AI 生成的內容。要接案或上架有聲書,先讀完當天的條款,以官網為準。

資料流向也看一眼:服務條款寫營運方是一家新加坡公司,隱私政策當天標示更新於 2025 年 12 月 9 日,寫一般不會把個人資料傳到新加坡以外的國家,服務對象限 16 歲以上。

最後一句提醒:一段夠像的合成語音就足以冒充一個人打電話借錢,這是深偽最便宜的用法。把 AI 生成標示在作品上、保留可查的來源歷程,是保護自己,也保護被複製的人。

  • 生活分享

    本機跑 Stable Diffusion 與 Flux:ComfyUI 入門

    ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。

  • 生活分享

    MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌

    MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。

  • 生活分享

    MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片

    海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。

  • 生活分享

    Figma AI 功能怎麼評估:設計生成、資料與交接

    Figma AI 已包含對話式設計代理、獨立 AI 工具及與外部工具連接的工作方式,不能只沿用早期 First Draft 教學。本文以原創共享廚房預約頁為例,整理功能與席位、設計系統、內容訓練、聊天可見性及 MCP 寫入的檢查方式,並說明 beta 與 AI 點數的現況。附步驟、比較表及原創圖解,協助評估可編輯成果與交接責任,不把生成畫面當成已完成的服務。

最新旅遊情報攻略

資料來源

生活分享