生活分享
MiniMax 語音合成:中文配音、有聲書與影片旁白
把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。
更新日期: 閱讀時間約 8 分鐘

MiniMax 的 Speech 系列把文字變成音檔。官方文件寫它支援 40 種語言與 300 多個系統音色,同步合成單次上限 10,000 字元,非同步長文單次上限 1,000,000 字元。要做中文配音、有聲書或影片旁白,你真正要決定的只有三件事:走網頁版還是 API、挑哪一個音色、參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文怎麼調。如果你是搜「配音 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文」找工具的,成品好不好也就看這三件事。
這篇把當天在官網查到的規格整理成可以照做的步驟:兩條路的最小操作、音色怎麼找、情緒與停頓怎麼寫、輸出格式與取樣率、費用與免費額度、聲音複製的驗證與授權規則,還有有聲書的分段做法。模型改版很快,動手前再開一次官方文件。
兩條路:網頁版與 API
網頁版叫 MiniMax Audio,登入後貼文字、挑音色、試聽、下載,適合一次做一兩段、邊聽邊改。API 走開放平台,申請金鑰後用 HTTP 或 WebSocket 呼叫,適合整批文章或整本書。介面以官網當天為準。
- 在開放平台申請金鑰,存進環境變數。
- 選 model:音質取向用 hd,速度與成本取向用 turbo。
- 準備 voice_id:系統音色、複製音色或設計出來的音色。
- 把文字與參數 POST 到同步端點 t2a_v2。
- 回傳的 audio 是十六進位字串;output_format 設 url 就直接拿連結。
# 金鑰放環境變數,不要寫死在程式碼或前端
export MINIMAX_API_KEY="your-key"
curl --location 'https://api.minimax.io/v1/t2a_v2' \
--header "Authorization: Bearer ${MINIMAX_API_KEY}" \
--header 'Content-Type: application/json' \
--data '{
"model": "speech-2.8-hd",
"text": "第一段唸完停一下<#0.6#>再接第二段。",
"language_boost": "Chinese",
"output_format": "url",
"subtitle_enable": true,
"voice_setting": {
"voice_id": "Chinese (Mandarin)_Radio_Host",
"speed": 1,
"vol": 1,
"pitch": 0
},
"audio_setting": {
"sample_rate": 44100,
"bitrate": 128000,
"format": "mp3",
"channel": 1
}
}'MiniMax 是什麼:海螺 AI、影片與語音生成,台灣使用者怎麼用MiniMax 是什麼:海螺 AI、影片與語音生成,台灣使用者怎麼用MiniMax 是上海的 AI 公司,海螺 AI(Hailuo)、MiniMax Audio 語音、Music 3.0 音樂、MiniMax Agent 對話助理與開源的 M 系列模型都是它的產品。這篇用 2026 年 9 月查證的官網與香港交易所資料,說明五條產品線各做什麼、台灣使用者走哪個國際版網址、費用怎麼算、隱私政策把資料放在哪裡,並示範用海螺做一支 5 秒影片,附費用對照表。閱讀全文
語音合成(TTS)是什麼:讓文字成為聽得懂、聽得對的聲音語音合成(TTS)是什麼:讓文字成為聽得懂、聽得對的聲音語音合成就是文字轉語音 AI、配音 AI 背後的技術:把文字轉成可播放的語音,常用於導覽、旁白與無障礙朗讀。本文以地方展覽導覽稿為例,說明文字如何形成聲音、為何多音字與數字需要試聽,以及音色、韻律、清晰度各自要怎麼驗收,並釐清語音合成與聲音複製、語音辨識的差別,讓自然的聲音真正傳達正確內容,而不是只追求像真人。閱讀全文
語言與中文:官方寫了什麼、沒寫什麼
非同步長文說明頁寫模型「完整支援全球 40 種常用語言」,清單第 1 項是 Chinese、第 2 項是 Cantonese。同步 API 的 language_boost 也有 Chinese 與 Chinese,Yue(粵語),共 40 個語言選項再加一個 auto。
繁體與台灣口音則要說清楚:音色清單與 API 文件當天都查不到「繁體中文」或「台灣口音」這幾個字,中文分類只有 Chinese (Mandarin) 與 Cantonese,官方沒有任何承諾,以官網為準。要用在台灣的作品上,先拿自己的稿子試唸一段。
挑音色與調參數
系統音色清單頁把 voice_id 列成表格,當天數下來 332 個,標成 Chinese (Mandarin) 的 34 個、Cantonese 的 6 個。也可以用 Get Voice API 列出帳號能用的音色;複製的音色要先成功合成過一次才查得到。清單裡沒有合用的,就用音色設計(試聽上限 500 字元)或快速聲音複製(試聽上限 1,000 字元)自己生。
# 列出這個帳號現在能用的音色
curl --location 'https://api.minimax.io/v1/get_voice' \
--header "Authorization: Bearer ${MINIMAX_API_KEY}" \
--header 'Content-Type: application/json' \
--data '{ "voice_type": "all" }'- 語速 speed:0.5 到 2,預設 1.0。
- 音量 vol:大於 0 到 10,預設 1.0。
- 音調 pitch:-12 到 12,預設 0 是原本音高。
- 情緒 emotion:happy、sad、angry、fearful、disgusted、surprised、calm、fluent、whisper 共 9 個值,預設由模型自動挑;whisper 在 speech-2.8 系列不支援。
- 停頓:文字裡插入 <#x#>,x 是秒數,範圍 0.01 到 99.99,最多兩位小數,不能連著用兩個。
- 讀音:半形括號包住漢語拼音、IPA 或粵拼,指定破音字與專有名詞怎麼唸。
- 語氣詞:只有 speech-2.8 系列支援,(laughs)、(sighs)、(breath) 這類標記直接寫進文字。
speech-2.8 是官網說明裡最新的一代,發布日寫 2026 年 1 月 23 日。先用預設值整段唸一次,只在明顯不對的地方調一個參數,比一次調四個容易找出原因。
閱讀完整文字說明
五個步驟的流程圖。第一步選音色:系統音色 332 個,其中中文普通話 34 個、粵語 6 個,也可以自建複製音色。第二步調參數:語速 0.5 到 2、音量 0 到 10、音調 -12 到 12、情緒 9 種可選,停頓可自訂秒數。第三步產生:同步單次上限 10,000 字元,超過 3,000 字改用串流,模型選 hd 或 turbo。第四步試聽:複製音色的試聽文字上限 1,000 字元,設計音色 500 字元,不對先換音色。第五步輸出:mp3、wav、flac 等格式,取樣率 8,000 到 44,100,下載連結有效 24 小時,可加字幕時間戳。左下方是長文與有聲書路線:非同步 API 單次上限 1,000,000 字元,建立任務後拿 task_id,完成再用 file_id 下載,下載網址有效 9 小時,可回句級字幕時間戳。右下方是聲音複製的規則:需通過個人或企業驗證,上傳錄音 10 秒到 5 分鐘、20 MB 以內,168 小時(7 天)未使用即刪除,第一次合成才收 1.5 美元。最下方提醒兩件事:要複製的聲音必須取得權利人授權,官網禁止冒充任何人;輸出請標示 AI 生成,價格與規格以官網當天頁面為準。
輸出格式與有聲書工作流
format 支援 mp3、pcm、flac、wav、opus 等七種,預設 mp3;sample_rate 可選 8000 到 44100 之間的六段;bitrate 只對 mp3 有效;channel 填 1 是單聲道。output_format 選 url 時連結有效 24 小時。打開 subtitle_enable 可以拿字幕時間戳,影片旁白對軸很好用。
同步 API 單次上限 10,000 字元,超過 3,000 字元文件建議改用串流。整本書用非同步長文 API:單次上限 1,000,000 字元,建立任務拿 task_id,完成後用 file_id 下載,網址有效 9 小時。文件另註明無效字元比例超過 10% 會直接回錯誤,從排版軟體複製的稿子送出前先清一次。
- 一章一個任務,檔名對上章節編號,重做不用重跑整本。
- 段落之間用換行分段,文件寫段落分隔就是換行字元。
- 標點決定呼吸,超長句先斷成短句再送。
- 章名之後、對白之前插 <#x#> 標記,不要靠多打空白。
- 專有名詞與破音字用 pronunciation_dict 做整本統一替換。
"""一章一個非同步任務;金鑰讀環境變數 MINIMAX_API_KEY。"""
import os
import requests
api_key = os.environ["MINIMAX_API_KEY"]
payload = {
"model": "speech-2.8-hd",
"text": open("chapter-01.txt", encoding="utf-8").read(),
"language_boost": "Chinese",
"voice_setting": {"voice_id": "Chinese (Mandarin)_Radio_Host", "speed": 1, "vol": 1, "pitch": 0},
"audio_setting": {"audio_sample_rate": 44100, "bitrate": 128000, "format": "mp3", "channel": 1},
}
resp = requests.post(
"https://api.minimax.io/v1/t2a_async_v2",
headers={"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"},
json=payload,
timeout=60,
)
print(resp.json()) # 取回 task_id,輪詢狀態,完成後用 file_id 下載自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字自動語音辨識就是「語音轉文字 AI」背後的技術:把語音訊號轉成文字,是字幕、口述輸入與會議逐字稿的基礎。本文以社區活動籌備錄音為例,說明聲音如何經過模型形成轉寫結果、為何人名與否定詞要回聽,也拆開逐字稿、說話者標記、翻譯與摘要的差別,並介紹錯誤率的用途與限制,讓流暢文字不會被誤當成完整可靠的會議紀錄。閱讀全文
MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。閱讀全文
MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。閱讀全文
費用與免費額度
開放平台依用量計價,語音合成照字元算。音色設計 3 美元、快速聲音複製 1.5 美元,都是第一次拿去合成才收費,不是產生當下就收;試聽音檔另外照字元計費,兩份官方頁面的單價不同,以官網為準。
網頁版走訂閱:付費條款寫 Starter 每月 5 美元含 100,000 點、Standard 每月 30 美元含一百萬點,每月贈送的點數月底到期。開放平台另有一份語音訂閱表,數字不一樣(Standard 每月 30 美元 300,000 點),兩份對應不同產品,付款前先確認自己在哪一邊。免費額度只查到一句:免費使用者登入後可獲得每日限時的免費額度;官網沒有台幣定價,也沒有台灣可用性的專門說明,以官網為準。
| 模型或功能 | 用途 | 官網數字 |
|---|---|---|
| speech-2.8-hd | 最高音質,支援語氣詞標記 | 100 美元/百萬字元 |
| speech-2.8-turbo | 同樣功能,速度與成本取向 | 60 美元/百萬字元 |
| speech-2.6 與 speech-02 系列 | 舊版,hd 與 turbo 兩種 | 100 或 60 美元/百萬字元 |
| 同步語音合成 T2A | 一次一段,可串流 | 單次上限 10,000 字元 |
| 非同步長文 T2A | 整本書一次送 | 單次上限 1,000,000 字元 |
| 音色設計 Voice Design | 用文字描述生成新音色 | 3 美元/個音色 |
| 快速聲音複製 | 用錄音複製音色 | 1.5 美元/個音色 |
| 語音辨識 Speech-to-Text | 把錄音轉成文字 | 0.38 美元/小時 |
| 系統音色清單 | 可直接使用的音色 | 332 個 |
聲音複製、商用與標示
技術規定:上傳的錄音支援 mp3、m4a、wav,長度至少 10 秒、最長 5 分鐘,檔案不超過 20 MB,另可上傳 8 秒以內的示範音訊提高相似度。API 總覽頁寫得更直接:聲音複製需要個人或企業驗證。複製與設計出來的音色都是暫時的,168 小時(7 天)內沒被合成 API 用過就會刪除。
授權規定寫在服務條款:輸入內容必須是你的原創或你已取得必要、有效且合法的權利;若包含任何個人的聲音,你必須擁有完整合法權利或取得權利人授權。禁止事項列了九項,包含誹謗他人、冒充任何人或虛稱關係、侵害未成年人權益、散布不實或誤導資訊。
輸出能不能商用?條款沒有一句直接寫「可以商用」。使用者生成內容那一節寫「我們不主張對使用者投稿與使用者生成內容的所有權」,同時要你授權 MiniMax 一份免權利金、永久、不可撤銷、全球、非專屬的授權;另一節寫個人非商業使用,但該節開頭已註明只涵蓋你造訪當下網站上既有的內容。條款也寫 MiniMax 可能在輸出裡嵌入識別碼或浮水印,未經授權不得移除,你也有責任清楚標示 AI 生成的內容。要接案或上架有聲書,先讀完當天的條款,以官網為準。
資料流向也看一眼:服務條款寫營運方是一家新加坡公司,隱私政策當天標示更新於 2025 年 12 月 9 日,寫一般不會把個人資料傳到新加坡以外的國家,服務對象限 16 歲以上。
使用中國系 AI App 前的資安檢查清單使用中國系 AI App 前的資安檢查清單裝 DeepSeek、豆包、Kimi、Qwen 或 MiniMax 之前,用官方頁面自己查清楚四件事:資料存在哪個國家、會不會拿去訓練、註冊要交出什麼、不用了怎麼刪。這篇把它拆成十三項檢查,依裝之前、註冊時、使用中、不用了四段排好,附五家隱私政策原文對照表、Apple 與 Google 的權限設定路徑,以及數位發展部公告的適用範圍。閱讀全文
MiniMax M 系列模型:開放權重、授權條款與 API 價格MiniMax M 系列模型:開放權重、授權條款與 API 價格M 系列是 MiniMax 的文字模型線,從 M1 一路做到 M3。這篇照 2026 年 9 月 14 日官網、API 文件與 Hugging Face 官方組織頁的內容,整理現有版本與時序、參數與上下文視窗、每一代授權能不能商用、API 每百萬 token 的價格與訂閱方案、本機執行的硬體需求,並說明開放權重和開源的差別,以及 M 系列和海螺影片、語音、音樂模型的分工。閱讀全文
最後一句提醒:一段夠像的合成語音就足以冒充一個人打電話借錢,這是深偽最便宜的用法。把 AI 生成標示在作品上、保留可查的來源歷程,是保護自己,也保護被複製的人。
深偽(Deepfake)是什麼:分清合成痕跡、來源與事件真假深偽(Deepfake)是什麼:分清合成痕跡、來源與事件真假深偽就是換臉 AI、仿聲工具背後的技術:利用 AI 生成或改造影像、聲音等內容,可能讓人看似說過或做過從未發生的事。本文以活動講者影片為例,拆解影像換臉、聲音模仿與一般剪輯的差別,說明為何嘴形、偵測分數與來源標記都不能單獨判定真偽,並提供從完整素材、正式管道與發布脈絡交叉核對的方式,保留應有的不確定性。閱讀全文
內容憑證(Content Credentials):查來源歷程,不替真假背書內容憑證(Content Credentials):查來源歷程,不替真假背書內容憑證以可驗證的來源資訊記錄影像等內容的製作與編輯歷程,C2PA 提供其技術規範。本文用活動照片的裁切與發布示範簽署、內容綁定和驗證,說明有效、失效與沒有憑證各代表什麼,也區分來源憑證、水印和真假判斷。讀完能檢查簽署者、記錄範圍與缺失資訊,避免把有效憑證當成事件真實的保證,或把無憑證內容直接判為偽造。閱讀全文
ChatGPT 語音模式:練英文、口說翻譯與免手打的完整做法ChatGPT 語音模式:練英文、口說翻譯與免手打的完整做法ChatGPT 語音模式是搜「口說 AI」「口譯 AI」的人真正會用到的功能,2026 年 7 月起由 GPT-Live 模型驅動,能同時聽與講。這篇依 OpenAI 官方說明整理它在手機 App 與網頁的開法、免費版與 Go、Plus、Pro 的每日額度、支援語言與開鏡頭的限制,並給練英文口說、旅行口譯、免手打三種情境的做法與可以照唸的開場句,最後說明語音片段保留 30 天、訓練開關在哪裡關。閱讀全文
同主題延伸閱讀
生活分享
本機跑 Stable Diffusion 與 Flux:ComfyUI 入門
ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。
生活分享
MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌
MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。
生活分享
MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片
海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。
生活分享
Figma AI 功能怎麼評估:設計生成、資料與交接
Figma AI 已包含對話式設計代理、獨立 AI 工具及與外部工具連接的工作方式,不能只沿用早期 First Draft 教學。本文以原創共享廚房預約頁為例,整理功能與席位、設計系統、內容訓練、聊天可見性及 MCP 寫入的檢查方式,並說明 beta 與 AI 點數的現況。附步驟、比較表及原創圖解,協助評估可編輯成果與交接責任,不把生成畫面當成已完成的服務。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- MiniMax API Docs:Text to Speech (T2A) HTTP(同步端點與全部參數) · 查證日期:
- MiniMax API Docs:API Overview(40 種語言、300 多個音色、複製需驗證、7 天未用即刪) · 查證日期:
- MiniMax API Docs:Async Long TTS Guide(1,000,000 字元、9 小時下載、無效字元 10%) · 查證日期:
- MiniMax API Docs:Voice Clone 使用指南(錄音長度、檔案大小與流程) · 查證日期:
- MiniMax API Docs:Voice Clone API(voice_id 規則、試聽文字上限) · 查證日期:
- MiniMax API Docs:Voice Design API(試聽文字上限 500 字元) · 查證日期:
- MiniMax API Docs:Get Voice API(voice_type 查詢帳號音色) · 查證日期:
- MiniMax API Docs:System Voice ID List(系統音色清單) · 查證日期:
- MiniMax API Docs:Pay as You Go(語音與音色的用量定價) · 查證日期:
- MiniMax API Docs:Audio Subscription(開放平台語音訂閱方案) · 查證日期:
- MiniMax API Docs:Model Release Notes(Speech-2.8 發布日期) · 查證日期:
- MiniMax Audio Subscription Service Terms(免費額度、訂閱與加值點數) · 查證日期:
- MiniMax App and Web Terms of Service(生成內容所有權、非商業條款、年齡) · 查證日期:
- MiniMax Audio Music Creation Terms of Use(聲音授權、禁止事項、浮水印與標示) · 查證日期:
- MiniMax App and Web Privacy Policy(營運方、資料傳輸與年齡) · 查證日期:
- MiniMax News:MiniMax Speech 2.8(語氣詞標記與音質說明) · 查證日期: