生活分享
語音合成(TTS)是什麼:讓文字成為聽得懂、聽得對的聲音
語音合成就是文字轉語音 AI、配音 AI 背後的技術:把文字轉成可播放的語音,常用於導覽、旁白與無障礙朗讀。本文以地方展覽導覽稿為例,說明文字如何形成聲音、為何多音字與數字需要試聽,以及音色、韻律、清晰度各自要怎麼驗收,並釐清語音合成與聲音複製、語音辨識的差別,讓自然的聲音真正傳達正確內容,而不是只追求像真人。
更新日期: 閱讀時間約 7 分鐘

一篇地方展覽導覽稿寫好了,想讓參觀者戴耳機收聽,可以使用語音合成把文字轉成聲音。Text-to-Speech 常縮寫為 TTS,也叫文字轉語音。它的任務是根據文字產生可聽的語音,不是辨識錄音中原本說過的話;後者屬於語音辨識。搜「配音 AIMiniMax 語音合成:中文配音、有聲書與影片旁白把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。閱讀全文」找到的工具,多半就是在做這件事。
語音合成可以使用預先提供的音色,也可能接受風格或其他聲音條件,功能依系統而異。聲音聽起來自然,是其中一項品質,發音是否正確、停頓能否表達原意同樣重要。以下採用假想導覽稿示範,沒有把示意句當成任何工具的實測成果。
文字如何成為可以播放的波形
語音合成系統需要處理文字與聲音的關係。以 Tacotron 2 研究為例,模型先從文字表示預測梅爾頻譜,再由聲碼器產生波形。頻譜可理解為聲音能量隨時間與頻率的表示,波形才是可輸出成音訊的訊號;它們在流程中的角色不同。
這是具體架構的說明,不代表所有現代 TTS 都一定有同樣的兩個模組。有些系統採用其他聲音表示或整合方式,對一般使用者最穩定的理解仍是:輸入需要說出的文字與支援條件,輸出是一段語音,並用實際聆聽核對它傳達了什麼。
即使原稿沒有錯字,系統也需要決定多音字、縮寫、符號與數字如何念。文字上同一個字形可能有不同讀法,標點也會影響斷句。因此,適合閱讀的稿件不必然適合直接朗讀,合成前常需要先整理成清楚的口語表達。
導覽案例:把書面稿整理成可朗讀稿
假設原稿寫著「請至二樓長廊,觀察展品編號 A12,開放時間為 09:30。」可以先確認「長廊」的讀音、編號希望逐字念還是依其他方式念,以及時間是否要表達為上午九點半。這些決定來自導覽需求,不應完全交給系統猜測。
示意流程是先整理朗讀稿,選擇工具支援的音色,再產生一小段試聽。期待的結果是聽眾能辨認樓層、地點、編號與時間;若聲音很溫柔卻把編號念成另一個意思,就應修正文字或使用支援的發音控制,而不只更換音色。
若工具可接受發音字典或標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文語法,應依它的實際格式使用;有些工具只接受一般文字,額外標籤可能被直接念出。每次修改後都重新試聽相關段落,確認修正真的進入音訊,也確認沒有順帶改壞前後句子的停頓。
音色、韻律與清晰度分開聽
音色是聲音的辨識特徵,韻律涉及節奏、重音、語調與停頓,清晰度則關係到字詞能否聽懂。導覽可以有舒服的音色,卻在地名中間停頓,讓人誤以為是不同地點;也可能每個字都清楚,整句卻因重音不對而難以理解。
例如「這件作品不是修復品,而是展示用複製品」,否定與轉折需要被聽出來。若停頓把「不是」和後半句切得太遠,或語氣讓人以為說明已結束,即使所有字都念出,資訊仍可能傳錯。這類問題需要聽完整句子,而不是逐字對照就好。
調整速度也要配合內容密度。專有名詞多的段落可以更清楚地分句,短指引則不一定需要同樣長的停頓。不能用一個越慢越好的原則處理全部內容;應讓真正第一次接觸展品的人試聽,看看他能否說出關鍵資訊。
語音合成不等於聲音複製
TTS 描述文字到語音的任務,聲音複製則關心如何讓合成語音具有特定聲音特徵。一般導覽用預設合成音色就能完成,並不需要模仿某個真人。即使兩種功能出現在同一個產品中,也應分清輸入文字與參考聲音各自的作用。
若使用經授權的真人聲音素材,要確認授權用途與呈現方式,避免讓聽眾以為本人親自錄製了每一句話。這裡的重點是內容與聲音來源的透明:稿件可能是後來改寫的,合成語音也不證明原聲音提供者曾說過或認可該段內容。
語音辨識則是反方向,把音訊轉成文字。你可以將 TTS 輸出送入辨識工具作輔助核對,但不能把轉回來的文字相同當作充分驗收。辨識器也可能依語境補正,或忽略聽感不自然的問題;導覽最終仍然是給人聽的。
在實際播放情境完成驗收
耳機裡清楚的聲音,在現場喇叭與人群背景音中可能不易辨認;手機小喇叭也可能讓輕聲詞尾不突出。正式交付前,應在預計使用的設備與音量下播放,檢查開頭、結尾是否完整,段落之間有沒有突然過大的音量落差。
導覽稿更新後,要同步更新對應音檔與文字版本。若時間已更改但播放檔仍是舊版,聲音再自然也會傳出錯誤資訊。可以把音檔與核准稿配對保存,註記哪些段落重新合成,讓維護者知道下一次需要檢查的範圍。
較長內容可以依主題切成段落,方便修正與重聽;切段時仍需注意前後語氣與銜接,不要讓每段都像重新開始。若使用背景音樂,還要確認它沒有蓋住關鍵字詞。配樂與後製改善的是成品呈現,不能取代文字與發音本身的正確性。
TTS 的實際價值,是讓文字更容易被聽取,並降低內容更新的重錄負擔。把朗讀稿、發音與播放情境一起納入工作流程,才能讓自然音色服務資訊傳達。合成完成是拿到音訊,驗收完成才是確認它能讓目標聽眾聽懂你原本要說的話。
試聽時可以先不看稿,只記下自己聽到的展品位置與編號,再對照原稿。這能發現看著文字時容易自動腦補的含糊發音。若需要重聽才能理解,就應再看是句子過長、斷句不清,還是陌生詞沒有足夠的語音提示。
| 面向 | 驗收問題 | 可採取的調整 |
|---|---|---|
| 文字與發音 | 編號、多音字是否念對 | 整理朗讀稿或發音控制 |
| 韻律 | 停頓、轉折與重音是否清楚 | 修改分句並重新試聽 |
| 音色 | 是否適合導覽情境 | 選擇支援的音色條件 |
| 播放與維護 | 現場聽得清楚且版本正確嗎 | 設備試播並配對稿件版本 |
自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字自動語音辨識就是「語音轉文字 AI」背後的技術:把語音訊號轉成文字,是字幕、口述輸入與會議逐字稿的基礎。本文以社區活動籌備錄音為例,說明聲音如何經過模型形成轉寫結果、為何人名與否定詞要回聽,也拆開逐字稿、說話者標記、翻譯與摘要的差別,並介紹錯誤率的用途與限制,讓流暢文字不會被誤當成完整可靠的會議紀錄。閱讀全文
深偽(Deepfake)是什麼:分清合成痕跡、來源與事件真假深偽(Deepfake)是什麼:分清合成痕跡、來源與事件真假深偽就是換臉 AI、仿聲工具背後的技術:利用 AI 生成或改造影像、聲音等內容,可能讓人看似說過或做過從未發生的事。本文以活動講者影片為例,拆解影像換臉、聲音模仿與一般剪輯的差別,說明為何嘴形、偵測分數與來源標記都不能單獨判定真偽,並提供從完整素材、正式管道與發布脈絡交叉核對的方式,保留應有的不確定性。閱讀全文
多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI 能處理不只一種資訊形式,例如文字、圖像、聲音或影片,但支援多種輸入不代表也能產生所有輸出。本文用組裝收納架的情境,說明影像與文字如何互相補充、原生整合與串接流程的差別,以及看見圖片為何仍可能漏讀細節。附輸入設計和交叉核對方法,幫你判斷模型依據畫面回答,還是把合理猜測當成看見的事實。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算