生活分享

語音合成(TTS)是什麼:讓文字成為聽得懂、聽得對的聲音

語音合成就是文字轉語音 AI、配音 AI 背後的技術:把文字轉成可播放的語音,常用於導覽、旁白與無障礙朗讀。本文以地方展覽導覽稿為例,說明文字如何形成聲音、為何多音字與數字需要試聽,以及音色、韻律、清晰度各自要怎麼驗收,並釐清語音合成與聲音複製、語音辨識的差別,讓自然的聲音真正傳達正確內容,而不是只追求像真人。

更新日期: 閱讀時間約 7 分鐘

導覽稿經聲音表示轉成喇叭播放的波紋原創插畫
圖片:Mokaair (© Mokaair)

一篇地方展覽導覽稿寫好了,想讓參觀者戴耳機收聽,可以使用語音合成把文字轉成聲音。Text-to-Speech 常縮寫為 TTS,也叫文字轉語音。它的任務是根據文字產生可聽的語音,不是辨識錄音中原本說過的話;後者屬於語音辨識。搜「」找到的工具,多半就是在做這件事。

語音合成可以使用預先提供的音色,也可能接受風格或其他聲音條件,功能依系統而異。聲音聽起來自然,是其中一項品質,發音是否正確、停頓能否表達原意同樣重要。以下採用假想導覽稿示範,沒有把示意句當成任何工具的實測成果。

文字如何成為可以播放的波形

語音合成系統需要處理文字與聲音的關係。以 Tacotron 2 研究為例,模型先從文字表示預測梅爾頻譜,再由聲碼器產生波形。頻譜可理解為聲音能量隨時間與頻率的表示,波形才是可輸出成音訊的訊號;它們在流程中的角色不同。

這是具體架構的說明,不代表所有現代 TTS 都一定有同樣的兩個模組。有些系統採用其他聲音表示或整合方式,對一般使用者最穩定的理解仍是:輸入需要說出的文字與支援條件,輸出是一段語音,並用實際聆聽核對它傳達了什麼。

即使原稿沒有錯字,系統也需要決定多音字、縮寫、符號與數字如何念。文字上同一個字形可能有不同讀法,標點也會影響斷句。因此,適合閱讀的稿件不必然適合直接朗讀,合成前常需要先整理成清楚的口語表達。

文字到語音的示意流程,並將發音、韻律與實際播放分成三種驗收
上方為所引用架構的概念示意;下方的驗收適用於最終音訊,不以中間格式代替試聽。 · 圖片:Mokaair (© Mokaair)

導覽案例:把書面稿整理成可朗讀稿

假設原稿寫著「請至二樓長廊,觀察展品編號 A12,開放時間為 09:30。」可以先確認「長廊」的讀音、編號希望逐字念還是依其他方式念,以及時間是否要表達為上午九點半。這些決定來自導覽需求,不應完全交給系統猜測。

示意流程是先整理朗讀稿,選擇工具支援的音色,再產生一小段試聽。期待的結果是聽眾能辨認樓層、地點、編號與時間;若聲音很溫柔卻把編號念成另一個意思,就應修正文字或使用支援的發音控制,而不只更換音色。

若工具可接受發音字典或語法,應依它的實際格式使用;有些工具只接受一般文字,額外標籤可能被直接念出。每次修改後都重新試聽相關段落,確認修正真的進入音訊,也確認沒有順帶改壞前後句子的停頓。

音色、韻律與清晰度分開聽

音色是聲音的辨識特徵,韻律涉及節奏、重音、語調與停頓,清晰度則關係到字詞能否聽懂。導覽可以有舒服的音色,卻在地名中間停頓,讓人誤以為是不同地點;也可能每個字都清楚,整句卻因重音不對而難以理解。

例如「這件作品不是修復品,而是展示用複製品」,否定與轉折需要被聽出來。若停頓把「不是」和後半句切得太遠,或語氣讓人以為說明已結束,即使所有字都念出,資訊仍可能傳錯。這類問題需要聽完整句子,而不是逐字對照就好。

調整速度也要配合內容密度。專有名詞多的段落可以更清楚地分句,短指引則不一定需要同樣長的停頓。不能用一個越慢越好的原則處理全部內容;應讓真正第一次接觸展品的人試聽,看看他能否說出關鍵資訊。

語音合成不等於聲音複製

TTS 描述文字到語音的任務,聲音複製則關心如何讓合成語音具有特定聲音特徵。一般導覽用預設合成音色就能完成,並不需要模仿某個真人。即使兩種功能出現在同一個產品中,也應分清輸入文字與參考聲音各自的作用。

若使用經授權的真人聲音素材,要確認授權用途與呈現方式,避免讓聽眾以為本人親自錄製了每一句話。這裡的重點是內容與聲音來源的透明:稿件可能是後來改寫的,合成語音也不證明原聲音提供者曾說過或認可該段內容。

語音辨識則是反方向,把音訊轉成文字。你可以將 TTS 輸出送入辨識工具作輔助核對,但不能把轉回來的文字相同當作充分驗收。辨識器也可能依語境補正,或忽略聽感不自然的問題;導覽最終仍然是給人聽的。

在實際播放情境完成驗收

耳機裡清楚的聲音,在現場喇叭與人群背景音中可能不易辨認;手機小喇叭也可能讓輕聲詞尾不突出。正式交付前,應在預計使用的設備與音量下播放,檢查開頭、結尾是否完整,段落之間有沒有突然過大的音量落差。

導覽稿更新後,要同步更新對應音檔與文字版本。若時間已更改但播放檔仍是舊版,聲音再自然也會傳出錯誤資訊。可以把音檔與核准稿配對保存,註記哪些段落重新合成,讓維護者知道下一次需要檢查的範圍。

較長內容可以依主題切成段落,方便修正與重聽;切段時仍需注意前後語氣與銜接,不要讓每段都像重新開始。若使用背景音樂,還要確認它沒有蓋住關鍵字詞。配樂與後製改善的是成品呈現,不能取代文字與發音本身的正確性。

TTS 的實際價值,是讓文字更容易被聽取,並降低內容更新的重錄負擔。把朗讀稿、發音與播放情境一起納入工作流程,才能讓自然音色服務資訊傳達。合成完成是拿到音訊,驗收完成才是確認它能讓目標聽眾聽懂你原本要說的話。

試聽時可以先不看稿,只記下自己聽到的展品位置與編號,再對照原稿。這能發現看著文字時容易自動腦補的含糊發音。若需要重聽才能理解,就應再看是句子過長、斷句不清,還是陌生詞沒有足夠的語音提示。

概念與使用情境比較;查證於 2026 年 9 月。
面向驗收問題可採取的調整
文字與發音編號、多音字是否念對整理朗讀稿或發音控制
韻律停頓、轉折與重音是否清楚修改分句並重新試聽
音色是否適合導覽情境選擇支援的音色條件
播放與維護現場聽得清楚且版本正確嗎設備試播並配對稿件版本

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享