生活分享

自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字

自動語音辨識就是「語音轉文字 AI」背後的技術:把語音訊號轉成文字,是字幕、口述輸入與會議逐字稿的基礎。本文以社區活動籌備錄音為例,說明聲音如何經過模型形成轉寫結果、為何人名與否定詞要回聽,也拆開逐字稿、說話者標記、翻譯與摘要的差別,並介紹錯誤率的用途與限制,讓流暢文字不會被誤當成完整可靠的會議紀錄。

更新日期: 閱讀時間約 7 分鐘

麥克風錄下波形,再形成帶有待核對記號的紙張逐字稿原創插畫
圖片:Mokaair (© Mokaair)

你把社區活動籌備會議的錄音交給工具,幾分鐘後得到一份可搜尋的文字。背後把語音訊號轉成文字的任務,就是自動語音辨識,英文 Automatic Speech Recognition,常縮寫成 ASR。它替後續整理打底,但轉出文字不等於已經完成會議摘要,更不等於每句話都聽對了。市面上叫語音轉文字 或 的工具,核心都是這一步。

ASR 的目標通常是對應音訊裡說出的內容。說話者是誰、這段話代表什麼決議、要翻成哪種語言,是可以與辨識搭配的其他任務。以下用假想活動會議示範核對流程;案例中的錯字用來解釋失敗類型,不是宣稱某套系統真的出現過這些結果。

聲音到文字,中間不是單純查字典

數位錄音是一段隨時間變化的訊號。辨識系統依模型要求處理音訊,形成可供模型使用的輸入,再預測文字序列。不同模型可能直接使用波形或不同的聲學表示,不宜把某一套實作的中間格式當成所有 ASR 都必須相同的流程。

模型學習聲音與文字的關係,也會受到語言資料與解碼方式影響。聽起來接近的詞需要依上下文區分,因此常見詞可能比陌生姓名更容易出現。文字流暢表示系統找到了合理的候選句子,不能由此推定它完整保留了原本每個音節。

錄音品質仍然重要。距離太遠、背景音蓋過人聲或多人同時說話,會讓輸入本身變得難以判讀。後處理能改善某些問題,卻不能保證找回根本沒有清楚錄下的內容;遇到聽不清的片段,保留不確定比補出一句合理的話更有用。

錄音到逐字稿、校訂、摘要的順序流程,關鍵詞核對另有回到原音的路徑
原音、逐字稿與摘要是不同層的材料;出錯時沿著來源往回核對。 · 圖片:Mokaair (© Mokaair)

會議案例:先轉寫,再核對關鍵資訊

假設錄音裡有人說:「不要把報到桌放在東門,請移到穿堂。」輸入給工具時,可先說明這是活動籌備會議,希望取得依原話轉寫的文字,並在不清楚的位置留標記。如果工具支援詞彙提示,可以提供活動名稱與人名清單,但不能把預期決議當成已說出口的內容。

期待結果應保留「不要」和「移到」之間的關係。若轉寫變成「要把報到桌放在東門」,句子仍通順,意義卻反轉。驗收時應回聽涉及否定、日期、地點與責任分工的段落,而不是只找明顯不像中文的錯字。

接著核對專有名詞與數字,將修正附回對應的音訊位置。若無法確認姓名,先標成待確認,或請參與者核對;不要因為通訊錄裡有相似名字,就自行認定那一定是發言所指的人。這樣整理出的逐字稿,才有可追溯的修正依據。

逐字稿、說話者與摘要各有工作

逐字稿主要保留說出的內容,說話者分離或標記則判斷何時換人說話。即使工具把片段標為「說話者甲」,也不表示它已核實真實姓名。若兩人聲音接近或同時說話,標籤可能需要人工更正,不能把標籤當成身分證明。

摘要會挑選與重組內容,可能省略口頭重複、猶豫或例外。會議裡有人提出尚未採用的方案,摘要若把它寫成決議,這是後續理解與整理的問題,不一定是 ASR 聽錯。排查時先看原音,再看逐字稿,最後才檢查摘要,才能找到錯誤發生在哪一層。

翻譯又涉及語言轉換。某些模型或產品能一起做轉寫與翻譯,但它們的輸出目標不同;想保留臺語夾華語或英文專有詞的原貌,就應確認模式與語言設定。把翻譯後的文字當作逐字原話,容易失去措辭與語氣上的重要差異。

錯誤率能比較什麼,不能保證什麼

ASR 評估常見詞錯誤率 WER,用參考轉寫與模型輸出之間的替換、刪除及插入來衡量差異。中文也常需要留意字或詞如何切分,以及標點、數字與大小寫是否先做正規化。不同計算規則下的數值,不宜直接當成同一把尺比較。

整體錯誤率低,不代表你的活動地名一定正確;某些不影響意思的標點差異,也可能在特定規則下被算進去。實際使用除了平均指標,還應檢查會改變決議的關鍵詞,例如否定、日期與指定位置,讓評估對應自己的用途。

若要選擇工作流程,可用一小批有代表性的自有錄音做比較,包含安靜發言、多人討論與專有名詞。先建立經人工核對的參考內容,再記錄錯在哪裡。只拿一段標準清楚的朗讀測試,無法代表社區會議實際的聲音條件。

讓轉寫成為可靠的整理起點

錄音之前先確認收音位置與參與者知道用途,會比事後花時間猜字更有效。音訊交給工具時,需依實際功能檢查格式、取樣要求與長度處理方式;不同系統的前處理條件不同,不能把某個範例的設定直接套到所有模型。

完成後保留原音、未修改轉寫與校訂版本,重要修正能連回音訊位置。時間戳若由工具提供,也要抽查是否準確對到語句;有時間數字不表示已完成對齊驗證。若要再產生待辦事項,則讓每項待辦對應到已核對的句子,避免把推測帶進執行清單。

ASR 最有用的地方,是把難搜尋的聲音變成可整理的文字入口。可靠程度卻要靠錄音條件、任務設定與回聽核對共同建立。當你能區分「聽到了什麼」「誰說的」與「最後決定什麼」,就比較不會讓一份看似完整的文字檔掩蓋仍需確認的內容。

例如同一位發言者先說東門、隨後自行更正為穿堂,逐字稿最好保留更正關係,摘要才有理由採用最後的地點。若工具只留下其中一句,讀者可能無法看出討論曾改變方向。這類語境檢查無法只靠拼字校正完成。

概念與使用情境比較;查證於 2026 年 9 月。
功能主要回答仍需確認
ASR 轉寫音訊說了什麼專有名詞與關鍵語意
說話者標記何時由誰發聲標籤與真實姓名的對應
翻譯用另一種語言怎麼表達是否保留原意
摘要與待辦哪些內容值得整理提案是否真的成為決議

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享