生活分享
自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字
自動語音辨識就是「語音轉文字 AI」背後的技術:把語音訊號轉成文字,是字幕、口述輸入與會議逐字稿的基礎。本文以社區活動籌備錄音為例,說明聲音如何經過模型形成轉寫結果、為何人名與否定詞要回聽,也拆開逐字稿、說話者標記、翻譯與摘要的差別,並介紹錯誤率的用途與限制,讓流暢文字不會被誤當成完整可靠的會議紀錄。
更新日期: 閱讀時間約 7 分鐘

你把社區活動籌備會議的錄音交給工具,幾分鐘後得到一份可搜尋的文字。背後把語音訊號轉成文字的任務,就是自動語音辨識,英文 Automatic Speech Recognition,常縮寫成 ASR。它替後續整理打底,但轉出文字不等於已經完成會議摘要,更不等於每句話都聽對了。市面上叫語音轉文字 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 或錄音轉文字 AIMacWhisper 與 WhisperDesktop 圖形介面逐字稿教學:不打指令的本機轉寫流程不想打指令的話,MacWhisper 與 WhisperDesktop 這兩個圖形介面工具能在自己電腦上把錄音變成文字;變成文字後,還需要核對講者、繁體用字和時間碼。本文以原創社區口述訪談情境,介紹 MacWhisper 與 Const-me WhisperDesktop 的桌面轉寫流程,區分本機模型、雲端轉寫與 AI 摘要的資料流。附工具比較表、操作步驟及自繪圖解,協助你保留原始錄音、整理可追溯逐字稿,再輸出適合閱讀或影片使用的字幕檔。閱讀全文 的工具,核心都是這一步。
ASR 的目標通常是對應音訊裡說出的內容。說話者是誰、這段話代表什麼決議、要翻成哪種語言,是可以與辨識搭配的其他任務。以下用假想活動會議示範核對流程;案例中的錯字用來解釋失敗類型,不是宣稱某套系統真的出現過這些結果。
聲音到文字,中間不是單純查字典
數位錄音是一段隨時間變化的訊號。辨識系統依模型要求處理音訊,形成可供模型使用的輸入,再預測文字序列。不同模型可能直接使用波形或不同的聲學表示,不宜把某一套實作的中間格式當成所有 ASR 都必須相同的流程。
模型學習聲音與文字的關係,也會受到語言資料與解碼方式影響。聽起來接近的詞需要依上下文區分,因此常見詞可能比陌生姓名更容易出現。文字流暢表示系統找到了合理的候選句子,不能由此推定它完整保留了原本每個音節。
錄音品質仍然重要。距離太遠、背景音蓋過人聲或多人同時說話,會讓輸入本身變得難以判讀。後處理能改善某些問題,卻不能保證找回根本沒有清楚錄下的內容;遇到聽不清的片段,保留不確定標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文比補出一句合理的話更有用。
會議案例:先轉寫,再核對關鍵資訊
假設錄音裡有人說:「不要把報到桌放在東門,請移到穿堂。」輸入給工具時,可先說明這是活動籌備會議,希望取得依原話轉寫的文字,並在不清楚的位置留標記。如果工具支援詞彙提示,可以提供活動名稱與人名清單,但不能把預期決議當成已說出口的內容。
期待結果應保留「不要」和「移到」之間的關係。若轉寫變成「要把報到桌放在東門」,句子仍通順,意義卻反轉。驗收時應回聽涉及否定、日期、地點與責任分工的段落,而不是只找明顯不像中文的錯字。
接著核對專有名詞與數字,將修正附回對應的音訊位置。若無法確認姓名,先標成待確認,或請參與者核對;不要因為通訊錄裡有相似名字,就自行認定那一定是發言所指的人。這樣整理出的逐字稿,才有可追溯的修正依據。
逐字稿、說話者與摘要各有工作
逐字稿主要保留說出的內容,說話者分離或標記則判斷何時換人說話。即使工具把片段標為「說話者甲」,也不表示它已核實真實姓名。若兩人聲音接近或同時說話,標籤可能需要人工更正,不能把標籤當成身分證明。
摘要會挑選與重組內容,可能省略口頭重複、猶豫或例外。會議裡有人提出尚未採用的方案,摘要若把它寫成決議,這是後續理解與整理的問題,不一定是 ASR 聽錯。排查時先看原音,再看逐字稿,最後才檢查摘要,才能找到錯誤發生在哪一層。
翻譯又涉及語言轉換。某些模型或產品能一起做轉寫與翻譯,但它們的輸出目標不同;想保留臺語夾華語或英文專有詞的原貌,就應確認模式與語言設定。把翻譯後的文字當作逐字原話,容易失去措辭與語氣上的重要差異。
錯誤率能比較什麼,不能保證什麼
ASR 評估常見詞錯誤率 WER,用參考轉寫與模型輸出之間的替換、刪除及插入來衡量差異。中文也常需要留意字或詞如何切分,以及標點、數字與大小寫是否先做正規化。不同計算規則下的數值,不宜直接當成同一把尺比較。
整體錯誤率低,不代表你的活動地名一定正確;某些不影響意思的標點差異,也可能在特定規則下被算進去。實際使用除了平均指標,還應檢查會改變決議的關鍵詞,例如否定、日期與指定位置,讓評估對應自己的用途。
若要選擇工作流程,可用一小批有代表性的自有錄音做比較,包含安靜發言、多人討論與專有名詞。先建立經人工核對的參考內容,再記錄錯在哪裡。只拿一段標準清楚的朗讀測試,無法代表社區會議實際的聲音條件。
讓轉寫成為可靠的整理起點
錄音之前先確認收音位置與參與者知道用途,會比事後花時間猜字更有效。音訊交給工具時,需依實際功能檢查格式、取樣要求與長度處理方式;不同系統的前處理條件不同,不能把某個範例的設定直接套到所有模型。
完成後保留原音、未修改轉寫與校訂版本,重要修正能連回音訊位置。時間戳若由工具提供,也要抽查是否準確對到語句;有時間數字不表示已完成對齊驗證。若要再產生待辦事項,則讓每項待辦對應到已核對的句子,避免把推測帶進執行清單。
ASR 最有用的地方,是把難搜尋的聲音變成可整理的文字入口。可靠程度卻要靠錄音條件、任務設定與回聽核對共同建立。當你能區分「聽到了什麼」「誰說的」與「最後決定什麼」,就比較不會讓一份看似完整的文字檔掩蓋仍需確認的內容。
例如同一位發言者先說東門、隨後自行更正為穿堂,逐字稿最好保留更正關係,摘要才有理由採用最後的地點。若工具只留下其中一句,讀者可能無法看出討論曾改變方向。這類語境檢查無法只靠拼字校正完成。
| 功能 | 主要回答 | 仍需確認 |
|---|---|---|
| ASR 轉寫 | 音訊說了什麼 | 專有名詞與關鍵語意 |
| 說話者標記 | 何時由誰發聲 | 標籤與真實姓名的對應 |
| 翻譯 | 用另一種語言怎麼表達 | 是否保留原意 |
| 摘要與待辦 | 哪些內容值得整理 | 提案是否真的成為決議 |
語音合成(TTS)是什麼:讓文字成為聽得懂、聽得對的聲音語音合成(TTS)是什麼:讓文字成為聽得懂、聽得對的聲音語音合成就是文字轉語音 AI、配音 AI 背後的技術:把文字轉成可播放的語音,常用於導覽、旁白與無障礙朗讀。本文以地方展覽導覽稿為例,說明文字如何形成聲音、為何多音字與數字需要試聽,以及音色、韻律、清晰度各自要怎麼驗收,並釐清語音合成與聲音複製、語音辨識的差別,讓自然的聲音真正傳達正確內容,而不是只追求像真人。閱讀全文
多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI 能處理不只一種資訊形式,例如文字、圖像、聲音或影片,但支援多種輸入不代表也能產生所有輸出。本文用組裝收納架的情境,說明影像與文字如何互相補充、原生整合與串接流程的差別,以及看見圖片為何仍可能漏讀細節。附輸入設計和交叉核對方法,幫你判斷模型依據畫面回答,還是把合理猜測當成看見的事實。閱讀全文
AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺是模型產生看似合理、卻缺乏事實支持或違背提供資料的內容。本文用一段虛構展覽介紹,示範如何拆出可查主張、核對原始來源,區分支持、矛盾與尚未確認;也說明附上連結、再次提問或兩個模型答案相同,為何仍不足以證明正確,並整理使用引用與不確定回答時的實際界線。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算