生活分享
用 Whisper 指令列在本機轉逐字稿:pip、ffmpeg 安裝與 SRT 字幕輸出
用指令列或 Python 在自己電腦跑 Whisper,音檔不必上傳:OpenAI 的模型權重下載後就能離線轉逐字稿。這篇照官方 README、模型卡與 LICENSE,說明六種模型大小的參數、顯示記憶體需求與相對速度,用 pip 與 ffmpeg 完成安裝,示範指令列與 Python 兩種轉錄方式、srt 與 vtt 字幕的輸出參數、中文與繁體輸出的設定,以及幻覺與重複這些官方寫明的限制。
更新日期: 閱讀時間約 7 分鐘

一小時的會議錄音要變成逐字稿,最省事的做法是丟給線上服務,但錄音裡的人名與客戶資料也跟著上傳。OpenAI 的 Whisper 提供另一條路:程式碼與模型權重可以下載回自己的電腦執行,轉錄不必連網路,音檔與逐字稿都留在本機。搜「逐字稿 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文」又不想把錄音上傳的人,這是最常見的解法。
這篇照 GitHub 上 openai/whisper 的 README、模型卡與 LICENSE,加上 Hugging Face 的 openai/whisper-large-v3 模型頁,帶你把一支錄音變成逐字稿:六種模型大小要多少顯示記憶體、怎麼用 pip 與 ffmpeg 裝起來、指令列與 Python 兩種用法、中文與繁體的設定,以及官方寫明的限制。
Whisper 是什麼:可以下載回來執行的語音辨識模型
官方 README 給 Whisper 的定位是「通用的語音辨識模型」,而且是一個多任務模型,一次做三件事:多語言語音辨識、語音翻譯(把外語講的內容翻成英語文字)與語言辨識。模型卡補上訓練資料的規模:從網路收集的 680,000 小時音檔與對應逐字稿,其中 65% 是英語音檔配英語逐字稿,非英語的部分涵蓋 98 種語言。
自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字自動語音辨識(ASR)是什麼:把錄音轉成可核對的文字自動語音辨識就是「語音轉文字 AI」背後的技術:把語音訊號轉成文字,是字幕、口述輸入與會議逐字稿的基礎。本文以社區活動籌備錄音為例,說明聲音如何經過模型形成轉寫結果、為何人名與否定詞要回聽,也拆開逐字稿、說話者標記、翻譯與摘要的差別,並介紹錯誤率的用途與限制,讓流暢文字不會被誤當成完整可靠的會議紀錄。閱讀全文
授權寫在 repo 的 LICENSE 檔裡:Whisper 的程式碼與模型權重以 MIT 授權釋出,允許使用、修改、散布與販售,條件是保留版權聲明與授權條文,軟體按現狀提供、不附任何擔保。要注意 Hugging Face 上 openai/whisper-large-v3 那一頁的授權標籤寫的是 apache-2.0,跟 GitHub 的 MIT 不是同一個名字;兩邊都是官方頁面,要商用時以你實際下載的那一頁為準。
# README.md
Whisper's code and model weights are released under the MIT License.
# LICENSE
MIT License
Copyright (c) 2022 OpenAI
Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:開放權重(Open Weights):能下載模型,還要確認什麼開放權重(Open Weights):能下載模型,還要確認什麼開放權重通常表示模型的已訓練參數可取得,讓使用者有機會自行部署或調整,但不等於訓練資料與程式都公開。本文用本機筆記摘要示範權重、架構、tokenizer 和推論程式的分工,區分下載、可修改、商業使用與完整開源,也解釋為什麼本機執行不自動保證隱私。讀完能檢查模型版本、授權文件、硬體需求和來源完整性。閱讀全文
六種模型大小:參數、顯示記憶體與相對速度
README 的模型表列出六種大小,其中 tiny、base、small、medium 四種另有英語專用版本,名稱後面加 .en;官方觀察是英語專用版本在 tiny 與 base 上比較有感,到 small 與 medium 差距就不明顯。turbo 是 large-v3 的最佳化版本,速度更快、準確度只有極小的退步,但 README 標明 turbo 沒有為翻譯任務訓練過:要把非英語翻成英語得用多語言模型,就算加上 --task translate,turbo 也只會回傳原本的語言。
| 模型 | 參數 | 需要的顯示記憶體 | 相對速度 |
|---|---|---|---|
| tiny | 39 M | 約 1 GB | 約 10 倍 |
| base | 74 M | 約 1 GB | 約 7 倍 |
| small | 244 M | 約 2 GB | 約 4 倍 |
| medium | 769 M | 約 5 GB | 約 2 倍 |
| large | 1550 M | 約 10 GB | 1 倍(基準) |
| turbo | 809 M | 約 6 GB | 約 8 倍 |
三個欄位要一起看。顯示記憶體是 README 寫的需求,沒有獨立顯示卡時也能用 CPU 跑,只是慢得多;相對速度是官方在 A100 上轉錄英語量到的,README 自己註明實際速度會因語言、語速與硬體差很多,當成大小之間的比例看就好,不要當成你機器上的秒數。另外,同一個 repo 的模型卡把 turbo 的參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文寫成 798 M,跟 README 表上的 809 M 不同。
跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon跑本機模型要什麼電腦:記憶體、顯示記憶體與 Apple Silicon官方文件沒有「幾 B 的模型要幾 GB 記憶體」的對照表,所以這篇只給算法:用 Ollama、llama.cpp、LM Studio 的官方需求,加上模型庫當天的檔案大小與 Apple、NVIDIA 規格頁的數字,算出模型權重與上下文視窗各佔多少記憶體,再對照一般筆電、獨立顯示卡桌機、Apple Silicon Mac 三種配置各能跑到哪一級。閱讀全文
安裝:pip 套件、ffmpeg 與第一次下載模型
安裝分兩件事。Python 套件用 README 給的 pip install -U openai-whisper;系統上另外要有命令列工具 ffmpeg,README 列出 Ubuntu 或 Debian、Arch、macOS 的 Homebrew、Windows 的 Chocolatey 與 Scoop 五種寫法。ffmpeg 官網把自己定位成處理多媒體的框架,Whisper 用它把 m4a、mp3 或影片音軌解碼成模型吃得下的音訊;官網只提供原始碼,下載頁另外整理了各平台編譯好的版本。
# Python 套件
pip install -U openai-whisper
# ffmpeg:macOS(Homebrew)
brew install ffmpeg
# ffmpeg:Ubuntu 或 Debian
sudo apt update && sudo apt install ffmpeg
# ffmpeg:Windows(Chocolatey)
choco install ffmpegREADME 說這套程式碼預期相容 Python 3.8 到 3.11 與近期版本的 PyTorch;PyPI 上 openai-whisper 套件頁標的授權同樣是 MIT,查證當天的最新版本是 20250625。安裝時若出現 tiktoken 相關錯誤,README 說要先裝 Rust 開發環境。模型權重會在第一次指定模型時自動下載,預設放在 ~/.cache/whisper,想換位置用 --model_dir。
轉第一支檔案:指令列與 Python
命令列工具就叫 whisper,把檔名接在後面即可,一次給多個檔案也行。--model 預設是 turbo;--language 指定音檔的語言,不給就讓模型自己偵測;--task 有 transcribe 與 translate 兩個值。輸出格式用 --output_format 選,可選 txt、vtt、srt、tsv、json 與 jsonl,預設值是 all,也就是每種各寫一份。
# README 的基本用法,一次轉多個檔案
whisper audio.flac audio.mp3 audio.wav --model turbo
# 指定語言、只輸出 srt 字幕,結果放進 out 資料夾
whisper meeting.m4a --model turbo --language Chinese --output_format srt --output_dir out
# 把日語錄音翻成英語文字(turbo 不做翻譯,改用多語言模型)
whisper japanese.wav --model medium --language Japanese --task translatePython 這邊三行就有結果:載入模型、呼叫 transcribe()、印出文字。README 說明 transcribe() 會把整個檔案讀進來,用一個 30 秒的滑動視窗逐段處理,所以一小時的會議不必自己先切檔;回傳的字典除了整篇文字,還帶著分段與時間資訊。
import whisper
model = whisper.load_model("turbo")
result = model.transcribe("audio.mp3")
print(result["text"])閱讀完整文字說明
由左往右的五格流程:第一格是音檔或影片音軌,格式可以是 m4a、mp3、wav 或 mov 的音軌;第二格是 ffmpeg 解碼,把各種格式解成模型吃得下的音訊;第三格是切成 30 秒視窗,模型一次只看 30 秒的音訊;第四格是 Whisper 模型,六種大小可選,從 tiny 到 large 還有 turbo;第五格是輸出逐字稿與字幕檔,格式有 txt、srt、vtt、tsv、json 與 jsonl。下面一排是常用參數:--language Chinese 指定音檔語言、不給就自動偵測;--initial_prompt 放一段繁體中文提示,讓用字往繁體靠;--output_format srt 選輸出格式,預設是 all、每種各寫一份。最下面兩個提醒:逐字稿一定要人工核對,模型卡寫明預測可能包含音檔裡沒有講過的內容,人名、數字與結論要對著時間戳再聽一次;以及全程在自己的電腦上執行,音檔、逐字稿與字幕檔都不離開這台機器,不需要帳號,也不必連網路。
中文與繁體輸出:語言參數與初始提示詞
--language 接受語言代碼與英文名稱兩種寫法,中文可以寫 zh 或 Chinese,粵語是 yue。Hugging Face 上 openai/whisper-large-v3 模型頁的語言標籤列出 99 種語言,套件裡 tokenizer.py 的語言表有 100 筆,多的是 large-v3 新增的粵語。不過模型卡也說,只有大約 10 種語言有很強的結果,不同語言與口音之間的表現並不平均。
Hugging Face 入門:找模型、看授權、下載Hugging Face 入門:找模型、看授權、下載Hugging Face 是開放模型最集中的地方。這篇從註冊與建立存取權杖開始,帶你讀懂模型頁的模型卡、Files and versions 與授權標籤,用篩選欄找到 GGUF 或特定授權的檔案,處理需要先同意條款的 gated 模型,再用 hf 指令與三行 Python 把權重下載到自己的電腦,並說明快取位置、Spaces 與官網當天的方案月費。閱讀全文
輸出繁體還是簡體,官方文件沒有給開關。能用的是 --initial_prompt,官方對它的說明只有一句:提供給第一個視窗的一段提示文字。把一段繁體中文的句子放進去,可以讓模型的用字往繁體靠;--carry_initial_prompt 設成 True 會把這段提示接在每次內部解碼前面,官方同時註明這樣會削弱 --condition_on_previous_text 的效果。這是引導不是保證:官方沒有承諾輸出的字體,成品仍要自己抽查。
whisper interview.m4a --model turbo --language Chinese \
--initial_prompt "以下是繁體中文的訪談逐字稿,用詞請照台灣的習慣。" \
--output_format srt --output_dir out限制與核對:幻覺、重複與長檔
模型卡把限制寫得很直白:因為訓練用的是弱監督與大量帶雜訊的資料,模型的預測可能包含音檔裡根本沒講過的內容,也就是幻覺;官方的推測是模型一邊轉錄,一邊在用語言知識預測下一個字。序列到序列的架構還讓它容易產生重複的文字,官方說束搜尋與溫度排程能緩解一部分、但無法完全解決,而且這兩種毛病在資料較少的語言上可能更嚴重。
官方的選項清單裡有幾個對應的旋鈕:--condition_on_previous_text 預設是開的,關掉之後段落之間的一致性會變差,但模型比較不會卡在重複的迴圈裡;--word_timestamps 打開逐字時間戳(官方標為實驗性),開了才能用 --hallucination_silence_threshold,在偵測到可能的幻覺時跳過超過設定秒數的靜音。
音檔不出門:適合的場合與後續
本機轉錄真正的差別在資料流向:模型下載回來之後,音檔、逐字稿與字幕檔都只在自己的電腦上處理,不需要帳號、也不必連網路;代價是硬體與時間要自己出,雲端服務則是用費用換掉這些麻煩。會議、訪談或客戶錄音這類內容敏感的場合,通常值得先在本機跑一次。
為什麼要在自己電腦跑 AI:隱私、離線與成本為什麼要在自己電腦跑 AI:隱私、離線與成本本機 AI 換到三件事:資料不出電腦、模型下載後可離線使用、沒有月費;代價是硬體、速度與品質落差,還要自己維護。這篇整理 Ollama、LM Studio、Open WebUI 官方文件對「資料不會離開你的電腦」與離線條件的原文,用官方模型卡的評測數字說明小模型與旗艦的差距,並列出敏感文件摘要、離線翻譯、程式補全、批量處理適合本機,以及哪三種情況該留在雲端。閱讀全文
另外兩件事對成品的影響比換模型還大。一是錄音本身:麥克風擺位、背景雜訊與人聲重疊都會直接變成辨識錯誤,該重錄就重錄、該降噪就先降噪。二是逐字稿之後的整理:Whisper 交給你的是文字與時間戳,決定與下一步還是得有人寫成筆記。不想碰指令列的話,桌面工具也有現成的選擇。
OBS 螢幕錄影入門:畫面來源、音軌與錄製驗收OBS 螢幕錄影入門:畫面來源、音軌與錄製驗收用 OBS 錄製螢幕教學,除了看見畫面,也要確認聲音來源、音軌與輸出檔都正確。本文以原創活動報名表教學情境,整理場景建立、視窗擷取、麥克風及應用程式音訊設定,並比較 MKV、傳統 MP4 與 Hybrid MP4 的用途。附操作步驟、音軌配置表和自繪圖解,讓你在正式錄製前完成一段能看清、聽懂且方便剪輯的驗收檔。閱讀全文
Adobe Podcast 音訊處理:降噪前後應該檢查什麼Adobe Podcast 音訊處理:降噪前後應該檢查什麼Adobe Podcast 的 Enhance Speech 可以協助處理語音錄音,但降噪後仍要檢查字尾、停頓和環境聲。本文以原創市集攤主訪談情境,整理上傳前準備、現行方案限制、語音與音樂分離,以及處理前後的聽覺驗收方法。附比較表、操作步驟和自繪圖解,幫助你保留原始錄音、避免過度處理,再把適合的版本交給剪輯流程。閱讀全文
MacWhisper 與 WhisperDesktop 圖形介面逐字稿教學:不打指令的本機轉寫流程MacWhisper 與 WhisperDesktop 圖形介面逐字稿教學:不打指令的本機轉寫流程不想打指令的話,MacWhisper 與 WhisperDesktop 這兩個圖形介面工具能在自己電腦上把錄音變成文字;變成文字後,還需要核對講者、繁體用字和時間碼。本文以原創社區口述訪談情境,介紹 MacWhisper 與 Const-me WhisperDesktop 的桌面轉寫流程,區分本機模型、雲端轉寫與 AI 摘要的資料流。附工具比較表、操作步驟及自繪圖解,協助你保留原始錄音、整理可追溯逐字稿,再輸出適合閱讀或影片使用的字幕檔。閱讀全文
會議筆記怎麼寫才有人接手:把決定、負責人與下一步留下來會議筆記怎麼寫才有人接手:把決定、負責人與下一步留下來不必逐字記下每句討論。用一頁筆記交代背景、已決定事項和待確認問題,讓沒有參加的人也能理解下一步由誰完成。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- GitHub openai/whisper:README(模型表、安裝、指令列與 Python 用法) · 查證日期:
- GitHub openai/whisper:LICENSE(MIT 授權原文) · 查證日期:
- GitHub openai/whisper:模型卡(訓練資料、限制與幻覺說明) · 查證日期:
- GitHub openai/whisper:transcribe.py(命令列選項與預設值) · 查證日期:
- GitHub openai/whisper:tokenizer.py(支援的語言表) · 查證日期:
- Hugging Face openai/whisper-large-v3 模型卡(語言標籤、長檔處理與限制) · 查證日期:
- Hugging Face API:openai/whisper-large-v3 的授權標籤與更新時間 · 查證日期:
- PyPI:openai-whisper 套件頁(版本、授權與 Python 需求) · 查證日期:
- FFmpeg 官網:About(這個工具是什麼) · 查證日期:
- FFmpeg 官網:下載頁(官方只提供原始碼,另列各平台建置) · 查證日期:
- OpenAI:Introducing Whisper(發布說明,模型與推論程式碼開源) · 查證日期: