生活分享
AI 上字幕與翻譯影片:CapCut、Whisper 與 YouTube 三條路
CapCut 在時間軸上一次做完轉錄、翻譯與輸出,Whisper 在自己的電腦上轉出 srt 但只翻得到英文,YouTube 負責把字幕送到觀眾眼前、翻譯由觀眾自己開。這篇照 2026 年 9 月 14 日的官方說明整理三條路的步驟、輸出格式與費用寫法,加上字幕檔格式、時間軸與繁體術語的校正法,以及燒錄與外掛字幕的取捨。
更新日期: 閱讀時間約 10 分鐘

影片要上字幕、還要翻成另一種語言,常見的做法有三條:在 CapCut 這類剪輯軟體裡按一次自動字幕、在自己的電腦上用 Whisper 把聲音轉成字幕檔,或是上傳後讓 YouTube 自動產生字幕。結論先說:三條路做的不是同一段工作。CapCut 把轉錄、翻譯與輸出綁在同一條時間軸上;Whisper 只把語音變成字幕檔,官方的翻譯任務還只翻成英文;YouTube 負責把字幕送到觀眾眼前,翻譯是觀眾自己在播放器裡開的。
以下按各家官網、說明中心與官方原始碼在 2026 年 9 月 14 日的內容整理:三條路的輸出與費用、CapCut 的字幕步驟、Whisper 產生字幕檔的指令與限制、YouTube 支援的字幕檔格式,再加上校正與翻譯的做法,以及字幕該燒進畫面還是另外掛一個檔案。介面名稱以官網當天版本為準。
三條路各做哪一段
一支有翻譯字幕的影片,中間至少有四道手續:把聲音轉成文字、校正錯字與時間軸、翻成目標語言、把字幕交給播放器或平台。沒有一個工具四道都包得剛好,選工具其實是在決定你要自己接手哪一段。CapCut 的長處是四道都在同一個畫面裡;Whisper 的長處是字幕檔留在自己的硬碟上,想重跑幾次都行;YouTube 的長處是觀眾端零成本,短處是你只能改文字,控制不了觀眾看到的樣式。
| 路線 | 工具 | 輸出 | 費用(官方頁面怎麼寫) |
|---|---|---|---|
| 剪輯軟體一次做完 | CapCut 手機、桌面與網頁版 | 影片裡的字幕;官方功能頁說也能單獨匯出 SRT 檔 | App 免費下載;Pro 與 Standard 的價格官方說隨方案、平台、帳號、地區與促銷而異,以登入後的官網為準 |
| 本機轉錄 | Whisper 指令列工具 | txt、vtt、srt、tsv、json、jsonl | 程式與模型權重採 MIT 授權,不收授權費 |
| 平台內建 | YouTube Studio 字幕頁 | 原始語言的自動字幕,或你上傳的字幕檔 | 隨 YouTube 帳號提供,官方頁沒有另外收費的說法 |
| 翻譯這一段 | CapCut 的字幕翻譯,或語言模型改寫字幕檔 | 翻好的字幕軌或字幕檔 | 看你用哪一個服務的哪一個方案 |
閱讀完整文字說明
橫向五個關卡:取得聲音、轉成文字、校正字與時間、翻成目標語言、輸出或上架。下方三列是三條路線。CapCut 這一列:影片拖進時間軸並把音樂與音效靜音、在 Text 選 Auto Captions 選語言後產生字幕、用 Edit captions 改字並按 B 或 Ctrl+B 斷句、把字幕翻成另一語言並自己核對人名術語、輸出影片或單獨匯出 SRT。Whisper 這一列:準備音訊檔且電腦要有 ffmpeg、用 --output_format srt 產生字幕檔、用文字編輯器改字但時間碼不要動、--task translate 只翻得到英文、字幕檔再上傳或燒進畫面。YouTube 這一列:上傳影片、自動字幕有 67 種語言、在 Studio 字幕頁編輯、觀眾端自己點自動翻譯、也可以上傳 srt 字幕檔。最下方提醒:三家官方說明都寫自動辨識會出錯,發布前逐行核對人名、數字與專有名詞。
CapCut:在時間軸上一次做完
CapCut 說明中心把入口寫得很清楚,三個平台的按鈕名稱不太一樣:網頁版在專案裡點 Text,選 Auto Captions,挑語言後按 Generate;桌面版點 Text 選 Auto Captions,挑語言與音軌後按 Recognize;手機版點 Text 選 Auto Captions,選好音訊來源等它跑完。
同一篇官方文章也把話說在前面:自動字幕是語音辨識做的,會因為背景噪音、口音、語速或音質而認錯字,三個平台都能手動修正、重新斷句與重新辨識。官方給的動線是點字幕區塊開 Edit captions 逐行改字,網頁版按 B、桌面版按 Ctrl+B 或 Cmd+B 切開太長的一段;錯太多就整批刪掉,先把音樂與音效靜音、只留人聲再跑一次。官方還補一句:網頁版的辨識在 Chrome 或 Edge、單聲道清晰人聲下表現最好。
翻譯接在後面。官方功能頁寫產生好的字幕可以自動翻成另一種語言,並提醒發布前檢查人名、術語、斷行與時間;同一頁的常見問題也寫了 CapCut 桌面版與線上版都能單獨匯出 SRT 檔,方便拿去上傳。
費用要自己查。官方說明中心寫 Pro 訂閱在手機、桌面與網頁都能用,Standard 只在部分地區供應、只在手機 App 生效,另一篇寫 Pro 含 100GB 雲端空間;至於月費,官方文章直接說價格、AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 點數、浮水印規則與匯出限制會隨方案、平台、帳號、地區與促銷而變,要在登入的帳號裡確認,所以這篇不寫數字,以官網為準。點數的官方說法是用在圖片生成、腳本轉影片、智慧去背、進階配音這類功能,執行前畫面會顯示這次扣多少點。
兩個常被誤會的地方。浮水印:官方說明寫它多半來自範本自帶的片尾片段,不是匯出造成的,刪掉時間軸最後那段就能輸出乾淨的影片。台灣能不能用:用 Apple 的查詢介面指定台灣區查,CapCut 的 iOS App 上架中,開發者掛 BYTEDANCE PTE. LTD.,當天版本 19.4.0、2026 年 9 月 8 日更新、售價顯示免費。自動字幕的免費額度、長度上限與支援語言數官方沒有寫成數字,一樣以官網為準。
Whisper:轉出字幕檔,翻譯得另外做
Whisper 是 OpenAI 釋出的語音辨識模型,官方 README 寫程式碼與模型權重採 MIT 授權,安裝後多一個 whisper 指令,另外需要系統裡有 ffmpeg。它和剪輯軟體最大的差別在輸出:官方原始碼的 CLI 參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文 --output_format(縮寫 -f)預設是 all,可指定 txt、vtt、srt、tsv、json、jsonl 其中一種,--output_dir(縮寫 -o)決定檔案放哪,預設是目前資料夾。要一個乾淨的字幕檔,就把格式指定成 srt。
pip install -U openai-whisper
# macOS 用 Homebrew 安裝 ffmpeg
brew install ffmpegwhisper talk.mp3 --model turbo --output_format srt --output_dir subs要注意 Whisper 的「翻譯」跟一般想的不一樣。官方原始碼裡 --task 只有兩個值:transcribe 是原語言轉原語言,translate 的說明寫的是翻成英文。README 也提醒 turbo 模型沒有受過翻譯訓練,加上 --task translate 還是會回原語言,要翻譯得改用 medium 或 large。換句話說,它幫不了你把日文影片翻成繁體中文,只到英文為止。
whisper japanese.wav --model medium --language Japanese --task translate中文還有一個坑。官方原始碼的語言清單有 100 種語言,中文只有一個 chinese(代碼 zh,別名表裡 mandarin 也指向 zh),另外單列 cantonese(yue),沒有繁簡之分,所以輸出哪一種字形不保證,得自己轉換或在翻譯那一步一起處理。字幕斷行的 --max_line_width、--max_line_count 與 --max_words_per_line 三個參數,官方都註明要先把 --word_timestamps 設成 True,而那功能官方自己標示為實驗性質。模型怎麼挑、硬體要多好,站上已經寫過。
用 Whisper 指令列在本機轉逐字稿:pip、ffmpeg 安裝與 SRT 字幕輸出用 Whisper 指令列在本機轉逐字稿:pip、ffmpeg 安裝與 SRT 字幕輸出用指令列或 Python 在自己電腦跑 Whisper,音檔不必上傳:OpenAI 的模型權重下載後就能離線轉逐字稿。這篇照官方 README、模型卡與 LICENSE,說明六種模型大小的參數、顯示記憶體需求與相對速度,用 pip 與 ffmpeg 完成安裝,示範指令列與 Python 兩種轉錄方式、srt 與 vtt 字幕的輸出參數、中文與繁體輸出的設定,以及幻覺與重複這些官方寫明的限制。閱讀全文
MacWhisper 與 WhisperDesktop 圖形介面逐字稿教學:不打指令的本機轉寫流程MacWhisper 與 WhisperDesktop 圖形介面逐字稿教學:不打指令的本機轉寫流程不想打指令的話,MacWhisper 與 WhisperDesktop 這兩個圖形介面工具能在自己電腦上把錄音變成文字;變成文字後,還需要核對講者、繁體用字和時間碼。本文以原創社區口述訪談情境,介紹 MacWhisper 與 Const-me WhisperDesktop 的桌面轉寫流程,區分本機模型、雲端轉寫與 AI 摘要的資料流。附工具比較表、操作步驟及自繪圖解,協助你保留原始錄音、整理可追溯逐字稿,再輸出適合閱讀或影片使用的字幕檔。閱讀全文
YouTube:自動字幕、字幕檔與觀眾端翻譯
第一件是自動字幕。官方說明列出的可用語言有 67 種,中文與粵語(官方寫成 Cantonese/Hong Kong)都在裡面;影片有多條語音軌時,自動字幕只會是預設語言那一條。官方也列了產不出字幕的原因:音訊還在處理、語言不支援、影片太長、音質太差、開頭安靜太久,或多位講者重疊、一段裡混了多種語言。直播的自動字幕只有英文,官方寫明逐步開放給訂閱數超過 1,000 的頻道,串流要用一般延遲。
第二件是上傳自己的字幕檔,也是把 Whisper 的成果接上平台的方法:在 YouTube Studio 左側選字幕,挑影片,按新增語言再按新增,然後選上傳檔案、自動同步或手動輸入。選上傳檔案要先決定含不含時間碼;選自動同步時,官方提醒逐字稿必須是語音辨識支援的語言、且與影片裡說的同一種語言,超過一小時或音質不佳的影片不建議這樣做。能上傳的格式官方列成三組,並註明基本格式不吃樣式標記token(Token)是什麼:AI 如何計算文字長度token 是語言模型處理內容的基本單位,可能是一段單字、標點或中文字的一部分,不能直接當成字數。本文用整理社團公告的情境,說明輸入、輸出與上下文如何計數,為什麼同一段中文換模型後用量可能不同,以及查看分詞器和實際用量時該注意什麼。你會學會估算任務空間、保留必要資訊,並分清楚 token 與登入用的存取權杖。閱讀全文、檔案必須是純 UTF-8。
- 基本格式:SubRip(.srt)、SubViewer(.sbv 或 .sub)、MPsub(.mpsub)、LRC(.lrc)、Videotron Lambda(.cap)
- 進階格式:SAMI(.smi 或 .sami)、RealText(.rt)、WebVTT(.vtt)、TTML(.ttml)、DFXP(.ttml 或 .dfxp)
- 廣播格式:Scenarist Closed Caption(.scc)、EBU-STL(.stl)、Caption Center(.tds)等,官方說 .scc 是偏好格式
第三件是翻譯。YouTube 沒有讓創作者一鍵產生翻譯字幕的功能,翻譯發生在觀眾那一端:官方的字幕設定說明寫,播放器的字幕選單裡沒有想要的語言時,可以點自動翻譯。頻道設定裡「不顯示可能不當的字詞」預設會把字換成 [ __ ],官方註明這設定同時作用在自動字幕與自動翻譯字幕上。另外還有自動配音,官方說它會產生翻譯後的語音軌、影片說明標上 auto-dubbed;超過 120 分鐘、沒有語音、原始語言不支援、語速太快或含著作權內容的影片不符資格,產生的配音不能編輯,不想要可在 Studio 的頻道設定取消勾選。
校正與翻譯:時間軸、繁體用字與術語
不論走哪條路,校正順序都一樣:先修字,再修斷句,最後才動時間。自動辨識錯的通常是詞不是時間點,先切段反而要重排時間軸。字幕檔本身是純文字:YouTube 官方文件給的 SubRip 時間碼範例是 00:00:00,599 --> 00:00:04,160,毫秒用逗號分隔;WebVTT 用小數點、小時位不一定寫出來,這也是 Whisper 官方原始碼裡兩種寫檔方式的差別,轉檔或手改時弄錯符號,平台就會判定格式不合。
翻譯交給語言模型的好處是可以一次交代術語與風格。最穩的做法是把整份字幕檔貼進去、要求保留序號與時間碼,並附上自己的術語表;太長就分批,但每批都要重申規則。
你是影片字幕的翻譯。我會貼上一份 SubRip 字幕檔。
規則:
1. 只翻譯字幕文字,序號與時間碼原樣保留,不要合併或拆開任何一段。
2. 輸出繁體中文,用台灣的說法(軟體、網路、影片、使用者)。
3. 術語照這張表:Whisper 維持原文、subtitle 譯成字幕、burn-in 譯成燒錄。
4. 每段長度盡量貼近原文,太長就照原本的斷行位置分行。
5. 人名、數字與單位照原文抄;不確定的地方在那一行結尾加上 [?]。
字幕檔:
(貼上內容)翻完不要直接上架。三個檢查點最會出事:數字(金額、日期、版本)有沒有被改掉、專有名詞前後是不是同一個譯法、每段字數會不會長到擋住畫面。方法很土但有效:把原文與譯文兩份字幕檔並排,先看序號對不對得上,再挑三到五段開影片對讀。
用 Claude 做中英日翻譯:語氣、專有名詞與術語表用 Claude 做中英日翻譯:語氣、專有名詞與術語表把 Claude 當翻譯 AI 用,靠的是提示詞而不是按一下翻譯:商務信、產品說明、日文旅遊資訊與英文條款都能翻成道地的繁體中文。這篇給你翻譯提示詞的五個部件與可直接貼的模板、「原文|譯法|不要譯成」術語表的做法、四種材料各自的語氣設定、繁體中文最容易露餡的翻譯腔與中國用詞、長文件分段翻與整篇順稿的流程,以及回譯與抽句驗證;上限依 Anthropic 官方文件 2026 年 9 月查證。閱讀全文
燒進畫面還是外掛字幕
最後一步是決定字幕跟影片的關係。外掛字幕是獨立的 .srt 或 .vtt 檔,播放器或平台自己疊上去,觀眾可以關掉、可以換語言,你也隨時能改字重傳,上傳到 YouTube 的就是這一種。燒進畫面則是把字畫進畫面裡,字型、大小與位置由你決定,在自動播放又預設靜音的社群動態裡一定看得到,代價是改一個字就要重新輸出,觀眾也關不掉。
要燒字幕,ffmpeg 官方文件的 subtitles 濾鏡是最常見的做法:它用 libass 把字幕畫在影片上,官方註明編譯時要開 --enable-libass,也需要 libavcodec 與 libavformat 把字幕檔轉成 ASS 格式。官方寫的用法是 subtitles=sub.srt,等同 subtitles=filename=sub.srt;想改字型與顏色,官方提供 force_style 選項,用 ASS 的樣式鍵值對覆寫。實務上兩種一起留最省事:先存一份校好的字幕檔,社群平台的版本燒進畫面,影音平台的版本上傳字幕檔。
ffmpeg -i INPUT -vf "subtitles=sub.srt" OUTPUTAI 內容標示:YouTube、Meta 與台灣的規定AI 內容標示:YouTube、Meta 與台灣的規定AI 生成的影片、聲音要不要標示?這篇照 YouTube、Meta 與 TikTok 官方規範當天的原文,整理三家各自要標什麼、在哪個開關標、不標會有什麼後果,再用全國法規資料庫的法條原文說明台灣目前的狀態:人工智慧基本法的透明原則寫給政府,選罷法與刑法處理的是深偽,沒有針對一般使用者的全面標示義務。最後給一套發布前用得上的判斷順序。閱讀全文
字幕只是影片的一部分。旁白、示範畫面與講解節奏怎麼安排,站上另有一篇專門寫教學影片的剪法。
教學影片怎麼剪:旁白、示範畫面與學習節奏教學影片怎麼剪:旁白、示範畫面與學習節奏教學影片剪得流暢之外,還要讓觀眾知道該看哪裡、何時操作,以及怎麼確認自己完成了。本文以原創社團值班名單教學為例,整理學習目標、分鏡、旁白同步、停頓練習、字幕與文字稿的製作方法,附流程圖及分鏡比較表。從錄製前安排到成品試看逐步檢查,協助你做出容易跟做、也方便日後更新的教學影片。閱讀全文
同主題延伸閱讀
生活分享
本機跑 Stable Diffusion 與 Flux:ComfyUI 入門
ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。
生活分享
MiniMax 語音合成:中文配音、有聲書與影片旁白
把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。
生活分享
MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌
MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。
生活分享
MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片
海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- OpenAI Whisper 官方 README(安裝指令、模型清單、翻譯任務的限制與 MIT 授權) · 查證日期:
- Whisper 官方原始碼 transcribe.py(CLI 參數:--output_format、--task、--word_timestamps 等) · 查證日期:
- Whisper 官方原始碼 utils.py(SubRip 與 WebVTT 兩種字幕檔的時間碼寫法) · 查證日期:
- Whisper 官方原始碼 tokenizer.py(語言清單與中文、粵語的代碼) · 查證日期:
- FFmpeg 官方文件:subtitles 濾鏡與 force_style 選項 · 查證日期:
- YouTube 說明:支援的字幕檔格式與 SubRip 時間碼範例 · 查證日期:
- YouTube 說明:新增字幕(上傳檔案、自動同步、手動輸入) · 查證日期:
- YouTube 說明:使用自動字幕(語言清單、直播限制、產不出字幕的原因) · 查證日期:
- YouTube 說明:字幕設定(播放器裡的自動翻譯) · 查證日期:
- YouTube 說明:使用自動配音(資格條件與品質說明) · 查證日期:
- CapCut 說明中心:自動字幕不準確時怎麼修(三個平台的步驟與快速鍵) · 查證日期:
- CapCut 說明中心:用 AI 為廣告影片加旁白與字幕(步驟,以及方案、點數、浮水印以帳號為準的說明) · 查證日期:
- CapCut 官方功能頁:為影片加字幕(步驟、翻譯與匯出 SRT 的常見問題) · 查證日期:
- CapCut 官方功能頁:字幕翻譯 · 查證日期:
- CapCut 說明中心:訂閱在多平台的使用範圍(Pro 與 Standard 的差別) · 查證日期:
- CapCut 說明中心:點數用在哪些 AI 功能 · 查證日期:
- CapCut 說明中心:價格調整說明(Pro 含 100GB 雲端空間) · 查證日期:
- CapCut 說明中心:匯出影片時的浮水印來自範本片尾 · 查證日期:
- Apple App Store 查詢介面(台灣區 CapCut 的上架狀態與版本) · 查證日期: