生活分享

ElevenLabs 與語音克隆:配音、方案與同意規則怎麼看

ElevenLabs 免費方案不含語音克隆、不可商用,公開發布還要在標題標上 elevenlabs.io;即時克隆從每月 6 美元的 Starter 起,專業克隆要 22 美元的 Creator 以上。這篇照官網 2026 年 9 月 14 日的頁面整理文字轉語音、克隆、配音翻譯與音效的限制、credit 換算、克隆要錄多久、使用政策與 voice captcha 驗證,以及商用與標示條款。

更新日期: 閱讀時間約 8 分鐘

插圖:左邊一支麥克風,中間圓形裡有一排聲波柱,右邊一張帶勾選標記的同意卡片,三者用箭頭串起來
圖片:Mokaair (© Mokaair)

ElevenLabs 把文字變成語音,也能複製一個人的聲音。這篇回答的是:它能做什麼、要花多少錢、克隆聲音要準備什麼、做出來的能不能拿去用。結論先說,免費方案不含語音克隆、不能商用,公開發布還要在標題加上標示;即時克隆要每月 6 美元的 Starter 起,專業克隆要每月 22 美元的 Creator 以上才有名額。

以下按官網、官方文件、定價頁與條款頁在 2026 年 9 月 14 日的內容整理:四類功能的能力與限制、credit 怎麼換算、兩種克隆各要錄多久、官方的驗證機制與使用政策,以及商用授權與標示條文。介面名稱以官網當天版本為準。

ElevenLabs 能做的四件事

第一件是文字轉語音:貼上文字、選一個聲音,輸出音檔。官方文件列出的模型裡,Eleven v3 支援 70 種以上語言、單次上限 5,000 個字元;Eleven Multilingual v2 支援 29 種語言、上限 10,000 個字元;Eleven Flash v2.5 支援 32 種語言、上限 40,000 個字元,官方標的延遲約 75 毫秒。

第二件是語音克隆,分成即時(Instant Voice Cloning)與專業(Professional Voice Cloning),下面單獨講。第三件是配音翻譯(Dubbing):上傳影片或貼一段 YouTube、TikTok 的網址,官方說可翻成 90 種以上語言並保留原講者的聲音,單檔不得超過 2 GB 也不得超過 180 分鐘;預設的第二代自動配音沒有站內編輯逐字稿的選項,舊版 Dubbing Studio 官方標示為維護模式。

第四件是音效:用一段最長 450 個字元的提示詞生成音效,官方寫的長度上限是 30 秒,可以開啟循環拼出更長的環境音。另外還有、音樂與對話代理(Agent),上面這些功能官方都有對應的 API。

方案、credit 與克隆名額

ElevenLabs 的額度單位叫 credit,不同功能扣法不同。定價頁寫的是:文字轉語音 1 個字元扣 1 credit;語音轉文字每分鐘 330 credit;配音翻譯每分鐘 2,000 credit(自動、含浮水印)到 10,000 credit(Dubbing Studio、無浮水印);音樂每分鐘 900 credit;音效每次生成 200 credit;變聲與人聲分離每分鐘 1,000 credit。

所以免費方案每月 10,000 credit,換算成文字轉語音大約一萬個字元,是一段幾分鐘旁白的量;同一份額度拿去配音翻譯,連五分鐘的影片都跑不完。官方說自助方案沒用完的 credit 最多累積兩個月份到下個月,降級或取消時不累積。專業克隆的名額另外算:Creator 與 Pro 各 1 組、Scale 3 組、Business 10 組。

額度單位為 credit。資料來源:ElevenLabs 定價頁,2026 年 9 月查證;價格為官網美元標價,方案與促銷以官網為準。
方案月費(美元)credit 額度與克隆類型商用
Free0每月 10,000;不含語音克隆不可商用,發布要標示
Starter6每月 30,000;即時克隆含商用授權
Creator22(首月 5 折 11)每月 121,000;專業克隆 1 組含商用授權
Pro99每月 600,000;專業克隆 1 組含商用授權
Scale299每月 1,800,000;專業克隆 3 組含商用授權
Business990每月 6,000,000;專業克隆 10 組含商用授權

中文支援只看官方語言清單

官網沒有一個通用的「支援語言數」,要分功能看。文件裡 Eleven v3 的語言清單寫的是 Mandarin Chinese,Multilingual v2 的 29 種與 Flash v2.5 的 32 種清單裡寫的是 Chinese;配音翻譯寫 90 種以上語言,對話代理寫 70 種以上語言,數字屬於各自的功能。

官方清單沒有把國語與粵語、繁體與簡體分開列,也沒有承諾台灣口音。要用在台灣受眾的內容,最實際的做法是拿真正要念的稿子試一段,聽數字、英文縮寫與人名的念法對不對。

克隆自己的聲音:兩種克隆的官方要求

即時克隆是上傳幾段錄音就馬上得到一個聲音,官方文件說沒有訓練過程。錄音官方建議大約 1 到 2 分鐘、乾淨、沒有殘響與背景雜訊,至少要錄 1 分鐘,超過 3 分鐘官方說幫助不大;檔案切成幾個不重要,重要的是總長度。存檔之前介面會要你確認你有權利、也取得同意克隆這個聲音。

專業克隆是拿你的錄音做,官方要求至少 30 分鐘的高品質音訊,建議盡量接近 2 到 3 小時,方案上要 Creator 以上才有名額。送出後官方寫微調通常需要 3 到 6 小時,排隊多時可能更久、最長到 24 小時。兩者差別不只是像不像,而是穩定度:素材越多,長篇旁白裡的語氣起伏越一致。

  1. 找安靜的空間,用同一支麥克風、同一個距離錄完所有素材,中途不要換設備。
  2. 念你真正會用到的內容:要做旁白就念旁白稿,要做客服就念對話。
  3. 上傳前自己聽一遍,刪掉有回音、爆音、鍵盤聲或第二個人說話的片段。
  4. 建立聲音時勾選同意聲明;專業克隆還要當場照提示錄一段驗證句。
  5. 驗證通過才會開始微調,完成之前先不要排定發布時間。
錄音前的口頭同意聲明(自行調整的範例,不是官方範本) · text
我是(姓名),今天是(日期)。
我同意(使用者或公司名稱)使用我這次提供的錄音,
在語音服務上建立我的語音模型,用途為(例如:公司產品教學影片旁白)。
授權期間為(期間),期間內我可以書面通知終止授權並要求刪除模型與素材。
流程圖:錄音、克隆與驗證、生成、標示與同意四個步驟,下方兩條橫幅寫同意規則與標示規則
從左看到右是四個步驟,下面兩條橫幅是從頭到尾都要成立的同意與標示規則。 · 圖片:Mokaair (© Mokaair)
閱讀完整文字說明

由左至右四個步驟。第一步錄音:安靜空間、同一支麥克風,即時克隆建議 1 到 2 分鐘、至少 1 分鐘、超過 3 分鐘幫助不大,專業克隆至少 30 分鐘、建議 2 到 3 小時,上傳前先自己聽過。第二步克隆與驗證:勾選同意聲明,專業克隆要當場錄驗證句,官方以 voice-captcha 確認本人在場,失敗等 24 小時再試,微調通常 3 到 6 小時,方案要 Creator 以上才有名額。第三步生成:文字轉語音 1 個字元扣 1 credit,配音翻譯 90 種以上語言,音效最長 30 秒,最便宜的自動配音含浮水印、無浮水印的檔次較貴。第四步標示與同意:免費層不可商用,發布時標題要加 elevenlabs.io,即時克隆從每月 6 美元起,專業克隆從每月 22 美元起,付費訂閱期間以外做的內容不可商用。下方第一條橫幅寫同意規則:克隆別人的聲音要有同意或法律權利,使用政策禁止未經同意複製他人聲音、造成騷擾或傷害,也禁止讓人誤以為不是人工智慧生成,並禁止冒充政治候選人與民選官員。第二條橫幅寫標示與偵測:免費方案或未登入時發布要在標題加上 elevenlabs.io 或 11.ai,音樂功能要註明 Eleven Music;官方的偵測工具只估計是否由該公司模型生成,無法可靠辨識較新的模型,也偵測不到其他供應商。

克隆別人的聲音:使用政策與驗證機制

專業克隆的官方文件寫得很直接:只能建立你自己的聲音,即使對方同意也不行。要用別人的聲音只能走即時克隆,責任落在建立的人身上。禁止使用政策第 5 條寫的是,不得為了以下情形複製他人聲音:未經同意或沒有法律權利、對當事人造成騷擾或傷害(包含未經授權的性化內容)、或以讓他人誤以為這不是生成的方式使用。第 6 條另外禁止冒充政治候選人與民選官員。

驗證機制官方文件稱為 voice-captcha:建立專業克隆時要當場照提示念幾句驗證句,確認提供樣本的人就在現場,而不是拿別人的錄音來上傳。文件也寫明這不能保證錄音真的屬於本人,只能確認請求者當下在場並實際參與。驗證失敗可以等 24 小時再試。安全頁另外寫到會封鎖名人與高風險聲音的克隆。

換句話說,平台擋得住隨手拿公開影片去複製名人,擋不住拿同事的語音訊息去做即時克隆。後者要靠你自己留紀錄:誰、何時、同意用在哪裡、怎麼撤回。

商用權與標示:免費層的兩個限制

條款(官網標示最後更新 2026 年 3 月 31 日)寫的是,在你與 ElevenLabs 之間你保有輸出內容的權利;但免費使用者只能用於非商業用途,付費使用者才能用於商業用途。官方說明頁另外寫,免費方案或未登入時產生的內容要公開發布,必須在標題裡加上 elevenlabs.io 或 11.ai;用音樂功能產生的要註明 Eleven Music。

還有一條容易被忽略:官方寫在付費訂閱期間以外(之前或之後)建立的內容不能商用,非商業分享時也一律要標示。先用免費方案做好一批旁白、之後再訂閱,不會讓那批舊檔案變成可商用。

深偽風險與可以查證的工具

語音克隆最現實的風險是聲音詐騙與假訊息。ElevenLabs 提供免費的 AI Speech Classifier,估計一段音訊是不是由它的模型生成,但官方寫明兩個限制:無法可靠辨識 Eleven v3 生成的音訊,也偵測不到其他供應商,而且分析只看檔案的前一分鐘。把偵測工具當成單一證據並不安全,該做的是先查來源。

台灣的相關規定與各平台的標示要求另有專篇,深偽本身的判讀方式也有一篇。要自己做語音內容,周邊流程可以一起理順:錄音的降噪、成品的逐字稿,以及做成有人像影片時的工具。

同樣是聲音,用途不一樣工具就不一樣:想練口說或做即時口說翻譯,走的是對話式的語音模式;想要背景音樂或完整歌曲,走的是音樂生成,那邊的商用規則也自成一套。

  • 生活分享

    本機跑 Stable Diffusion 與 Flux:ComfyUI 入門

    ComfyUI 是一套開源的節點式生成引擎,可以在自己的電腦上跑 Stable Diffusion 與 Flux。這篇照官方文件整理三種安裝方式與系統需求、模型檔要放進哪個子資料夾、怎麼載入官方範本完成第一張圖,以及每個節點在做什麼;並逐版本核對 Flux 與 Stable Diffusion 的授權、商用條件與官方寫的顯示記憶體需求。

  • 生活分享

    MiniMax 語音合成:中文配音、有聲書與影片旁白

    把 MiniMax 的 Speech 系列當配音 AI,把文字變成音檔:網頁版與 API 兩條路的最小步驟、332 個系統音色怎麼挑、情緒與語速停頓的參數範圍、輸出格式與取樣率、每百萬字元的費用與免費額度、聲音複製要通過的驗證與授權規則,以及有聲書的分段工作流。規格與價格以官網 2026 年 9 月 14 日的頁面為準。

  • 生活分享

    MiniMax 音樂生成怎麼用:從一段描述與歌詞做出一首歌

    MiniMax 的作曲 AI(音樂生成)在 2026 年換了入口:付費 API 自 8 月 20 日起不再開放給新使用者,官方把一般使用者指向 MiniMax Audio、開發者指向 Hugging Face 上的開源權重 MiniMax Music 3。這篇照官網整理提示詞與歌詞怎麼寫、14 種段落標記、長度與音檔格式、費用與免費額度、API 最小呼叫範例,以及輸出音檔的商用與著作權。

  • 生活分享

    MiniMax 海螺影片生成教學:從註冊到下載第一支 AI 影片

    海螺 AI(Hailuo AI)是 MiniMax 的影片生成產品,網頁版與 iOS、Android App 都能用。這篇帶台灣使用者走完第一次:入口與登入方式、免費版的浮水印與排隊限制、點數與訂閱方案怎麼算、文生影片與圖生影片的操作順序、提示詞的四段寫法,以及官方公布的時長與解析度規格,最後說明服務條款怎麼寫生成內容的授權與商用。

最新旅遊情報攻略

資料來源

生活分享