簡短回答
重點摘要
- 一個配音請求把一部作品配成最多 29 種目標語言;手動審閱旗標令每種語言停在審閱步驟,直至審閱人員批准。
- 每種語言各自確認後才渲染,日語仍在審閱時,西班牙語已可發佈。
- Webhook 回報每一次狀態變化:配音待審閱、每種語言輸出就緒、整條配音完成,或失敗連同錯誤原因。
- 2026 年 8 月 5 日以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。
01.為何覆蓋率是瓶頸?
內容庫每星期都在新增作品;逐部選角、錄音、混音的流程,只能以固定速度新增語言,所以排隊的長度,決定了一個市場能用自己的語言看到內容庫的多少。
最大的 100 個 YouTube 頻道中,不以英語為主的頻道數目。
- 完整的人工配音,翻譯加聲音,每分鐘成片要 $70 至 $150:一部 60 分鐘的作品配一種語言,就是 $4,200 至 $9,000(2026 年配音要多少錢?)。
- 在逐部處理的流程裡,每種語言都是一條獨立的隊列:一部作品配十種語言,就是十次選角、錄音和混音,最慢的一種決定上線日期。
- 只配聲音的配音,讓嘴仍在說原文語言;觀眾讀到的唇形,跟聽到的話互相矛盾(配音在海外為何不對勁?製作公司如何解決)。
02.上載即配音是怎樣運作的?
一次整合覆蓋整條流程:上載流程發出一個請求,API 在每一步回報,成品檔案由平台自家的播放器播出。
| 步驟 | 發生甚麼 | 平台收到甚麼 |
|---|---|---|
| 上載 | POST /v1/dubs,附上檔案或來源網址、最多 29 個目標語言代碼,以及 review=manual;來源語言自動偵測或指定。 | dub_id、狀態 queued,每種語言一個 outputs[] 項目 |
| 轉錄和翻譯 | 語音轉文字附逐字時間戳,說話者分開;每一句都套用不翻譯清單和背景簡介翻譯。 | 狀態 transcribing,然後 translating |
| 審閱 | 配音停在 in_review。按語言 GET 文字稿,PATCH 任何一句,POST /render 渲染一種語言或全部。 | dub.ready_for_review,然後是可編輯的文字稿 |
| 渲染 | 聲音和唇形同步一起生成,按語言進行;每種語言有自己的狀態。 | 每種語言的 dub.output_ready;全部語言渲染完成後的 dub.completed |
| 交付 | 每種語言一個輸出:成品 mp4、根據審閱過的文字稿生成的 .srt 和 .vtt 字幕、完整混音或只有人聲的音軌,以及翻譯好的標題和描述。 | GET /v1/dubs/{dub_id}/output/{lang},format 為 mp4、srt、vtt、audio 或 voice |
- 失敗也是事件。dub.failed 帶有語言和錯誤原因;10 秒內未確認的送達會在 24 小時內重試,重複的事件按事件 ID 去重(Webhook)。
- 名字和口頭禪保持不變。不翻譯清單令它們完全照原話保留;一句背景簡介(鏡頭前是誰、這是甚麼節目)令每一句更準確;兩者都可設定在創作者檔案、直播或單一作品的層級(不翻譯清單、背景簡介)。
- 元數據隨作品同行。翻譯好的標題和描述按語言送達;連結、@帳號、#標籤、優惠碼和章節原樣保留(元數據翻譯)。
03.為何一個模型會改變覆蓋率的算式?
拼湊而成的流程要在產能和質素之間取捨:每多一套工具,就多一道工序、多一張賬單,而兩個模型守不住同一個身份。一個統一模型同時生成聲音、唇形和場景。
ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。
11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日Familiar 的聲音像真人說話者的程度高 27.8%;測試的 11 種語言全部更接近。
0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日Familiar 的重要翻譯錯誤少 54.7%(29 次 vs 64 次)。
ElevenLabs Dubbing v2 (Alpha) · 與 270% 那格相同的 111 組配對輸出 · 2026 年 8 月 5 日- 翻譯質素守得住。Familiar 的翻譯達到專業譯者初稿質素的 100.3%,法語、中文、印地語、印尼語平均計算,以專家修訂稿為標準盲測評分(2026 年 8 月 6 日):旗鼓相當(研究全文)。
- 場景在配音後依然完整。音樂絕不配音;歌曲原樣通過,笑聲、音效和環境聲留在新語音之下;鏡頭前每位說話者都用自己的聲音配音。
04.哪些作品先做?
按語言放行,令規劃單位變成「一部作品的一種語言」:一個市場帶著已通過的語言上線(多國同步推出:所有市場一次配音)。
| 級別 | 語言 |
|---|---|
| 第一級(14 種) | 日語、印尼語、西班牙語、法語、英語、俄語、泰語、普通話、越南語、粵語、意大利語、葡萄牙語、德語、韓語 |
| 第二級(9 種) | 加泰羅尼亞語、立陶宛語、克羅地亞語、希臘語、保加利亞語、挪威語、荷蘭語、斯洛伐克語、瑞典語 |
| 第三級(7 種) | 丹麥語、白俄羅斯語、阿拉伯語、拉脫維亞語、哈薩克語、烏克蘭語、塞爾維亞語 |
- 最乾淨的形式優先。2 至 3 人上鏡的播客和訪談、直接對著鏡頭說話的影片、講課、簡報,以及乾淨的單機位場景。
- 先做第一級,再逐步擴展。30 種語言每一種都可互為來源和目標,所以級別次序就是推出次序(語言)。
- 按風險分流。review=manual 令作品停在 in_review,直至該市場的審閱人員觸發渲染;review=auto(預設)直接渲染;字幕任務一定會停下,因為字幕文字來自審閱步驟。
- 廣播是另一條線。直播工作階段透過 SRT、RTMP 或 WHIP 為廣播配音,比原聲慢 5 至 9 秒,由 11 種來源語言譯成其餘 29 種,每種語言的訊號推送到各自的目的地;直播沒有審閱步驟(直播的即時配音)。
05.如何用自己的內容庫試行?
- 挑最難的作品。一集有代表性的劇集,或連續幾集,配兩三種優先語言,要有快對白、笑話、對白下的音樂、專有名詞,以及一次後期改動。
- 在任何人試聽之前先寫好驗收標準。譯文、聲音、場景、臉部和時間點,每項由母語審閱人員評分;再加上修改輪次,以及從來源改動到替換版本獲批准所需的時間。
- 點算修改次數。審閱人員在審閱步驟改動的句數和類別,就是直接的質素指標;每處修改都會落入配音和字幕。
配對設計、評分表和結果解讀:如何進行 AI 配音試行(2026)。以 Studio 合約提供,按內容庫規模定制,已簽署的年度合約享 30 日退款保證。
常見問題
串流平台用甚麼更快地增加本地語言配音?
透過 API 上載即配音:每部作品一個請求,配成最多 29 種目標語言,每種語言有審閱步驟,Webhook 回報每次狀態變化,成品影片、字幕、音軌和翻譯好的標題和描述,由平台自家的播放器播出。
配音更快,質素會更差嗎?
聲音、唇形同步和場景出自同一個模型時,不會。以相同片段測試(2026 年 8 月 5 日),ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤比 Familiar 多 270%。Familiar 的翻譯在法語、中文、印地語、印尼語達到專業譯者初稿質素的 100.3%:旗鼓相當。
可以先推出一種語言,其他稍後嗎?
可以。用 review=manual,每種語言停在 in_review,各自確認後才渲染:POST /render 附上 langs 清單,今天放行西班牙語,其餘語言待各自的審閱人員簽核後再放行;每種語言的檔案可下載時,會發出自己的 dub.output_ready Webhook。
作為參考,完整的人工配音要多少錢?
完整的人工配音,翻譯加聲音,每分鐘成片要 $70 至 $150:一部 60 分鐘的作品配一種語言,就是 $4,200 至 $9,000。單是翻譯,按公開的每字收費計算,每分鐘口語要 $22 至 $45。
平台可以配成哪些語言?
30 種語言,任意互譯:30 種之中任何一種的作品,都可配成其餘 29 種,分三個公開的質素級別,最佳在前。第一級 14 種,第二級 9 種,第三級 7 種,級別內按筆畫序排列。
參考資料
配音終於好了。先看實測數據,再跟團隊談談你的內容庫。
FAMILIAR · 發佈影片 · 2:31
