平台實戰指南

串流平台如何補上本地語言配音的缺口

FAMILIAR 研究全部文章

簡短回答

本地語言配音的缺口,本質是產能問題:內容庫增長的速度,快過逐部作品配音的流程,而完整的人工配音每分鐘成片要 $70 至 $150。平台的解法是上載即配音:每部作品一個請求,配成最多 29 種語言,每種語言先停在審閱步驟,通過即上線,每個狀態都由 Webhook 回報。Familiar 用一個模型渲染說話者自己的聲音、唇形同步和場景聲音。

重點摘要

  • 一個配音請求把一部作品配成最多 29 種目標語言;手動審閱旗標令每種語言停在審閱步驟,直至審閱人員批准。
  • 每種語言各自確認後才渲染,日語仍在審閱時,西班牙語已可發佈。
  • Webhook 回報每一次狀態變化:配音待審閱、每種語言輸出就緒、整條配音完成,或失敗連同錯誤原因。
  • 2026 年 8 月 5 日以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。

01.為何覆蓋率是瓶頸?

內容庫每星期都在新增作品;逐部選角、錄音、混音的流程,只能以固定速度新增語言,所以排隊的長度,決定了一個市場能用自己的語言看到內容庫的多少。

圖 01 · 觀眾早已遍佈全球
64

最大的 100 個 YouTube 頻道中,不以英語為主的頻道數目。

  • 完整的人工配音,翻譯加聲音,每分鐘成片要 $70 至 $150:一部 60 分鐘的作品配一種語言,就是 $4,200 至 $9,000(2026 年配音要多少錢?)。
  • 在逐部處理的流程裡,每種語言都是一條獨立的隊列:一部作品配十種語言,就是十次選角、錄音和混音,最慢的一種決定上線日期。
  • 只配聲音的配音,讓嘴仍在說原文語言;觀眾讀到的唇形,跟聽到的話互相矛盾(配音在海外為何不對勁?製作公司如何解決)。

02.上載即配音是怎樣運作的?

一次整合覆蓋整條流程:上載流程發出一個請求,API 在每一步回報,成品檔案由平台自家的播放器播出。

流程 · 一部作品,每種目標語言 · 見 /docs 文件
步驟發生甚麼平台收到甚麼
上載POST /v1/dubs,附上檔案或來源網址、最多 29 個目標語言代碼,以及 review=manual;來源語言自動偵測或指定。dub_id、狀態 queued,每種語言一個 outputs[] 項目
轉錄和翻譯語音轉文字附逐字時間戳,說話者分開;每一句都套用不翻譯清單和背景簡介翻譯。狀態 transcribing,然後 translating
審閱配音停在 in_review。按語言 GET 文字稿,PATCH 任何一句,POST /render 渲染一種語言或全部。dub.ready_for_review,然後是可編輯的文字稿
渲染聲音和唇形同步一起生成,按語言進行;每種語言有自己的狀態。每種語言的 dub.output_ready;全部語言渲染完成後的 dub.completed
交付每種語言一個輸出:成品 mp4、根據審閱過的文字稿生成的 .srt 和 .vtt 字幕、完整混音或只有人聲的音軌,以及翻譯好的標題和描述。GET /v1/dubs/{dub_id}/output/{lang},format 為 mp4、srt、vtt、audio 或 voice
  • 失敗也是事件。dub.failed 帶有語言和錯誤原因;10 秒內未確認的送達會在 24 小時內重試,重複的事件按事件 ID 去重(Webhook)。
  • 名字和口頭禪保持不變。不翻譯清單令它們完全照原話保留;一句背景簡介(鏡頭前是誰、這是甚麼節目)令每一句更準確;兩者都可設定在創作者檔案、直播或單一作品的層級(不翻譯清單背景簡介)。
  • 元數據隨作品同行。翻譯好的標題和描述按語言送達;連結、@帳號、#標籤、優惠碼和章節原樣保留(元數據翻譯)。
POST /v1/dubsreview=manualPOST /renderdub.output_readymp4 | srt | vtt | m4a | wav

03.為何一個模型會改變覆蓋率的算式?

拼湊而成的流程要在產能和質素之間取捨:每多一套工具,就多一道工序、多一張賬單,而兩個模型守不住同一個身份。一個統一模型同時生成聲音、唇形和場景。

圖 02 · 相同片段的配對黑盒研究 · ElevenLabs · 2026 年 8 月 5 日
270%

ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。

11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日
+27.8%

Familiar 的聲音像真人說話者的程度高 27.8%;測試的 11 種語言全部更接近。

0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日
54.7%

Familiar 的重要翻譯錯誤少 54.7%(29 次 vs 64 次)。

ElevenLabs Dubbing v2 (Alpha) · 與 270% 那格相同的 111 組配對輸出 · 2026 年 8 月 5 日
  • 翻譯質素守得住。Familiar 的翻譯達到專業譯者初稿質素的 100.3%,法語、中文、印地語、印尼語平均計算,以專家修訂稿為標準盲測評分(2026 年 8 月 6 日):旗鼓相當(研究全文)。
  • 場景在配音後依然完整。音樂絕不配音;歌曲原樣通過,笑聲、音效和環境聲留在新語音之下;鏡頭前每位說話者都用自己的聲音配音。

04.哪些作品先做?

按語言放行,令規劃單位變成「一部作品的一種語言」:一個市場帶著已通過的語言上線(多國同步推出:所有市場一次配音)。

三個公開的質素級別 · 最佳在前 · 級別內按筆畫序
級別語言
第一級(14 種)日語、印尼語、西班牙語、法語、英語、俄語、泰語、普通話、越南語、粵語、意大利語、葡萄牙語、德語、韓語
第二級(9 種)加泰羅尼亞語、立陶宛語、克羅地亞語、希臘語、保加利亞語、挪威語、荷蘭語、斯洛伐克語、瑞典語
第三級(7 種)丹麥語、白俄羅斯語、阿拉伯語、拉脫維亞語、哈薩克語、烏克蘭語、塞爾維亞語
  • 最乾淨的形式優先。2 至 3 人上鏡的播客和訪談、直接對著鏡頭說話的影片、講課、簡報,以及乾淨的單機位場景。
  • 先做第一級,再逐步擴展。30 種語言每一種都可互為來源和目標,所以級別次序就是推出次序(語言)。
  • 按風險分流。review=manual 令作品停在 in_review,直至該市場的審閱人員觸發渲染;review=auto(預設)直接渲染;字幕任務一定會停下,因為字幕文字來自審閱步驟。
  • 廣播是另一條線。直播工作階段透過 SRT、RTMP 或 WHIP 為廣播配音,比原聲慢 5 至 9 秒,由 11 種來源語言譯成其餘 29 種,每種語言的訊號推送到各自的目的地;直播沒有審閱步驟(直播的即時配音)。

05.如何用自己的內容庫試行?

  • 挑最難的作品。一集有代表性的劇集,或連續幾集,配兩三種優先語言,要有快對白、笑話、對白下的音樂、專有名詞,以及一次後期改動。
  • 在任何人試聽之前先寫好驗收標準。譯文、聲音、場景、臉部和時間點,每項由母語審閱人員評分;再加上修改輪次,以及從來源改動到替換版本獲批准所需的時間。
  • 點算修改次數。審閱人員在審閱步驟改動的句數和類別,就是直接的質素指標;每處修改都會落入配音和字幕。

配對設計、評分表和結果解讀:如何進行 AI 配音試行(2026)。以 Studio 合約提供,按內容庫規模定制,已簽署的年度合約享 30 日退款保證。

常見問題

串流平台用甚麼更快地增加本地語言配音?

透過 API 上載即配音:每部作品一個請求,配成最多 29 種目標語言,每種語言有審閱步驟,Webhook 回報每次狀態變化,成品影片、字幕、音軌和翻譯好的標題和描述,由平台自家的播放器播出。

配音更快,質素會更差嗎?

聲音、唇形同步和場景出自同一個模型時,不會。以相同片段測試(2026 年 8 月 5 日),ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤比 Familiar 多 270%。Familiar 的翻譯在法語、中文、印地語、印尼語達到專業譯者初稿質素的 100.3%:旗鼓相當。

可以先推出一種語言,其他稍後嗎?

可以。用 review=manual,每種語言停在 in_review,各自確認後才渲染:POST /render 附上 langs 清單,今天放行西班牙語,其餘語言待各自的審閱人員簽核後再放行;每種語言的檔案可下載時,會發出自己的 dub.output_ready Webhook。

作為參考,完整的人工配音要多少錢?

完整的人工配音,翻譯加聲音,每分鐘成片要 $70 至 $150:一部 60 分鐘的作品配一種語言,就是 $4,200 至 $9,000。單是翻譯,按公開的每字收費計算,每分鐘口語要 $22 至 $45。

平台可以配成哪些語言?

30 種語言,任意互譯:30 種之中任何一種的作品,都可配成其餘 29 種,分三個公開的質素級別,最佳在前。第一級 14 種,第二級 9 種,第三級 7 種,級別內按筆畫序排列。

參考資料

  1. [1]Familiar API:簡介、快速入門與配音生命周期
  2. [2]文字稿與審閱:暫停、修改、按語言渲染
  3. [3]Webhook:事件目錄、送達與重試
  4. [4]Familiar 配音基準測試:三項配對研究、完整數據與試聽範例
  5. [5]2026 年配音要多少錢?(所有公開的配音收費,按每分鐘成片計)
  6. [6]ElevenLabs Dubbing 文件:按來源媒體每分鐘、每種目標語言收費(2026 年 9 月 6 日查閱)

配音終於好了。先看實測數據,再跟團隊談談你的內容庫。

FAMILIAR · 發佈影片 · 2:31