製作公司實戰指南

配音在海外為何不對勁?製作公司如何解決

FAMILIAR 研究全部文章

簡短回答

配音不對勁,是三件事同時脫節:陌生人的聲音取代了演員本人,嘴仍在說原文語言,對白之下的音樂和環境聲被壓平。解決辦法是三者一起配。Familiar 用一個模型,在一次渲染內保留每位演員自己的聲音、讓臉部重新演出,並完整保留場景聲音;任何一句譯文都可在渲染前修改。

重點摘要

  • 三個缺陷令配音不對勁:陌生人的聲音、仍在說原文語言的嘴,以及被新對白壓平的場景。
  • 以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲(111 組配對輸出,2026 年 8 月 5 日)。
  • Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%,測試的 11 種語言全部更接近(418 組配對輸出,2026 年 8 月 5 日)。
  • 製作公司自己的譯者可在渲染前修改任何一句譯文,每種語言各自確認後才渲染。

01.配音為何不對勁?

其中兩個缺陷比 AI 更古老:配音員同樣是陌生人的聲音,而任何錄音都動不了演員的嘴。只換聲音的 AI 配音還可能加上第三個:被壓平的場景,下文有實測。

  • 陌生人的聲音。無論是配音員還是聲音庫的現成聲音在讀台詞,認識這位演員的人都不再認得他(AI 影片配音詳解(2026))。
  • 說著另一種語言的嘴。大腦會結合唇部動作和聲音來理解說話;兩者不吻合時,理解會變得困難,甚至會聽成另一個音:這就是麥格克效應,屬於視聽語音整合的一部分。只配聲音的配音,把這種不吻合留在每一格畫面裡。
  • 被壓平的場景。笑聲、音樂、音效和環境聲,在新的語音之下被剝掉或抹糊。
  • 逐句直譯。一句話逐字對應譯過來,即使正確也讀來生硬,笑話要麼遲了落地,要麼根本落不了地(影片翻譯真正重要的是甚麼)。
陌生人的聲音嘴形對不上場景被壓平逐句直譯

02.實測數據怎樣說?

圖 01 · 配對研究 · 相同來源片段 · 只比較最終音訊 · 2026 年 8 月
270%

ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。

11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日
+27.8%

Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%;測試的 11 種語言全部更接近。

0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日
100.3%

達到專業譯者初稿的質素,法語、中文、印地語、印尼語平均計算,以專家修訂稿為標準盲測評分。旗鼓相當。

生產流程翻譯研究 vs 專業譯者初稿 · 2026 年 8 月

兩組 ElevenLabs 樣本與人工翻譯研究從不合併計算。完整數據、置信區間和試聽範例:Familiar vs ElevenLabsvs 人工翻譯;方法見AI 翻譯 vs 人工翻譯:與專業譯者對比測試(2026)

  • 譯文,ElevenLabs Dubbing v2 (Alpha)。Familiar 的重要翻譯錯誤少 54.7%(29 次 vs 64 次)。
  • 語音輸出錯誤,ElevenLabs Dubbing v1。Familiar 被審閱標記的語音輸出錯誤少 48.8%(132 次 vs 258 次)。

03.聲音、唇形和場景出自同一個模型,有甚麼不同?

一個統一模型同時生成聲音、唇形和場景,理解場景與世界,並保持身份的恒常,所以留住的是演員本人的演出,而不是陌生人的聲音,加上對不上的嘴形。

  • 聲音來自演員本人的演出。配音不是文字轉語音:它以原始音訊為輸入,保留說話者的身份和表達方式。
  • 臉部重新演出:眼睛、眉毛、面頰、頭部,不只是嘴唇。整張臉都在演出新語言,觀眾看到的嘴形跟聽到的話一致(AI 唇形同步:是甚麼、欠甚麼、甚麼更好(2026))。
  • 場景在配音後依然完整。笑聲、音樂和低音、音效、環境聲;模型判定為音樂的段落原樣通過。
  • 鏡頭前每個人都會配音,各自用自己的聲音;/demos 上那段三人電影場景,就是英語配成西班牙語。咪高峰擋著嘴,手掠過臉:模型明白甚麼在遮擋。
  • 名字、地名和口頭禪完全照原話保留,靠的是製作公司自己掌控的不翻譯清單;笑話會在目標語言重寫落地。
  • 一次渲染就帶齊翻譯、演員的聲音、場景聲音和唇形同步。

04.製作公司怎樣運作?

  • 渲染前先審閱,按語言放行。流程會在審閱步驟暫停,製作公司自己的譯者修改任何一句譯文;每種語言各自確認後才渲染,西班牙語今天就可上線,其餘語言待各自的審閱人員簽核後渲染(文字稿與審閱)。
  • 一句背景簡介。說明鏡頭前是誰、這是甚麼節目,可在創作者層級為整部劇集設定,也可在任務層級為單集設定;較窄的層級優先(背景簡介)。
  • 不翻譯清單同樣有這三個層級,角色名字或口頭禪在第 60 集跟第 1 集一模一樣(不翻譯清單)。
  • Webhook。翻譯就緒時發出 dub.ready_for_review,每種語言完成時發出 dub.output_ready(Webhook)。
  • 30 種語言,任意互譯,分三個公開的質素級別,最佳在前(語言)。
  • 參考價格。完整的人工配音,翻譯加聲音,每分鐘成片要 $70 至 $150;Familiar 以 Studio 合約提供,按內容庫規模定制。
每種語言交付甚麼 · 每條配音都附帶完整檔案
交付項目格式備註
成品影片完整混音的 mp4可直接發佈
字幕.srt 和 .vtt根據審閱過的文字稿生成;不單獨出售
獨立音訊完整混音,或只有人聲供製作公司自行混音
標題和描述每種語言各自翻譯連結、@帳號、#標籤和章節原樣保留

05.簽下整季之前,製作公司應該測試甚麼?

  • 挑最難的一集:對白快、有笑話、有情緒轉折、有專有名詞、對白下壓著音樂;一段乾淨的場景證明不了一整季。
  • 在任何人試聽之前先寫好驗收標準。母語審閱人員據此為譯文、聲音、場景和臉部評分,並標出觀眾出戲的一刻;評分表見如何進行 AI 配音試行(2026)
  • 加入一次後期改動。母版一旦改動,就是一次新的配音請求;改動的台詞在審閱步驟核對,不翻譯清單和背景簡介自動沿用。

常見問題

為何海外觀眾說配音不對勁?

三件事脫節了:聲音屬於一個陌生人,嘴仍在說原文語言,對白之下的音樂和環境聲被壓平。觀眾很少說得出原因;但嘴形跟聲音對不上,說話就更難聽懂。

問題出在翻譯還是聲音?

兩者皆是,而且會疊加:逐句直譯即使正確也讀來生硬,換掉的聲音則抹去了演員本人。在配對片段上,Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%;在另一項獨立研究中,它的翻譯達到專業譯者初稿質素的 100.3%,旗鼓相當。

我們自己的譯者仍可審閱台詞嗎?

可以。流程會在審閱步驟暫停,任何一句譯文都可在渲染前修改,每種語言待其審閱人員簽核後才渲染:日語仍在審閱時,西班牙語已可上線。

角色名字和口頭禪能跨集保持一致嗎?

可以。不翻譯清單令名字、地名和口頭禪在配音、字幕以及翻譯好的標題和描述裡完全照原話保留。在創作者層級設定,覆蓋整部劇集的每一集;任務層級的條目只對某一次上載生效。

每種語言我們會收到甚麼?

完整混音的成品影片、根據審閱過的文字稿生成的 .srt 和 .vtt 字幕、翻譯好的標題和描述,以及獨立音訊:完整混音,或只有人聲,供製作公司自行混音。

參考資料

  1. [1]Familiar vs ElevenLabs 基準測試:完整結果、置信區間與試聽範例
  2. [2]Familiar vs 人工翻譯:翻譯質素研究
  3. [3]文字稿與審閱:審閱步驟與按語言渲染(API 文件)
  4. [4]影片翻譯真正重要的是甚麼(四大問題)
  5. [5]McGurk & MacDonald, “Hearing lips and seeing voices,” Nature 264 (1976)

配音終於好了。先看實測數據,再跟團隊談談你的內容庫。

FAMILIAR · 發佈影片 · 2:31