簡短回答
重點摘要
- 三個缺陷令配音不對勁:陌生人的聲音、仍在說原文語言的嘴,以及被新對白壓平的場景。
- 以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲(111 組配對輸出,2026 年 8 月 5 日)。
- Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%,測試的 11 種語言全部更接近(418 組配對輸出,2026 年 8 月 5 日)。
- 製作公司自己的譯者可在渲染前修改任何一句譯文,每種語言各自確認後才渲染。
01.配音為何不對勁?
其中兩個缺陷比 AI 更古老:配音員同樣是陌生人的聲音,而任何錄音都動不了演員的嘴。只換聲音的 AI 配音還可能加上第三個:被壓平的場景,下文有實測。
- 陌生人的聲音。無論是配音員還是聲音庫的現成聲音在讀台詞,認識這位演員的人都不再認得他(AI 影片配音詳解(2026))。
- 說著另一種語言的嘴。大腦會結合唇部動作和聲音來理解說話;兩者不吻合時,理解會變得困難,甚至會聽成另一個音:這就是麥格克效應,屬於視聽語音整合的一部分。只配聲音的配音,把這種不吻合留在每一格畫面裡。
- 被壓平的場景。笑聲、音樂、音效和環境聲,在新的語音之下被剝掉或抹糊。
- 逐句直譯。一句話逐字對應譯過來,即使正確也讀來生硬,笑話要麼遲了落地,要麼根本落不了地(影片翻譯真正重要的是甚麼)。
02.實測數據怎樣說?
ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。
11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%;測試的 11 種語言全部更接近。
0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日達到專業譯者初稿的質素,法語、中文、印地語、印尼語平均計算,以專家修訂稿為標準盲測評分。旗鼓相當。
生產流程翻譯研究 vs 專業譯者初稿 · 2026 年 8 月兩組 ElevenLabs 樣本與人工翻譯研究從不合併計算。完整數據、置信區間和試聽範例:Familiar vs ElevenLabs 及 vs 人工翻譯;方法見AI 翻譯 vs 人工翻譯:與專業譯者對比測試(2026)。
- 譯文,ElevenLabs Dubbing v2 (Alpha)。Familiar 的重要翻譯錯誤少 54.7%(29 次 vs 64 次)。
- 語音輸出錯誤,ElevenLabs Dubbing v1。Familiar 被審閱標記的語音輸出錯誤少 48.8%(132 次 vs 258 次)。
03.聲音、唇形和場景出自同一個模型,有甚麼不同?
一個統一模型同時生成聲音、唇形和場景,理解場景與世界,並保持身份的恒常,所以留住的是演員本人的演出,而不是陌生人的聲音,加上對不上的嘴形。
- 聲音來自演員本人的演出。配音不是文字轉語音:它以原始音訊為輸入,保留說話者的身份和表達方式。
- 臉部重新演出:眼睛、眉毛、面頰、頭部,不只是嘴唇。整張臉都在演出新語言,觀眾看到的嘴形跟聽到的話一致(AI 唇形同步:是甚麼、欠甚麼、甚麼更好(2026))。
- 場景在配音後依然完整。笑聲、音樂和低音、音效、環境聲;模型判定為音樂的段落原樣通過。
- 鏡頭前每個人都會配音,各自用自己的聲音;/demos 上那段三人電影場景,就是英語配成西班牙語。咪高峰擋著嘴,手掠過臉:模型明白甚麼在遮擋。
- 名字、地名和口頭禪完全照原話保留,靠的是製作公司自己掌控的不翻譯清單;笑話會在目標語言重寫落地。
- 一次渲染就帶齊翻譯、演員的聲音、場景聲音和唇形同步。
04.製作公司怎樣運作?
- 渲染前先審閱,按語言放行。流程會在審閱步驟暫停,製作公司自己的譯者修改任何一句譯文;每種語言各自確認後才渲染,西班牙語今天就可上線,其餘語言待各自的審閱人員簽核後渲染(文字稿與審閱)。
- 一句背景簡介。說明鏡頭前是誰、這是甚麼節目,可在創作者層級為整部劇集設定,也可在任務層級為單集設定;較窄的層級優先(背景簡介)。
- 不翻譯清單同樣有這三個層級,角色名字或口頭禪在第 60 集跟第 1 集一模一樣(不翻譯清單)。
- Webhook。翻譯就緒時發出 dub.ready_for_review,每種語言完成時發出 dub.output_ready(Webhook)。
- 30 種語言,任意互譯,分三個公開的質素級別,最佳在前(語言)。
- 參考價格。完整的人工配音,翻譯加聲音,每分鐘成片要 $70 至 $150;Familiar 以 Studio 合約提供,按內容庫規模定制。
| 交付項目 | 格式 | 備註 |
|---|---|---|
| 成品影片 | 完整混音的 mp4 | 可直接發佈 |
| 字幕 | .srt 和 .vtt | 根據審閱過的文字稿生成;不單獨出售 |
| 獨立音訊 | 完整混音,或只有人聲 | 供製作公司自行混音 |
| 標題和描述 | 每種語言各自翻譯 | 連結、@帳號、#標籤和章節原樣保留 |
05.簽下整季之前,製作公司應該測試甚麼?
- 挑最難的一集:對白快、有笑話、有情緒轉折、有專有名詞、對白下壓著音樂;一段乾淨的場景證明不了一整季。
- 在任何人試聽之前先寫好驗收標準。母語審閱人員據此為譯文、聲音、場景和臉部評分,並標出觀眾出戲的一刻;評分表見如何進行 AI 配音試行(2026)。
- 加入一次後期改動。母版一旦改動,就是一次新的配音請求;改動的台詞在審閱步驟核對,不翻譯清單和背景簡介自動沿用。
常見問題
為何海外觀眾說配音不對勁?
三件事脫節了:聲音屬於一個陌生人,嘴仍在說原文語言,對白之下的音樂和環境聲被壓平。觀眾很少說得出原因;但嘴形跟聲音對不上,說話就更難聽懂。
問題出在翻譯還是聲音?
兩者皆是,而且會疊加:逐句直譯即使正確也讀來生硬,換掉的聲音則抹去了演員本人。在配對片段上,Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%;在另一項獨立研究中,它的翻譯達到專業譯者初稿質素的 100.3%,旗鼓相當。
我們自己的譯者仍可審閱台詞嗎?
可以。流程會在審閱步驟暫停,任何一句譯文都可在渲染前修改,每種語言待其審閱人員簽核後才渲染:日語仍在審閱時,西班牙語已可上線。
角色名字和口頭禪能跨集保持一致嗎?
可以。不翻譯清單令名字、地名和口頭禪在配音、字幕以及翻譯好的標題和描述裡完全照原話保留。在創作者層級設定,覆蓋整部劇集的每一集;任務層級的條目只對某一次上載生效。
每種語言我們會收到甚麼?
完整混音的成品影片、根據審閱過的文字稿生成的 .srt 和 .vtt 字幕、翻譯好的標題和描述,以及獨立音訊:完整混音,或只有人聲,供製作公司自行混音。
參考資料
配音終於好了。先看實測數據,再跟團隊談談你的內容庫。
FAMILIAR · 發佈影片 · 2:31
