簡短回答
重點摘要
- 只處理音訊的流程會把重疊的說話者撞成一個聲音,所以三人對話的場景是電影公司該做的第一個測試。
- 以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲(111 組配對輸出,2026 年 8 月 5 日)。
- Familiar 生產流程的翻譯,在法語、中文、印地語、印尼語達到專業譯者初稿質素的 100.3%,旗鼓相當。
- 電影公司在渲染前的審閱步驟修改任何一句譯文,不翻譯清單令角色名字和口頭禪完全照原話保留。
01.電影配音必須留住甚麼?
一個電影場景把所有難題疊在一起:幾位演員你一句我一句,對白之下有配樂,環境聲要跨越剪接點連貫不斷,而觀眾早已熟悉每位演員的聲音。
- 聲音。配音不是文字轉語音:它以演員錄下的台詞為輸入,保留身份和表達方式。
- 整個演出。觀眾邊聽邊讀唇,仍照原文語言開合的嘴,在每一格畫面都跟新台詞作對;演員演一句台詞,用的也是整張臉:眼睛、眉毛、面頰、頭部(AI 唇形同步:是甚麼、欠甚麼、甚麼更好(2026))。
- 場景。配樂、環境聲、音效和人群聲留在對白之下:判定為音樂的段落絕不配音,底噪在新語音之下完整保留。
- 每位說話者。鏡頭前每個人都會配音,各自用自己的聲音;只處理音訊的流程會把重疊的說話者撞成一個聲音(雞尾酒會問題)。
- 台詞。配音需要一份用目標語言重寫的劇本:笑話重新落地,角色名字和口頭禪完全照原話保留(影片翻譯真正重要的是甚麼)。
02.怎樣評判?
六個維度的評分表和配對方法見全球最好的 AI 配音:如何量度;一個電影場景把它們壓縮成五個問題。
| 準則 | 電影公司會問的問題 | Familiar 的基準測試如何量度 |
|---|---|---|
| 每位說話者保留自己的聲音 | 閉上眼:鏡頭前每位演員仍是同一個人嗎,包括兩人同時說話的時候? | 配音對真人說話者的說話者相似度,按來源片段和目標語言計算(ElevenLabs Dubbing v1 研究,11 種語言);重疊說話者相撞在相同片段審核中記錄為一類缺陷 |
| 臉部演出台詞 | 嘴、眼睛、眉毛、面頰和頭部都在說新台詞,還是只有嘴唇? | 在相同片段上並排比較;公開的研究只比較最終音訊,所以只處理音訊的工具跳過這一行 |
| 場景完整保留 | 配樂仍在對白之下嗎?環境聲呢?音效呢? | 對照來源場景的背景聲音錯誤,以 dB 計(ElevenLabs Dubbing v2 (Alpha) 研究) |
| 台詞傳達原意 | 每一句都說出劇本的意思嗎?笑話落地了嗎?角色的名字保住了嗎? | 每個輸出對照一個已批准的意思計算重要翻譯錯誤(ElevenLabs Dubbing v2 (Alpha) 研究);翻譯質素以專家修訂稿為標準盲測評分(人工翻譯研究) |
| 有量度,有公開 | 相同片段經過每套系統、樣本組凍結、數據公開嗎? | 配對黑盒研究,附置信區間、試聽範例和凍結樣本組,公開於 thefamiliarlab.com/benchmark |
- 參考渲染。一段三人審訊場景,英語配成西班牙語,在 /demos 與原片並排播放;那裡另一段並排比較,咪高峰擋著嘴,手掠過臉:模型明白甚麼在遮擋。
03.量度了甚麼?
Familiar 的研究是配對且黑盒的:相同的來源片段經過每套系統,只比較最終音訊,每個樣本組保持凍結和獨立。
ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。
ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日Familiar 的聲音像真人說話者的程度高 27.8%;測試的 11 種語言全部更接近。
ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日Familiar 生產流程的翻譯與專業譯者初稿的質素旗鼓相當,法語、中文、印地語、印尼語平均計算,以專家修訂稿為標準盲測評分。
生產流程翻譯研究 vs 專業譯者初稿 · 法語、中文、印地語、印尼語 · 2026 年 8 月- 台詞,同一樣本組。在相同的 111 組配對輸出中,Familiar 的重要翻譯錯誤比 ElevenLabs Dubbing v2 (Alpha) 少 54.7%,29 次 vs 64 次。
04.電影公司仍掌控甚麼?
- 每一句。流程會在審閱步驟暫停,任何一句譯文都可在渲染前修改,每種語言待其審閱人員簽核後才渲染(文字稿與審閱)。
- 名字和口頭禪。不翻譯清單令角色名字、地名和招牌台詞在配音、字幕以及翻譯好的標題和描述中完全照原話保留;一句背景簡介說明鏡頭前是誰、這是甚麼電影(不翻譯清單)。
- 聲音。聲音來自演員在該場景的演出本身;沒有選角步驟。
- 語言。一個來源渲染成最多 29 種目標語言,來源可以是 30 種任何一種,分三個公開的質素級別,最佳在前(語言)。
- 每種語言的交付項目。成品影片、根據審閱過的文字稿生成的 .srt 和 .vtt 字幕、翻譯好的標題和描述,以及獨立的音訊檔:完整混音,或只有人聲,供電影公司自行混音(輸出)。
- 權利。權利確認記錄在任務上。
05.簽下整個內容庫之前
- 挑最難的場景。三位說話者、對白之下有配樂、有笑話、有咪高峰或手擋著嘴。
- 先寫好驗收標準。表 01 就是評分表;母語審閱人員在任何人聽到候選方案之前,用電影公司自己的片段為每種語言盲測評分。
- 加入一次後期改動。第一次渲染後改一句,經審閱步驟再跑一次;審閱人員改動的句數本身就是質素指標。
- 以試行方式進行。配對設計、連續的場景、兩三種優先語言:如何進行 AI 配音試行(2026)。
- 取得使用權。以 Studio 合約提供,按內容庫規模定制;已簽署的年度合約享 30 日退款保證。
常見問題
場景裡每位演員都保留自己的聲音嗎?
是。鏡頭前每個人都會配音,各自用自己的聲音。在 11 種語言、418 組配對輸出上對比 ElevenLabs Dubbing v1,Familiar 的聲音像真人說話者的程度高 27.8%,11 種語言全部更接近。
配樂在配音後還在嗎?
在。判定為音樂的段落絕不配音,對白之下的底噪完整保留:配樂、環境聲、音效。以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%(11.92 vs 3.22 dB;111 組配對輸出,2026 年 8 月 5 日)。
聲音對了,嘴形為何仍然重要?
觀眾會結合唇部動作和聲音來理解說話;兩者不吻合時,理解會變得困難,甚至會聽成另一個音(麥格克效應,McGurk & MacDonald,Nature,1976)。只配聲音的配音,把這種不吻合留在每一格畫面裡;Familiar 把聲音和唇形同步一起渲染。
作為參考,完整的人工配音要多少錢?
完整的人工配音,翻譯加聲音,每種語言每分鐘成片要 $70 至 $150:翻譯按公開的每字收費計算,每分鐘口語 $22 至 $45,加上聲音和錄音室 $39 至 $94。Familiar 一次渲染就帶齊翻譯、演員的聲音、場景聲音和唇形同步;以 Studio 合約提供。
參考資料
配音終於好了。先看實測數據,再跟團隊談談你的內容庫。
FAMILIAR · 發佈影片 · 2:31
