電影實戰指南

電影最好的 AI 配音是甚麼?

FAMILIAR 研究全部文章

簡短回答

電影最好的 AI 配音留住演出:每位演員自己的聲音、跟台詞吻合的嘴形、原封不動的配樂,場景裡每位說話者都如此,而且電影公司在渲染前審閱每一句譯文。Familiar 用一個模型生成聲音、唇形同步和場景聲音,並公開實測數據:它的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%,測試的 11 種語言全部更接近。

重點摘要

  • 只處理音訊的流程會把重疊的說話者撞成一個聲音,所以三人對話的場景是電影公司該做的第一個測試。
  • 以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲(111 組配對輸出,2026 年 8 月 5 日)。
  • Familiar 生產流程的翻譯,在法語、中文、印地語、印尼語達到專業譯者初稿質素的 100.3%,旗鼓相當。
  • 電影公司在渲染前的審閱步驟修改任何一句譯文,不翻譯清單令角色名字和口頭禪完全照原話保留。

01.電影配音必須留住甚麼?

一個電影場景把所有難題疊在一起:幾位演員你一句我一句,對白之下有配樂,環境聲要跨越剪接點連貫不斷,而觀眾早已熟悉每位演員的聲音。

  • 聲音。配音不是文字轉語音:它以演員錄下的台詞為輸入,保留身份和表達方式。
  • 整個演出。觀眾邊聽邊讀唇,仍照原文語言開合的嘴,在每一格畫面都跟新台詞作對;演員演一句台詞,用的也是整張臉:眼睛、眉毛、面頰、頭部(AI 唇形同步:是甚麼、欠甚麼、甚麼更好(2026))。
  • 場景。配樂、環境聲、音效和人群聲留在對白之下:判定為音樂的段落絕不配音,底噪在新語音之下完整保留。
  • 每位說話者。鏡頭前每個人都會配音,各自用自己的聲音;只處理音訊的流程會把重疊的說話者撞成一個聲音(雞尾酒會問題)。
  • 台詞。配音需要一份用目標語言重寫的劇本:笑話重新落地,角色名字和口頭禪完全照原話保留(影片翻譯真正重要的是甚麼)。
AI 唇形同步聲音複製場景聲音多人對話場景

02.怎樣評判?

六個維度的評分表和配對方法見全球最好的 AI 配音:如何量度;一個電影場景把它們壓縮成五個問題。

表 01 · 電影配音的五項準則 · 電影公司會問的問題 · Familiar 的基準測試如何量度
準則電影公司會問的問題Familiar 的基準測試如何量度
每位說話者保留自己的聲音閉上眼:鏡頭前每位演員仍是同一個人嗎,包括兩人同時說話的時候?配音對真人說話者的說話者相似度,按來源片段和目標語言計算(ElevenLabs Dubbing v1 研究,11 種語言);重疊說話者相撞在相同片段審核中記錄為一類缺陷
臉部演出台詞嘴、眼睛、眉毛、面頰和頭部都在說新台詞,還是只有嘴唇?在相同片段上並排比較;公開的研究只比較最終音訊,所以只處理音訊的工具跳過這一行
場景完整保留配樂仍在對白之下嗎?環境聲呢?音效呢?對照來源場景的背景聲音錯誤,以 dB 計(ElevenLabs Dubbing v2 (Alpha) 研究)
台詞傳達原意每一句都說出劇本的意思嗎?笑話落地了嗎?角色的名字保住了嗎?每個輸出對照一個已批准的意思計算重要翻譯錯誤(ElevenLabs Dubbing v2 (Alpha) 研究);翻譯質素以專家修訂稿為標準盲測評分(人工翻譯研究)
有量度,有公開相同片段經過每套系統、樣本組凍結、數據公開嗎?配對黑盒研究,附置信區間、試聽範例和凍結樣本組,公開於 thefamiliarlab.com/benchmark
  • 參考渲染。一段三人審訊場景,英語配成西班牙語,在 /demos 與原片並排播放;那裡另一段並排比較,咪高峰擋著嘴,手掠過臉:模型明白甚麼在遮擋。

03.量度了甚麼?

Familiar 的研究是配對且黑盒的:相同的來源片段經過每套系統,只比較最終音訊,每個樣本組保持凍結和獨立。

圖 01 · 配對研究 · 相同來源片段經過每套系統 · 2026 年 8 月
270%

ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。

ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日
+27.8%

Familiar 的聲音像真人說話者的程度高 27.8%;測試的 11 種語言全部更接近。

ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日
100.3%

Familiar 生產流程的翻譯與專業譯者初稿的質素旗鼓相當,法語、中文、印地語、印尼語平均計算,以專家修訂稿為標準盲測評分。

生產流程翻譯研究 vs 專業譯者初稿 · 法語、中文、印地語、印尼語 · 2026 年 8 月
  • 台詞,同一樣本組。在相同的 111 組配對輸出中,Familiar 的重要翻譯錯誤比 ElevenLabs Dubbing v2 (Alpha) 少 54.7%,29 次 vs 64 次。

04.電影公司仍掌控甚麼?

  • 每一句。流程會在審閱步驟暫停,任何一句譯文都可在渲染前修改,每種語言待其審閱人員簽核後才渲染(文字稿與審閱)。
  • 名字和口頭禪。不翻譯清單令角色名字、地名和招牌台詞在配音、字幕以及翻譯好的標題和描述中完全照原話保留;一句背景簡介說明鏡頭前是誰、這是甚麼電影(不翻譯清單)。
  • 聲音。聲音來自演員在該場景的演出本身;沒有選角步驟。
  • 語言。一個來源渲染成最多 29 種目標語言,來源可以是 30 種任何一種,分三個公開的質素級別,最佳在前(語言)。
  • 每種語言的交付項目。成品影片、根據審閱過的文字稿生成的 .srt 和 .vtt 字幕、翻譯好的標題和描述,以及獨立的音訊檔:完整混音,或只有人聲,供電影公司自行混音(輸出)。
  • 權利。權利確認記錄在任務上。

05.簽下整個內容庫之前

  • 挑最難的場景。三位說話者、對白之下有配樂、有笑話、有咪高峰或手擋著嘴。
  • 先寫好驗收標準。表 01 就是評分表;母語審閱人員在任何人聽到候選方案之前,用電影公司自己的片段為每種語言盲測評分。
  • 加入一次後期改動。第一次渲染後改一句,經審閱步驟再跑一次;審閱人員改動的句數本身就是質素指標。
  • 以試行方式進行。配對設計、連續的場景、兩三種優先語言:如何進行 AI 配音試行(2026)
  • 取得使用權。以 Studio 合約提供,按內容庫規模定制;已簽署的年度合約享 30 日退款保證。

常見問題

場景裡每位演員都保留自己的聲音嗎?

是。鏡頭前每個人都會配音,各自用自己的聲音。在 11 種語言、418 組配對輸出上對比 ElevenLabs Dubbing v1,Familiar 的聲音像真人說話者的程度高 27.8%,11 種語言全部更接近。

配樂在配音後還在嗎?

在。判定為音樂的段落絕不配音,對白之下的底噪完整保留:配樂、環境聲、音效。以相同片段測試,ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%(11.92 vs 3.22 dB;111 組配對輸出,2026 年 8 月 5 日)。

聲音對了,嘴形為何仍然重要?

觀眾會結合唇部動作和聲音來理解說話;兩者不吻合時,理解會變得困難,甚至會聽成另一個音(麥格克效應,McGurk & MacDonald,Nature,1976)。只配聲音的配音,把這種不吻合留在每一格畫面裡;Familiar 把聲音和唇形同步一起渲染。

作為參考,完整的人工配音要多少錢?

完整的人工配音,翻譯加聲音,每種語言每分鐘成片要 $70 至 $150:翻譯按公開的每字收費計算,每分鐘口語 $22 至 $45,加上聲音和錄音室 $39 至 $94。Familiar 一次渲染就帶齊翻譯、演員的聲音、場景聲音和唇形同步;以 Studio 合約提供。

參考資料

  1. [1]Familiar vs ElevenLabs 基準測試:完整結果、置信區間與試聽範例
  2. [2]Familiar vs 人工翻譯:以專家修訂稿為標準盲測評分的翻譯質素,以及價格
  3. [3]全球最好的 AI 配音:如何量度
  4. [4]配音在海外為何不對勁?製作公司如何解決
  5. [5]如何進行 AI 配音試行(2026)
  6. [6]McGurk & MacDonald, "Hearing lips and seeing voices," Nature 264, 746–748 (1976)

配音終於好了。先看實測數據,再跟團隊談談你的內容庫。

FAMILIAR · 發佈影片 · 2:31