試行指南

如何進行 AI 配音試行(2026)

FAMILIAR 研究全部文章

簡短回答

AI 配音試行是一場配對測試:相同片段經過現行流程和候選方案,由母語審閱人員按譯文、聲音、場景、臉部和時間點評判,對照在任何人試聽之前寫好的驗收標準。試行用連續幾集進行,包括一次後期改動,並點算修改輪次。Familiar 公開自己的配對結果;試行則在買方自己的片段上核實。

重點摘要

  • 試行是配對的:相同的來源片段經過現行流程和候選方案,配成兩三種目標語言。
  • 驗收標準在任何人試聽之前寫好:每個維度一個合格線,六個量度維度加兩行營運指標。
  • 母語審閱人員在形式允許時盲測評分,並標出出戲的那一秒。
  • 審閱步驟點算修改:審閱人員在渲染前改了多少句譯文,屬於哪一類。
  • 兩項營運指標與質素並列:每集的修改輪次,以及從來源改動到替換版本獲批准的時間。

01.試行是為了甚麼?

示範展示的是供應商最好的片段。試行展示的是買方最難的片段經過兩套流程的結果。

  • 單位是一個決定。試行回答的是一季、一個內容庫或一個創作者網絡能否轉過去;一段乾淨的場景說明不了第六十集。
  • 合格線先定。在任何人試聽之前定好的標準,不會偏向在場的人碰巧喜歡的那條配音。
  • 設計是公開的。Familiar 在 /benchmark 的配對研究用的就是它;試行在買方自己的片段上重跑一次。

02.放哪些片段進去?

  • 劇集要用連續幾集。兩三集連續劇集,有貫穿的主角,這樣聲音、名字和敬稱的連貫性才能跨集測試。
  • 會令配音失手的場景。快對白、笑話、情緒轉折、專有名詞、對白下的音樂,以及鏡頭前兩三個人搶著說話。
  • 一次後期改動。第一次配音之後再提交一句改動的台詞或重新剪接的場景;來源一改,就是一次新的配音請求,在審閱步驟核對。
  • 兩三種優先語言,選自 /docs/languages 公開的三個質素級別,最佳級別先行。

03.驗收標準寫甚麼?

母語審閱人員在每段片段回答的一個問題、每個維度一個合格線,以及 Familiar 的基準測試量度同一件事所用的指標。

表 01 · 評分表 · 六個量度維度 + 兩行營運指標 · 合格線在第一次渲染前定好
維度審閱人員的問題Familiar 基準測試的量度
口語意思這句話說的跟原話一樣嗎?由母語者或回譯核對。每個輸出對照一個已批准的目標意思計算重要翻譯錯誤
聲音複製閉上眼:這是同一個人嗎?對真人說話者的說話者相似度
場景聲音音樂、笑聲和環境聲仍在新語音之下嗎?對照來源場景的背景聲音錯誤,以 dB 計
臉部嘴和整張臉都跟新的話吻合嗎,鏡頭前每位說話者都如此?以配對試聽範例評判;音訊指標不評這一項,只處理音訊的工具跳過這個維度
聲音事件和時間點笑聲、嘆息和反應是否在原來的位置、以原來的方式出現?事件形態相關性;瞬態時間 F1
覆蓋率工具是否接受每段片段、每種長度、每種要求的語言?被拒絕的片段在該片段計零分;最短時長和批次上限都計入不利
修改輪次每種語言批准之前經過多少輪?不在基準測試內;試行中按集點算
替換版本獲批准所需時間從後期改動到替換配音獲批准要多久?不在基準測試內;在那次後期改動上計時一次
  • 合格線是一個數字。名字和數字零翻譯錯誤;四位審閱人員中三位閉眼能認出說話者;沒有任何場景音樂中斷;每集一輪修改。

04.怎樣進行?

  • 配對且黑盒。每段來源片段和每種目標語言都經過兩套流程,只評判最終的配音,一如公開的方法只評判最終音訊。
  • 形式允許時盲測。偏好評分會偏向聽起來熟悉的一方;站得住的記錄,是出戲的那一秒,以及是甚麼令人出戲。
  • 目標語言評審小組與內部審閱人員並行。外部人員捉到俚語、語域和落地遲了的笑話;內部人員捉到名字或公司內部用語。
  • 審閱步驟就是修改計數器。流程會為審閱人員暫停,所以他們一直在環節之內:任何一句譯文都可在審閱步驟渲染前修改,改動的句數和類別就是質素指標。
  • 為每句改動標記類別。類別顯示出不翻譯清單和一句背景簡介在第二輪本可避免甚麼。
名字慣用語語域數字敬稱重疊說話

05.結果怎樣解讀?

跨片段類型和跨語言都站得住的進步才算數;音樂場景或快速剪接段落可能需要自己的門檻。

  • 片段類型分行報告。乾淨的單機位場景和快速剪接場景平均在一起,會掩蓋決定整個內容庫的那一行。
  • 按語言報告。三種語言中兩種有進步,就是一份兩種語言的合約,直至第三種重測。
  • 點算營運指標。每集的修改輪次,以及從來源改動到替換版本獲批准的時間,決定每日上線的排期能否守住。
  • 公開數字是參考;試行才是證明。Familiar 在相同維度的結果:
圖 01 · Familiar 公開的對比 ElevenLabs 結果 · 兩項配對黑盒研究 · 2026 年 8 月 5 日
270%

ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。

ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 11.92 vs 3.22 dB · 2026 年 8 月 5 日
+27.8%

Familiar 的聲音像真人說話者的程度高 27.8%;測試的 11 種語言全部更接近。

ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 0.4605 vs 0.3604 · 2026 年 8 月 5 日
54.7%

Familiar 的重要翻譯錯誤少 54.7%(29 次 vs 64 次)。

ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 與 270% 相同的樣本組 · 2026 年 8 月 5 日
圖 02 · Familiar 公開的對比人工翻譯結果 · 以專家修訂稿為標準盲測評分 · 2026 年 8 月
100.3%

Familiar 生產流程的翻譯與專業譯者初稿的質素旗鼓相當,法語、中文、印地語、印尼語平均計算。

生產流程翻譯研究 vs 專業譯者初稿 · 四種語言 · 2026 年 8 月

06.從試行到合約

以 Studio 合約提供,按內容庫規模定制,已簽署的年度合約享 30 日退款保證;試行的語言成為合約的首批語言。

  • 修改會延續。試行中修正的名字和字句保存在創作者層級的不翻譯清單和背景簡介;第一集正式製作由此起步。
  • 直播工作階段隨合約啟用:語言、預期的並行數量,以及在買方真實設定上透過 SRT、RTMP 或 WHIP 的一次綵排;之後廣播比原聲慢 5 至 9 秒,每位說話者都用自己的聲音。
  • 其餘實戰指南由此接手製作公司串流平台微短劇多國同步推出,以及創作者網絡

常見問題

AI 配音試行應該做多久?

足以把連續幾集配成兩三種語言、由母語者審閱,並處理一次後期改動。兩三集連續劇集配上貫穿的主角,既測質素,也測連貫性。

配音試行應該量度甚麼?

六個維度,每個由母語審閱人員按事先寫好的標準評分:口語意思、聲音、場景聲音、臉部、時間點和覆蓋率。旁邊還有兩行營運指標:每集的修改輪次,以及從來源改動到替換版本獲批准的時間。

審閱人員應該知道哪條配音是哪家的嗎?

形式允許時應該盲測。偏好評分會偏向聽起來熟悉的一方,所以有用的記錄是出戲的一刻:時間戳,以及令人出戲的是笑話、名字、聲音,還是兩個人同時說話。

審閱步驟可以納入試行嗎?

可以。Familiar 的流程會在審閱步驟暫停,任何一句譯文都可在渲染前修改;審閱人員改動的句數和類別就是質素指標,修改會落入成品配音。直播配音即時翻譯,沒有審閱步驟。

Familiar 在相同維度公開了甚麼?

2026 年 8 月的配對研究。ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%,測試的 11 種語言全部更接近。Familiar 的翻譯在法語、中文、印地語、印尼語達到專業譯者初稿質素的 100.3%,旗鼓相當。

參考資料

  1. [1]配音基準測試總覽:三項配對研究
  2. [2]全球最好的 AI 配音:如何量度(六個維度)
  3. [3]Familiar vs ElevenLabs Dubbing:兩項配對研究(方法)
  4. [4]AI 翻譯 vs 人工翻譯:與專業譯者對比測試(2026)
  5. [5]API 參考:文字稿與審閱(審閱步驟)

配音終於好了。先看實測數據,再跟團隊談談你的內容庫。

FAMILIAR · 發佈影片 · 2:31