簡短回答
重點摘要
- 試行是配對的:相同的來源片段經過現行流程和候選方案,配成兩三種目標語言。
- 驗收標準在任何人試聽之前寫好:每個維度一個合格線,六個量度維度加兩行營運指標。
- 母語審閱人員在形式允許時盲測評分,並標出出戲的那一秒。
- 審閱步驟點算修改:審閱人員在渲染前改了多少句譯文,屬於哪一類。
- 兩項營運指標與質素並列:每集的修改輪次,以及從來源改動到替換版本獲批准的時間。
01.試行是為了甚麼?
示範展示的是供應商最好的片段。試行展示的是買方最難的片段經過兩套流程的結果。
- 單位是一個決定。試行回答的是一季、一個內容庫或一個創作者網絡能否轉過去;一段乾淨的場景說明不了第六十集。
- 合格線先定。在任何人試聽之前定好的標準,不會偏向在場的人碰巧喜歡的那條配音。
- 設計是公開的。Familiar 在 /benchmark 的配對研究用的就是它;試行在買方自己的片段上重跑一次。
02.放哪些片段進去?
- 劇集要用連續幾集。兩三集連續劇集,有貫穿的主角,這樣聲音、名字和敬稱的連貫性才能跨集測試。
- 會令配音失手的場景。快對白、笑話、情緒轉折、專有名詞、對白下的音樂,以及鏡頭前兩三個人搶著說話。
- 一次後期改動。第一次配音之後再提交一句改動的台詞或重新剪接的場景;來源一改,就是一次新的配音請求,在審閱步驟核對。
- 兩三種優先語言,選自 /docs/languages 公開的三個質素級別,最佳級別先行。
03.驗收標準寫甚麼?
母語審閱人員在每段片段回答的一個問題、每個維度一個合格線,以及 Familiar 的基準測試量度同一件事所用的指標。
| 維度 | 審閱人員的問題 | Familiar 基準測試的量度 |
|---|---|---|
| 口語意思 | 這句話說的跟原話一樣嗎?由母語者或回譯核對。 | 每個輸出對照一個已批准的目標意思計算重要翻譯錯誤 |
| 聲音複製 | 閉上眼:這是同一個人嗎? | 對真人說話者的說話者相似度 |
| 場景聲音 | 音樂、笑聲和環境聲仍在新語音之下嗎? | 對照來源場景的背景聲音錯誤,以 dB 計 |
| 臉部 | 嘴和整張臉都跟新的話吻合嗎,鏡頭前每位說話者都如此? | 以配對試聽範例評判;音訊指標不評這一項,只處理音訊的工具跳過這個維度 |
| 聲音事件和時間點 | 笑聲、嘆息和反應是否在原來的位置、以原來的方式出現? | 事件形態相關性;瞬態時間 F1 |
| 覆蓋率 | 工具是否接受每段片段、每種長度、每種要求的語言? | 被拒絕的片段在該片段計零分;最短時長和批次上限都計入不利 |
| 修改輪次 | 每種語言批准之前經過多少輪? | 不在基準測試內;試行中按集點算 |
| 替換版本獲批准所需時間 | 從後期改動到替換配音獲批准要多久? | 不在基準測試內;在那次後期改動上計時一次 |
- 合格線是一個數字。名字和數字零翻譯錯誤;四位審閱人員中三位閉眼能認出說話者;沒有任何場景音樂中斷;每集一輪修改。
04.怎樣進行?
- 配對且黑盒。每段來源片段和每種目標語言都經過兩套流程,只評判最終的配音,一如公開的方法只評判最終音訊。
- 形式允許時盲測。偏好評分會偏向聽起來熟悉的一方;站得住的記錄,是出戲的那一秒,以及是甚麼令人出戲。
- 目標語言評審小組與內部審閱人員並行。外部人員捉到俚語、語域和落地遲了的笑話;內部人員捉到名字或公司內部用語。
- 審閱步驟就是修改計數器。流程會為審閱人員暫停,所以他們一直在環節之內:任何一句譯文都可在審閱步驟渲染前修改,改動的句數和類別就是質素指標。
- 為每句改動標記類別。類別顯示出不翻譯清單和一句背景簡介在第二輪本可避免甚麼。
05.結果怎樣解讀?
跨片段類型和跨語言都站得住的進步才算數;音樂場景或快速剪接段落可能需要自己的門檻。
- 片段類型分行報告。乾淨的單機位場景和快速剪接場景平均在一起,會掩蓋決定整個內容庫的那一行。
- 按語言報告。三種語言中兩種有進步,就是一份兩種語言的合約,直至第三種重測。
- 點算營運指標。每集的修改輪次,以及從來源改動到替換版本獲批准的時間,決定每日上線的排期能否守住。
- 公開數字是參考;試行才是證明。Familiar 在相同維度的結果:
ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。
ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 11.92 vs 3.22 dB · 2026 年 8 月 5 日Familiar 的聲音像真人說話者的程度高 27.8%;測試的 11 種語言全部更接近。
ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 0.4605 vs 0.3604 · 2026 年 8 月 5 日Familiar 的重要翻譯錯誤少 54.7%(29 次 vs 64 次)。
ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 與 270% 相同的樣本組 · 2026 年 8 月 5 日Familiar 生產流程的翻譯與專業譯者初稿的質素旗鼓相當,法語、中文、印地語、印尼語平均計算。
生產流程翻譯研究 vs 專業譯者初稿 · 四種語言 · 2026 年 8 月06.從試行到合約
以 Studio 合約提供,按內容庫規模定制,已簽署的年度合約享 30 日退款保證;試行的語言成為合約的首批語言。
常見問題
AI 配音試行應該做多久?
足以把連續幾集配成兩三種語言、由母語者審閱,並處理一次後期改動。兩三集連續劇集配上貫穿的主角,既測質素,也測連貫性。
配音試行應該量度甚麼?
六個維度,每個由母語審閱人員按事先寫好的標準評分:口語意思、聲音、場景聲音、臉部、時間點和覆蓋率。旁邊還有兩行營運指標:每集的修改輪次,以及從來源改動到替換版本獲批准的時間。
審閱人員應該知道哪條配音是哪家的嗎?
形式允許時應該盲測。偏好評分會偏向聽起來熟悉的一方,所以有用的記錄是出戲的一刻:時間戳,以及令人出戲的是笑話、名字、聲音,還是兩個人同時說話。
審閱步驟可以納入試行嗎?
可以。Familiar 的流程會在審閱步驟暫停,任何一句譯文都可在渲染前修改;審閱人員改動的句數和類別就是質素指標,修改會落入成品配音。直播配音即時翻譯,沒有審閱步驟。
Familiar 在相同維度公開了甚麼?
2026 年 8 月的配對研究。ElevenLabs Dubbing v2 (Alpha) 的背景聲音錯誤多 270%:笑聲、音樂、環境聲。Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%,測試的 11 種語言全部更接近。Familiar 的翻譯在法語、中文、印地語、印尼語達到專業譯者初稿質素的 100.3%,旗鼓相當。
參考資料
配音終於好了。先看實測數據,再跟團隊談談你的內容庫。
FAMILIAR · 發佈影片 · 2:31
