简短回答
要点速览
- 试点是成对的:同一批源片段分别走现有流程和候选方案,配成两到三种目标语言。
- 验收标准在任何人试听之前写好:每个维度一条及格线,六个实测维度加两行运营指标。
- 母语审校人员在形式允许时盲评,并标出观众出戏的那一秒。
- 审核环节负责统计修改:审校人员在渲染前改了多少句译文,属于哪一类。
- 两项运营指标与质量并列:每集的修改轮次,以及从源片改动到替换版通过验收所用的时间。
01.试点是为了什么?
演示展示的是供应商最好的片段。试点展示的是买方最难的素材走完两套流程。
- 单位是一个决策。试点回答的是一季剧、一个片库或一家 MCN 机构能不能迁移;一段干净的场景说明不了第六十集。
- 及格线先定。在任何人试听之前定下的标准,不会随着房间里的人碰巧喜欢哪条配音而漂移。
- 设计是公开的。Familiar 在 /benchmark 上的成对研究用的就是它;试点在买方自己的片段上重跑一遍。
02.哪些素材放进去?
- 连续几集,针对剧集。两到三集连续剧集,有反复出场的主角,这样声音、名字和称谓的连续性都能跨集测到。
- 会毁掉配音的场景。快对白、笑点、情绪转折、专有名词、对白下的音乐,以及镜头里两三个人抢着说话。
- 一次后期改动。第一次配音后再提交一句改过的台词或一段重剪的场景;源片一改就是一次新的配音请求,在审核环节核对。
- 两到三种优先语言,从 /docs/languages 公开的三个质量梯队里选,先选最高梯队。
03.验收标准写什么?
每段片段一个由母语审校人员回答的问题,每个维度一条及格线,以及 Familiar 基准测试衡量同一件事所用的指标。
| 维度 | 审校人员的问题 | Familiar 基准测试的指标 |
|---|---|---|
| 语义 | 这句话说的是原话的意思吗?由母语者或回译来核对。 | 每条输出相对同一份批准语义的重大翻译错误数 |
| 声音克隆 | 闭上眼:这是同一个人吗? | 与说话人本人的音色还原度 |
| 场景音 | 音乐、笑声和环境音还在新语音之下吗? | 相对源场景的背景音错误,以 dB 计 |
| 面部 | 嘴和整张脸都对得上新台词吗?镜头里的每位说话人都是吗? | 在成对试听示例上评判;音频指标不打这一项,只做音频的工具跳过这一维度 |
| 声音事件与时间点 | 笑声、叹气和反应落在原来的位置、保持原来的样子吗? | 事件形态相关性;瞬态时间点 F1 |
| 覆盖率 | 工具接受了每一段片段吗?任何长度、每一种要求的语言? | 被拒绝处理的片段在该片段上计零分;最短时长限制和每批数量上限都算扣分 |
| 修改轮次 | 每种语言通过验收之前,改了几轮? | 不在基准测试里;试点中按集统计 |
| 替换版通过验收所用的时间 | 从后期改动到替换配音通过验收,用了多久? | 不在基准测试里;在那次后期改动上计时一次 |
- 及格线是一个数字。名字和数字零翻译错误;四位审校人员中有三位闭眼能认出说话人;没有任何一个场景丢掉音乐;每集一轮修改。
04.怎么跑?
- 成对且黑盒。每段源片段的每种目标语言都走两套流程,只评判最终配音,就像公开方法只评判最终音频。
- 形式允许时盲评。偏好评分会向听着顺耳的那一方漂移;站得住的记录是观众出戏的那一秒,以及是什么让他出戏。
- 目标语言评审组与内部审校并行。外部人抓俚语、语体和落地晚了的笑话;内部人抓名字和内部术语。
- 审核环节就是修改计数器。审校人员始终在环路里,因为流程会为他们暂停:任何一句译文都在审核环节于渲染前修改,改动句子的数量和类别就是质量指标。
- 给每一句改动打标签。这些类别说明,第二轮里一份「不翻译清单」和一句一句话说明本可以避免什么。
05.结果怎么读?
一项提升要在各种素材类型和语言上都成立才算数;音乐场景或快速切换镜头的段落,可能需要各自的阈值。
- 素材类型分行报告。干净的单机位场景和快速切换镜头的场景平均在一起,会掩盖那一行决定整个片库的数据。
- 按语言报告。三种语言里两种有提升,那就是一份两种语言的合约,直到第三种重测为止。
- 统计运营指标。每集的修改轮次,以及从源片改动到替换版通过验收所用的时间,决定日更排期能否成立。
- 公开数据是参照,试点才是证据。Familiar 在同样维度上的结果:
ElevenLabs 的背景音错误多出 270%:笑声、音乐、环境音。
ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 11.92 vs 3.22 dB · 2026 年 8 月 5 日Familiar 的音色还原度高出 27.8%;全部 11 种语言都更接近说话人本人。
ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 0.4605 vs 0.3604 · 2026 年 8 月 5 日Familiar 的重大翻译错误少 54.7%(29 次 vs 64 次)。
ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 与 270% 相同的样本集 · 2026 年 8 月 5 日Familiar 正式产品的翻译与专业译者初译的质量打平,在法语、中文、印地语、印尼语上取平均。
正式产品翻译研究 vs 专业译者初译 · 四种语言 · 2026 年 8 月06.从试点到合约
以 Studio 合约提供,按片库规模定制,签订年度合约可享 30 天退款保证;试点用过的语言成为合约的首批语言。
常见问题
AI 配音试点该做多久?
足够把连续几集配成两到三种语言、由母语者审校一遍,并处理一次后期改动。两到三集有反复出场主角的连续剧集,既测连续性也测质量。
配音试点该测什么?
六个维度,每一项由母语审校人员对照在任何人试听之前写好的标准打分:语义、声音、场景音、面部、时间点和覆盖率。另有两行运营指标并列:每集的修改轮次,以及从源片改动到替换版通过验收所用的时间。
审校人员该知道哪条配音是谁的吗?
形式允许时盲评。偏好评分会向听着顺耳的那一方漂移,所以有用的记录是观众出戏的那一刻:时间戳,以及是笑话、名字、声音,还是两个人同时说话让他出戏。
审核环节可以纳入试点吗?
可以。Familiar 的流程会在审核环节暂停,任何一句译文都能在渲染前修改;审校人员改动句子的数量和类别是质量指标,改动会进入最终配音。直播配音是实时生成的,没有审核环节。
在同样的维度上,Familiar 公开了什么?
2026 年 8 月的成对研究。ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音。对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%,全部 11 种语言都更接近说话人本人。Familiar 的翻译在法语、中文、印地语、印尼语上与专业译者初译打平,达到 100.3%。
参考资料
配音终于像样了。先看实测数据,再和团队聊聊你的片库。
FAMILIAR · 发布视频 · 2:31
