简短回答
要点速览
- 三个缺陷让配音显得别扭:陌生人的声音、还在说原语言的嘴,以及被新对白压平的场景。
- 同一批片段实测,ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音(111 组成对输出,2026 年 8 月 5 日)。
- 对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%,全部 11 种语言都更接近说话人本人(418 组成对输出,2026 年 8 月 5 日)。
- 片方自己的译者可以在渲染前修改任何一句译文,每种语言各自确认后才渲染。
01.配音为什么显得别扭?
其中两个缺陷比 AI 更古老:配音演员同样是一个陌生人的声音,而任何录音棚都动不了演员的嘴。只换声音的 AI 配音还可能添上第三个:被压平的场景,下文有实测。
- 陌生人的声音。无论是配音演员还是素材库里的声音在念台词,熟悉这位演员的人都认不出他了(AI 视频配音详解(2026))。
- 说着另一种语言的嘴。大脑要把口型和声音合在一起,才能听懂别人说话;两者一旦对不上,理解就会变得吃力,甚至会听成完全不同的音:这就是麦格克效应,属于视听言语整合现象。只换声音的配音,等于把这种错位留在每一帧画面里。
- 被压平的场景。笑声、音乐、音效和环境音,在新的语音之下被剥掉或抹糊。
- 逐句直译。一句话逐字对应地译过来,即使正确也读着生硬,笑话要么落地晚了,要么根本落不了地(视频翻译真正重要的是什么)。
02.实测数据怎么说?
ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音。
11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 2026 年 8 月 5 日对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%;全部 11 种语言都更接近说话人本人。
0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 2026 年 8 月 5 日相当于专业译者初译的质量,在法语、中文、印地语、印尼语上取平均,对照专家修订的参考译文盲评打分。打平。
正式产品翻译研究 vs 专业译者初译 · 2026 年 8 月两组 ElevenLabs 样本与人工翻译研究从不合并计算。完整数据、置信区间和试听示例:Familiar vs ElevenLabs 与 vs 专业译者;方法见 AI 翻译 vs 人工翻译:与专业译者同场测试(2026)。
- 译文,ElevenLabs Dubbing v2 (Alpha)。Familiar 的重大翻译错误少 54.7%(29 次 vs 64 次)。
- 语音输出错误,ElevenLabs Dubbing v1。Familiar 被审核标记的语音输出错误少 48.8%(132 次 vs 258 次)。
03.声音、口型和场景出自同一个模型,会有什么不同?
一个统一模型把声音、口型和场景一起生成,读得懂场景与世界,也让每个人的身份始终一致,所以演员本人的演绎原样保留,而不是陌生人的声音配一张口型对不上的脸。
- 声音来自演员本人的演绎。配音不是文字转语音:它以原始音频为输入,保留说话人的身份与演绎方式。
- 面部重新演绎:眼神、眉毛、脸颊、头部,不只是嘴。整张脸都在演绎新的语言,观众看到的口型和听到的话对得上(AI 口型同步:是什么、缺什么、什么更好(2026))。
- 场景在配音后依然完整。笑声、音乐和低音、音效、环境音;模型识别为音乐的片段原样直通。
- 镜头里的每个人都会被配音,各用自己的声音;/demos 上那段三人电影场景就是英语配成西班牙语。麦克风挡在嘴前,手从脸前划过:模型读得懂遮挡。
- 名字、地名和口头禅完全按原话保留,靠的是片方自己掌控的「不翻译清单」;笑话在目标语言里重新改写落地。
- 一次渲染就带上翻译、演员的声音、场景音和口型同步。
04.影视公司怎么用?
- 渲染前先审核,按语言分别放行。流程会在审核环节暂停,片方自己的译者可以编辑任何一句译文;每种语言各自确认后才渲染,西班牙语今天就能上,其余语言等各自的审校人员签字后再渲染(转写与审核)。
- 一句话说明。说清谁在镜头里、这是部什么剧,可以在创作者层级为整部剧设置,也可以在任务层级为单集设置;更具体的层级优先(一句话说明)。
- 「不翻译清单」同样有这三个层级,角色名和口头禅在第 60 集和第 1 集里一模一样(不翻译清单)。
- Webhook。翻译就绪时推送 dub.ready_for_review,每种语言完成时推送 dub.output_ready(Webhook)。
- 30 种语言,任意互译,按公开的三个质量梯队从高到低排列(语言)。
- 参考价格。翻译加真人配音的整套人工配音,成片每分钟要 $70 到 $150;Familiar 以 Studio 合约提供,按片库规模定制。
| 交付物 | 格式 | 说明 |
|---|---|---|
| 成片 | 带完整混音的 mp4 | 可直接发布 |
| 字幕 | .srt 和 .vtt | 由审核过的译稿生成;不单独出售 |
| 独立音频 | 完整混音,或只含人声的音轨 | 供片方自行混音 |
| 标题和简介 | 每种语言各自译好 | 链接、@账号、#话题标签和章节原样保留 |
05.整季签约之前,影视公司该测什么?
- 挑最难的一集:对白快、有笑点、有情绪转折、有专有名词、对白下压着音乐;一段干净的场景证明不了一整季。
- 在任何人试听之前先写好验收标准。母语审校人员据此为译文、声音、场景和面部打分,并标出观众出戏的那一刻;评分表见如何做一次 AI 配音试点(2026)。
- 放进一次后期改动。母版一旦改动,就是一次新的配音请求;改动的台词在审核环节核对,「不翻译清单」和一句话说明会自动沿用。
常见问题
为什么海外观众说配音显得别扭?
三件事脱节了:声音属于一个陌生人,嘴还在说原语言,对白之下的音乐和环境音被压平。观众很少能说出原因;但口型和声音对不上,话就更难听懂。
问题出在翻译还是声音?
两者都有,而且会叠加:逐句直译即使正确也读着生硬,换掉的声音则把演员本人抹掉了。在成对片段上,对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%;另一项独立研究中,它的翻译达到专业译者初译质量的 100.3%,打平。
我们自己的译者还能审稿吗?
可以。流程会在审核环节暂停,任何一句译文都能在渲染前修改,每种语言在其审校人员签字后才渲染:日语还在审核时,西班牙语已经可以上线。
角色名和口头禅能跨集保持一致吗?
可以。「不翻译清单」让名字、地名和口头禅在配音、字幕以及译好的标题和简介里完全按原话保留。在创作者层级设置,覆盖整部剧的每一集;任务层级的条目只对某一次上传生效。
每种语言我们能拿到什么?
带完整混音的成片、由审核过的译稿生成的 .srt 和 .vtt 字幕、译好的标题和简介,以及独立音频:完整混音,或只含人声的音轨,供片方自行混音。
参考资料
配音终于像样了。先看实测数据,再和团队聊聊你的片库。
FAMILIAR · 发布视频 · 2:31
