影视公司实操指南

为什么配音在海外显得别扭,影视公司如何解决

FAMILIAR 研究全部文章

简短回答

配音显得别扭,是三件事同时脱节:陌生人的声音替换了演员本人,嘴还在说原语言,对白之下的音乐和环境音被压平。解决办法是把三者一起配。Familiar 用一个模型,在一次渲染中保留每位演员自己的声音、让面部重新演绎,并完整保留场景音;任何一句译文都可以在渲染前修改。

要点速览

  • 三个缺陷让配音显得别扭:陌生人的声音、还在说原语言的嘴,以及被新对白压平的场景。
  • 同一批片段实测,ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音(111 组成对输出,2026 年 8 月 5 日)。
  • 对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%,全部 11 种语言都更接近说话人本人(418 组成对输出,2026 年 8 月 5 日)。
  • 片方自己的译者可以在渲染前修改任何一句译文,每种语言各自确认后才渲染。

01.配音为什么显得别扭?

其中两个缺陷比 AI 更古老:配音演员同样是一个陌生人的声音,而任何录音棚都动不了演员的嘴。只换声音的 AI 配音还可能添上第三个:被压平的场景,下文有实测。

  • 陌生人的声音。无论是配音演员还是素材库里的声音在念台词,熟悉这位演员的人都认不出他了(AI 视频配音详解(2026))。
  • 说着另一种语言的嘴。大脑要把口型和声音合在一起,才能听懂别人说话;两者一旦对不上,理解就会变得吃力,甚至会听成完全不同的音:这就是麦格克效应,属于视听言语整合现象。只换声音的配音,等于把这种错位留在每一帧画面里。
  • 被压平的场景。笑声、音乐、音效和环境音,在新的语音之下被剥掉或抹糊。
  • 逐句直译。一句话逐字对应地译过来,即使正确也读着生硬,笑话要么落地晚了,要么根本落不了地(视频翻译真正重要的是什么)。
陌生人的声音口型对不上场景被压平逐句直译

02.实测数据怎么说?

图 01 · 成对研究 · 同一批源片段 · 只比较最终音频 · 2026 年 8 月
270%

ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音。

11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 2026 年 8 月 5 日
+27.8%

对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%;全部 11 种语言都更接近说话人本人。

0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 2026 年 8 月 5 日
100.3%

相当于专业译者初译的质量,在法语、中文、印地语、印尼语上取平均,对照专家修订的参考译文盲评打分。打平。

正式产品翻译研究 vs 专业译者初译 · 2026 年 8 月

两组 ElevenLabs 样本与人工翻译研究从不合并计算。完整数据、置信区间和试听示例:Familiar vs ElevenLabsvs 专业译者;方法见 AI 翻译 vs 人工翻译:与专业译者同场测试(2026)

  • 译文,ElevenLabs Dubbing v2 (Alpha)。Familiar 的重大翻译错误少 54.7%(29 次 vs 64 次)。
  • 语音输出错误,ElevenLabs Dubbing v1。Familiar 被审核标记的语音输出错误少 48.8%(132 次 vs 258 次)。

03.声音、口型和场景出自同一个模型,会有什么不同?

一个统一模型把声音、口型和场景一起生成,读得懂场景与世界,也让每个人的身份始终一致,所以演员本人的演绎原样保留,而不是陌生人的声音配一张口型对不上的脸。

  • 声音来自演员本人的演绎。配音不是文字转语音:它以原始音频为输入,保留说话人的身份与演绎方式。
  • 面部重新演绎:眼神、眉毛、脸颊、头部,不只是嘴。整张脸都在演绎新的语言,观众看到的口型和听到的话对得上(AI 口型同步:是什么、缺什么、什么更好(2026))。
  • 场景在配音后依然完整。笑声、音乐和低音、音效、环境音;模型识别为音乐的片段原样直通。
  • 镜头里的每个人都会被配音,各用自己的声音;/demos 上那段三人电影场景就是英语配成西班牙语。麦克风挡在嘴前,手从脸前划过:模型读得懂遮挡。
  • 名字、地名和口头禅完全按原话保留,靠的是片方自己掌控的「不翻译清单」;笑话在目标语言里重新改写落地。
  • 一次渲染就带上翻译、演员的声音、场景音和口型同步。

04.影视公司怎么用?

  • 渲染前先审核,按语言分别放行。流程会在审核环节暂停,片方自己的译者可以编辑任何一句译文;每种语言各自确认后才渲染,西班牙语今天就能上,其余语言等各自的审校人员签字后再渲染(转写与审核)。
  • 一句话说明。说清谁在镜头里、这是部什么剧,可以在创作者层级为整部剧设置,也可以在任务层级为单集设置;更具体的层级优先(一句话说明)。
  • 「不翻译清单」同样有这三个层级,角色名和口头禅在第 60 集和第 1 集里一模一样(不翻译清单)。
  • Webhook。翻译就绪时推送 dub.ready_for_review,每种语言完成时推送 dub.output_ready(Webhook)。
  • 30 种语言,任意互译,按公开的三个质量梯队从高到低排列(语言)。
  • 参考价格。翻译加真人配音的整套人工配音,成片每分钟要 $70 到 $150;Familiar 以 Studio 合约提供,按片库规模定制。
每种语言交付什么 · 每条配音都附带完整文件
交付物格式说明
成片带完整混音的 mp4可直接发布
字幕.srt 和 .vtt由审核过的译稿生成;不单独出售
独立音频完整混音,或只含人声的音轨供片方自行混音
标题和简介每种语言各自译好链接、@账号、#话题标签和章节原样保留

05.整季签约之前,影视公司该测什么?

  • 挑最难的一集:对白快、有笑点、有情绪转折、有专有名词、对白下压着音乐;一段干净的场景证明不了一整季。
  • 在任何人试听之前先写好验收标准。母语审校人员据此为译文、声音、场景和面部打分,并标出观众出戏的那一刻;评分表见如何做一次 AI 配音试点(2026)
  • 放进一次后期改动。母版一旦改动,就是一次新的配音请求;改动的台词在审核环节核对,「不翻译清单」和一句话说明会自动沿用。

常见问题

为什么海外观众说配音显得别扭?

三件事脱节了:声音属于一个陌生人,嘴还在说原语言,对白之下的音乐和环境音被压平。观众很少能说出原因;但口型和声音对不上,话就更难听懂。

问题出在翻译还是声音?

两者都有,而且会叠加:逐句直译即使正确也读着生硬,换掉的声音则把演员本人抹掉了。在成对片段上,对比 ElevenLabs Dubbing v1,Familiar 的音色还原度高出 27.8%;另一项独立研究中,它的翻译达到专业译者初译质量的 100.3%,打平。

我们自己的译者还能审稿吗?

可以。流程会在审核环节暂停,任何一句译文都能在渲染前修改,每种语言在其审校人员签字后才渲染:日语还在审核时,西班牙语已经可以上线。

角色名和口头禅能跨集保持一致吗?

可以。「不翻译清单」让名字、地名和口头禅在配音、字幕以及译好的标题和简介里完全按原话保留。在创作者层级设置,覆盖整部剧的每一集;任务层级的条目只对某一次上传生效。

每种语言我们能拿到什么?

带完整混音的成片、由审核过的译稿生成的 .srt 和 .vtt 字幕、译好的标题和简介,以及独立音频:完整混音,或只含人声的音轨,供片方自行混音。

参考资料

  1. [1]Familiar vs ElevenLabs 基准测试:完整结果、置信区间与试听示例
  2. [2]Familiar vs 专业译者:翻译质量研究
  3. [3]转写与审核:审核环节与按语言渲染(API 文档)
  4. [4]视频翻译真正重要的是什么(四大问题)
  5. [5]McGurk & MacDonald, “Hearing lips and seeing voices,” Nature 264 (1976)

配音终于像样了。先看实测数据,再和团队聊聊你的片库。

FAMILIAR · 发布视频 · 2:31