简短回答
要点速览
- 只处理音频的流程会把同时说话的几个人撞成一个声音,所以三人对话的场景是片方该做的第一项测试。
- 同一批片段上,ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音(111 组成对输出,2026 年 8 月 5 日)。
- Familiar 正式产品的翻译在法语、中文、印地语、印尼语上与专业译者初译打平,达到其质量的 100.3%。
- 片方在渲染前的审核环节修改任意一句译文,「不翻译清单」让角色名和口头禅完全按原话保留。
01.一部电影的配音必须保住什么?
一个电影场景把所有难点叠在一起:几位演员你来我往,配乐压在对白之下,环境音要跨越剪辑点连续不断,而观众早就知道每位演员是什么声音。
- 声音。配音不是文字转语音:它以演员录下的那句台词为输入,保留身份与演绎方式。
- 完整的表演。观众边听边读口型,一张仍按原语言张合的嘴,在每一帧里都和新台词打架;演员演一句台词,用的也是整张脸:眼神、眉毛、脸颊、头部(AI 口型同步:是什么、缺什么、什么更好(2026))。
- 场景。配乐、环境音、音效和人群声留在对白之下:识别为音乐的片段从不配音,环境音层在新语音之下完整保留。
- 每一位说话人。镜头里的每个人都会被配音,各用自己的声音;只处理音频的流程会把同时说话的几个人撞成一个声音(鸡尾酒会问题)。
- 台词。配音需要一份用目标语言重写的剧本:笑话重新落地,角色名和口头禅完全按原话保留(视频翻译真正重要的是什么)。
02.怎么评判?
六维评分表和成对方法见世界上最好的 AI 配音:如何衡量;一个电影场景把它们压缩成五个问题。
| 标准 | 片方要问的问题 | Familiar 基准测试如何衡量 |
|---|---|---|
| 每位说话人保住自己的声音 | 闭上眼:镜头里的每位演员还是同一个人吗?两人同时开口时也是吗? | 配音与说话人本人的音色还原度,按源片段和目标语言计(ElevenLabs Dubbing v1 研究,11 种语言);同时说话时的声音撞车在同一批片段审计中记为一类缺陷 |
| 面部演绎台词 | 嘴、眼神、眉毛、脸颊和头部都在说新台词,还是只有嘴唇? | 同一片段并排对比;公开研究比较的是最终音频,所以只做音频的工具跳过这一行 |
| 场景保住了 | 配乐还在对白之下吗?环境音呢?音效呢? | 相对源场景的背景音错误,以 dB 计(ElevenLabs Dubbing v2 (Alpha) 研究) |
| 台词传达了原意 | 每一句都说出了剧本的意思吗?笑话落地了吗?角色名保住了吗? | 每条输出相对同一份批准语义的重大翻译错误数(ElevenLabs Dubbing v2 (Alpha) 研究);翻译质量对照专家修订的参考译文盲评打分(人工翻译研究) |
| 有实测,且公开 | 同一批片段过每套系统,样本集固定,数据公开吗? | 带置信区间、试听示例和固定样本集的成对黑盒研究,公开于 thefamiliarlab.com/benchmark |
- 参考渲染。一段三人审讯场景,英语配成西班牙语,在 /demos 上与原版并排播放;那里的另一组并排对比里,麦克风挡在嘴前,手从脸前划过:模型读得懂遮挡。
03.测了什么?
Familiar 的研究是成对且黑盒的:同一批源片段过每套系统,只比较最终音频,每个样本集固定且彼此独立。
ElevenLabs 的背景音错误多出 270%:笑声、音乐、环境音。
ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 2026 年 8 月 5 日Familiar 的音色还原度高出 27.8%;全部 11 种语言都更接近说话人本人。
ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 2026 年 8 月 5 日Familiar 正式产品的翻译与专业译者初译的质量打平,在法语、中文、印地语、印尼语上取平均,对照专家修订的参考译文盲评打分。
正式产品翻译研究 vs 专业译者初译 · 法语、中文、印地语、印尼语 · 2026 年 8 月- 台词,同一样本集。在同样的 111 组成对输出上,Familiar 的重大翻译错误比 ElevenLabs Dubbing v2 (Alpha) 少 54.7%,29 次 vs 64 次。
04.片方还掌控什么?
- 每一句。流程会在审核环节暂停,任何一句译文都能在渲染前修改,每种语言在其审校人员签字后才渲染(转写与审核)。
- 名字和口头禅。「不翻译清单」让角色名、地名和标志性台词在配音、字幕以及译好的标题和简介里完全按原话保留;一句话说明说清谁在镜头里、这是部什么电影(不翻译清单)。
- 声音。声音来自演员在这个场景里的本人表演;没有选角这一步。
- 语言。一个源可以渲染成最多 29 种目标语言,源语言可以是 30 种中的任意一种,按公开的三个质量梯队从高到低排列(语言)。
- 每种语言的交付物。成片、由审核过的译稿生成的 .srt 和 .vtt 字幕、译好的标题和简介,以及独立的音频文件:完整混音,或只含人声的音轨,供片方自行混音(成品)。
- 权利。授权确认随任务记录在案。
05.整个片库签约之前
- 挑最难的场景。三个人说话、对白下有配乐、有笑点、有麦克风或手挡在嘴前。
- 先写验收标准。表 01 就是评分表;在任何人听到候选方案之前,母语审校人员先在片方自己的素材上按语言盲评。
- 放进一次后期改动。第一次渲染后改一句台词,走一遍审核环节;审校人员改动的句数本身就是质量指标。
- 当作试点来做。成对设计、连续的场景、两到三种优先语言:如何做一次 AI 配音试点(2026)。
- 接入。以 Studio 合约提供,按片库规模定制;签订年度合约可享 30 天退款保证。
常见问题
场景里的每位演员都能保住自己的声音吗?
能。镜头里的每个人都会被配音,各用自己的声音。对比 ElevenLabs Dubbing v1,在 11 种语言的 418 组成对输出上,Familiar 的音色还原度高出 27.8%,全部 11 种语言都更接近说话人本人。
配乐在配音后还在吗?
在。识别为音乐的片段从不配音,对白之下的环境音层完整保留:配乐、环境音、音效。同一批片段上,ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%(11.92 vs 3.22 dB;111 组成对输出,2026 年 8 月 5 日)。
声音对了,口型为什么还重要?
观众要把口型和声音合在一起才能听懂别人说话;两者一旦对不上,理解就会变得吃力,甚至会听成完全不同的音(麦格克效应,McGurk & MacDonald,Nature,1976)。只换声音的配音把这种错位留在每一帧画面里;Familiar 把声音和口型一起生成。
作为参照,整套人工配音要花多少钱?
翻译加真人配音的整套人工配音,每种语言成片每分钟要 $70 到 $150:翻译按公开的每词费率,一分钟口语 $22–45,再加上配音演员和录音棚 $39–94。Familiar 一次渲染就带上翻译、演员的声音、场景音和口型同步;以 Studio 合约提供。
参考资料
配音终于像样了。先看实测数据,再和团队聊聊你的片库。
FAMILIAR · 发布视频 · 2:31
