简短回答
要点速览
- 一次配音请求可以把一部作品配成最多 29 种目标语言;开启人工审核后,每种语言都停在审核环节,等审校人员批准。
- 每种语言各自确认后才渲染,日语还在审核时,西班牙语已经可以上线。
- Webhook 通知每一次状态变化:配音待审核、某种语言的成片就绪、整条配音完成,或带错误信息的失败。
- 2026 年 8 月 5 日同一批片段实测,ElevenLabs Dubbing v2 (Alpha) 的背景音错误多出 270%:笑声、音乐、环境音。
01.为什么覆盖率成了瓶颈?
片库每周都在新增作品;一条选角、录音、混音逐部推进的流程,新增语言的速度却是固定的,于是排队的长度决定了一个市场能用自己的语言看到多少内容。
YouTube 百大频道中,不是英语频道的数量。
- 整套人工配音成片每分钟要 $70 到 $150,翻译加真人配音:一部 60 分钟的作品配成一种语言,要 $4,200 到 $9,000(2026 年配音要花多少钱?)。
- 每种语言都是一条独立的队伍:逐部制作的流程里,一部作品配十种语言,就是十次选角、录音、混音,最慢的那一条决定上线日期。
- 只换声音的配音,嘴还在说原语言;观众读到的口型和听到的话互相矛盾(为什么配音在海外显得别扭,影视公司如何解决)。
02.上传即配音是什么样子?
一次对接就闭合整个环路:上传流程发出一次请求,API 在每一步回报状态,成品文件由平台自己的播放器播出。
| 步骤 | 发生什么 | 平台收到什么 |
|---|---|---|
| 上传 | POST /v1/dubs,带上文件或源 URL、最多 29 个目标语言代码以及 review=manual;源语言自动识别或由请求指定。 | dub_id、状态 queued、每种语言一条 outputs[] 记录 |
| 转写与翻译 | 带词级时间戳的语音转文字,分离说话人;每一句都在应用「不翻译清单」和一句话说明后翻译。 | 状态 transcribing,随后 translating |
| 审核 | 配音停在 in_review。按语言 GET 译稿,PATCH 任意一句,POST /render 渲染一种或全部语言。 | dub.ready_for_review,随后是可编辑的译稿 |
| 渲染 | 声音和口型同步一起生成,按语言进行;每种语言有自己的状态。 | 每种语言一条 dub.output_ready;全部渲染完成后 dub.completed |
| 交付 | 每种语言一份成品:成片 mp4、由审核过的译稿生成的 .srt 和 .vtt 字幕、完整混音或只含人声的音轨,以及译好的标题和简介。 | GET /v1/dubs/{dub_id}/output/{lang},format 为 mp4、srt、vtt、audio 或 voice |
- 失败同样是事件。dub.failed 带上语言和错误信息;10 秒内未确认的推送会在 24 小时内持续重试,重复推送按事件 ID 去重(Webhook)。
- 名字和口头禅保持不变。「不翻译清单」让它们完全按原话保留;一句话说明(谁在镜头里、这是部什么剧)让每一句译文更准确;两者都可以设在创作者档案、某场直播或某一部作品上(不翻译清单、一句话说明)。
- 元数据随作品一起交付。译好的标题和简介按语言送达;链接、@账号、#话题标签、优惠码和章节原样保留(元数据翻译)。
03.为什么一个模型会改变覆盖率的算法?
拼接起来的流程用质量换产能:每多一个工具,就多一道工序、多一张账单,而两个模型守不住同一个身份。一个统一模型把声音、口型和场景一起生成。
ElevenLabs 的背景音错误多出 270%:笑声、音乐、环境音。
11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 2026 年 8 月 5 日Familiar 的音色还原度高出 27.8%;全部 11 种语言都更接近说话人本人。
0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 2026 年 8 月 5 日Familiar 的重大翻译错误少 54.7%(29 次 vs 64 次)。
ElevenLabs Dubbing v2 (Alpha) · 与 270% 那块相同的 111 组成对输出 · 2026 年 8 月 5 日- 翻译质量不打折。Familiar 的翻译达到专业译者初译质量的 100.3%,在法语、中文、印地语、印尼语上取平均,对照专家修订的参考译文盲评打分(2026 年 8 月 6 日):打平(研究全文)。
- 场景在配音后依然完整。音乐从不配音;歌曲原样直通,笑声、音效和环境音留在新语音之下;镜头里的每个人都用自己的声音被配音。
04.先配哪些作品?
按语言放行让计划单位变成「某部作品的某种语言」:一个市场可以带着已经通过的语言先上线(多国同步发行:一次配好所有市场)。
| 梯队 | 语言 |
|---|---|
| 第一梯队(14 种) | 德语、俄语、法语、韩语、葡萄牙语、普通话、日语、泰语、西班牙语、意大利语、印尼语、英语、粤语、越南语 |
| 第二梯队(9 种) | 保加利亚语、荷兰语、加泰罗尼亚语、克罗地亚语、立陶宛语、挪威语、瑞典语、斯洛伐克语、希腊语 |
| 第三梯队(7 种) | 阿拉伯语、白俄罗斯语、丹麦语、哈萨克语、拉脱维亚语、塞尔维亚语、乌克兰语 |
- 最干净的形式先做。2 到 3 人出镜的播客和访谈、直面镜头的视频、讲座、演讲,以及干净的单机位场景。
- 先做第一梯队,再扩大。30 种语言中的每一种都能与其余语言互译,所以梯队顺序就是上线顺序(语言)。
- 按风险分流。review=manual 让作品停在 in_review,直到该市场的审校人员触发渲染;review=auto(默认)直接渲染完成;字幕任务始终会停下来等待审核,因为字幕文本来自审核环节。
- 电视节目是另一条通道。直播会话通过 SRT、RTMP 或 WHIP 为节目配音,比原声慢 5 到 9 秒,支持 11 种源语言译成其余 29 种,每种语言的直播流推送到各自的目的地;直播没有审核环节(直播实时配音)。
05.如何在自己的片库上做试点?
- 挑最难的作品。一集有代表性的剧集或连续几集,选两到三种优先语言,要有快对白、笑点、对白下的音乐、专有名词,以及一次后期改动。
- 在任何人试听之前先写好验收标准。译文、声音、场景、面部和时间点,每一项由母语审校人员打分;再加上修改轮次,以及从源片改动到替换版通过验收所用的时间。
- 统计修改数。审校人员在审核环节改动的句子,按数量和类型统计,是最直接的质量指标;每一处修改都会进入配音和字幕。
成对设计、评分表以及如何解读结果:如何做一次 AI 配音试点(2026)。以 Studio 合约提供,按片库规模定制,签订年度合约可享 30 天退款保证。
常见问题
流媒体平台在用什么更快地补上本地语言配音?
通过 API 上传即配音:每部作品一次请求,最多译成 29 种目标语言,每种语言一个审核环节,Webhook 通知每一次状态变化,成片、字幕、音轨以及译好的标题和简介由平台自己的播放器播出。
配得更快,就意味着配得更差吗?
声音、口型同步和场景出自同一个模型时,并不会。同一批片段实测(2026 年 8 月 5 日),ElevenLabs Dubbing v2 (Alpha) 的背景音错误比 Familiar 多出 270%。Familiar 的翻译在法语、中文、印地语、印尼语上达到专业译者初译质量的 100.3%:打平。
可以先上线一种语言,其他语言之后再放吗?
可以。开启 review=manual 后,每种语言各自停在 in_review,各自确认后才渲染:带 langs 列表的 POST /render 今天放行西班牙语,其余语言等各自的审校人员签字再放;每种语言的文件可下载时,各自触发一条 dub.output_ready Webhook。
作为参照,整套人工配音要花多少钱?
翻译加真人配音的整套人工配音,成片每分钟要 $70 到 $150:一部 60 分钟的作品配成一种语言,要 $4,200 到 $9,000。光是专业人工翻译,按公开的每词费率,一分钟口语就要 $22 到 $45。
平台可以配成哪些语言?
30 种语言,任意互译:30 种语言中任意一种的作品都能配成其余 29 种,按公开的三个质量梯队从高到低排列。第一梯队 14 种,第二梯队 9 种,第三梯队 7 种,梯队内按拼音排序。
参考资料
配音终于像样了。先看实测数据,再和团队聊聊你的片库。
FAMILIAR · 发布视频 · 2:31
