短剧实操指南

日更节奏下的短剧配音

FAMILIAR 研究全部文章

简短回答

日更不给配音排队留任何余地。Familiar 把每一集定剪后的成片一次请求配成最多 29 种语言,在审核环节暂停以修改任意一句,再把所有语言一起渲染。声音来自演员本人的演绎,所以同一个角色在第 60 集和第 1 集听起来是同一个人;「不翻译清单」让名字和口头禅在整部剧里保持一致。

要点速览

  • 一次请求把定剪的一集配成最多 29 种目标语言;每种语言的文件完成后即由 Webhook 送达。
  • 审核环节在翻译完成后暂停配音,所以卡点前的最后一句台词,会在任何渲染之前被读过。
  • 在创作者层级(片方用它对应整部剧)设置的「不翻译清单」和一句话说明,作用于每一集;任务层级的条目只对某一次上传生效。
  • 快速切换镜头、压在脸上的文字和手持画面,对 Familiar 的 Alpha 模型更难处理;在连续几集上做试点,决定今天哪些剧合适。

01.日更对配音意味着什么?

  • 一天一集,同一天所有语言。配音只能用定剪到上线之间的那几个小时;每种语言各开一场录音,塞不进这个窗口。
  • 漂移会累积。一个名字或称谓在第 3 集是一种译法,到第 12 集变成另一种,会毁掉观众一口气刷完的整部剧。
  • 最后一句台词就是留存点。卡点上一句落地晚了或平了的译文,会削弱观众点开下一集的动力。
  • 镜头里的每个人都用自己的声音被配音;配乐和环境音留在新台词之下。
短剧配音竖屏短剧短剧出海本地化日更AI 口型同步

02.当天闭环怎么跑?

表 01 · 一集,一次请求
步骤发生什么触发什么
上传定剪的一集只进一次,带上最多 29 种目标语言;原标题和简介一并送去翻译。一个 dub_id,每种语言一个状态
审核翻译完成后配音暂停;制片人可以修改任意一句,首先是卡点前的最后一句。dub.ready_for_review
渲染一次调用批准整集,或者一种语言先渲染,另一种语言的审校人员继续审。按语言的状态:rendering
交付每种语言各成一套文件:成片、.srt 和 .vtt 字幕、译好的标题和简介,以及完整混音或只含人声的音轨。每种语言一条 dub.output_ready;全部完成后 dub.completed
  • Webhook 承载排期。dub.ready_for_review、dub.output_ready 和 dub.completed 报告每一次状态变化,发布队列无需轮询就能往前推(Webhook)。
  • 纯音频模式面向音频剪辑和人声音轨(dub_mode=audio);带口型同步的视频是默认选项。
  • 30 种语言,任意互译,按公开的三个质量梯队从高到低排列(语言表)。第一梯队:
德语俄语法语韩语葡萄牙语普通话日语泰语西班牙语意大利语印尼语英语粤语越南语

03.六十集下来,连续性怎么保持?

声音来自片段本身,从来不是现成的旁白声,也没有选角这一步:每一集的配音都由这一集的表演生成,所以演员带着自己的声音进入每一种语言。

  • 每部剧一个创作者档案。创作者层级的「不翻译清单」条目是长期默认项:名字、地名、称谓和口头禅录入一次,就作用于每一集的配音、字幕和译好的元数据,匹配时不区分大小写(不翻译清单)。
  • 同一层级的一句话说明。「一部复仇剧;林是女主角,赵是她的继兄」会在每一句翻译前被读到,名字就还是名字,前面埋的伏笔也接得上(一句话说明)。
  • 更具体的层级优先。任务层级的条目会为某一集覆盖创作者层级的默认项:一段伪装剧情、一场闪回、一个客串角色。
  • 改动从下一条配音起生效。已经在翻译中的任务,沿用开始时的清单。
创作者层级 = 整部剧直播层级 = 一场直播会话任务层级 = 单集

04.卡点悬念怎么在翻译里活下来?

  • 译稿按语言送达,带词级时间。每一句都标有以秒计的起止时间和说话人;译文是唯一可编辑的字段(转写与审核)。
  • 最后一句对着画面读。时间戳把制片人直接带到卡点前的最后几秒;晚了或平了的一句,改一处,然后渲染。
  • 笑话和习语在目标语言里重新改写落地;「不翻译清单」的条目可以钉住任何必须原话保留的短语(视频翻译真正重要的是什么)。
  • 面部演绎新台词。眼神、眉毛、脸颊和头部随新的词句重新演绎,卡点前的反应镜头在目标语言里同样成立。
  • 审核可以关闭,上传后直接渲染完成;对一部剧而言,每集把最后一句读一遍,就能在漂移累积之前抓住它。

05.测了什么?

下面的 ElevenLabs 数据来自同一批源片段上的成对输出;两项 ElevenLabs 研究是各自独立的样本集。

图 01 · vs ElevenLabs 配音 · 两项成对研究 · 2026 年 8 月 5 日
270%

ElevenLabs 的背景音错误多出 270%:笑声、音乐、环境音。

11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 2026 年 8 月 5 日
+27.8%

Familiar 的音色还原度高出 27.8%;全部 11 种语言都更接近说话人本人。

0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 2026 年 8 月 5 日
54.7%

Familiar 的重大翻译错误少 54.7%(29 次 vs 64 次)。

ElevenLabs Dubbing v2 (Alpha) · 与 270% 那块相同的样本集 · 2026 年 8 月 5 日
图 02 · vs 专业译者初译 · 2026 年 8 月
100.3%

相当于专业译者初译的质量,在法语、中文、印地语、印尼语上取平均,对照专家修订的参考译文盲评打分:打平。

正式产品翻译研究 vs 专业译者初译 · 2026 年 8 月

06.整季签约前要测什么

  • 连续几集,而不是一段场景。三到五集连续剧集,有反复出场的主角、一场对峙和一个卡点结尾;剧集清单和一句话说明在第一次上传前设置一次。
  • 最难的一集先来。切换最快的镜头、压在脸上最多的文字、最多的手持镜头;它决定今天哪些剧合适。
  • 中途改一个名字。在两集之间改一条「不翻译清单」条目,确认下一条配音、它的字幕和译好的标题都跟着变了。
  • 一次后期改动。改过的剪辑就是一次新的配音请求;创作者层级的清单和说明自动沿用,改动的台词在审核环节读一遍。
  • 统计审核环节的修改数。每集改了多少处、同一处是否反复出现,就是试点的数字(如何做一次 AI 配音试点(2026))。

常见问题

AI 配音跟得上短剧日更吗?

跟得上。Familiar 把定剪的一集一次请求配成最多 29 种目标语言,在审核环节暂停一次,再把所有语言一起渲染;每种语言的文件完成后即由 Webhook 送达。

六十集下来,角色的声音怎么保持一致?

声音来自演员在每一集里的本人演绎;没有选角,也不从声音库里挑。每一集的配音都由这一集的台词生成,所以同一位演员在第 1 天和第 60 天听起来是同一个人。

怎么防止名字和口头禅在集与集之间漂移?

创作者层级(片方用它对应整部剧)的「不翻译清单」作用于每一集的配音、字幕以及译好的标题和简介;同一层级的一句话说明告诉翻译角色都是谁。任务层级的条目可以为某一集覆盖两者。

竖屏视频可以吗?

上传的视频可以从 30 种语言中的任意一种配音,横竖屏都行;演示页上有一条 9:16 竖屏配音。对 Familiar 的 Alpha 模型更难的,恰恰是竖屏短剧常常叠在一起的那几样:快速切换镜头、压在脸上的文字、手持画面。用这部剧最难的一集做试点,就能看出今天哪些作品合适。

参考资料

  1. [1]不翻译清单:三个层级、匹配规则、预置默认项(API 参考)
  2. [2]一句话说明:每个层级一句背景说明(API 参考)
  3. [3]转写与审核:编辑台词、按语言渲染(API 参考)
  4. [4]Familiar vs ElevenLabs 基准测试:完整结果、置信区间与试听示例
  5. [5]vs 专业译者:翻译质量研究
  6. [6]为什么配音在海外显得别扭,影视公司如何解决(关于剧集连续性的影视公司实操指南)

配音终于像样了。先看实测数据,再和团队聊聊你的片库。

FAMILIAR · 发布视频 · 2:31