简短回答
要点速览
- 一份创作者档案(一个 creator_id,外加机构自己的 external_id)把这位创作者的「不翻译清单」和一句话说明带到每一次配音和直播会话上。
- 条目可以挂在三个层级:创作者、直播或任务;更具体的层级优先。
- 配音的声音来自创作者自己的片段:对比 ElevenLabs Dubbing v1,Familiar 在 418 组成对输出上音色还原度高出 27.8%(2026 年 8 月 5 日)。
- 每种语言都交付成片、.srt 和 .vtt 字幕、两个音频文件,以及链接和话题标签原样保留的译好的标题和简介。
01.为什么每位创作者一套流程会崩?
一家 MCN 机构把 40 位创作者配成六种语言,就是 240 个配音频道,而每位创作者都带着自己的名字、口头禅、固定梗和赞助商优惠码。
- 逐创作者流程在哪里失灵。记在文档里的术语表,靠读到它的人去执行;某位创作者清单上的改动,只有有人手动带过去,才会进入下一条配音。
- 它损失的观众。YouTube 百大频道中,有 64 个不是英语频道。
02.按创作者的设置如何跑在同一次对接上?
机构用组织的 API 密钥对接一次;每位创作者是一份档案,流程在每次请求时读取它。
- 每位创作者一份档案。POST /v1/creators 返回一个 creator_id;机构把自己的 external_id 存在档案上,并据此查找创作者(创作者档案)。
- 清单和说明跟着档案走。带 creator_id 的配音或直播会话,会得到这位创作者的「不翻译清单」和一句话说明,在配音、字幕和译好的元数据里匹配,不区分大小写(不翻译清单)。
- 三个层级,更具体的优先。条目可挂在创作者(长期默认)、直播(随直播会话保存,下次复用)或任务(某一次上传)层级;任务条目只为这条视频覆盖创作者默认项。
- 预置默认项,一句话背景。新档案默认保护平台名称和常见的游戏、网络用语;一句「一个国际象棋频道:开局、失误、速通」这样的说明,让名字还是名字(一句话说明)。
- 一份列表,一条 Webhook 流。GET /v1/dubs 按 creator_id 和状态筛选;每一次状态变化都送到同一个端点,带签名,24 小时内持续重试(Webhook)。
| 设置项 | 机构共享 | 按创作者 |
|---|---|---|
| API 密钥 | 每次请求用同一个组织密钥 | 无:创作者是该密钥下的档案,无需单独登录 |
| 不翻译清单 | 预置默认项:平台名称、常见的游戏和网络用语 | 创作者自己的条目,以 creator_id 为键;任务条目为某条视频覆盖 |
| 一句话说明 | 无 | 每位创作者一句;直播或任务层级的一句可以覆盖 |
| 目标语言 | 每次配音最多 29 种 | 按请求选择 |
| 审核环节 | review=auto 直接渲染;review=manual 停在 in_review | 按配音选择 |
| Webhook | 一个默认端点,带签名,24 小时内重试 | 每次配音或直播会话可用 webhook_url 覆盖 |
| 配音列表 | GET /v1/dubs 覆盖整个组织 | creator_id 筛选缩到某位创作者 |
| 默认配额 | 每分钟 100 次请求、10 个并发渲染、2 个直播会话、单文件 10 GB、24 小时源时长 | 不按创作者设限;由组织的对接人上调 |
03.创作者听起来还是自己吗?
配音里的声音来自创作者自己的片段,整张脸都在演绎新的语言:眼神、眉毛、脸颊、头部。现成的旁白声,等于把另一个人卖给观众。
ElevenLabs 的背景音错误多出 270%:笑声、音乐、环境音(11.92 vs 3.22 dB)。
ElevenLabs Dubbing v2 (Alpha) · 111 组成对输出 · 普通话、西班牙语、日语 · 2026 年 8 月 5 日Familiar 的音色还原度高出 27.8%(0.4605 vs 0.3604);全部 11 种语言都更接近说话人本人。
ElevenLabs Dubbing v1 · 418 组成对输出 · 11 种语言 · 2026 年 8 月 5 日- vs YouTube 自动配音,另一项独立研究。在一个固定样本集(50 组成对配音,31 组对齐;阿拉伯语、西班牙语、法语、印地语、韩语;2026 年 8 月 8 日采集)上,Familiar 的音色还原度高出 182.9%(0.399 vs 0.141)(研究全文)。
04.直播也是同一套形态吗?
带 creator_id 的直播会话应用同样的清单和说明,随会话发送的说明会写入直播层级。直播会话支持 11 种源语言译成其余 29 种,比原声慢 5 到 9 秒,镜头里的每个人都用自己的声音;节目信号通过 WHIP(WebRTC)、RTMP 或 SRT 接入,每种语言的直播流推送到各自的频道。直播没有审核环节;清单和说明就是控制手段(直播实时配音、直播接入)。
05.每种语言,机构能拿到什么去发布?
- 成片(mp4),该语言的 dub.output_ready 一触发即可下载(成品与字幕)。
- 字幕:.srt 和 .vtt,每条配音免费附带,由审核过的译稿生成。
- 两个音频文件。完整混音(m4a)给支持额外音轨的平台;只含人声的音轨(wav)供创作者自行混音。
- 译好的标题和简介,链接、@账号、#话题标签、优惠码和章节时间戳完全按原文保留(元数据翻译)。
- 审核,按配音选择。review=manual 停在 in_review,任何一句都能在渲染前修改;review=auto 是默认,直接渲染完成。
06.机构在签约前该测什么?
- 挑最难的创作者。两三位名字、赞助商优惠码和固定梗最多的;先导入他们的清单,再配成对片段(如何做一次 AI 配音试点)。
- 统计审核环节的修改数。开启 review=manual 后,母语审校人员改动的句子就是测量结果;他们保护下来的任何短语,都进入这位创作者的清单,此后每条配音都适用。
- 核对旗下创作者的形式。干净、稳定的画面配得最好:2 到 3 人出镜的播客和访谈、讲座;镜头里的每个人都会被配音。
常见问题
机构如何为众多创作者配音,而不用给每人单独一套流程?
每位创作者一份档案,装着他的「不翻译清单」和一句话说明。每一次配音请求和直播会话都带着档案的 creator_id,所以机构只对接一次,按创作者列出配音,并在同一个 Webhook 端点接收每一次状态变化。
创作者能保住自己的口头禅和圈内梗吗?
能。创作者的「不翻译清单」让口头禅、名字和标志性俚语在配音、字幕以及译好的标题和简介里完全按原话保留。笑话在目标语言里重新改写落地,一句话说明保住固定梗的铺垫。
配音里的创作者听起来还是自己吗?
声音来自创作者自己的片段。在 ElevenLabs Dubbing v1 研究中(418 组成对输出,11 种语言,2026 年 8 月 5 日),Familiar 的音色还原度高出 27.8%,全部 11 种语言都更接近说话人本人。
每位创作者都需要自己的 Familiar 账号吗?
不需要。创作者是机构对接下的档案:POST /v1/creators 接收一个显示名称和机构自己的 external_id,返回一个 creator_id,配音和会话带上它即可。谁能打开哪个设置界面,由机构自己的产品决定。
参考资料
配音终于像样了。先看实测数据,再和团队聊聊你的片库。
FAMILIAR · 发布视频 · 2:31
