簡短回答
重點摘要
- 一個創作者檔案(一個 creator_id,加上 MCN 自己的 external_id)把該創作者的不翻譯清單和背景簡介帶到每條配音和每場直播工作階段。
- 條目可設定在三個層級:創作者、直播或任務,較窄的層級優先。
- 配音的聲音來自創作者自己的片段:在 418 組配對輸出中,Familiar 的聲音像真人說話者的程度,比 ElevenLabs Dubbing v1 高 27.8%(2026 年 8 月 5 日)。
- 每種語言交付成品影片、.srt 和 .vtt 字幕、兩個音訊檔,以及翻譯好的標題和描述,連結和標籤原樣保留。
01.為何每位創作者一套流程會失效?
一家多頻道網絡(MCN)把 40 位創作者配成六種語言,就要營運 240 條配音頻道,而每位創作者都有自己的名字、口頭禪、長期的玩笑梗和贊助優惠碼。
- 逐位創作者的流程在哪裡失效。存在文件裡的詞彙表,靠讀到的人去套用;某位創作者的清單改了,除非有人親手帶過去,否則下一條配音不會知道。
- 因此失去的觀眾。最大的 100 個 YouTube 頻道中,64 個不是英語。
02.按創作者的設定如何跟著同一次整合走?
MCN 以機構的 API 金鑰整合一次;每位創作者是一個檔案,流程在每個請求都會讀取。
- 每位創作者一個檔案。POST /v1/creators 回傳一個 creator_id;MCN 把自己的 external_id 存在檔案上,並以此查找創作者(創作者檔案)。
- 清單和簡介跟著檔案走。標上 creator_id 的配音或直播工作階段,會套用該創作者的不翻譯清單和背景簡介,在配音、字幕和翻譯好的元數據中比對,不分大小寫(不翻譯清單)。
- 三個層級,較窄者優先。條目可設定在創作者(持久的預設值)、直播(隨直播工作階段保存,下次沿用)或任務(一次上載)層級;任務層級的條目只為那條影片覆寫創作者的預設值。
- 預載的預設值,加一句背景。新檔案一開始就保護平台名稱和常見的遊戲及網絡用語;一句「國際象棋頻道:開局、失誤、速通」這樣的背景簡介,令名字保持是名字(背景簡介)。
- 一個列表,一條 Webhook 串流。GET /v1/dubs 可按 creator_id 和狀態篩選;每次狀態變化送到同一個端點,附有簽名,24 小時內重試(Webhook)。
| 設定 | MCN 共用 | 按創作者 |
|---|---|---|
| API 金鑰 | 每個請求用同一個機構金鑰 | 沒有:創作者是該金鑰下的檔案;沒有創作者登入 |
| 不翻譯清單 | 預載的預設值:平台名稱、常見的遊戲及網絡用語 | 創作者自己的條目,以 creator_id 為鍵;任務條目只為一條影片覆寫 |
| 背景簡介 | 沒有 | 每位創作者一句;直播或任務的一句可覆寫 |
| 目標語言 | 每條配音最多 29 種 | 每個請求自行選擇 |
| 審閱步驟 | review=auto 直接渲染;review=manual 停在 in_review | 每條配音自行選擇 |
| Webhook | 一個預設端點,附有簽名,24 小時內重試 | 每條配音或直播工作階段可用 webhook_url 覆寫 |
| 配音列表 | GET /v1/dubs 涵蓋整個機構 | creator_id 篩選收窄到一位創作者 |
| 預設上限 | 每分鐘 100 個請求、10 個並行渲染、2 個直播工作階段、每個檔案 10 GB、24 小時來源 | 沒有按創作者的上限;由機構的聯絡人要求提高 |
03.創作者聽起來仍是自己嗎?
配音的聲音來自創作者自己的片段,整張臉都在演出新語言:眼睛、眉毛、面頰、頭部。現成的旁白聲,等於向觀眾推銷另一個人。
ElevenLabs 的背景聲音錯誤多 270%:笑聲、音樂、環境聲(11.92 vs 3.22 dB)。
ElevenLabs Dubbing v2 (Alpha) · 111 組配對輸出 · 普通話、西班牙語、日語 · 2026 年 8 月 5 日Familiar 的聲音像真人說話者的程度高 27.8%(0.4605 vs 0.3604);測試的 11 種語言全部更接近。
ElevenLabs Dubbing v1 · 418 組配對輸出 · 11 種語言 · 2026 年 8 月 5 日- 對比 YouTube 自動配音,另一項獨立研究。在 50 組配對配音的凍結樣本組中(31 組已對齊;阿拉伯語、西班牙語、法語、印地語、韓語;2026 年 8 月 8 日擷取),Familiar 的說話者相似度高 182.9%(0.399 vs 0.141)(研究全文)。
04.直播也適用同一套嗎?
標上 creator_id 的直播工作階段套用同一份清單和簡介,隨工作階段送出的背景則寫入直播層級。直播工作階段由 11 種來源語言譯成其餘 29 種,比原聲慢 5 至 9 秒,鏡頭前每個人都用自己的聲音;廣播訊號透過 WHIP(WebRTC)、RTMP 或 SRT 送入,每種語言的訊號推送到各自的頻道。直播沒有審閱步驟;清單和簡介就是控制手段(直播的即時配音、直播串流)。
05.每種語言,MCN 拿到甚麼可以發佈?
- 成品影片(mp4),該語言的 dub.output_ready 一發出即可下載(輸出與字幕)。
- 字幕,.srt 和 .vtt,每條配音免費附送,根據審閱過的文字稿生成。
- 兩個音訊檔。完整混音(m4a)供接受額外音軌的平台使用;只有人聲(wav)供創作者自行混音。
- 翻譯好的標題和描述,連結、@帳號、#標籤、優惠碼和章節時間戳完全照原文保留(元數據翻譯)。
- 審閱,每條配音自行選擇。review=manual 停在 in_review,任何一句都可在渲染前修改;review=auto 是預設,直接渲染。
06.MCN 簽約之前應該測試甚麼?
- 挑最難的創作者。兩三位名字、贊助優惠碼和玩笑梗最多的;先載入他們的清單,再為配對片段配音(如何進行 AI 配音試行)。
- 點算審閱步驟的修改次數。用 review=manual 時,母語審閱人員改動的句子就是量度指標;他們要保護的任何字句,都加到該創作者的清單,供之後每條配音使用。
- 檢查旗下創作者的影片形式。乾淨穩定的畫面配得最好:2 至 3 人上鏡的播客和訪談、講課;鏡頭前每個人都會配音。
常見問題
MCN 怎樣為眾多創作者配音,而不用每位一套流程?
每位創作者一個檔案,載有該創作者的不翻譯清單和背景簡介。每個配音請求和直播工作階段都帶著檔案的 creator_id,所以 MCN 只需整合一次,可按創作者列出配音,並在同一個 Webhook 端點接收每次狀態變化。
創作者可以保留口頭禪和圈內笑話嗎?
可以。創作者的不翻譯清單令口頭禪、名字和招牌用語在配音、字幕以及翻譯好的標題和描述中完全照原話保留。笑話會在目標語言重寫落地,背景簡介則守住長期玩笑梗的鋪排。
創作者在配音裡聽起來像自己嗎?
聲音來自創作者自己的片段。在 ElevenLabs Dubbing v1 的研究中(418 組配對輸出、11 種語言、2026 年 8 月 5 日),Familiar 的聲音像真人說話者的程度高 27.8%,測試的 11 種語言全部更接近。
每位創作者都要有自己的 Familiar 帳戶嗎?
不需要。創作者是 MCN 整合下的檔案:POST /v1/creators 接收顯示名稱和 MCN 自己的 external_id,回傳一個 creator_id,供配音和工作階段使用。誰可以開啟哪個設定畫面,由 MCN 自家的產品決定。
參考資料
配音終於好了。先看實測數據,再跟團隊談談你的內容庫。
FAMILIAR · 發佈影片 · 2:31
