結論
要点
- 音声だけのパイプラインは、重なって話す複数の話者をひとつの声に潰してしまいます。3人が話すシーンが、スタジオが最初に試すべきテストです。
- ElevenLabs Dubbing v2 (Alpha)は、同じクリップで笑い声や音楽、空気感といった背景音のエラーが270%多く発生しました(111ペアの出力、2026年8月5日)。
- Familiarの実サービスの翻訳は、フランス語、中国語、ヒンディー語、インドネシア語で熟練プロ翻訳者の一次翻訳の品質の100.3%。つまり互角です。
- スタジオはレンダリング前のレビューのステップで翻訳された行をどれでも編集でき、「翻訳しないリスト」が登場人物の名前と決め台詞を話した通りに守ります。
01.映画の吹き替えは何を残さなければならないか?
映画のシーンには、難しい条件がすべて同時に重なります。セリフを交わす複数の俳優、セリフの下に流れる劇伴、カットをまたいで途切れずに続くべき部屋の響き、そして各俳優の声をすでに知っている観客です。
- 声。 吹き替えはテキスト読み上げではありません。俳優が収録したセリフを取り込み、本人らしさと語り口を保ちます。
- 演技の全体。 視聴者は聴きながら口の動きを読むので、元の言語の形のままの口は、どのフレームでも新しいセリフと食い違います。俳優はセリフを顔全体で演じます。目、眉、頬、頭で(AIリップシンクとは何か、何を取りこぼすか、何がそれを超えるか(2026年版))。
- シーン。 劇伴、部屋の響き、効果音、群衆のざわめきはセリフの下に残ります。音楽と検出された区間は決して吹き替えず、ノイズの土台は新しいセリフの下に保たれます。
- すべての話者。 画面に映る全員が、それぞれ本人の声で吹き替えられます。音声だけのパイプラインは、重なって話す話者をひとつの声に潰します(カクテルパーティー問題)。
- 言葉。 吹き替えには、対象言語で書き直された新しい脚本が必要です。ジョークは伝わるように書き直し、登場人物の名前と決め台詞は話した通りに守ります(動画翻訳で本当に重要なこと)。
02.どう判断するか?
6次元の採点表とペア比較の方法は世界最高のAI吹き替え:その測り方にあります。映画のシーンでは、それが5つの問いに凝縮されます。
| 基準 | スタジオが問うこと | Familiarのベンチマークの測り方 |
|---|---|---|
| すべての話者が自分の声を保つ | 目を閉じてください。画面の各俳優は、2人が同時に話すときも含めて、まだ同じ人物ですか? | 元クリップと対象言語ごとの、本人の声に対する吹き替えの声の本人らしさ(ElevenLabs Dubbing v1の研究、11言語)。重なって話す話者の混線は、同一クリップ監査で欠陥クラスとして記録 |
| 顔がセリフを演じる | 口、目、眉、頬、頭が新しい言葉を運んでいますか、それとも唇だけですか? | 同じクリップで並べて比較。公開している研究は完成音声を比較するため、音声のみのツールはこの行を飛ばします |
| シーンが残る | 劇伴はまだセリフの下にありますか?部屋の響きは?効果音は? | 元のシーンに対する背景音のエラー、dB単位(ElevenLabs Dubbing v2 (Alpha)の研究) |
| 言葉が意図を運ぶ | 各行は脚本の意図どおりに言っていますか?ジョークは伝わりましたか?登場人物の名前は残りましたか? | 承認された1つの意味に対する、出力ごとの重要な翻訳ミス(ElevenLabs Dubbing v2 (Alpha)の研究)。翻訳品質は専門家が修正した参照訳を基準にブラインドで採点(人間翻訳の研究) |
| 測定され、公開されている | 同じクリップを各システムに通し、コホートを固定し、データを公開していますか? | 信頼区間、試聴サンプル、固定コホート付きのブラックボックス型ペア比較研究を、thefamiliarlab.com/benchmarkで公開 |
- 参照レンダリング。 3人が話す取調室のシーンを英語からスペイン語に吹き替えたものが、オリジナルと並べて/demosにあります。もう1本の並列比較には、口元を覆うマイクと顔を横切る手が映ります。モデルはオクルージョンを理解しています。
03.何を測定したか?
Familiarの研究は、ペア比較のブラックボックス型です。同じ元クリップを各システムに通し、完成音声だけを比較し、各コホートは固定したまま別々に扱います。
ElevenLabsは、笑い声や音楽、空気感といった背景音のエラーが270%多く発生しました。
ElevenLabs Dubbing v2 (Alpha) · 111ペアの出力 · 中国語(普通話)、スペイン語、日本語 · 2026年8月5日Familiarの声は本人に27.8%近く聞こえ、全11言語でFamiliarが上回りました。
ElevenLabs Dubbing v1 · 418ペアの出力 · 11言語 · 2026年8月5日Familiarの実サービスの翻訳は、フランス語、中国語、ヒンディー語、インドネシア語の平均で、熟練プロ翻訳者の一次翻訳と互角です。専門家が修正した参照訳を基準にブラインドで採点。
実サービスの翻訳 vs 熟練プロ翻訳者の一次翻訳 · フランス語、中国語、ヒンディー語、インドネシア語 · 2026年8月- 言葉、同じコホート。 重要な翻訳ミスは、同じ111ペアの出力でFamiliarのほうがElevenLabs Dubbing v2 (Alpha)より54.7%少なくなりました(29件 vs 64件)。
04.スタジオは何を引き続き管理できるか?
- すべての行。 パイプラインはレビューのステップで一旦停止し、翻訳された行はレンダリング前にどれでも編集できます。各言語は、レビュー担当者の確認が済んだ時点でレンダリングされます(文字起こしとレビュー)。
- 名前と決め台詞。 「翻訳しないリスト」が、登場人物の名前、地名、印象的なセリフを、吹き替え、字幕、翻訳されたタイトルと説明のすべてで話した通りに守ります。1行のコンテキストが、誰が画面に映り、どんな映画かを伝えます(翻訳しないリスト)。
- 声。 声は、シーンにおける俳優本人のテイクから生まれます。キャスティングの工程はありません。
- 言語。 1つの元素材を、30言語のいずれからでも最大29の対象言語へ。公開している3つの品質ティアに、品質の高い順に分かれています(対応言語)。
- 言語ごとの成果物。 完成した動画、レビュー済みの文字起こしから生成した.srtと.vttの字幕、翻訳されたタイトルと説明、そして単体ファイルとしての音声。すべての音が入ったミックスと、スタジオ側でミックスするための声だけのトラックです(出力)。
- 権利。 権利確認の記録は、ジョブごとに残ります。
05.カタログ単位で契約する前に
- いちばん難しいシーンを選ぶ。 3人の話者、セリフの下に流れる劇伴、ジョーク、口元を覆うマイクや手。
- 受け入れ基準を先に書く。 表01が採点表です。候補を誰かが聴く前に、ネイティブのレビュー担当者がスタジオ自身の映像で各言語をブラインドで採点します。
- 後からの修正を含める。 最初のレンダリング後に1行を変え、レビューのステップを通します。レビュー担当者が変更した行の数そのものが品質の指標です。
- パイロット検証として実施する。 ペア比較の設計、連続したシーン、優先度の高い2〜3言語。方法はAI吹き替えのパイロット検証の進め方(2026年版)にあります。
- ご利用について。 Studio契約で、カタログの規模に合わせてご用意します。年間契約の締結後30日間は返金保証付きです。
よくある質問
シーンに映る俳優は全員、自分の声を保てますか?
はい。画面に映る全員が、それぞれ本人の声で吹き替えられます。ElevenLabs Dubbing v1と11言語・418ペアの出力で比較したところ、Familiarの声は本人に27.8%近く聞こえ、全11言語でより近いと測定されました。
劇伴は吹き替え後も残りますか?
はい。音楽と検出された区間は決して吹き替えず、セリフの下のノイズの土台、つまり劇伴、部屋の響き、効果音は保たれます。同じクリップで測ると、ElevenLabs Dubbing v2 (Alpha)は背景音のエラーが270%多く発生しました(11.92 vs 3.22 dB。111ペアの出力、2026年8月5日)。
声が正しければ、口の動きはなぜ重要なのですか?
視聴者は口の動きと音声を組み合わせて言葉を聞き取っています。ふたつがずれると聞き取りにくくなり、まったく別の音に聞こえてしまうことさえあります(マガーク効果。McGurk & MacDonald, Nature, 1976)。声だけを差し替える吹き替えではそのずれがどのフレームにも残ります。Familiarは声とリップシンクを同時に生成します。
比較のために、人による吹き替え一式の費用はいくらですか?
翻訳も声も人が手がける吹き替え一式は、1言語につき仕上がり1分あたり$70から$150。内訳は、公開されている単語単価で発話1分あたり$22–45の翻訳と、$39–94の声とスタジオです。Familiarは1回のレンダリングに、翻訳、俳優の声、シーンの音、リップシンクまですべて込み。ご利用はStudio契約です。
参考資料
吹き替えは、ついに良くなった。測定結果をご確認のうえ、お持ちのカタログについてチームにご相談ください。
FAMILIAR · ローンチムービー · 2:31
