スタジオ向けプレイブック

海外で吹き替えが「合わない」理由と、スタジオの解決策

FAMILIAR 研究記事一覧

結論

吹き替えに違和感が生まれるのは、3つの要素がばらばらになったときです。俳優の声が別人の声に置き換わり、口は元の言語を話し続け、セリフの下にある音楽や部屋の響きが平板になる。解決策は、この3つをまとめて吹き替えることです。Familiarのひとつのモデルは、俳優本人の声を保ち、顔の演技を新しい言語で再現し、シーンの音をそのまま残して1回のレンダリングで仕上げます。翻訳された行は、レンダリング前にどれでも編集できます。

要点

  • 吹き替えの違和感を生む3つの欠陥:別人の声、元の言語を話し続ける口、新しいセリフの下でつぶれたシーン。
  • 同じクリップで測ると、ElevenLabs Dubbing v2 (Alpha)は笑い声や音楽、空気感といった背景音のエラーが270%多く発生しました(111ペアの出力、2026年8月5日)。
  • Familiarの声はElevenLabs Dubbing v1より本人に27.8%近く聞こえ、全11言語でより近いと測定されています(418ペアの出力、2026年8月5日)。
  • スタジオ自身の翻訳者が、レンダリング前に翻訳された行をどれでも編集でき、各言語はそれぞれの承認で個別にレンダリングされます。

01.吹き替えはなぜ「合わない」のか?

欠陥のうち2つはAI以前からあるものです。声優の声もまた別人の声であり、どんな収録セッションも俳優の口は動かせません。音声だけのAI吹き替えは、そこに3つ目の欠陥、平板になったシーンを加えることがあります。その測定結果は後述します。

  • 別人の声。 声優が読んでも合成音声が読んでも、その俳優を知る人にはもう本人だとわかりません(AI動画吹き替えの解説(2026年版))。
  • 元の言語のまま動く口。 私たちの脳は、口の動きと音声を組み合わせて言葉を聞き取っています。ふたつがずれると聞き取りにくくなり、まったく別の音に聞こえてしまうことさえあります。この現象は「マガーク効果」と呼ばれ、視聴覚音声知覚の代表例です。声だけを差し替える吹き替えでは、そのずれがどのフレームにも残ります。
  • つぶれたシーン。 笑い声、音楽、効果音、部屋の空気感が、新しいセリフの下で削られたり、にじんだりします。
  • 一文ずつの直訳。 単語を一対一で置き換えた行は、正確でも外国語臭さが残り、ジョークは遅れて届くか、まったく届きません(動画翻訳で本当に重要なこと)。
別人の声口元のズレつぶれたシーン直訳

02.測定結果は何を示しているか?

FIG. 01 · ペア比較研究 · 同一の元クリップ · 完成音声を比較 · 2026年8月
270%

ElevenLabs Dubbing v2 (Alpha)は、笑い声や音楽、空気感といった背景音のエラーが270%多く発生しました。

11.92 vs 3.22 dB · ElevenLabs Dubbing v2 (Alpha) · 111ペアの出力 · 中国語(普通話)、スペイン語、日本語 · 2026年8月5日
+27.8%

Familiarの声はElevenLabs Dubbing v1より本人に27.8%近く聞こえ、全11言語でFamiliarが上回りました。

0.4605 vs 0.3604 · ElevenLabs Dubbing v1 · 418ペアの出力 · 11言語 · 2026年8月5日
100.3%

熟練プロ翻訳者の一次翻訳に対する品質。フランス語、中国語、ヒンディー語、インドネシア語の平均で、専門家が修正した参照訳を基準にブラインドで採点。つまり互角です。

実サービスの翻訳 vs 熟練プロ翻訳者の一次翻訳 · 2026年8月

ElevenLabsの2つのコホートと人間翻訳の研究は、決して合算していません。全データ、信頼区間、試聴サンプルはFamiliar vs ElevenLabsvs プロ翻訳者に、方法はAI翻訳 vs 人間翻訳:プロと比較テスト(2026年版)にあります。

  • 言葉、ElevenLabs Dubbing v2 (Alpha)。 重要な翻訳ミスは、Familiarのほうが54.7%少なくなりました(29件 vs 64件)。
  • 発話出力のミス、ElevenLabs Dubbing v1。 レビューで指摘された発話出力のミスは、Familiarのほうが48.8%少なくなりました(132件 vs 258件)。

03.声も口元もシーンも、ひとつのモデルから生成すると何が変わるか?

ひとつの統合モデルが、声も、口元も、シーンも同時に生成します。シーンと世界を理解し、誰が誰かを見失わないので、別人の声とズレた口元ではなく、俳優本人のパフォーマンスがそのまま残ります。

  • 声は俳優本人の演技から生まれます。 吹き替えはテキスト読み上げではありません。元の音声を取り込み、話し手の本人らしさと語り口を保ちます。
  • 口元だけでなく、目、眉、頬、頭まで顔全体が演じ直します。 顔全体が新しい言語を演じるので、視聴者が目にする口の動きと耳にする言葉がぴたりと合います(AIリップシンクとは何か、何を取りこぼすか、何がそれを超えるか(2026年版))。
  • シーンは吹き替え後も残ります。 笑い声、音楽と重低音、効果音、部屋の空気感。モデルが音楽と検出した区間は、そのまま通します。
  • 画面に映る全員が、それぞれ本人の声で吹き替えられます。 /demosにある3人が話す映画のシーンは、英語からスペイン語への吹き替えです。口元を覆うマイクも、顔を横切る手も。モデルはオクルージョンを理解しています。
  • 名前、地名、決め台詞は話した通りにそのまま残ります。 スタジオが管理する「翻訳しないリスト」で守り、ジョークは対象言語で伝わるように書き直されます。
  • 翻訳、俳優の声、シーンの音、リップシンクを、1回のレンダリングでまとめて仕上げます。

04.スタジオはどう運用するか?

  • レンダリング前に、言語ごとにレビュー。 パイプラインはレビューのステップで一旦停止し、スタジオ自身の翻訳者が翻訳された行をどれでも編集します。各言語はそれぞれの承認でレンダリングされるので、スペイン語は今日、残りはレビュー担当者の確認が済み次第です(文字起こしとレビュー)。
  • 1行のコンテキスト。 誰が画面に映り、どんな番組かを、シリーズ全体ならクリエイタースコープに、1エピソードだけならジョブスコープに設定します。狭いスコープが優先されます(コンテキスト)。
  • 同じ3つのスコープで使える「翻訳しないリスト」。 登場人物の名前や決め台詞が、第1話と同じ形で第60話にも残ります(翻訳しないリスト)。
  • Webhook。 翻訳が整うとdub.ready_for_review、言語ごとに仕上がるとdub.output_readyが届きます(Webhook)。
  • 30言語、どの言語からどの言語へも。 公開している3つの品質ティアに、品質の高い順に分かれています(対応言語)。
  • 参考価格。 翻訳も声も人が手がける吹き替え一式は、仕上がり1分あたり$70から$150かかります。Familiarのご利用はStudio契約で、カタログの規模に合わせてご用意します。
言語ごとに届くもの · すべての吹き替えにファイル一式が付属
成果物形式備考
完成した動画音声ミックスまで入ったmp4そのまま投稿できます
字幕.srtと.vttレビュー済みの文字起こしから生成。単体販売はありません
音声単体すべての音が入ったミックス、または声だけのトラックスタジオ側でミックスする場合に
タイトルと説明言語ごとに翻訳リンク、@ハンドル、#ハッシュタグ、チャプターは元の表記のまま

05.シーズン単位で契約する前に、スタジオは何を試すべきか?

  • いちばん難しいエピソードを選ぶ。 速いセリフ、ジョーク、感情の転換、固有名詞、セリフの下に流れる音楽が入ったもの。きれいなシーンが1本うまくいっても、シーズン全体の証明にはなりません。
  • 誰かが聴く前に、受け入れ基準を書いておく。 ネイティブのレビュー担当者が、言葉、声、シーン、顔をその基準で採点し、没入感が途切れた瞬間を記録します。採点表はAI吹き替えのパイロット検証の進め方(2026年版)にあります。
  • 後からの修正を含める。 マスターが変われば、それは新しい吹き替えリクエストです。変更された行はレビューのステップで確認し、「翻訳しないリスト」とコンテキストはそのまま引き継がれます。

よくある質問

海外の視聴者が「吹き替えが合わない」と言うのはなぜですか?

3つの要素がばらばらになったからです。声は別人のもので、口は元の言語を話し続け、セリフの下の音楽や部屋の響きは平板になっています。視聴者が原因を言葉にすることはまれですが、音と食い違う口の動きは、言葉そのものを聞き取りにくくします。

問題は翻訳ですか、声ですか?

両方で、しかも重なります。一文ずつの直訳は正確でも外国語臭さが残り、差し替えられた声は俳優を消してしまいます。ペアのクリップで比較すると、Familiarの声はElevenLabs Dubbing v1より本人に27.8%近く聞こえました。別の研究では、Familiarの翻訳はプロの一次翻訳と100.3%で互角でした。

自社の翻訳者が行をレビューすることはできますか?

はい。パイプラインはレビューのステップで一旦停止し、翻訳された行はレンダリング前にどれでも編集できます。各言語はレビュー担当者の確認が済んだ時点でレンダリングされるので、日本語がレビュー中でもスペイン語は先に公開できます。

登場人物の名前や決め台詞は、エピソードをまたいでも保たれますか?

はい。「翻訳しないリスト」に登録した名前、地名、決め台詞は、吹き替え、字幕、翻訳されたタイトルと説明のすべてで話した通りに残ります。クリエイタースコープに設定すればシリーズ全話に適用され、ジョブスコープの登録は1本のアップロードだけを上書きします。

言語ごとに何が届きますか?

音声ミックスまで仕上がった動画、レビュー済みの文字起こしから生成した.srtと.vttの字幕、翻訳されたタイトルと説明、そして音声単体です。音声は、すべての音が入ったミックスと、スタジオ側でミックスするための声だけのトラックの両方が届きます。

参考資料

  1. [1]Familiar vs ElevenLabsベンチマーク:全結果、信頼区間、試聴サンプル
  2. [2]Familiar vs プロ翻訳者:翻訳品質の研究
  3. [3]文字起こしとレビュー:レビューのステップと言語ごとのレンダリング(APIドキュメント)
  4. [4]動画翻訳で本当に重要なこと(4つの問題)
  5. [5]McGurk & MacDonald, “Hearing lips and seeing voices,” Nature 264 (1976)

吹き替えは、ついに良くなった。測定結果をご確認のうえ、お持ちのカタログについてチームにご相談ください。

FAMILIAR · ローンチムービー · 2:31