PLAYBOOK FÜR STUDIOS

Warum die Synchro im Ausland nicht stimmt und was Studios tun

FAMILIAR FORSCHUNGALLE ARTIKEL

DIE KURZE ANTWORT

Eine Synchro stimmt nicht, wenn drei Dinge auseinanderfallen: Eine fremde Stimme ersetzt die des Schauspielers, der Mund spricht weiter die Originalsprache, und Musik und Raum unter dem Dialog werden platt. Die Lösung ist, alle drei gemeinsam zu synchronisieren. Das eine Modell von Familiar behält die eigene Stimme jedes Schauspielers, spielt das Gesicht neu und erhält den Ton der Szene in einem einzigen Rendering; jede übersetzte Zeile wird bearbeitet, bevor sie gerendert wird.

DIE KURZFASSUNG

  • Drei Fehler lassen eine Synchro falsch wirken: eine fremde Stimme, ein Mund, der noch die Ausgangssprache spricht, und eine Szene, die unter dem neuen Dialog platt wird.
  • Auf denselben Clips hatte ElevenLabs Dubbing v2 (Alpha) 270% mehr Fehler bei den Hintergrundgeräuschen: das Lachen, die Musik, die Atmosphäre (111 Vergleichspaare, 5. August 2026).
  • Familiar klingt 27.8% mehr nach dem echten Sprecher als ElevenLabs Dubbing v1, in allen 11 Sprachen näher dran (418 Vergleichspaare, 5. August 2026).
  • Die eigenen Übersetzer des Studios bearbeiten jede übersetzte Zeile, bevor sie gerendert wird, und jede Sprache rendert nach ihrer eigenen Freigabe.

01.Warum stimmt die Synchro nicht?

Zwei der Fehler sind älter als KI: Auch ein Synchronsprecher ist eine fremde Stimme, und keine Aufnahmesitzung bewegt den Mund des Schauspielers. Reine Audio-KI-Synchronisation kann einen dritten hinzufügen, eine plattgemachte Szene, unten gemessen.

  • Eine fremde Stimme. Ob ein Synchronsprecher oder eine Standardstimme die Zeile liest: Wer den Schauspieler kennt, erkennt ihn nicht mehr (KI-Videosynchronisation, erklärt (2026)).
  • Ein Mund, der die falsche Sprache spricht. Das Gehirn kombiniert Lippenbewegungen und Ton, um Sprache zu verstehen; passt beides nicht zusammen, wird das Verstehen anstrengender, oder der Zuschauer nimmt einen ganz anderen Laut wahr: der McGurk-Effekt, Teil der audiovisuellen Sprachwahrnehmung. Eine Synchro, die nur die Stimme austauscht, lässt diesen Widerspruch in jedem einzelnen Bild stehen.
  • Eine plattgemachte Szene. Das Lachen, die Musik, die Soundeffekte und die Atmosphäre des Raums werden unter der neuen Sprache entfernt oder verschmiert.
  • Eine Satz-für-Satz-Übersetzung. Eine Zeile, die Wort für Wort übertragen wird, liest sich fremd, selbst wenn sie korrekt ist, und Witze kommen zu spät oder gar nicht an (Worauf es bei der Videoübersetzung ankommt).
FREMDE STIMMEMUND PASST NICHTPLATTE SZENEWÖRTLICHE ÜBERSETZUNG

02.Was sagen die Messungen?

ABB. 01 · GEPAARTE STUDIEN · DIESELBEN AUSGANGSCLIPS · VERGLICHEN WURDE DAS FERTIGE AUDIO · AUGUST 2026
270%

ElevenLabs Dubbing v2 (Alpha) hatte 270% mehr Fehler bei den Hintergrundgeräuschen: das Lachen, die Musik, die Atmosphäre.

11.92 VS 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 VERGLEICHSPAARE · MANDARIN, SPANISCH, JAPANISCH · 5. AUGUST 2026
+27.8%

Familiar klingt 27.8% mehr nach dem echten Sprecher als ElevenLabs Dubbing v1, in allen 11 Sprachen näher dran.

0.4605 VS 0.3604 · ELEVENLABS DUBBING V1 · 418 VERGLEICHSPAARE · 11 SPRACHEN · 5. AUGUST 2026
100.3%

der Qualität der professionellen Erstübersetzung, gemittelt über Französisch, Chinesisch, Hindi und Indonesisch, blind bewertet gegen von Experten redigierte Referenzen. Ein Gleichstand.

PRODUKTIONS-ÜBERSETZUNGSSTUDIE VS PROFESSIONELLE ÜBERSETZER (ERSTÜBERSETZUNG) · AUGUST 2026

Die beiden ElevenLabs-Kohorten und die Studie gegen menschliche Übersetzer werden nie zusammengelegt. Alle Daten, Konfidenzintervalle und Hörbeispiele: Familiar vs ElevenLabs und vs menschliche Übersetzer; die Methode in KI vs menschliche Übersetzung: gegen Profis getestet (2026).

  • Die Worte, ElevenLabs Dubbing v2 (Alpha). Familiar machte 54.7% weniger schwerwiegende Übersetzungsfehler im gesprochenen Text (29 vs 64).
  • Fehler in der gesprochenen Ausgabe, ElevenLabs Dubbing v1. Familiar machte 48.8% weniger in der Prüfung markierte Fehler in der gesprochenen Ausgabe (132 vs 258).

03.Was ändert sich, wenn Stimme, Lippen und Szene aus einem Modell kommen?

Ein einziges Modell erzeugt Stimme, Lippen und Szene gemeinsam, mit Szenen- und Weltverständnis und Permanenz der Identitäten, sodass die Performance des Schauspielers selbst erhalten bleibt, statt einer fremden Stimme über einem Mund, der nicht synchron läuft.

  • Die Stimme kommt aus der Performance des Schauspielers selbst. Synchronisation ist kein Text-to-Speech: Sie nimmt das Originalaudio entgegen und erhält Identität und Vortragsweise des Sprechers.
  • Das Gesicht spielt neu, nicht nur die Lippen: Augen, Brauen, Wangen, Kopf. Das ganze Gesicht spricht die neue Sprache, damit der Mund, den die Zuschauer ablesen, zu den Worten passt, die sie hören (KI-Lippensynchronisation: Was sie ist, was sie übersieht, was besser ist (2026)).
  • Die Szene überlebt die Synchro. Das Lachen, die Musik und der Bass, die Soundeffekte, die Atmosphäre des Raums; Passagen, die das Modell als Musik erkennt, laufen unverändert durch.
  • Alle vor der Kamera werden synchronisiert, jeweils in ihrer eigenen Stimme; die Filmszene mit drei Sprechern auf /demos ist von Englisch nach Spanisch synchronisiert. Mikrofone direkt vorm Mund, Hände vorm Gesicht: Das Modell versteht Verdeckungen.
  • Namen, Orte und Catchphrases bleiben genau so, wie sie gesagt werden, über eine Nicht-übersetzen-Liste, die das Studio führt; Witze werden in der Zielsprache neu gesetzt.
  • Ein Rendering trägt die Übersetzung, die Stimme des Schauspielers, den Ton der Szene und den Lipsync.

04.Wie setzt ein Studio das ein?

  • Prüfung vor dem Rendern, pro Sprache. Die Pipeline pausiert an einem Prüfschritt, an dem die eigenen Übersetzer des Studios jede übersetzte Zeile bearbeiten; jede Sprache rendert nach ihrer eigenen Freigabe, Spanisch heute, der Rest, sobald die jeweiligen Prüfer freigeben (Transkript & Prüfung).
  • Ein Kontextsatz. Wer im Bild ist und worum es in der Serie geht, gesetzt auf Creator-Ebene für eine ganze Serie oder auf Job-Ebene für eine Folge; die engere Ebene gewinnt (Kontext).
  • Eine Nicht-übersetzen-Liste auf denselben drei Ebenen, damit der Name oder die Catchphrase einer Figur in Folge 60 genauso hält wie in Folge 1 (Nicht übersetzen).
  • Webhooks. dub.ready_for_review, wenn die Übersetzung bereitsteht, dub.output_ready pro fertiger Sprache (Webhooks).
  • 30 Sprachen, jede zu jeder, in drei veröffentlichten Qualitätsstufen, die beste zuerst (Sprachen).
  • Der Referenzpreis. Eine komplette Synchronisation von Menschenhand, Übersetzung plus Stimme, kostet $70 bis $150 pro fertiger Minute; Zugang zu Familiar gibt es per Studio-Vertrag, zugeschnitten auf den Katalog.
WAS PRO SPRACHE ANKOMMT · JEDE SYNCHRO LIEFERT IHRE DATEIEN
BestandteilFormatHinweis
Fertiges Videomp4 mit komplett abgemischtem TonBereit zur Veröffentlichung
Untertitel.srt und .vttAus dem geprüften Transkript; nicht einzeln erhältlich
Ton separatDer komplette Mix oder nur die StimmeFür die eigene Mischung des Studios
Titel und BeschreibungPro Sprache übersetztLinks, @Handles, #Hashtags und Kapitel bleiben unverändert

05.Was sollte ein Studio testen, bevor es eine Staffel vergibt?

  • Die schwierigste Folge wählen, eine mit schnellen Dialogen, einem Witz, einer emotionalen Wendung, Eigennamen und Musik unter der Sprache; eine saubere Szene beweist nichts über eine Staffel.
  • Die Abnahmekriterien schreiben, bevor jemand zuhört. Muttersprachliche Prüfer bewerten daran Worte, Stimme, Szene und Gesicht und markieren den Moment, in dem die Immersion bricht; die Bewertungstabelle steht in So läuft ein Pilotprojekt für KI-Synchronisation (2026).
  • Eine späte Änderung einplanen. Ein geändertes Master ist eine neue Synchro-Anfrage; am Prüfschritt werden die geänderten Zeilen geprüft, und Nicht-übersetzen-Liste und Kontextsatz werden übernommen.

FRAGEN

Warum sagen internationale Zuschauer, die Synchro stimme nicht?

Drei Dinge sind auseinandergefallen: Die Stimme gehört einem Fremden, der Mund spricht weiter die Originalsprache, und Musik und Raum unter dem Dialog wurden platt. Zuschauer nennen die Ursache selten; ein Mund, der dem Ton widerspricht, macht Sprache schwerer verständlich.

Liegt es an der Übersetzung oder an der Stimme?

An beidem, und sie verstärken sich: Eine Satz-für-Satz-Übersetzung liest sich fremd, selbst wenn sie korrekt ist, und eine ersetzte Stimme nimmt den Schauspieler weg. Auf gepaarten Clips klang Familiar 27.8% mehr nach dem echten Sprecher als ElevenLabs Dubbing v1; in einer separaten Studie erreichten seine Übersetzungen 100.3% der Qualität der professionellen Erstübersetzung.

Können unsere eigenen Übersetzer die Zeilen weiterhin prüfen?

Ja. Die Pipeline pausiert an einem Prüfschritt, an dem jede übersetzte Zeile bearbeitet wird, bevor sie gerendert wird, und jede Sprache rendert, sobald ihr Prüfer freigibt: Spanisch kann erscheinen, während Japanisch noch in der Prüfung ist.

Bleiben Figurennamen und Catchphrases über alle Folgen erhalten?

Ja. Eine Nicht-übersetzen-Liste hält Namen, Orte und Catchphrases genau so, wie sie gesagt werden, in der Synchro, in den Untertiteln und in Titel und Beschreibung. Auf Creator-Ebene gesetzt gilt sie für jede Folge einer Serie; ein Eintrag auf Job-Ebene überschreibt sie für einen einzelnen Upload.

Was erhalten wir pro Sprache?

Das fertige Video mit komplett abgemischtem Ton, Untertitel als .srt- und .vtt-Dateien aus dem geprüften Transkript, Titel und Beschreibung in der Zielsprache und den Ton separat: den kompletten Mix oder nur die Stimme für die eigene Mischung des Studios.

QUELLEN

  1. [1]Benchmark Familiar vs ElevenLabs: alle Ergebnisse, Konfidenzintervalle und Hörbeispiele
  2. [2]Familiar vs menschliche Übersetzer: die Studie zur Übersetzungsqualität
  3. [3]Transkript & Prüfung: der Prüfschritt und das Rendern pro Sprache (API-Dokumentation)
  4. [4]Worauf es bei der Videoübersetzung ankommt (die vier Probleme)
  5. [5]McGurk & MacDonald, „Hearing lips and seeing voices“, Nature 264 (1976)

Synchronisation, endlich gut. Sehen Sie sich die Messungen an, und sprechen Sie dann mit dem Team über Ihren Katalog.

FAMILIAR · DER LAUNCH-FILM · 2:31