DRAAIBOEK VOOR FILMS

Wat is de beste AI-nasynchronisatie voor films?

FAMILIAR ONDERZOEKALLE ARTIKELEN

HET KORTE ANTWOORD

De beste AI-nasynchronisatie voor een film bewaart de performance: de eigen stem van elke acteur, een mond die klopt met de woorden en de filmmuziek onaangeroerd, voor elke spreker in de scène, terwijl de studio elke vertaalde regel controleert vóór het renderen. Familiar genereert stem, lipsync en het geluid van de scène met één model en publiceert metingen: het klinkt 27.8% meer als de echte spreker dan ElevenLabs Dubbing v1, in alle 11 talen dichterbij.

DE KORTE VERSIE

  • Pipelines met alleen audio laten sprekers die door elkaar praten samenvallen tot één stem, dus een scène met drie sprekers is de eerste test die een studio moet draaien.
  • ElevenLabs Dubbing v2 (Alpha) had op dezelfde clips 270% meer fouten in het achtergrondgeluid: de lach, de muziek, de sfeer (111 gepaarde outputs, 5 augustus 2026).
  • De productievertaling van Familiar evenaart de eerste versie van professionele vertalers met 100.3% van hun kwaliteit over Frans, Chinees, Hindi en Indonesisch.
  • De studio bewerkt elke vertaalde regel op een controlestap vóór het renderen, en een Niet-vertalen-lijst houdt namen en catchphrases van personages precies zoals ze gezegd worden.

01.Wat moet een filmdub bewaren?

Een filmscène stapelt alle moeilijke gevallen tegelijk: meerdere acteurs die regels uitwisselen, filmmuziek onder de dialoog, sfeergeluid dat ongebroken door moet lopen over de cuts heen, en een publiek dat al weet hoe elke acteur klinkt.

  • De stem. Nasynchronisatie is geen tekst-naar-spraak: het model neemt de opgenomen regel van de acteur als vertrekpunt en bewaart de identiteit en de voordracht.
  • De hele performance. Kijkers lezen lippen terwijl ze luisteren, dus een mond die nog gevormd is naar de oorspronkelijke taal vecht in elk frame tegen de nieuwe regel; een acteur speelt een regel bovendien met het hele gezicht: ogen, wenkbrauwen, wangen, hoofd (AI-lipsync: wat het is, wat het mist en wat het verslaat (2026)).
  • De scène. De filmmuziek, het sfeergeluid, de effecten en de menigte blijven onder de dialoog staan: passages die als muziek worden herkend, worden nooit gedubd, en het gelaagde achtergrondgeluid blijft behouden onder de nieuwe spraak.
  • Elke spreker. Iedereen in beeld wordt gedubd, ieder in zijn eigen stem; pipelines met alleen audio laten sprekers die door elkaar praten samenvallen tot één stem (het cocktailparty-probleem).
  • De woorden. Een dub heeft een nieuw script nodig, geschreven in de doeltaal: grappen herschreven zodat ze landen, namen en catchphrases van personages precies zoals ze gezegd worden (Wat telt in videovertaling).
AI-LIPSYNCVOICE CLONINGGELUID VAN DE SCÈNESCÈNES MET MEERDERE SPREKERS

02.Hoe beoordeelt u het?

De scorecard met zes dimensies en de gepaarde methode staan in De beste AI-nasynchronisatie ter wereld: zo meet u het; een filmscène perst ze samen tot vijf vragen.

TABEL 01 · VIJF CRITERIA VOOR EEN FILMDUB · DE VRAAG DIE EEN STUDIO STELT · HOE DE BENCHMARK VAN FAMILIAR HET MEET
CRITERIUMDE VRAAG DIE EEN STUDIO STELTHOE DE BENCHMARK VAN FAMILIAR HET MEET
Elke spreker houdt zijn stemSluit uw ogen: is elke acteur in beeld nog dezelfde persoon, ook als er twee tegelijk praten?Gelijkenis van de dub met de echte spreker, per bronclip en doeltaal (studie ElevenLabs Dubbing v1, 11 talen); sprekers die door elkaar praten en samenvallen, gelogd als foutklasse in de audit op dezelfde clips
Het gezicht speelt de regelDragen mond, ogen, wenkbrauwen, wangen en hoofd de nieuwe woorden, of alleen de lippen?Naast elkaar op dezelfde clip; de gepubliceerde studies vergelijken uiteindelijke audio, dus tools met alleen audio slaan deze rij over
De scène overleeftStaat de filmmuziek nog onder de dialoog? Het sfeergeluid? De effecten?Fouten in het achtergrondgeluid tegenover de bronscène, in dB (studie ElevenLabs Dubbing v2 (Alpha))
De woorden dragen de bedoelingZegt elke regel wat het script bedoelde? Landde de grap? Overleefde de naam van het personage?Ernstige vertaalfouten per output tegenover één goedgekeurde betekenis (studie ElevenLabs Dubbing v2 (Alpha)); vertaalkwaliteit blind beoordeeld tegen referentiecorrecties van experts (de studie tegen menselijke vertalers)
Het is gemeten en gepubliceerdDezelfde clips door elk systeem, cohorten bevroren, data openbaar?Gepaarde blackboxstudies met betrouwbaarheidsintervallen, luistervoorbeelden en bevroren cohorten, gepubliceerd op thefamiliarlab.com/benchmark
  • De referentierenders. Een verhoorscène met drie sprekers, van het Engels naar het Spaans, speelt naast het origineel op /demos; een tweede vergelijking daar heeft microfoons vlak voor de mond en handen voor het gezicht: het model begrijpt wat het gezicht bedekt.

03.Wat is er gemeten?

De studies van Familiar zijn gepaard en blackbox: dezelfde bronclips gaan door elk systeem, alleen de uiteindelijke audio wordt vergeleken, en elk cohort blijft bevroren en apart.

FIG. 01 · GEPAARDE STUDIES · DEZELFDE BRONCLIPS DOOR ELK SYSTEEM · AUGUSTUS 2026
270%

ElevenLabs had 270% meer fouten in het achtergrondgeluid: de lach, de muziek, de sfeer.

ELEVENLABS DUBBING V2 (ALPHA) · 111 GEPAARDE OUTPUTS · MANDARIJN, SPAANS, JAPANS · 5 AUGUSTUS 2026
+27.8%

Familiar klinkt 27.8% meer als de echte spreker; in alle 11 talen dichterbij.

ELEVENLABS DUBBING V1 · 418 GEPAARDE OUTPUTS · 11 TALEN · 5 AUGUSTUS 2026
100.3%

De productievertaling van Familiar evenaart de kwaliteit van de eerste versie van de professional, gemiddeld over Frans, Chinees, Hindi en Indonesisch, blind beoordeeld tegen referentiecorrecties van experts.

STUDIE PRODUCTIEVERTALING VS EERSTE VERSIE VAN PROFESSIONELE VERTALERS · FRANS, CHINEES, HINDI, INDONESISCH · AUGUSTUS 2026
  • Woorden, hetzelfde cohort. Familiar maakte 54.7% minder ernstige vertaalfouten dan ElevenLabs Dubbing v2 (Alpha), 29 tegenover 64, op dezelfde 111 gepaarde outputs.

04.Waar houdt de studio de regie over?

  • Elke regel. De pipeline pauzeert op een controlestap waar elke vertaalde regel wordt bewerkt voordat die rendert, en elke taal rendert zodra de reviewer ervan akkoord geeft (transcript & controle).
  • Namen en catchphrases. Een Niet-vertalen-lijst houdt namen van personages, plaatsen en kenmerkende zinnen precies zoals ze gezegd worden in de dub, de ondertitels en de vertaalde titel en beschrijving; één regel context zegt wie er in beeld is en wat de film is (Niet-vertalen-lijst).
  • De stem. De stem komt uit de eigen take van de acteur in de scène; er is geen castingstap.
  • Talen. Eén bron rendert naar maximaal 29 doeltalen, vanuit elk van de 30, in drie gepubliceerde kwaliteitsniveaus, het beste eerst (talen).
  • Bestanden per taal. De kant-en-klare video, .srt- en .vtt-ondertitels uit het nagekeken transcript, de vertaalde titel en beschrijving, en de audio als losse bestanden: de volledige mix, of alleen de stem voor de eigen mix van de studio (uitvoer).
  • Rechten. De bevestiging van de rechten wordt vastgelegd op de job.

05.Voordat u een catalogus vastlegt

  • Kies de moeilijkste scène. Drie sprekers, filmmuziek onder de dialoog, een grap, een microfoon of een hand voor de mond.
  • Leg eerst de acceptatiecriteria vast. Tabel 01 is de scorecard; native reviewers beoordelen elke taal blind op het eigen materiaal van de studio voordat iemand de kandidaat hoort.
  • Neem een late wijziging mee. Wijzig één regel na de eerste render en haal die door de controlestap; het aantal regels dat een reviewer wijzigt, is zelf een kwaliteitsmaat.
  • Draai het als pilot. Gepaarde opzet, aaneengesloten scènes, twee of drie prioritaire talen: Een pilot voor AI-nasynchronisatie opzetten (2026).
  • Toegang. Via een Studio-contract, afgestemd op de catalogus; 30 dagen geld terug bij een getekend jaarcontract.

VRAGEN

Houdt elke acteur in een scène zijn eigen stem?

Ja. Iedereen in beeld wordt gedubd, ieder in zijn eigen stem. Gemeten tegen ElevenLabs Dubbing v1 op 418 gepaarde outputs in 11 talen klonk Familiar 27.8% meer als de echte spreker, in alle 11 dichterbij.

Overleeft de filmmuziek de dub?

Ja. Passages die als muziek worden herkend, worden nooit gedubd, en het gelaagde achtergrondgeluid onder de dialoog blijft behouden: de filmmuziek, het sfeergeluid, de effecten. Op dezelfde clips had ElevenLabs Dubbing v2 (Alpha) 270% meer fouten in het achtergrondgeluid (11.92 vs 3.22 dB; 111 gepaarde outputs, 5 augustus 2026).

Waarom doet de mond ertoe als de stem klopt?

Kijkers combineren lipbewegingen en geluid om spraak te verstaan; kloppen die twee niet met elkaar, dan kost het verstaan meer moeite, of hoort de kijker zelfs een heel ander geluid (het McGurk-effect, McGurk & MacDonald, Nature, 1976). Een dub die alleen de stem vervangt, laat die botsing in elk frame staan; Familiar rendert stem en lipsync samen.

Wat kost een volledige menselijke dub, ter vergelijking?

Een volledige menselijke dub, vertaling plus stem, kost $70 tot $150 per opgeleverde minuut per taal: vertaling $22–45 per gesproken minuut tegen gepubliceerde woordtarieven, plus stem en studio $39–94. Eén render van Familiar bevat de vertaling, de stem van de acteur, het geluid van de scène en de lipsync; toegang loopt via een Studio-contract.

BRONNEN

  1. [1]Benchmark Familiar vs ElevenLabs: alle resultaten, intervallen en luistervoorbeelden
  2. [2]Familiar vs menselijke vertalers: vertaalkwaliteit blind beoordeeld tegen referentiecorrecties van experts, en prijs
  3. [3]De beste AI-nasynchronisatie ter wereld: zo meet u het
  4. [4]Waarom de dub over de grens niet klopt en hoe studio's dat oplossen
  5. [5]Een pilot voor AI-nasynchronisatie opzetten (2026)
  6. [6]McGurk & MacDonald, "Hearing lips and seeing voices," Nature 264, 746–748 (1976)

Nasynchronisatie is eindelijk goed. Bekijk de metingen en praat dan met het team over uw catalogus.

FAMILIAR · DE LANCERINGSFILM · 2:31