HET KORTE ANTWOORD
DE KORTE VERSIE
- Drie fouten maken dat een dub niet klopt: een vreemde stem, een mond die nog de brontaal spreekt en een scène die onder de nieuwe dialoog is vervlakt.
- Op dezelfde clips had ElevenLabs Dubbing v2 (Alpha) 270% meer fouten in het achtergrondgeluid: de lach, de muziek, de sfeer (111 gepaarde outputs, 5 augustus 2026).
- Familiar klinkt 27.8% meer als de echte spreker dan ElevenLabs Dubbing v1, in alle 11 talen dichterbij (418 gepaarde outputs, 5 augustus 2026).
- De eigen vertalers van de studio bewerken elke vertaalde regel voordat er gerenderd wordt, en elke taal rendert zodra die is goedgekeurd.
01.Waarom klopt de dub niet?
Twee van de fouten zijn ouder dan AI: een stemacteur is ook een vreemde stem, en geen enkele opnamesessie beweegt de mond van de acteur mee. AI-nasynchronisatie met alleen audio kan er een derde aan toevoegen, een vervlakte scène; hieronder gemeten.
- Een vreemde stem. Of nu een stemacteur of een standaardstem de regel inspreekt: wie de acteur kent, herkent hem niet meer (AI-nasynchronisatie van video, uitgelegd (2026)).
- Een mond die de verkeerde taal spreekt. Het brein combineert lipbewegingen en geluid om spraak te verstaan; kloppen die twee niet met elkaar, dan kost het verstaan meer moeite, of hoort de kijker zelfs een heel ander geluid: het McGurk-effect, onderdeel van hoe het brein beeld en geluid tot spraak samenvoegt. Een dub die alleen de stem vervangt, laat die botsing in elk frame staan.
- Een vervlakte scène. De lach, de muziek, de geluidseffecten en het sfeergeluid van de ruimte worden weggehaald of uitgesmeerd onder de nieuwe spraak.
- Een zin-voor-zin-vertaling. Een regel die woord voor woord is omgezet, leest als vertaald, ook als hij klopt, en grappen landen te laat of helemaal niet (Wat telt in videovertaling).
02.Wat zeggen de metingen?
ElevenLabs Dubbing v2 (Alpha) had 270% meer fouten in het achtergrondgeluid: de lach, de muziek, de sfeer.
11.92 VS 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 GEPAARDE OUTPUTS · MANDARIJN, SPAANS, JAPANS · 5 AUGUSTUS 2026Familiar klinkt 27.8% meer als de echte spreker dan ElevenLabs Dubbing v1; in alle 11 talen dichterbij.
0.4605 VS 0.3604 · ELEVENLABS DUBBING V1 · 418 GEPAARDE OUTPUTS · 11 TALEN · 5 AUGUSTUS 2026van de kwaliteit van de eerste versie van de professional, gemiddeld over Frans, Chinees, Hindi en Indonesisch, blind beoordeeld tegen referentiecorrecties van experts. Gelijkspel.
STUDIE PRODUCTIEVERTALING VS EERSTE VERSIE VAN PROFESSIONELE VERTALERS · AUGUSTUS 2026De twee ElevenLabs-cohorten en de studie tegen menselijke vertalers worden nooit samengevoegd. Alle data, intervallen en luistervoorbeelden: Familiar vs ElevenLabs en vs menselijke vertalers; de methode in AI vs menselijke vertaling: getest tegen professionals (2026).
- De woorden, ElevenLabs Dubbing v2 (Alpha). Familiar maakte 54.7% minder ernstige vertaalfouten (29 tegenover 64).
- Fouten in de gesproken output, ElevenLabs Dubbing v1. Familiar maakte 48.8% minder bij de controle gemarkeerde fouten in de gesproken output (132 tegenover 258).
03.Wat verandert er als stem, lippen en scène uit één model komen?
Eén model genereert stem, lippen en scène samen, met scène- en wereldbegrip en permanentie van identiteiten, zodat de performance van de acteur zelf behouden blijft in plaats van een vreemde stem over een mond die niet meeloopt.
- De stem komt uit de eigen performance van de acteur. Nasynchronisatie is geen tekst-naar-spraak: het model neemt de originele audio als vertrekpunt en bewaart de identiteit en de voordracht van de spreker.
- Het gezicht opnieuw gespeeld: ogen, wenkbrauwen, wangen en hoofd, niet alleen de lippen. Het hele gezicht vertolkt de nieuwe taal, zodat de mond die kijkers aflezen klopt met de woorden die ze horen (AI-lipsync: wat het is, wat het mist en wat het verslaat (2026)).
- De scène overleeft de dub. De lach, de muziek en de bas, de geluidseffecten, het sfeergeluid van de ruimte; passages die het model als muziek herkent, gaan onaangeroerd door.
- Iedereen in beeld wordt gedubd, ieder in zijn eigen stem; de filmscène met drie sprekers op /demos is gedubd van het Engels naar het Spaans. Microfoons vlak voor de mond, handen voor het gezicht: het model begrijpt wat het gezicht bedekt.
- Namen, plaatsen en catchphrases blijven precies zoals ze gezegd worden, via een Niet-vertalen-lijst die de studio zelf beheert; grappen worden herschreven zodat ze landen in de doeltaal.
- Eén render bevat de vertaling, de stem van de acteur, het geluid van de scène en de lipsync.
04.Hoe zet een studio het in?
- Controleren vóór het renderen, per taal. De pipeline pauzeert op een controlestap waar de eigen vertalers van de studio elke vertaalde regel bewerken; elke taal rendert zodra die is goedgekeurd: Spaans vandaag, de rest zodra hun reviewers akkoord geven (Transcript & controle).
- Eén regel context. Wie er in beeld is en wat de serie is, ingesteld op creatorniveau voor een hele serie of op jobniveau voor één aflevering; de smalste instelling wint (Context).
- Een Niet-vertalen-lijst op dezelfde drie niveaus, zodat de naam of catchphrase van een personage in aflevering 60 net zo standhoudt als in aflevering 1 (Niet-vertalen-lijst).
- Webhooks. dub.ready_for_review zodra de vertaling klaarstaat, dub.output_ready per afgeronde taal (Webhooks).
- 30 talen, elke naar elke, in drie gepubliceerde kwaliteitsniveaus, het beste eerst (Talen).
- De referentieprijs. Een volledige menselijke dub, vertaling plus stem, kost $70 tot $150 per opgeleverde minuut; toegang tot Familiar loopt via een Studio-contract, afgestemd op de catalogus.
| Onderdeel | Formaat | Opmerking |
|---|---|---|
| Kant-en-klare video | mp4 met de volledige audiomix | Klaar om te posten |
| Ondertitels | .srt en .vtt | Uit het nagekeken transcript; niet los verkocht |
| De audio los | De volledige mix, of alleen de stem | Voor de eigen mix van de studio |
| Titel en beschrijving | Vertaald per taal | Links, @handles, #hashtags en hoofdstukken blijven precies zoals ze zijn |
05.Wat test een studio voordat ze een seizoen vastlegt?
- Kies de moeilijkste aflevering, een met snelle dialogen, een grap, een emotionele wending, eigennamen en muziek onder de spraak; een schone scène bewijst niets over een seizoen.
- Leg de acceptatiecriteria vast voordat iemand luistert. Native reviewers beoordelen daartegen de woorden, de stem, de scène en het gezicht, en markeren het moment waarop ze eruit vielen; de scorecard staat in Een pilot voor AI-nasynchronisatie opzetten (2026).
- Neem een late wijziging mee. Een gewijzigde master is een nieuw dubverzoek; op de controlestap worden de gewijzigde regels nagekeken, en de Niet-vertalen-lijst en de context gaan mee.
VRAGEN
Waarom zeggen internationale kijkers dat de dub niet klopt?
Drie dingen zijn uit elkaar gevallen: de stem is van een vreemde, de mond spreekt nog de oorspronkelijke taal, en de muziek en het sfeergeluid onder de dialoog zijn vervlakt. Kijkers benoemen de oorzaak zelden; een mond die niet klopt met het geluid maakt spraak moeilijker te verstaan.
Ligt het aan de vertaling of aan de stem?
Aan beide, en ze versterken elkaar: een zin-voor-zin-vertaling leest als vertaald, ook als hij klopt, en een vervangen stem haalt de acteur weg. Op gepaarde clips klonk Familiar 27.8% meer als de echte spreker dan ElevenLabs Dubbing v1; in een aparte studie evenaarden de vertalingen de eerste versie van professionele vertalers met 100.3%.
Kunnen onze eigen vertalers de regels nog nakijken?
Ja. De pipeline pauzeert op een controlestap waar elke vertaalde regel wordt bewerkt voordat die rendert, en elke taal rendert zodra de reviewer ervan akkoord geeft: Spaans kan de deur uit terwijl Japans nog in controle zit.
Blijven namen en catchphrases van personages overeind over afleveringen heen?
Ja. Een Niet-vertalen-lijst houdt namen, plaatsen en catchphrases precies zoals ze gezegd worden, in de dub, de ondertitels en de vertaalde titel en beschrijving. Ingesteld op creatorniveau dekt hij elke aflevering van een serie; een invoer op jobniveau overschrijft dat voor één upload.
Wat ontvangen we per taal?
De kant-en-klare video met de volledige audiomix, ondertitels als .srt en .vtt uit het nagekeken transcript, de vertaalde titel en beschrijving, en de audio los: de volledige mix, of alleen de stem voor de eigen mix van de studio.
BRONNEN
- [1]Benchmark Familiar vs ElevenLabs: alle resultaten, intervallen en luistervoorbeelden
- [2]Familiar vs menselijke vertalers: de studie naar vertaalkwaliteit
- [3]Transcript & controle: de controlestap en renderen per taal (API-documentatie)
- [4]Wat telt in videovertaling (de vier problemen)
- [5]McGurk & MacDonald, “Hearing lips and seeing voices,” Nature 264 (1976)
Nasynchronisatie is eindelijk goed. Bekijk de metingen en praat dan met het team over uw catalogus.
FAMILIAR · DE LANCERINGSFILM · 2:31
