DET KORTE SVAR
DEN KORTE VERSION
- Pipelines med lyd alene smelter overlappende talere sammen til én stemme, så en scene med tre talere er den første test, et filmselskab bør køre.
- ElevenLabs Dubbing v2 (Alpha) havde 270% større fejl i baggrundslyden på de samme klip: latteren, musikken, atmosfæren (111 parrede output, 5. august 2026).
- Familiars produktionsoversættelse matcher professionelle ekspertoversætteres første udkast med 100.3% af deres kvalitet over fransk, kinesisk, hindi og indonesisk.
- Filmselskabet redigerer enhver oversat linje ved et gennemgangstrin før rendering, og en Oversæt ikke-liste holder karakternavne og faste vendinger præcis, som de siges.
01.Hvad skal en filmdub bevare?
En filmscene stabler alle de svære tilfælde på én gang: flere skuespillere, der veksler replikker, underlægningsmusik under dialogen, rumtone, der skal løbe ubrudt over klippene, og et publikum, der allerede ved, hvordan hver skuespiller lyder.
- Stemmen. Dubbing er ikke tekst-til-tale: den tager skuespillerens indspillede replik ind og bevarer identiteten og fremførelsen.
- Hele præstationen. Seerne læser læber, mens de lytter, så en mund, der stadig er formet efter originalsproget, kæmper mod den nye replik i hvert billede; en skuespiller spiller også en replik med hele ansigtet: øjne, bryn, kinder, hoved (AI-lipsync: hvad det er, hvad det mangler, og hvad der slår det (2026)).
- Scenen. Underlægningsmusikken, rumtonen, effekterne og publikum bliver under dialogen: passager registreret som musik dubbes aldrig, og lydtæppet bevares under den nye tale.
- Hver taler. Alle i billedet bliver dubbet, hver med sin egen stemme; pipelines med lyd alene smelter overlappende talere sammen til én stemme (cocktailparty-problemet).
- Ordene. En dub kræver et nyt manuskript skrevet på målsproget: jokes, der lander igen, karakternavne og faste vendinger holdt præcis, som de siges (Hvad der betyder noget i videooversættelse).
02.Hvordan bedømmer man det?
Bedømmelsesskemaet med seks dimensioner og den parrede metode findes i Verdens bedste AI-dubbing: sådan måler man den; en filmscene komprimerer dem til fem spørgsmål.
| KRITERIUM | DET SPØRGSMÅL, FILMSELSKABET STILLER | SÅDAN MÅLER FAMILIARS BENCHMARK DET |
|---|---|---|
| Hver taler beholder sin stemme | Luk øjnene: er hver skuespiller i billedet stadig den samme person, også når to taler på én gang? | Dubbens stemmelighed med den rigtige taler, pr. kildeklip og målsprog (studiet mod ElevenLabs Dubbing v1, 11 sprog); sammensmeltning af overlappende talere logget som en fejlklasse i gennemgangen af de samme klip |
| Ansigtet spiller replikken | Bærer munden, øjnene, brynene, kinderne og hovedet de nye ord, eller kun læberne? | Side om side på det samme klip; de offentliggjorte studier sammenligner færdig lyd, så værktøjer med lyd alene springer denne række over |
| Scenen overlever | Ligger underlægningsmusikken stadig under dialogen? Rumtonen? Effekterne? | Fejl i baggrundslyden mod kildescenen, i dB (studiet mod ElevenLabs Dubbing v2 (Alpha)) |
| Ordene bærer meningen | Siger hver replik det, manuskriptet mente? Landede joken? Overlevede karakterens navn? | Vigtige oversættelsesfejl pr. output mod én godkendt mening (studiet mod ElevenLabs Dubbing v2 (Alpha)); oversættelseskvalitet bedømt blindt mod eksperters referenceredigeringer (studiet af menneskelig oversættelse) |
| Det er målt og offentliggjort | Samme klip gennem hvert system, kohorter fastfrosne, data offentlige? | Parrede black-box-studier med konfidensintervaller, lytteeksempler og fastfrosne kohorter, offentliggjort på thefamiliarlab.com/benchmark |
- Referencerenderingerne. En afhøringsscene med tre talere, engelsk til spansk, afspilles ved siden af originalen på /demos; et andet side-om-side-klip dér har mikrofoner foran munden og hænder hen over ansigtet: modellen forstår okklusioner.
03.Hvad blev målt?
Familiars studier er parrede og black-box: de samme kildeklip kører gennem hvert system, kun den færdige lyd sammenlignes, og hver kohorte holdes fastfrosset og adskilt.
ElevenLabs havde 270% større fejl i baggrundslyden: latteren, musikken, atmosfæren.
ELEVENLABS DUBBING V2 (ALPHA) · 111 PARREDE OUTPUT · MANDARIN, SPANSK, JAPANSK · 5. AUGUST 2026Familiar lyder 27.8% mere som den rigtige taler; alle 11 sprog faldt ud til Familiars fordel.
ELEVENLABS DUBBING V1 · 418 PARREDE OUTPUT · 11 SPROG · 5. AUGUST 2026Familiars produktionsoversættelse matcher kvaliteten i den professionelle oversætters første udkast, i gennemsnit over fransk, kinesisk, hindi og indonesisk, bedømt blindt mod eksperters referenceredigeringer.
STUDIE AF PRODUKTIONSOVERSÆTTELSE MOD PROFESSIONELLE EKSPERTOVERSÆTTERES FØRSTE UDKAST · FRANSK, KINESISK, HINDI, INDONESISK · AUGUST 2026- Ordene, samme kohorte. Familiar lavede 54.7% færre vigtige oversættelsesfejl i det talte end ElevenLabs Dubbing v2 (Alpha), 29 mod 64, på de samme 111 parrede output.
04.Hvad styrer filmselskabet stadig?
- Hver linje. Pipelinen stopper ved et gennemgangstrin, hvor enhver oversat linje redigeres, før den renderes, og hvert sprog renderes, når dets korrekturlæser har sagt god for det (transskription & gennemgang).
- Navne og faste vendinger. En Oversæt ikke-liste holder karakternavne, steder og kendte replikker præcis, som de siges, i dubben, underteksterne og den oversatte titel og beskrivelse; en kontekstlinje på én sætning fortæller, hvem der er i billedet, og hvad filmen handler om (Oversæt ikke).
- Stemmen. Stemmen kommer fra skuespillerens egen optagelse i scenen; der er intet castingtrin.
- Sprog. Én kilde renderes til op til 29 målsprog, fra et hvilket som helst af 30, i tre offentliggjorte kvalitetsniveauer, bedste først (sprog).
- Leverancer pr. sprog. Den færdige video, .srt- og .vtt-undertekster fra den gennemgåede transskription, den oversatte titel og beskrivelse, og lyden som selvstændige filer: det fulde mix, eller stemmen alene til filmselskabets eget mix (output).
- Rettigheder. Bekræftelsen af rettighederne registreres på jobbet.
05.Før man forpligter sig til et katalog
- Vælg den sværeste scene. Tre talere, underlægningsmusik under dialogen, en joke, en mikrofon eller en hånd foran munden.
- Skriv acceptkriterierne først. Tabel 01 er bedømmelsesskemaet; bedømmere med sproget som modersmål scorer hvert sprog blindt på filmselskabets egne optagelser, før nogen hører kandidaten.
- Tag en sen ændring med. Ret én replik efter den første rendering, og kør den gennem gennemgangstrinnet; antallet af linjer, en korrekturlæser ændrer, er i sig selv et kvalitetsmål.
- Kør det som et pilotprojekt. Parret design, sammenhængende scener, to eller tre prioriterede sprog: Sådan kører man et pilotprojekt med AI-dubbing (2026).
- Adgang. Via Studio-kontrakt, dimensioneret efter kataloget; 30 dages pengene-tilbage-garanti på underskrevne årskontrakter.
SPØRGSMÅL
Beholder hver skuespiller i en scene sin egen stemme?
Ja. Alle i billedet bliver dubbet, hver med sin egen stemme. Målt mod ElevenLabs Dubbing v1 på 418 parrede output over 11 sprog lød Familiar 27.8% mere som den rigtige taler, tættere på i alle 11.
Overlever underlægningsmusikken dubben?
Ja. Passager registreret som musik dubbes aldrig, og lydtæppet under dialogen bevares: underlægningsmusikken, rumtonen, effekterne. På de samme klip havde ElevenLabs Dubbing v2 (Alpha) 270% større fejl i baggrundslyden (11.92 mod 3.22 dB; 111 parrede output, 5. august 2026).
Hvorfor betyder munden noget, hvis stemmen er rigtig?
Seerne kombinerer mundbevægelser og lyd for at forstå tale; når de ikke passer sammen, bliver det sværere at forstå, eller seeren hører en helt anden lyd (McGurk-effekten, McGurk & MacDonald, Nature, 1976). En dub med kun ny stemme lader det misforhold stå i hvert eneste billede; Familiar renderer stemme og lipsync sammen.
Hvad koster komplet dubbing udført af mennesker til sammenligning?
Komplet dubbing udført af mennesker, oversættelse plus stemme, koster $70 til $150 pr. færdigt minut pr. sprog: oversættelse $22 til $45 pr. talt minut til offentliggjorte priser pr. ord, plus stemme og studietid $39 til $94. Én rendering fra Familiar indeholder oversættelsen, skuespillerens stemme, scenens lyd og lipsyncen; adgang sker via Studio-kontrakt.
REFERENCER
- [1]Familiar mod ElevenLabs-benchmarken: alle resultater, intervaller og lytteeksempler
- [2]Familiar mod menneskelige oversættere: oversættelseskvalitet bedømt blindt mod eksperters referenceredigeringer, og pris
- [3]Verdens bedste AI-dubbing: sådan måler man den
- [4]Dubben føles forkert i udlandet: sådan løser produktionsselskaber det
- [5]Sådan kører man et pilotprojekt med AI-dubbing (2026)
- [6]McGurk & MacDonald, "Hearing lips and seeing voices," Nature 264, 746–748 (1976)
Dubbing er endelig blevet god. Se målingerne, og tal så med teamet om jeres katalog.
FAMILIAR · LANCERINGSFILMEN · 2:31
