DREJEBOG: FILM

Hvad er den bedste AI-dubbing til film?

FAMILIAR FORSKNINGALLE ARTIKLER

DET KORTE SVAR

Den bedste AI-dubbing til en film bevarer præstationen: hver skuespillers egen stemme, en mund, der passer til ordene, og underlægningsmusikken uberørt, for hver taler i scenen, mens filmselskabet gennemgår hver oversat linje før rendering. Familiar genererer stemme, lipsync og scenens lyd med én model og offentliggør målinger: den lyder 27.8% mere som den rigtige taler end ElevenLabs Dubbing v1, tættere på i alle 11 sprog.

DEN KORTE VERSION

  • Pipelines med lyd alene smelter overlappende talere sammen til én stemme, så en scene med tre talere er den første test, et filmselskab bør køre.
  • ElevenLabs Dubbing v2 (Alpha) havde 270% større fejl i baggrundslyden på de samme klip: latteren, musikken, atmosfæren (111 parrede output, 5. august 2026).
  • Familiars produktionsoversættelse matcher professionelle ekspertoversætteres første udkast med 100.3% af deres kvalitet over fransk, kinesisk, hindi og indonesisk.
  • Filmselskabet redigerer enhver oversat linje ved et gennemgangstrin før rendering, og en Oversæt ikke-liste holder karakternavne og faste vendinger præcis, som de siges.

01.Hvad skal en filmdub bevare?

En filmscene stabler alle de svære tilfælde på én gang: flere skuespillere, der veksler replikker, underlægningsmusik under dialogen, rumtone, der skal løbe ubrudt over klippene, og et publikum, der allerede ved, hvordan hver skuespiller lyder.

  • Stemmen. Dubbing er ikke tekst-til-tale: den tager skuespillerens indspillede replik ind og bevarer identiteten og fremførelsen.
  • Hele præstationen. Seerne læser læber, mens de lytter, så en mund, der stadig er formet efter originalsproget, kæmper mod den nye replik i hvert billede; en skuespiller spiller også en replik med hele ansigtet: øjne, bryn, kinder, hoved (AI-lipsync: hvad det er, hvad det mangler, og hvad der slår det (2026)).
  • Scenen. Underlægningsmusikken, rumtonen, effekterne og publikum bliver under dialogen: passager registreret som musik dubbes aldrig, og lydtæppet bevares under den nye tale.
  • Hver taler. Alle i billedet bliver dubbet, hver med sin egen stemme; pipelines med lyd alene smelter overlappende talere sammen til én stemme (cocktailparty-problemet).
  • Ordene. En dub kræver et nyt manuskript skrevet på målsproget: jokes, der lander igen, karakternavne og faste vendinger holdt præcis, som de siges (Hvad der betyder noget i videooversættelse).
AI-LIPSYNCSTEMMEKLONINGSCENENS LYDSCENER MED FLERE TALERE

02.Hvordan bedømmer man det?

Bedømmelsesskemaet med seks dimensioner og den parrede metode findes i Verdens bedste AI-dubbing: sådan måler man den; en filmscene komprimerer dem til fem spørgsmål.

TABEL 01 · FEM KRITERIER FOR EN FILMDUB · DET SPØRGSMÅL, FILMSELSKABET STILLER · SÅDAN MÅLER FAMILIARS BENCHMARK DET
KRITERIUMDET SPØRGSMÅL, FILMSELSKABET STILLERSÅDAN MÅLER FAMILIARS BENCHMARK DET
Hver taler beholder sin stemmeLuk øjnene: er hver skuespiller i billedet stadig den samme person, også når to taler på én gang?Dubbens stemmelighed med den rigtige taler, pr. kildeklip og målsprog (studiet mod ElevenLabs Dubbing v1, 11 sprog); sammensmeltning af overlappende talere logget som en fejlklasse i gennemgangen af de samme klip
Ansigtet spiller replikkenBærer munden, øjnene, brynene, kinderne og hovedet de nye ord, eller kun læberne?Side om side på det samme klip; de offentliggjorte studier sammenligner færdig lyd, så værktøjer med lyd alene springer denne række over
Scenen overleverLigger underlægningsmusikken stadig under dialogen? Rumtonen? Effekterne?Fejl i baggrundslyden mod kildescenen, i dB (studiet mod ElevenLabs Dubbing v2 (Alpha))
Ordene bærer meningenSiger hver replik det, manuskriptet mente? Landede joken? Overlevede karakterens navn?Vigtige oversættelsesfejl pr. output mod én godkendt mening (studiet mod ElevenLabs Dubbing v2 (Alpha)); oversættelseskvalitet bedømt blindt mod eksperters referenceredigeringer (studiet af menneskelig oversættelse)
Det er målt og offentliggjortSamme klip gennem hvert system, kohorter fastfrosne, data offentlige?Parrede black-box-studier med konfidensintervaller, lytteeksempler og fastfrosne kohorter, offentliggjort på thefamiliarlab.com/benchmark
  • Referencerenderingerne. En afhøringsscene med tre talere, engelsk til spansk, afspilles ved siden af originalen på /demos; et andet side-om-side-klip dér har mikrofoner foran munden og hænder hen over ansigtet: modellen forstår okklusioner.

03.Hvad blev målt?

Familiars studier er parrede og black-box: de samme kildeklip kører gennem hvert system, kun den færdige lyd sammenlignes, og hver kohorte holdes fastfrosset og adskilt.

FIG. 01 · PARREDE STUDIER · DE SAMME KILDEKLIP GENNEM HVERT SYSTEM · AUGUST 2026
270%

ElevenLabs havde 270% større fejl i baggrundslyden: latteren, musikken, atmosfæren.

ELEVENLABS DUBBING V2 (ALPHA) · 111 PARREDE OUTPUT · MANDARIN, SPANSK, JAPANSK · 5. AUGUST 2026
+27.8%

Familiar lyder 27.8% mere som den rigtige taler; alle 11 sprog faldt ud til Familiars fordel.

ELEVENLABS DUBBING V1 · 418 PARREDE OUTPUT · 11 SPROG · 5. AUGUST 2026
100.3%

Familiars produktionsoversættelse matcher kvaliteten i den professionelle oversætters første udkast, i gennemsnit over fransk, kinesisk, hindi og indonesisk, bedømt blindt mod eksperters referenceredigeringer.

STUDIE AF PRODUKTIONSOVERSÆTTELSE MOD PROFESSIONELLE EKSPERTOVERSÆTTERES FØRSTE UDKAST · FRANSK, KINESISK, HINDI, INDONESISK · AUGUST 2026
  • Ordene, samme kohorte. Familiar lavede 54.7% færre vigtige oversættelsesfejl i det talte end ElevenLabs Dubbing v2 (Alpha), 29 mod 64, på de samme 111 parrede output.

04.Hvad styrer filmselskabet stadig?

  • Hver linje. Pipelinen stopper ved et gennemgangstrin, hvor enhver oversat linje redigeres, før den renderes, og hvert sprog renderes, når dets korrekturlæser har sagt god for det (transskription & gennemgang).
  • Navne og faste vendinger. En Oversæt ikke-liste holder karakternavne, steder og kendte replikker præcis, som de siges, i dubben, underteksterne og den oversatte titel og beskrivelse; en kontekstlinje på én sætning fortæller, hvem der er i billedet, og hvad filmen handler om (Oversæt ikke).
  • Stemmen. Stemmen kommer fra skuespillerens egen optagelse i scenen; der er intet castingtrin.
  • Sprog. Én kilde renderes til op til 29 målsprog, fra et hvilket som helst af 30, i tre offentliggjorte kvalitetsniveauer, bedste først (sprog).
  • Leverancer pr. sprog. Den færdige video, .srt- og .vtt-undertekster fra den gennemgåede transskription, den oversatte titel og beskrivelse, og lyden som selvstændige filer: det fulde mix, eller stemmen alene til filmselskabets eget mix (output).
  • Rettigheder. Bekræftelsen af rettighederne registreres på jobbet.

05.Før man forpligter sig til et katalog

  • Vælg den sværeste scene. Tre talere, underlægningsmusik under dialogen, en joke, en mikrofon eller en hånd foran munden.
  • Skriv acceptkriterierne først. Tabel 01 er bedømmelsesskemaet; bedømmere med sproget som modersmål scorer hvert sprog blindt på filmselskabets egne optagelser, før nogen hører kandidaten.
  • Tag en sen ændring med. Ret én replik efter den første rendering, og kør den gennem gennemgangstrinnet; antallet af linjer, en korrekturlæser ændrer, er i sig selv et kvalitetsmål.
  • Kør det som et pilotprojekt. Parret design, sammenhængende scener, to eller tre prioriterede sprog: Sådan kører man et pilotprojekt med AI-dubbing (2026).
  • Adgang. Via Studio-kontrakt, dimensioneret efter kataloget; 30 dages pengene-tilbage-garanti på underskrevne årskontrakter.

SPØRGSMÅL

Beholder hver skuespiller i en scene sin egen stemme?

Ja. Alle i billedet bliver dubbet, hver med sin egen stemme. Målt mod ElevenLabs Dubbing v1 på 418 parrede output over 11 sprog lød Familiar 27.8% mere som den rigtige taler, tættere på i alle 11.

Overlever underlægningsmusikken dubben?

Ja. Passager registreret som musik dubbes aldrig, og lydtæppet under dialogen bevares: underlægningsmusikken, rumtonen, effekterne. På de samme klip havde ElevenLabs Dubbing v2 (Alpha) 270% større fejl i baggrundslyden (11.92 mod 3.22 dB; 111 parrede output, 5. august 2026).

Hvorfor betyder munden noget, hvis stemmen er rigtig?

Seerne kombinerer mundbevægelser og lyd for at forstå tale; når de ikke passer sammen, bliver det sværere at forstå, eller seeren hører en helt anden lyd (McGurk-effekten, McGurk & MacDonald, Nature, 1976). En dub med kun ny stemme lader det misforhold stå i hvert eneste billede; Familiar renderer stemme og lipsync sammen.

Hvad koster komplet dubbing udført af mennesker til sammenligning?

Komplet dubbing udført af mennesker, oversættelse plus stemme, koster $70 til $150 pr. færdigt minut pr. sprog: oversættelse $22 til $45 pr. talt minut til offentliggjorte priser pr. ord, plus stemme og studietid $39 til $94. Én rendering fra Familiar indeholder oversættelsen, skuespillerens stemme, scenens lyd og lipsyncen; adgang sker via Studio-kontrakt.

REFERENCER

  1. [1]Familiar mod ElevenLabs-benchmarken: alle resultater, intervaller og lytteeksempler
  2. [2]Familiar mod menneskelige oversættere: oversættelseskvalitet bedømt blindt mod eksperters referenceredigeringer, og pris
  3. [3]Verdens bedste AI-dubbing: sådan måler man den
  4. [4]Dubben føles forkert i udlandet: sådan løser produktionsselskaber det
  5. [5]Sådan kører man et pilotprojekt med AI-dubbing (2026)
  6. [6]McGurk & MacDonald, "Hearing lips and seeing voices," Nature 264, 746–748 (1976)

Dubbing er endelig blevet god. Se målingerne, og tal så med teamet om jeres katalog.

FAMILIAR · LANCERINGSFILMEN · 2:31