HÅNDBOK FOR FILM

Hva er den beste KI-dubbingen for film?

FAMILIAR FORSKNINGALLE ARTIKLER

DET KORTE SVARET

Den beste KI-dubbingen for en film beholder fremføringen: hver skuespillers egen stemme, en munn som stemmer med ordene, og filmmusikken urørt, for hver taler i scenen, med studioet som går gjennom hver oversatt linje før rendering. Familiar genererer stemme, leppesynk og lyden i scenen med én modell og publiserer målingene: den høres 27.8% mer ut som den ekte taleren enn ElevenLabs Dubbing v1, nærmere på alle 11 språk.

KORTVERSJONEN

  • Pipeliner med bare lyd slår overlappende talere sammen til én stemme, så en scene med tre talere er den første testen et studio bør kjøre.
  • ElevenLabs Dubbing v2 (Alpha) hadde 270% mer feil i bakgrunnslyden på de samme klippene: latteren, musikken, atmosfæren (111 parvise resultater, 5. august 2026).
  • Familiars produksjonsoversettelse ligger på nivå med profesjonelle ekspertoversetteres førsteutkast, 100.3% av kvaliteten, over fransk, kinesisk, hindi og indonesisk.
  • Studioet redigerer hvilken som helst oversatt linje på et gjennomgangssteg før rendering, og en Ikke oversett-liste holder rollefigurenes navn og faste uttrykk nøyaktig slik de sies.

01.Hva må en filmdub beholde?

En filmscene stabler alle de vanskelige tilfellene på én gang: flere skuespillere som veksler replikker, filmmusikk under dialogen, romtone som må løpe ubrutt over kuttene, og et publikum som allerede vet hvordan hver skuespiller høres ut.

  • Stemmen. Dubbing er ikke tekst-til-tale: den tar inn skuespillerens innspilte replikk og bevarer identiteten og leveringen.
  • Hele fremføringen. Seerne leser lepper mens de lytter, så en munn fortsatt formet for originalspråket slåss mot den nye replikken i hvert bilde; en skuespiller fremfører også en replikk med hele ansiktet: øyne, bryn, kinn, hode (KI-leppesynk: hva det er, hva det mangler, hva som slår det (2026)).
  • Scenen. Filmmusikken, romtonen, effektene og folkemengden blir liggende under dialogen: partier gjenkjent som musikk dubbes aldri, og lydteppet bevares under den nye talen.
  • Hver taler. Alle i bildet blir dubbet, hver med sin egen stemme; pipeliner med bare lyd slår overlappende talere sammen til én stemme (cocktailparty-problemet).
  • Ordene. En dub trenger et nytt manus skrevet på målspråket: vitser som lander på nytt, rollefigurenes navn og faste uttrykk holdt nøyaktig slik de sies (Hva som betyr noe i videooversettelse).
KI-LEPPESYNKSTEMMEKLONINGLYDEN I SCENENSCENER MED FLERE TALERE

02.Hvordan vurderer man det?

Vurderingsskjemaet med seks dimensjoner og den parvise metoden ligger i Verdens beste KI-dubbing: slik måles den; en filmscene komprimerer dem til fem spørsmål.

TABELL 01 · FEM KRITERIER FOR EN FILMDUB · SPØRSMÅLET ET STUDIO STILLER · HVORDAN FAMILIARS BENCHMARK MÅLER DET
KRITERIUMSPØRSMÅLET ET STUDIO STILLERHVORDAN FAMILIARS BENCHMARK MÅLER DET
Hver taler beholder stemmen sinLukk øynene: er hver skuespiller i bildet fortsatt samme person, også når to snakker samtidig?Dubbens likhet med den ekte taleren, per kildeklipp og målspråk (studien mot ElevenLabs Dubbing v1, 11 språk); overlappende talere som slås sammen, loggført som en feilklasse i revisjonen av de samme klippene
Ansiktet fremfører replikkenBærer munnen, øynene, brynene, kinnene og hodet de nye ordene, eller bare leppene?Side om side på samme klipp; de publiserte studiene sammenligner ferdig lyd, så verktøy med bare lyd hopper over denne raden
Scenen overleverLigger filmmusikken fortsatt under dialogen? Romtonen? Effektene?Feil i bakgrunnslyden mot kildescenen, i dB (studien mot ElevenLabs Dubbing v2 (Alpha))
Ordene bærer intensjonenSier hver replikk det manuset mente? Landet vitsen? Overlevde rollefigurens navn?Viktige oversettelsesfeil per resultat mot én godkjent mening (studien mot ElevenLabs Dubbing v2 (Alpha)); oversettelseskvalitet blindvurdert mot ekspertenes referanseredigeringer (studien mot menneskelige oversettere)
Det er målt og publisertSamme klipp gjennom hvert system, kohortene frosset, dataene offentlige?Parvise svart-boks-studier med konfidensintervaller, lytteeksempler og frosne kohorter, publisert på thefamiliarlab.com/benchmark
  • Referanserenderingene. En avhørsscene med tre talere, engelsk til spansk, spilles ved siden av originalen på /demos; et annet side-om-side-klipp der har mikrofoner foran munnen og hender over ansiktet: modellen forstår hva som dekker hva.

03.Hva ble målt?

Familiars studier er parvise og svart-boks: de samme kildeklippene går gjennom hvert system, bare den ferdige lyden sammenlignes, og hver kohort holdes frosset og adskilt.

FIG. 01 · PARVISE STUDIER · DE SAMME KILDEKLIPPENE GJENNOM HVERT SYSTEM · AUGUST 2026
270%

ElevenLabs hadde 270% mer feil i bakgrunnslyden: latteren, musikken, atmosfæren.

ELEVENLABS DUBBING V2 (ALPHA) · 111 PARVISE RESULTATER · MANDARIN, SPANSK, JAPANSK · 5. AUGUST 2026
+27.8%

Familiar høres 27.8% mer ut som den ekte taleren; alle 11 språk gikk i Familiars favør.

ELEVENLABS DUBBING V1 · 418 PARVISE RESULTATER · 11 SPRÅK · 5. AUGUST 2026
100.3%

Familiars produksjonsoversettelse ligger på nivå med den profesjonelle ekspertoversetterens førsteutkast, i snitt over fransk, kinesisk, hindi og indonesisk, blindvurdert mot ekspertenes referanseredigeringer.

STUDIE AV PRODUKSJONSOVERSETTELSEN MOT FØRSTEUTKAST FRA PROFESJONELLE EKSPERTOVERSETTERE · FRANSK, KINESISK, HINDI, INDONESISK · AUGUST 2026
  • Ordene, samme kohort. Familiar gjorde 54.7% færre viktige oversettelsesfeil i talen enn ElevenLabs Dubbing v2 (Alpha), 29 mot 64, på de samme 111 parvise resultatene.

04.Hva styrer studioet fortsatt?

  • Hver linje. Pipelinen stopper på et gjennomgangssteg der hvilken som helst oversatt linje redigeres før den rendres, og hvert språk rendres når den språkansvarlige har gitt klarsignal (transkripsjon og gjennomgang).
  • Navn og faste uttrykk. En Ikke oversett-liste holder rollefigurenes navn, steder og signaturfraser nøyaktig slik de sies, i dubben, undertekstene og den oversatte tittelen og beskrivelsen; en kontekstsetning på én linje sier hvem som er i bildet og hva filmen er (Ikke oversett).
  • Stemmen. Stemmen kommer fra skuespillerens eget opptak i scenen; det finnes ingen casting.
  • Språk. Én kilde rendres til opptil 29 målspråk, fra hvilket som helst av 30, i tre publiserte kvalitetsnivåer, beste først (språk).
  • Leveranser per språk. Den ferdige videoen, .srt- og .vtt-undertekster fra den gjennomgåtte transkripsjonen, den oversatte tittelen og beskrivelsen, og lyden som egne filer: den fulle miksen, eller stemmen alene til studioets egen miks (leveranser).
  • Rettigheter. Rettighetsbekreftelsen registreres på jobben.

05.Før man forplikter seg til en katalog

  • Velg den vanskeligste scenen. Tre talere, filmmusikk under dialogen, en vits, en mikrofon eller en hånd over munnen.
  • Skriv akseptansekriteriene først. Tabell 01 er vurderingsskjemaet; morsmålsbrukere vurderer hvert språk blindt på studioets eget materiale før noen hører kandidaten.
  • Ta med en sen endring. Endre én replikk etter første rendering og kjør den gjennom gjennomgangssteget; antallet linjer en språkansvarlig endrer, er i seg selv et kvalitetsmål.
  • Kjør det som en pilot. Parvis design, sammenhengende scener, to eller tre prioriterte språk: Hvordan gjennomføre en pilot på KI-dubbing (2026).
  • Tilgang. Gjennom Studio-kontrakt, tilpasset katalogen; 30 dagers pengene-tilbake-garanti på signerte årskontrakter.

SPØRSMÅL

Beholder hver skuespiller i en scene sin egen stemme?

Ja. Alle i bildet blir dubbet, hver med sin egen stemme. Målt mot ElevenLabs Dubbing v1 på 418 parvise resultater over 11 språk hørtes Familiar 27.8% mer ut som den ekte taleren, nærmere på alle 11.

Overlever filmmusikken dubben?

Ja. Partier gjenkjent som musikk dubbes aldri, og lydteppet under dialogen bevares: filmmusikken, romtonen, effektene. På de samme klippene hadde ElevenLabs Dubbing v2 (Alpha) 270% mer feil i bakgrunnslyden (11.92 mot 3.22 dB; 111 parvise resultater, 5. august 2026).

Hvorfor betyr munnen noe hvis stemmen stemmer?

Seerne kombinerer leppebevegelser og lyd for å forstå tale; når de ikke stemmer overens, blir det vanskeligere å forstå, eller seeren oppfatter en helt annen lyd (McGurk-effekten, McGurk & MacDonald, Nature, 1976). En dub med bare ny stemme lar den feilen stå i hvert bilde; Familiar rendrer stemme og leppesynk sammen.

Hva koster komplett dubbing utført av mennesker, til sammenligning?

Komplett dubbing utført av mennesker, oversettelse pluss stemme, koster $70 til $150 per ferdig minutt per språk: oversettelse $22–45 per talte minutt til publiserte ordpriser, pluss stemme og studio $39–94. Én rendering fra Familiar bærer oversettelsen, skuespillerens stemme, lyden i scenen og leppesynken; tilgang gis gjennom Studio-kontrakt.

KILDER

  1. [1]Benchmark Familiar mot ElevenLabs: alle resultater, intervaller og lytteeksempler
  2. [2]Familiar mot menneskelige oversettere: oversettelseskvalitet blindvurdert mot ekspertenes referanseredigeringer, og pris
  3. [3]Verdens beste KI-dubbing: slik måles den
  4. [4]Hvorfor dubben skurrer i utlandet, og hva studioer gjør
  5. [5]Hvordan gjennomføre en pilot på KI-dubbing (2026)
  6. [6]McGurk & MacDonald, «Hearing lips and seeing voices», Nature 264, 746–748 (1976)

Endelig er dubbing bra. Se målingene, og snakk så med teamet om katalogen din.

FAMILIAR · LANSERINGSFILMEN · 2:31