FILMHANDBOK

Vilken är den bästa AI-dubbningen för film?

FAMILIAR FORSKNINGALLA ARTIKLAR

DET KORTA SVARET

Den bästa AI-dubbningen för en film behåller framförandet: varje skådespelares egen röst, en mun som stämmer med orden och filmmusiken orörd, för alla som talar i scenen, med studion som granskar varje översatt rad före rendering. Familiar genererar röst, läppsynk och scenens ljud med en enda modell och publicerar mätningarna: den låter 27.8% mer som den verkliga talaren än ElevenLabs Dubbing v1, närmare i alla 11 språk.

KORTVERSIONEN

  • Pipelines med enbart ljud smälter ihop överlappande talare till en röst, så en scen med tre talare är det första testet en studio bör köra.
  • ElevenLabs Dubbing v2 (Alpha) hade 270% mer fel i bakgrundsljudet på samma klipp: skratten, musiken, atmosfären (111 parade resultat, 5 augusti 2026).
  • Familiars produktionsöversättning är likvärdig med professionella översättares första utkast, 100.3% av deras kvalitet över franska, kinesiska, hindi och indonesiska.
  • Studion redigerar varje översatt rad vid ett granskningssteg före rendering, och en Översätt inte-lista håller karaktärsnamn och signaturfraser exakt som de sägs.

01.Vad måste en filmdubbning behålla?

En filmscen staplar alla svåra fall på en gång: flera skådespelare som växlar repliker, filmmusik under dialogen, rumston som måste löpa obruten över klippen, och en publik som redan vet hur varje skådespelare låter.

  • Rösten. Dubbning är inte text-till-tal: skådespelarens inspelade replik går in, och identiteten och framförandet bevaras.
  • Hela framförandet. Tittarna läser läppar medan de lyssnar, så en mun som fortfarande är formad för originalspråket kämpar mot den nya repliken i varje bildruta; en skådespelare framför också en replik med hela ansiktet: ögon, ögonbryn, kinder, huvud (AI-läppsynk: vad det är, vad det missar, vad som slår det (2026)).
  • Scenen. Filmmusiken, rumstonen, effekterna och folkmassan ligger kvar under dialogen: partier som känns igen som musik dubbas aldrig, och ljudmattan bevaras under det nya talet.
  • Varje talare. Alla i bild dubbas, var och en med sin egen röst; pipelines med enbart ljud smälter ihop överlappande talare till en röst (cocktailpartyproblemet).
  • Orden. En dubbning behöver ett nytt manus skrivet på målspråket: skämt som skrivs om så att de landar, karaktärsnamn och signaturfraser som hålls exakt som de sägs (Vad som spelar roll i videoöversättning).
AI-LÄPPSYNKRÖSTKLONINGSCENENS LJUDSCENER MED FLERA TALARE

02.Hur bedömer du den?

Bedömningsmallen med sex dimensioner och den parade metoden finns i Världens bästa AI-dubbning: så mäter man den; en filmscen komprimerar dem till fem frågor.

TABELL 01 · FEM KRITERIER FÖR EN FILMDUBBNING · FRÅGAN EN STUDIO STÄLLER · HUR FAMILIARS BENCHMARK MÄTER DET
KRITERIUMFRÅGAN EN STUDIO STÄLLERHUR FAMILIARS BENCHMARK MÄTER DET
Varje talare behåller sin röstBlunda: är varje skådespelare i bild fortfarande samma person, även när två talar samtidigt?Dubbningens talarlikhet med den verkliga talaren, per källklipp och målspråk (studien mot ElevenLabs Dubbing v1, 11 språk); kollisioner mellan överlappande talare loggade som en felklass i granskningen av samma klipp
Ansiktet framför replikenBär munnen, ögonen, ögonbrynen, kinderna och huvudet de nya orden, eller bara läpparna?Sida vid sida på samma klipp; de publicerade studierna jämför färdigt ljud, så verktyg med enbart ljud hoppar över den här raden
Scenen överleverLigger filmmusiken fortfarande under dialogen? Rumstonen? Effekterna?Fel i bakgrundsljudet mot källscenen, i dB (studien mot ElevenLabs Dubbing v2 (Alpha))
Orden bär avsiktenSäger varje replik vad manuset menade? Landade skämtet? Överlevde karaktärens namn?Viktiga översättningsfel per resultat mot en godkänd betydelse (studien mot ElevenLabs Dubbing v2 (Alpha)); översättningskvalitet blindbedömd mot expertgranskade referensversioner (studien mot mänskliga översättare)
Det är uppmätt och publiceratSamma klipp genom varje system, frysta kohorter, öppna data?Parade black box-studier med konfidensintervall, lyssningsexempel och frysta kohorter, publicerade på thefamiliarlab.com/benchmark
  • Referensrenderingarna. En förhörsscen med tre talare, engelska till spanska, spelas bredvid sitt original på /demos; en andra jämförelse sida vid sida där har mickar framför munnen och händer över ansiktet: modellen förstår när ansiktet skyms.

03.Vad mättes?

Familiars studier är parade och black box: samma källklipp körs genom varje system, bara det färdiga ljudet jämförs, och varje kohort hålls fryst och separat.

FIG. 01 · PARADE STUDIER · SAMMA KÄLLKLIPP GENOM VARJE SYSTEM · AUGUSTI 2026
270%

ElevenLabs hade 270% mer fel i bakgrundsljudet: skratten, musiken, atmosfären.

ELEVENLABS DUBBING V2 (ALPHA) · 111 PARADE RESULTAT · MANDARIN, SPANSKA, JAPANSKA · 5 AUGUSTI 2026
+27.8%

Familiar låter 27.8% mer som den verkliga talaren; alla 11 språk föll ut till Familiars fördel.

ELEVENLABS DUBBING V1 · 418 PARADE RESULTAT · 11 SPRÅK · 5 AUGUSTI 2026
100.3%

Familiars produktionsöversättning är likvärdig med den professionella översättarens första utkast, i snitt över franska, kinesiska, hindi och indonesiska, blindbedömt mot expertgranskade referensversioner.

PRODUKTIONSSTUDIE I ÖVERSÄTTNING VS PROFESSIONELLA ÖVERSÄTTARES FÖRSTA UTKAST · FRANSKA, KINESISKA, HINDI, INDONESISKA · AUGUSTI 2026
  • Orden, samma kohort. Familiar gjorde 54.7% färre viktiga översättningsfel i talet än ElevenLabs Dubbing v2 (Alpha), 29 mot 64, på samma 111 parade resultat.

04.Vad styr studion fortfarande över?

  • Varje replik. Pipelinen pausar vid ett granskningssteg där valfri översatt rad redigeras innan den renderas, och varje språk renderas när dess granskare har godkänt (transkription & granskning).
  • Namn och signaturfraser. En Översätt inte-lista håller karaktärsnamn, platser och signaturrepliker exakt som de sägs i dubbningen, undertexterna och den översatta titeln och beskrivningen; en kontextrad säger vem som är i bild och vad filmen är (Översätt inte).
  • Rösten. Rösten kommer från skådespelarens egen tagning i scenen; det finns ingen rollsättning.
  • Språk. En källa renderas till upp till 29 målspråk, från vilket som helst av 30, i tre publicerade kvalitetsnivåer, bäst först (språk).
  • Leveranser per språk. Den färdiga videon, undertexter i .srt och .vtt från den granskade transkriptionen, den översatta titeln och beskrivningen, och ljudet som fristående filer: hela mixen, eller bara rösten för studions egen mix (leveranser).
  • Rättigheter. Bekräftelsen av rättigheterna registreras på jobbet.

05.Innan en katalog binds upp

  • Välj den svåraste scenen. Tre talare, filmmusik under dialogen, ett skämt, en mick eller en hand framför munnen.
  • Skriv acceptanskriterierna först. Tabell 01 är bedömningsmallen; granskare med målspråket som modersmål bedömer varje språk blint på studions eget material innan någon hör kandidaten.
  • Ta med en sen ändring. Ändra en replik efter första renderingen och kör den genom granskningssteget; antalet rader en granskare ändrar är i sig ett kvalitetsmått.
  • Kör det som en pilot. Parad design, sammanhängande scener, två eller tre prioriterade språk: Så kör du en pilot för AI-dubbning (2026).
  • Tillgång. Via Studio-avtal, anpassat till katalogen; pengarna tillbaka inom 30 dagar på signerade årsavtal.

FRÅGOR

Behåller varje skådespelare i en scen sin egen röst?

Ja. Alla i bild dubbas, var och en med sin egen röst. Mätt mot ElevenLabs Dubbing v1 på 418 parade resultat över 11 språk lät Familiar 27.8% mer som den verkliga talaren, närmare i alla 11.

Överlever filmmusiken dubbningen?

Ja. Partier som känns igen som musik dubbas aldrig, och ljudmattan under dialogen bevaras: filmmusiken, rumstonen, effekterna. På samma klipp hade ElevenLabs Dubbing v2 (Alpha) 270% mer fel i bakgrundsljudet (11.92 mot 3.22 dB; 111 parade resultat, 5 augusti 2026).

Varför spelar munnen roll om rösten är rätt?

Tittarna kombinerar läpprörelser och ljud för att förstå tal; när de inte stämmer överens blir det svårare att förstå, eller så uppfattar tittaren ett helt annat ljud (McGurk-effekten, McGurk & MacDonald, Nature, 1976). En dubbning med bara röst lämnar kvar den krocken i varje bildruta; Familiar renderar röst och läppsynk tillsammans.

Vad kostar komplett dubbning utförd av människor, som jämförelse?

Komplett dubbning utförd av människor, översättning plus röst, kostar $70 till $150 per färdig minut per språk: översättning $22–45 per talad minut enligt publicerade priser per ord, plus röst och studio $39–94. En rendering från Familiar bär översättningen, skådespelarens röst, scenens ljud och läppsynken; tillgången går via Studio-avtal.

KÄLLOR

  1. [1]Familiar vs ElevenLabs-benchmarken: fullständiga resultat, intervall och lyssningsexempel
  2. [2]Familiar vs mänskliga översättare: översättningskvalitet blindbedömd mot expertgranskade referensversioner, och pris
  3. [3]Världens bästa AI-dubbning: så mäter man den
  4. [4]Varför dubbningen känns fel utomlands, och hur studior löser det
  5. [5]Så kör du en pilot för AI-dubbning (2026)
  6. [6]McGurk & MacDonald, ”Hearing lips and seeing voices”, Nature 264, 746–748 (1976)

Äntligen bra dubbning. Se mätningarna, och prata sedan med teamet om din katalog.

FAMILIAR · LANSERINGSFILMEN · 2:31