DET KORTA SVARET
KORTVERSIONEN
- Pipelines med enbart ljud smälter ihop överlappande talare till en röst, så en scen med tre talare är det första testet en studio bör köra.
- ElevenLabs Dubbing v2 (Alpha) hade 270% mer fel i bakgrundsljudet på samma klipp: skratten, musiken, atmosfären (111 parade resultat, 5 augusti 2026).
- Familiars produktionsöversättning är likvärdig med professionella översättares första utkast, 100.3% av deras kvalitet över franska, kinesiska, hindi och indonesiska.
- Studion redigerar varje översatt rad vid ett granskningssteg före rendering, och en Översätt inte-lista håller karaktärsnamn och signaturfraser exakt som de sägs.
01.Vad måste en filmdubbning behålla?
En filmscen staplar alla svåra fall på en gång: flera skådespelare som växlar repliker, filmmusik under dialogen, rumston som måste löpa obruten över klippen, och en publik som redan vet hur varje skådespelare låter.
- Rösten. Dubbning är inte text-till-tal: skådespelarens inspelade replik går in, och identiteten och framförandet bevaras.
- Hela framförandet. Tittarna läser läppar medan de lyssnar, så en mun som fortfarande är formad för originalspråket kämpar mot den nya repliken i varje bildruta; en skådespelare framför också en replik med hela ansiktet: ögon, ögonbryn, kinder, huvud (AI-läppsynk: vad det är, vad det missar, vad som slår det (2026)).
- Scenen. Filmmusiken, rumstonen, effekterna och folkmassan ligger kvar under dialogen: partier som känns igen som musik dubbas aldrig, och ljudmattan bevaras under det nya talet.
- Varje talare. Alla i bild dubbas, var och en med sin egen röst; pipelines med enbart ljud smälter ihop överlappande talare till en röst (cocktailpartyproblemet).
- Orden. En dubbning behöver ett nytt manus skrivet på målspråket: skämt som skrivs om så att de landar, karaktärsnamn och signaturfraser som hålls exakt som de sägs (Vad som spelar roll i videoöversättning).
02.Hur bedömer du den?
Bedömningsmallen med sex dimensioner och den parade metoden finns i Världens bästa AI-dubbning: så mäter man den; en filmscen komprimerar dem till fem frågor.
| KRITERIUM | FRÅGAN EN STUDIO STÄLLER | HUR FAMILIARS BENCHMARK MÄTER DET |
|---|---|---|
| Varje talare behåller sin röst | Blunda: är varje skådespelare i bild fortfarande samma person, även när två talar samtidigt? | Dubbningens talarlikhet med den verkliga talaren, per källklipp och målspråk (studien mot ElevenLabs Dubbing v1, 11 språk); kollisioner mellan överlappande talare loggade som en felklass i granskningen av samma klipp |
| Ansiktet framför repliken | Bär munnen, ögonen, ögonbrynen, kinderna och huvudet de nya orden, eller bara läpparna? | Sida vid sida på samma klipp; de publicerade studierna jämför färdigt ljud, så verktyg med enbart ljud hoppar över den här raden |
| Scenen överlever | Ligger filmmusiken fortfarande under dialogen? Rumstonen? Effekterna? | Fel i bakgrundsljudet mot källscenen, i dB (studien mot ElevenLabs Dubbing v2 (Alpha)) |
| Orden bär avsikten | Säger varje replik vad manuset menade? Landade skämtet? Överlevde karaktärens namn? | Viktiga översättningsfel per resultat mot en godkänd betydelse (studien mot ElevenLabs Dubbing v2 (Alpha)); översättningskvalitet blindbedömd mot expertgranskade referensversioner (studien mot mänskliga översättare) |
| Det är uppmätt och publicerat | Samma klipp genom varje system, frysta kohorter, öppna data? | Parade black box-studier med konfidensintervall, lyssningsexempel och frysta kohorter, publicerade på thefamiliarlab.com/benchmark |
- Referensrenderingarna. En förhörsscen med tre talare, engelska till spanska, spelas bredvid sitt original på /demos; en andra jämförelse sida vid sida där har mickar framför munnen och händer över ansiktet: modellen förstår när ansiktet skyms.
03.Vad mättes?
Familiars studier är parade och black box: samma källklipp körs genom varje system, bara det färdiga ljudet jämförs, och varje kohort hålls fryst och separat.
ElevenLabs hade 270% mer fel i bakgrundsljudet: skratten, musiken, atmosfären.
ELEVENLABS DUBBING V2 (ALPHA) · 111 PARADE RESULTAT · MANDARIN, SPANSKA, JAPANSKA · 5 AUGUSTI 2026Familiar låter 27.8% mer som den verkliga talaren; alla 11 språk föll ut till Familiars fördel.
ELEVENLABS DUBBING V1 · 418 PARADE RESULTAT · 11 SPRÅK · 5 AUGUSTI 2026Familiars produktionsöversättning är likvärdig med den professionella översättarens första utkast, i snitt över franska, kinesiska, hindi och indonesiska, blindbedömt mot expertgranskade referensversioner.
PRODUKTIONSSTUDIE I ÖVERSÄTTNING VS PROFESSIONELLA ÖVERSÄTTARES FÖRSTA UTKAST · FRANSKA, KINESISKA, HINDI, INDONESISKA · AUGUSTI 2026- Orden, samma kohort. Familiar gjorde 54.7% färre viktiga översättningsfel i talet än ElevenLabs Dubbing v2 (Alpha), 29 mot 64, på samma 111 parade resultat.
04.Vad styr studion fortfarande över?
- Varje replik. Pipelinen pausar vid ett granskningssteg där valfri översatt rad redigeras innan den renderas, och varje språk renderas när dess granskare har godkänt (transkription & granskning).
- Namn och signaturfraser. En Översätt inte-lista håller karaktärsnamn, platser och signaturrepliker exakt som de sägs i dubbningen, undertexterna och den översatta titeln och beskrivningen; en kontextrad säger vem som är i bild och vad filmen är (Översätt inte).
- Rösten. Rösten kommer från skådespelarens egen tagning i scenen; det finns ingen rollsättning.
- Språk. En källa renderas till upp till 29 målspråk, från vilket som helst av 30, i tre publicerade kvalitetsnivåer, bäst först (språk).
- Leveranser per språk. Den färdiga videon, undertexter i .srt och .vtt från den granskade transkriptionen, den översatta titeln och beskrivningen, och ljudet som fristående filer: hela mixen, eller bara rösten för studions egen mix (leveranser).
- Rättigheter. Bekräftelsen av rättigheterna registreras på jobbet.
05.Innan en katalog binds upp
- Välj den svåraste scenen. Tre talare, filmmusik under dialogen, ett skämt, en mick eller en hand framför munnen.
- Skriv acceptanskriterierna först. Tabell 01 är bedömningsmallen; granskare med målspråket som modersmål bedömer varje språk blint på studions eget material innan någon hör kandidaten.
- Ta med en sen ändring. Ändra en replik efter första renderingen och kör den genom granskningssteget; antalet rader en granskare ändrar är i sig ett kvalitetsmått.
- Kör det som en pilot. Parad design, sammanhängande scener, två eller tre prioriterade språk: Så kör du en pilot för AI-dubbning (2026).
- Tillgång. Via Studio-avtal, anpassat till katalogen; pengarna tillbaka inom 30 dagar på signerade årsavtal.
FRÅGOR
Behåller varje skådespelare i en scen sin egen röst?
Ja. Alla i bild dubbas, var och en med sin egen röst. Mätt mot ElevenLabs Dubbing v1 på 418 parade resultat över 11 språk lät Familiar 27.8% mer som den verkliga talaren, närmare i alla 11.
Överlever filmmusiken dubbningen?
Ja. Partier som känns igen som musik dubbas aldrig, och ljudmattan under dialogen bevaras: filmmusiken, rumstonen, effekterna. På samma klipp hade ElevenLabs Dubbing v2 (Alpha) 270% mer fel i bakgrundsljudet (11.92 mot 3.22 dB; 111 parade resultat, 5 augusti 2026).
Varför spelar munnen roll om rösten är rätt?
Tittarna kombinerar läpprörelser och ljud för att förstå tal; när de inte stämmer överens blir det svårare att förstå, eller så uppfattar tittaren ett helt annat ljud (McGurk-effekten, McGurk & MacDonald, Nature, 1976). En dubbning med bara röst lämnar kvar den krocken i varje bildruta; Familiar renderar röst och läppsynk tillsammans.
Vad kostar komplett dubbning utförd av människor, som jämförelse?
Komplett dubbning utförd av människor, översättning plus röst, kostar $70 till $150 per färdig minut per språk: översättning $22–45 per talad minut enligt publicerade priser per ord, plus röst och studio $39–94. En rendering från Familiar bär översättningen, skådespelarens röst, scenens ljud och läppsynken; tillgången går via Studio-avtal.
KÄLLOR
- [1]Familiar vs ElevenLabs-benchmarken: fullständiga resultat, intervall och lyssningsexempel
- [2]Familiar vs mänskliga översättare: översättningskvalitet blindbedömd mot expertgranskade referensversioner, och pris
- [3]Världens bästa AI-dubbning: så mäter man den
- [4]Varför dubbningen känns fel utomlands, och hur studior löser det
- [5]Så kör du en pilot för AI-dubbning (2026)
- [6]McGurk & MacDonald, ”Hearing lips and seeing voices”, Nature 264, 746–748 (1976)
Äntligen bra dubbning. Se mätningarna, och prata sedan med teamet om din katalog.
FAMILIAR · LANSERINGSFILMEN · 2:31
