DET KORTA SVARET
KORTVERSIONEN
- Tre fel gör att en dubbning känns fel: en främlings röst, en mun som fortfarande talar källspråket och en scen som plattats till under den nya dialogen.
- På samma klipp hade ElevenLabs Dubbing v2 (Alpha) 270% mer fel i bakgrundsljudet: skratten, musiken, atmosfären (111 parade resultat, 5 augusti 2026).
- Familiar låter 27.8% mer som den verkliga talaren än ElevenLabs Dubbing v1, närmare i alla 11 språk (418 parade resultat, 5 augusti 2026).
- Studions egna översättare redigerar varje översatt rad innan den renderas, och varje språk renderas efter sitt eget godkännande.
01.Varför känns dubbningen fel?
Två av felen är äldre än AI: en röstskådespelare är också en främlings röst, och ingen inspelning flyttar skådespelarens mun. AI-dubbning med enbart ljud kan lägga till ett tredje, en tillplattad scen, uppmätt nedan.
- En främlings röst. Oavsett om en röstskådespelare eller en standardröst läser raden känner den som kan skådespelarens röst inte längre igen den (AI-videodubbning, förklarad (2026)).
- En mun som talar fel språk. Hjärnan kombinerar läpprörelser och ljud för att förstå tal; när de inte stämmer överens blir det svårare att förstå, eller så uppfattar tittaren ett helt annat ljud: McGurk-effekten, en del av den audiovisuella talperceptionen. En dubbning med bara röst lämnar kvar den krocken i varje bildruta.
- En tillplattad scen. Skratten, musiken, ljudeffekterna och rummets atmosfär skalas bort eller smetas ut under det nya talet.
- En översättning mening för mening. En rad som förs över ord för ord låter främmande även när den är korrekt, och skämten landar sent eller inte alls (Vad som spelar roll i videoöversättning).
02.Vad säger mätningarna?
ElevenLabs Dubbing v2 (Alpha) hade 270% mer fel i bakgrundsljudet: skratten, musiken, atmosfären.
11.92 VS 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 PARADE RESULTAT · MANDARIN, SPANSKA, JAPANSKA · 5 AUGUSTI 2026Familiar låter 27.8% mer som den verkliga talaren än ElevenLabs Dubbing v1; alla 11 språk föll ut till Familiars fördel.
0.4605 VS 0.3604 · ELEVENLABS DUBBING V1 · 418 PARADE RESULTAT · 11 SPRÅK · 5 AUGUSTI 2026av kvaliteten i den professionella översättarens första utkast, i snitt över franska, kinesiska, hindi och indonesiska, blindbedömt mot expertgranskade referensversioner. Likvärdigt.
PRODUKTIONSSTUDIE I ÖVERSÄTTNING VS PROFESSIONELLA ÖVERSÄTTARES FÖRSTA UTKAST · AUGUSTI 2026De två ElevenLabs-kohorterna och studien mot mänskliga översättare slås aldrig ihop. Fullständiga data, intervall och lyssningsexempel: Familiar vs ElevenLabs och vs mänskliga översättare; metoden i AI mot mänsklig översättning: testad mot proffs (2026).
- Orden, ElevenLabs Dubbing v2 (Alpha). Familiar gjorde 54.7% färre viktiga översättningsfel i talet (29 mot 64).
- Fel i det talade resultatet, ElevenLabs Dubbing v1. Familiar gjorde 48.8% färre granskningsflaggade fel i det talade resultatet (132 mot 258).
03.Vad förändras när röst, läppar och scen kommer från en och samma modell?
En enda enhetlig modell genererar rösten, läpparna och scenen tillsammans, med beständiga identiteter samt scen- och världsförståelse, så att skådespelarens eget framförande bevaras i stället för en främlings röst över en mun i osynk.
- Rösten kommer från skådespelarens eget framförande. Dubbning är inte text-till-tal: originalljudet går in, och talarens identitet och framförande bevaras.
- Ansiktet spelas på nytt: ögon, ögonbryn, kinder, huvud, inte bara läpparna. Hela ansiktet talar det nya språket, så att munnen tittarna läser stämmer med orden de hör (AI-läppsynk: vad det är, vad det missar, vad som slår det (2026)).
- Scenen överlever dubbningen. Skratten, musiken och basen, ljudeffekterna, rummets atmosfär; partier som modellen känner igen som musik passerar orörda.
- Alla i bild dubbas, var och en med sin egen röst; filmscenen med tre talare på /demos är dubbad från engelska till spanska. Mickar framför munnen, händer över ansiktet: modellen förstår när ansiktet skyms.
- Namn, platser och signaturfraser förblir exakt som de sägs genom en Översätt inte-lista som studion styr; skämt skrivs om så att de landar på målspråket.
- En enda rendering bär översättningen, skådespelarens röst, scenens ljud och läppsynken.
04.Hur kör en studio det?
- Granskning före rendering, per språk. Pipelinen pausar vid ett granskningssteg där studions egna översättare redigerar valfri översatt rad; varje språk renderas efter sitt eget godkännande, spanska i dag och resten när deras granskare har godkänt (Transkription & granskning).
- En kontextrad på en mening. Vem som är i bild och vad serien är, satt per kreatör för en hel serie eller per jobb för ett enskilt avsnitt; den smalare inställningen gäller (Kontext).
- En Översätt inte-lista per kreatör, sändning eller jobb, så att en karaktärs namn eller signaturfras håller i avsnitt 60 precis som i avsnitt 1 (Översätt inte).
- Webhooks. dub.ready_for_review när översättningen är klar, dub.output_ready per färdigt språk (Webhooks).
- 30 språk, från vilket som helst till vilket som helst, i tre publicerade kvalitetsnivåer, bäst först (Språk).
- Referenspriset. Komplett dubbning utförd av människor, översättning plus röst, kostar $70 till $150 per färdig minut; tillgången till Familiar går via Studio-avtal, anpassat till katalogen.
| Leverans | Format | Anmärkning |
|---|---|---|
| Färdig video | mp4 med hela ljudmixen | Klar att publicera |
| Undertexter | .srt och .vtt | Från den granskade transkriptionen; säljs inte separat |
| Ljudet för sig | Hela mixen, eller bara rösten | För studions egen mix |
| Titel och beskrivning | Översatta per språk | Länkar, @-namn, #hashtags och kapitel förblir orörda |
05.Vad bör en studio testa innan den binder upp en säsong?
- Välj det svåraste avsnittet, ett med snabb dialog, ett skämt, en känslomässig vändning, egennamn och musik under talet; en ren scen bevisar ingenting om en säsong.
- Skriv acceptanskriterierna innan någon lyssnar. Granskare med målspråket som modersmål bedömer orden, rösten, scenen och ansiktet mot dem och markerar ögonblicket då illusionen brast; bedömningsmallen finns i Så kör du en pilot för AI-dubbning (2026).
- Ta med en sen ändring. En ändrad master är en ny dubbningsförfrågan; granskningssteget är där de ändrade raderna kontrolleras, och Översätt inte-listan och kontextraden följer med.
FRÅGOR
Varför säger utländska tittare att dubbningen känns fel?
Tre saker gick isär: rösten tillhör en främling, munnen talar fortfarande originalspråket, och musiken och rummet under dialogen plattades till. Tittare sätter sällan ord på orsaken; en mun som motsäger ljudet gör talet svårare att förstå.
Är det översättningen eller rösten?
Både och, och de förstärker varandra: en översättning mening för mening låter främmande även när den är korrekt, och en utbytt röst tar bort skådespelaren. På parade klipp lät Familiar 27.8% mer som den verkliga talaren än ElevenLabs Dubbing v1; i en separat studie var översättningarna likvärdiga med professionella översättares första utkast, 100.3%.
Kan våra egna översättare fortfarande granska raderna?
Ja. Pipelinen pausar vid ett granskningssteg där varje översatt rad redigeras innan den renderas, och varje språk renderas när dess granskare har godkänt: spanska kan släppas medan japanska fortfarande granskas.
Överlever karaktärsnamn och signaturfraser mellan avsnitten?
Ja. En Översätt inte-lista håller namn, platser och signaturfraser exakt som de sägs i dubbningen, undertexterna och den översatta titeln och beskrivningen. Satt per kreatör täcker den varje avsnitt i en serie; en post per jobb går före för en enskild uppladdning.
Vad får vi per språk?
Den färdiga videon med hela ljudmixen, undertexter i .srt och .vtt från den granskade transkriptionen, den översatta titeln och beskrivningen, och ljudet för sig: hela mixen, eller bara rösten för studions egen mix.
KÄLLOR
- [1]Familiar vs ElevenLabs-benchmarken: fullständiga resultat, intervall och lyssningsexempel
- [2]Familiar vs mänskliga översättare: studien i översättningskvalitet
- [3]Transkription & granskning: granskningssteget och rendering per språk (API-dokumentation)
- [4]Vad som spelar roll i videoöversättning (de fyra problemen)
- [5]McGurk & MacDonald, ”Hearing lips and seeing voices”, Nature 264 (1976)
Äntligen bra dubbning. Se mätningarna, och prata sedan med teamet om din katalog.
FAMILIAR · LANSERINGSFILMEN · 2:31
