DREJEBOG: PRODUKTIONSSELSKABER

Dubben føles forkert i udlandet: sådan løser produktionsselskaber det

FAMILIAR FORSKNINGALLE ARTIKLER

DET KORTE SVAR

En dub føles forkert, når tre ting skiller sig fra hinanden: en fremmed stemme erstatter skuespillerens, munden bliver ved at tale originalsproget, og musikken og rummet under dialogen trykkes flade. Løsningen er at dubbe alle tre sammen. Familiars ene model bevarer hver skuespillers egen stemme, spiller ansigtet på ny og bevarer scenens lyd i én rendering; enhver oversat linje redigeres, før den renderes.

DEN KORTE VERSION

  • Tre fejl får en dub til at føles forkert: en fremmed stemme, en mund, der stadig taler kildesproget, og en scene trykket flad under den nye dialog.
  • På de samme klip havde ElevenLabs Dubbing v2 (Alpha) 270% større fejl i baggrundslyden: latteren, musikken, atmosfæren (111 parrede output, 5. august 2026).
  • Familiar lyder 27.8% mere som den rigtige taler end ElevenLabs Dubbing v1, tættere på i alle 11 sprog (418 parrede output, 5. august 2026).
  • Selskabets egne oversættere redigerer enhver oversat linje, før den renderes, og hvert sprog renderes på sin egen godkendelse.

01.Hvorfor føles dubben forkert?

To af fejlene er ældre end AI: en stemmeskuespiller er også en fremmed stemme, og ingen indspilning flytter skuespillerens mund. AI-dubbing med lyd alene kan tilføje en tredje, en fladtrykt scene, målt nedenfor.

  • En fremmed stemme. Uanset om en stemmeskuespiller eller en standardstemme læser replikken, genkender den, der kender skuespilleren, ikke længere personen (AI-videodubbing forklaret (2026)).
  • En mund, der taler det forkerte sprog. Hjernen kombinerer mundbevægelser og lyd for at forstå tale; når de ikke passer sammen, bliver det sværere at forstå, eller seeren hører en helt anden lyd: McGurk-effekten, en del af hjernens audiovisuelle taleintegration. En dub med kun ny stemme lader det misforhold stå i hvert eneste billede.
  • En fladtrykt scene. Latteren, musikken, lydeffekterne og rummets atmosfære fjernes eller udtværes under den nye tale.
  • En oversættelse sætning for sætning. En replik oversat ord for ord lyder fremmed, selv når den er korrekt, og jokes lander for sent eller slet ikke (Hvad der betyder noget i videooversættelse).
FREMMED STEMMEMUND UDE AF SYNCFLADTRYKT SCENEORDRET OVERSÆTTELSE

02.Hvad viser målingerne?

FIG. 01 · PARREDE STUDIER · SAMME KILDEKLIP · FÆRDIG LYD SAMMENLIGNET · AUGUST 2026
270%

ElevenLabs Dubbing v2 (Alpha) havde 270% større fejl i baggrundslyden: latteren, musikken, atmosfæren.

11.92 MOD 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 PARREDE OUTPUT · MANDARIN, SPANSK, JAPANSK · 5. AUGUST 2026
+27.8%

Familiar lyder 27.8% mere som den rigtige taler end ElevenLabs Dubbing v1; alle 11 sprog faldt ud til Familiars fordel.

0.4605 MOD 0.3604 · ELEVENLABS DUBBING V1 · 418 PARREDE OUTPUT · 11 SPROG · 5. AUGUST 2026
100.3%

af kvaliteten i den professionelle oversætters første udkast, i gennemsnit over fransk, kinesisk, hindi og indonesisk, bedømt blindt mod eksperters referenceredigeringer. Det matcher.

STUDIE AF PRODUKTIONSOVERSÆTTELSE MOD PROFESSIONELLE EKSPERTOVERSÆTTERES FØRSTE UDKAST · AUGUST 2026

De to ElevenLabs-kohorter og studiet af menneskelig oversættelse lægges aldrig sammen. Alle data, intervaller og lytteeksempler: Familiar mod ElevenLabs og mod menneskelige oversættere; metoden i AI mod menneskelig oversættelse: testet mod professionelle (2026).

  • Ordene, ElevenLabs Dubbing v2 (Alpha). Familiar lavede 54.7% færre vigtige oversættelsesfejl i det talte (29 mod 64).
  • Fejl i det talte output, ElevenLabs Dubbing v1. Familiar lavede 48.8% færre fejl i det talte output markeret ved gennemgang (132 mod 258).

03.Hvad ændrer sig, når stemme, læber og scene kommer fra én model?

Én samlet model genererer stemmen, læberne og scenen sammen, med identiteter, der bevares hele vejen igennem, og scene- og verdensforståelse, så skuespillerens egen præstation bevares i stedet for en fremmed stemme over en mund ude af sync.

  • Stemmen kommer fra skuespillerens egen præstation. Dubbing er ikke tekst-til-tale: den tager den originale lyd ind og bevarer talerens identitet og fremførelse.
  • Ansigtet spillet på ny: øjne, bryn, kinder, hoved, ikke kun læberne. Hele ansigtet spiller det nye sprog, så den mund, seerne læser, passer til de ord, de hører (AI-lipsync: hvad det er, hvad det mangler, og hvad der slår det (2026)).
  • Scenen overlever dubben. Latteren, musikken og bassen, lydeffekterne, rummets atmosfære; passager, modellen registrerer som musik, går igennem uændret.
  • Alle i billedet bliver dubbet, hver med sin egen stemme; filmscenen med tre talere på /demos er dubbet fra engelsk til spansk. Mikrofoner foran munden, hænder hen over ansigtet: modellen forstår okklusioner.
  • Navne, steder og faste vendinger bliver præcis, som de siges, via en Oversæt ikke-liste, som selskabet styrer; jokes skrives om, så de lander på målsproget.
  • Én rendering indeholder oversættelsen, skuespillerens stemme, scenens lyd og lipsyncen.

04.Hvordan kører et produktionsselskab det?

  • Gennemgang før rendering, pr. sprog. Pipelinen stopper ved et gennemgangstrin, hvor selskabets egne oversættere redigerer enhver oversat linje; hvert sprog renderes på sin egen godkendelse, spansk i dag, resten når deres korrekturlæsere har sagt god for dem (Transskription & gennemgang).
  • En kontekstlinje på én sætning. Hvem der er i billedet, og hvad serien handler om, sat på creator-scope for en hel serie eller på job-scope for ét afsnit; det smalleste scope vinder (Kontekst).
  • En Oversæt ikke-liste på de samme tre scopes, så en karakters navn eller faste vending holder i afsnit 60 som i afsnit 1 (Oversæt ikke).
  • Webhooks. dub.ready_for_review, når oversættelsen er klar, dub.output_ready pr. færdigt sprog (Webhooks).
  • 30 sprog, fra alle til alle, i tre offentliggjorte kvalitetsniveauer, bedste først (Sprog).
  • Referenceprisen. Komplet dubbing udført af mennesker, oversættelse plus stemme, koster $70 til $150 pr. færdigt minut; adgang til Familiar sker via Studio-kontrakt, dimensioneret efter kataloget.
HVAD DER LEVERES PR. SPROG · HVER DUB KOMMER MED SINE FILER
LeveranceFormatBemærkning
Færdig videomp4 med det fulde lydmixKlar til at lægge op
Undertekster.srt og .vttFra den gennemgåede transskription; sælges ikke separat
Lyden for sig selvDet fulde mix eller stemmen aleneTil selskabets eget mix
Titel og beskrivelseOversat pr. sprogLinks, @handles, #hashtags og kapitler bliver uændrede

05.Hvad bør et selskab teste, før det forpligter sig til en sæson?

  • Vælg det sværeste afsnit, et med hurtig dialog, en joke, et følelsesmæssigt vendepunkt, egennavne og musik under tale; en ren scene beviser intet om en sæson.
  • Skriv acceptkriterierne, før nogen lytter. Bedømmere med sproget som modersmål scorer ordene, stemmen, scenen og ansigtet mod dem og markerer det øjeblik, illusionen brast; bedømmelsesskemaet findes i Sådan kører man et pilotprojekt med AI-dubbing (2026).
  • Tag en sen ændring med. En ændret master er en ny forespørgsel om dubbing; gennemgangstrinnet er der, hvor de ændrede linjer tjekkes, og Oversæt ikke-listen og konteksten følger med.

SPØRGSMÅL

Hvorfor siger internationale seere, at dubben føles forkert?

Tre ting er skilt fra hinanden: stemmen tilhører en fremmed, munden taler stadig originalsproget, og musikken og rummet under dialogen er trykket flade. Seerne sætter sjældent ord på årsagen; en mund, der ikke passer til lyden, gør talen sværere at forstå.

Er det oversættelsen eller stemmen?

Begge dele, og de forstærker hinanden: en oversættelse sætning for sætning lyder fremmed, selv når den er korrekt, og en udskiftet stemme fjerner skuespilleren. På parrede klip lød Familiar 27.8% mere som den rigtige taler end ElevenLabs Dubbing v1; i et separat studie matchede dets oversættelser professionelle oversætteres første udkast med 100.3%.

Kan vores egne oversættere stadig gennemgå linjerne?

Ja. Pipelinen stopper ved et gennemgangstrin, hvor enhver oversat linje redigeres, før den renderes, og hvert sprog renderes, når dets korrekturlæser har sagt god for det: spansk kan udgives, mens japansk stadig er under gennemgang.

Overlever karakternavne og faste vendinger på tværs af afsnit?

Ja. En Oversæt ikke-liste holder navne, steder og faste vendinger præcis, som de siges, i dubben, underteksterne og den oversatte titel og beskrivelse. Sat på creator-scope dækker den alle afsnit i en serie; en post på job-scope tilsidesætter den for én upload.

Hvad modtager vi pr. sprog?

Den færdige video med det fulde lydmix, undertekster som .srt og .vtt fra den gennemgåede transskription, den oversatte titel og beskrivelse, og lyden for sig selv: det fulde mix, eller stemmen alene til selskabets eget mix.

REFERENCER

  1. [1]Familiar mod ElevenLabs-benchmarken: alle resultater, intervaller og lytteeksempler
  2. [2]Familiar mod menneskelige oversættere: studiet af oversættelseskvalitet
  3. [3]Transskription & gennemgang: gennemgangstrinnet og rendering pr. sprog (API-dokumentation)
  4. [4]Hvad der betyder noget i videooversættelse (de fire problemer)
  5. [5]McGurk & MacDonald, “Hearing lips and seeing voices,” Nature 264 (1976)

Dubbing er endelig blevet god. Se målingerne, og tal så med teamet om jeres katalog.

FAMILIAR · LANCERINGSFILMEN · 2:31