PILOTGUIDE

Sådan kører man et pilotprojekt med AI-dubbing (2026)

FAMILIAR FORSKNINGALLE ARTIKLER

DET KORTE SVAR

Et pilotprojekt med AI-dubbing er en parret test: de samme klip gennem den nuværende arbejdsgang og kandidaten, bedømt af bedømmere med sproget som modersmål på ord, stemme, scene, ansigt og timing, mod acceptkriterier skrevet, før nogen lytter. Pilotprojektet kører på sammenhængende afsnit, indeholder én sen ændring og tæller rettelsesrunder. Familiar offentliggør sine egne parrede resultater; et pilotprojekt tjekker dem på køberens egne optagelser.

DEN KORTE VERSION

  • Et pilotprojekt er parret: de samme kildeklip går gennem den nuværende arbejdsgang og kandidaten, på to eller tre målsprog.
  • Acceptkriterierne skrives, før nogen lytter: én beståelsesgrænse pr. dimension, seks målte dimensioner plus to operationelle rækker.
  • Bedømmere med sproget som modersmål scorer blindt, hvor formatet tillader det, og markerer det sekund, illusionen brast.
  • Gennemgangstrinnet tæller rettelser: hvor mange oversatte linjer korrekturlæseren ændrede før rendering, og af hvilken klasse.
  • To operationelle mål følger med ved siden af kvaliteten: rettelsesrunder pr. afsnit og tiden fra en ændring i kilden til en godkendt erstatning.

01.Hvad er et pilotprojekt til?

En demo viser leverandørens bedste klip. Et pilotprojekt viser køberens sværeste optagelser gennem to arbejdsgange.

  • Enheden er en beslutning. Pilotprojektet svarer på, om en sæson, et katalog eller et creator-netværk kan flyttes; én ren scene siger intet om afsnit tres.
  • Beståelsesgrænsen kommer først. Kriterier, der er fastlagt, før nogen lytter, kan ikke skride mod den dub, lokalet tilfældigvis bedst kunne lide.
  • Designet er offentliggjort. Familiars parrede studier på /benchmark bruger det; pilotprojektet kører det igen på køberens egne klip.

02.Hvilke optagelser skal med?

  • En sammenhængende række, for en serie. To eller tre afsnit i træk med en fast hovedrolle, så stemme, navne og tiltaleformer testes for kontinuitet gennem rækken.
  • De scener, der knækker dubs. Hurtig dialog, en joke, et følelsesmæssigt vendepunkt, egennavne, musik under tale, og to eller tre personer i billedet, der taler oven i hinanden.
  • Én sen ændring. En ændret replik eller en omklippet scene indsendt efter den første dub; en ændret kilde er en ny forespørgsel om dubbing, tjekket ved gennemgangstrinnet.
  • To eller tre prioriterede sprog, fra de tre offentliggjorte kvalitetsniveauer på /docs/languages, bedste niveau først.

03.Hvad siger acceptkriterierne?

Ét spørgsmål, som en bedømmer med sproget som modersmål besvarer på hvert klip, én beståelsesgrænse pr. dimension, og det mål, Familiars benchmark bruger til det samme.

TABEL 01 · BEDØMMELSESSKEMAET · SEKS MÅLTE DIMENSIONER + TO OPERATIONELLE RÆKKER · BESTÅELSESGRÆNSER FASTLAGT FØR DEN FØRSTE RENDERING
DIMENSIONBEDØMMERENS SPØRGSMÅLFAMILIARS BENCHMARK MÅLER
Talt meningSiger replikken det, der blev sagt? En modersmålstalende eller en tilbageoversættelse tjekker det.Vigtige oversættelsesfejl pr. output, mod én godkendt mening på målsproget
StemmekloningMed lukkede øjne: er det den samme person?Stemmelighed med den rigtige taler
Scenens lydEr musikken, latteren og rummet der stadig under den nye tale?Fejl i baggrundslyden mod kildescenen, i dB
AnsigtetPasser munden og hele ansigtet til de nye ord, på hver taler i billedet?Bedømt på de parrede lytteeksempler; lydmålene scorer det ikke, og værktøjer med lyd alene springer dimensionen over
Vokale hændelser og timingLander latter, suk og reaktioner, hvor og som de landede?Korrelation af hændelsesform; F1 for transient-timing
DækningTog værktøjet imod hvert klip, i hver længde, på hvert ønsket sprog?Et afvist klip scorer nul på det klip; minimumslængder og bundtgrænser tæller imod
RettelsesrunderHvor mange runder, før hvert sprog var godkendt?Ikke i benchmarken; talt pr. afsnit i pilotprojektet
Tid til en godkendt erstatningHvor lang tid fra den sene ændring til en godkendt erstatningsdub?Ikke i benchmarken; målt én gang, på den sene ændring
  • En beståelsesgrænse er et tal. Nul oversættelsesfejl på navne og tal; taleren genkendt med lukkede øjne af tre ud af fire bedømmere; ingen scene, hvor musikken falder ud; én rettelsesrunde pr. afsnit.

04.Hvordan køres det?

  • Parret og black-box. Hvert kildeklip og målsprog går gennem begge arbejdsgange, og kun den færdige dub bedømmes, på samme måde som den offentliggjorte metode kun bedømmer den færdige lyd.
  • Blindt, hvor formatet tillader det. Præferencescorer skrider mod det, der lyder velkendt; det, der holder, er registreringen af det sekund, illusionen brast, og hvad der brød den.
  • Et panel på målsproget ved siden af de interne bedømmere. Udefrakommende fanger slang, register og en sen joke; den interne side fanger et navn eller et husudtryk.
  • Gennemgangstrinnet er rettelsestælleren. Korrekturlæserne bliver i løkken, fordi pipelinen stopper for dem: enhver oversat linje redigeres ved gennemgangstrinnet før rendering, og antallet og klassen af redigerede linjer er et kvalitetsmål.
  • Mærk hver ændret linje. Klasserne viser, hvad en Oversæt ikke-liste og en kontekstlinje på én sætning ville have forhindret i anden runde.
NAVNETALEMÅDERREGISTERTALTILTALEFORMEROVERLAPPENDE TALE

05.Hvordan læses resultaterne?

En gevinst tæller, når den holder på tværs af optagelsestyper og sprog; en musikscene eller en sekvens med hurtige klip kan kræve sin egen tærskel.

  • Rapportér optagelsestyper som separate rækker. Rene scener med ét kamera og scener med hurtige klip lagt sammen i ét gennemsnit skjuler den række, der afgør kataloget.
  • Rapportér pr. sprog. En gevinst på to af tre sprog er en kontrakt på to sprog, indtil det tredje er testet igen.
  • Tæl de operationelle rækker. Rettelsesrunder pr. afsnit og tiden fra en ændring i kilden til en godkendt erstatning afgør, om en daglig udgivelse holder.
  • De offentliggjorte tal er referencen; pilotprojektet er beviset. Familiars resultater på de samme dimensioner:
FIG. 01 · HVAD FAMILIAR OFFENTLIGGØR MOD ELEVENLABS · TO PARREDE BLACK-BOX-STUDIER · 5. AUGUST 2026
270%

ElevenLabs havde 270% større fejl i baggrundslyden: latteren, musikken, atmosfæren.

ELEVENLABS DUBBING V2 (ALPHA) · 111 PARREDE OUTPUT · MANDARIN, SPANSK, JAPANSK · 11.92 MOD 3.22 DB · 5. AUGUST 2026
+27.8%

Familiar lyder 27.8% mere som den rigtige taler; alle 11 sprog faldt ud til Familiars fordel.

ELEVENLABS DUBBING V1 · 418 PARREDE OUTPUT · 11 SPROG · 0.4605 MOD 0.3604 · 5. AUGUST 2026
54.7%

Familiar lavede 54.7% færre vigtige oversættelsesfejl i det talte (29 mod 64).

ELEVENLABS DUBBING V2 (ALPHA) · 111 PARREDE OUTPUT · SAMME KOHORTE SOM 270% · 5. AUGUST 2026
FIG. 02 · HVAD FAMILIAR OFFENTLIGGØR MOD MENNESKELIGE OVERSÆTTERE · BLIND BEDØMMELSE MOD EKSPERTERS REFERENCEREDIGERINGER · AUGUST 2026
100.3%

Familiars produktionsoversættelse matcher kvaliteten i den professionelle oversætters første udkast, i gennemsnit over fransk, kinesisk, hindi og indonesisk.

STUDIE AF PRODUKTIONSOVERSÆTTELSE MOD PROFESSIONELLE EKSPERTOVERSÆTTERES FØRSTE UDKAST · FIRE SPROG · AUGUST 2026

06.Fra pilotprojekt til kontrakt

Adgang sker via Studio-kontrakt, dimensioneret efter kataloget, med 30 dages pengene-tilbage-garanti på underskrevne årskontrakter; pilotprojektets sprog bliver kontraktens første sprog.

  • Rettelserne følger med. Navne og vendinger rettet i pilotprojektet ligger fast i Oversæt ikke-listen og kontekstlinjen på creator-scope; det første produktionsafsnit starter derfra.
  • Livesessioner aktiveres med kontrakten: sprog, forventet samtidighed og en prøve på køberens rigtige setup over SRT, RTMP eller WHIP; udsendelser kører derefter 5 til 9 sekunder efter originalen, hver taler med sin egen stemme.
  • De øvrige drejebøger tager over herfra: produktionsselskaber, streamingtjenester, mikrodramaer, lanceringer i flere lande og creator-netværk.

SPØRGSMÅL

Hvor lang tid bør et pilotprojekt med AI-dubbing tage?

Længe nok til at dubbe en sammenhængende række på to eller tre sprog, gennemgå den med modersmålstalende og behandle én sen ændring. To eller tre afsnit i træk med en fast hovedrolle tester kontinuitet såvel som kvalitet.

Hvad skal et dubbingpilotprojekt måle?

Seks dimensioner, hver scoret af en bedømmer med sproget som modersmål mod kriterier skrevet, før nogen lytter: talt mening, stemme, scenens lyd, ansigtet, timing og dækning. To operationelle rækker følger med: rettelsesrunder pr. afsnit og tiden fra en ændring i kilden til en godkendt erstatning.

Skal bedømmerne vide, hvilken dub der er hvilken?

Blindt, hvor formatet tillader det. Præferencescorer skrider mod det, der lyder velkendt, så den brugbare registrering er det øjeblik, illusionen brast: tidsstemplet, og om det var en joke, et navn, en stemme eller to, der talte på én gang, der brød den.

Kan gennemgangstrinnet være en del af pilotprojektet?

Ja. Familiars pipeline stopper ved et gennemgangstrin, hvor enhver oversat linje redigeres før rendering; antallet og arten af de linjer, korrekturlæseren ændrer, er et kvalitetsmål, og rettelserne kommer med i den færdige dub. Livedubs oversættes løbende, uden gennemgangstrin.

Hvad offentliggør Familiar for de samme dimensioner?

Parrede studier, august 2026. ElevenLabs Dubbing v2 (Alpha) havde 270% større fejl i baggrundslyden: latteren, musikken, atmosfæren. Familiar lød 27.8% mere som den rigtige taler end ElevenLabs Dubbing v1, tættere på i alle 11 sprog. Familiars oversættelser matchede den professionelle ekspertoversætters første udkast med 100.3% over fransk, kinesisk, hindi og indonesisk.

REFERENCER

  1. [1]Benchmark-hubben for dubbing: de tre parrede studier
  2. [2]Verdens bedste AI-dubbing: sådan måler man den (de seks dimensioner)
  3. [3]Familiar mod ElevenLabs Dubbing: to parrede studier (metoden)
  4. [4]AI mod menneskelig oversættelse: testet mod professionelle (2026)
  5. [5]API-reference: transskription og gennemgang (gennemgangstrinnet)

Dubbing er endelig blevet god. Se målingerne, og tal så med teamet om jeres katalog.

FAMILIAR · LANCERINGSFILMEN · 2:31