DET KORTE SVARET
KORTVERSJONEN
- En pilot er parvis: de samme kildeklippene går gjennom dagens arbeidsflyt og kandidaten, på to eller tre målspråk.
- Akseptansekriteriene skrives før noen lytter: én godkjentgrense per dimensjon, seks målte dimensjoner pluss to operative rader.
- Morsmålsbrukere vurderer blindt der formatet tillater det, og markerer sekundet illusjonen brast.
- Gjennomgangssteget teller korreksjoner: hvor mange oversatte linjer den språkansvarlige endret før rendering, og av hvilken klasse.
- To operative mål følger kvaliteten: revisjonsrunder per episode, og tiden fra en endring i kilden til en godkjent erstatning.
01.Hva er en pilot til for?
En demo viser leverandørens beste klipp. En pilot viser kjøperens vanskeligste materiale gjennom to arbeidsflyter.
- Enheten er en beslutning. Piloten svarer på om en sesong, en katalog eller et skapernettverk kan flyttes; én ren scene sier ingenting om episode seksti.
- Godkjentgrensen kommer først. Kriterier fastsatt før noen lytter, kan ikke gli mot den dubben rommet tilfeldigvis likte.
- Designet er publisert. Familiars parvise studier på /benchmark bruker det; piloten kjører det på nytt på kjøperens egne klipp.
02.Hvilket materiale går inn?
- En sammenhengende rekke, for en serie. To eller tre påfølgende episoder med en gjennomgående hovedrolle, så stemme, navn og tiltaleformer testes for kontinuitet gjennom rekken.
- Scenene som knekker dubber. Rask dialog, en vits, et emosjonelt vendepunkt, egennavn, musikk under talen, og to eller tre personer i bildet som snakker over hverandre.
- Én sen endring. En endret linje eller en omklippet scene levert etter første dub; en endret kilde er en ny dub-forespørsel, sjekket på gjennomgangssteget.
- To eller tre prioriterte språk, fra de tre publiserte kvalitetsnivåene på /docs/languages, beste nivå først.
03.Hva sier akseptansekriteriene?
Ett spørsmål en morsmålsbruker svarer på for hvert klipp, én godkjentgrense per dimensjon, og målet Familiars benchmark bruker for det samme.
| DIMENSJON | SPØRSMÅLET SOM STILLES | FAMILIARS BENCHMARK MÅLER |
|---|---|---|
| Meningen i talen | Sier linjen det som ble sagt? En morsmålsbruker eller en tilbakeoversettelse sjekker det. | Viktige oversettelsesfeil per resultat, mot én godkjent mening på målspråket |
| Stemmekloning | Med lukkede øyne: er dette samme person? | Likhet med den ekte taleren |
| Lyden i scenen | Er musikken, latteren og rommet fortsatt der under den nye talen? | Feil i bakgrunnslyden mot kildescenen, i dB |
| Ansiktet | Stemmer munnen og hele ansiktet med de nye ordene, på hver taler i bildet? | Vurdert på de parvise lytteeksemplene; lydmålene skårer det ikke, og verktøy med bare lyd hopper over dimensjonen |
| Vokale hendelser og timing | Lander latter, sukk og reaksjoner der og slik de landet? | Formkorrelasjon for lydhendelser; F1 for transient-timing |
| Dekning | Tok verktøyet imot hvert klipp, i hver lengde, på hvert språk som ble bedt om? | Et avvist klipp skårer null på det klippet; minstelengder og tak på bunkestørrelse teller mot det |
| Revisjonsrunder | Hvor mange runder før hvert språk ble godkjent? | Ikke i benchmarken; telles per episode i piloten |
| Tid til godkjent erstatning | Hvor lang tid fra den sene endringen til en godkjent erstatningsdub? | Ikke i benchmarken; måles én gang, på den sene endringen |
- En godkjentgrense er et tall. Null oversettelsesfeil på navn og tall; taleren gjenkjent med lukkede øyne av tre av fire i panelet; ingen scene der musikken faller ut; én revisjonsrunde per episode.
04.Hvordan gjennomføres den?
- Parvis og svart-boks. Hvert kildeklipp og målspråk går gjennom begge arbeidsflytene, og bare den ferdige dubben vurderes, slik den publiserte metoden bare vurderer den ferdige lyden.
- Blindt der formatet tillater det. Preferansevurderinger trekkes mot det som lyder kjent; det som holder, er sekundet illusjonen brast, og hva som brøt den.
- Et panel av målspråkbrukere ved siden av de interne. Utenforstående fanger slang, register og en sen vits; de interne fanger et navn eller et husuttrykk.
- Gjennomgangssteget er korreksjonstelleren. De språkansvarlige forblir i løpet fordi pipelinen stopper for dem: hvilken som helst oversatt linje redigeres på gjennomgangssteget før rendering, og antallet og klassen av redigerte linjer er et kvalitetsmål.
- Merk hver endret linje. Klassene viser hva en Ikke oversett-liste og en kontekstsetning på én linje ville ha forhindret i andre runde.
05.Hvordan leses resultatene?
En gevinst teller når den holder på tvers av materialtyper og språk; en musikalsk scene eller en sekvens med raske kutt kan trenge sin egen terskel.
- Rapporter materialtyper som egne rader. Rene scener med ett kamera og scener med raske kutt lagt sammen i ett snitt skjuler raden som avgjør katalogen.
- Rapporter per språk. En gevinst på to av tre språk er en kontrakt på to språk til det tredje er testet på nytt.
- Tell de operative radene. Revisjonsrunder per episode og tiden fra en endring i kilden til en godkjent erstatning avgjør om en daglig publiseringstakt holder.
- De publiserte tallene er referansen; piloten er beviset. Familiars resultater på de samme dimensjonene:
ElevenLabs hadde 270% mer feil i bakgrunnslyden: latteren, musikken, atmosfæren.
ELEVENLABS DUBBING V2 (ALPHA) · 111 PARVISE RESULTATER · MANDARIN, SPANSK, JAPANSK · 11.92 VS 3.22 DB · 5. AUGUST 2026Familiar høres 27.8% mer ut som den ekte taleren; alle 11 språk gikk i Familiars favør.
ELEVENLABS DUBBING V1 · 418 PARVISE RESULTATER · 11 SPRÅK · 0.4605 VS 0.3604 · 5. AUGUST 2026Familiar gjorde 54.7% færre viktige oversettelsesfeil i talen (29 mot 64).
ELEVENLABS DUBBING V2 (ALPHA) · 111 PARVISE RESULTATER · SAMME KOHORT SOM 270% · 5. AUGUST 2026Familiars produksjonsoversettelse ligger på nivå med den profesjonelle ekspertoversetterens førsteutkast, i snitt over fransk, kinesisk, hindi og indonesisk.
STUDIE AV PRODUKSJONSOVERSETTELSEN MOT FØRSTEUTKAST FRA PROFESJONELLE EKSPERTOVERSETTERE · FIRE SPRÅK · AUGUST 202606.Fra pilot til kontrakt
Tilgang gis gjennom Studio-kontrakt, tilpasset katalogen, med 30 dagers pengene-tilbake-garanti på signerte årskontrakter; pilotens språk blir kontraktens første språk.
- Korreksjonene følger med. Navn og fraser rettet i piloten ligger fast i Ikke oversett-listen og kontekstsetningen på skapernivå; den første produksjonsepisoden starter fra dem.
- Live-økter aktiveres med kontrakten: språk, forventet samtidighet og en gjennomkjøring på kjøperens faktiske oppsett over SRT, RTMP eller WHIP; sendinger går deretter 5 til 9 sekunder bak originalen, hver taler med sin egen stemme.
- De andre håndbøkene tar over herfra: studioer, strømmetjenester, mikrodramaer, lanseringer i flere land og skapernettverk.
SPØRSMÅL
Hvor lang tid bør en pilot på KI-dubbing ta?
Lenge nok til å dubbe en sammenhengende rekke på to eller tre språk, gå gjennom den med morsmålsbrukere og behandle én sen endring. To eller tre påfølgende episoder med en gjennomgående hovedrolle tester kontinuitet like mye som kvalitet.
Hva bør en dubbingpilot måle?
Seks dimensjoner, hver vurdert av en morsmålsbruker mot kriterier skrevet før noen lytter: meningen i talen, stemmen, lyden i scenen, ansiktet, timingen og dekningen. To operative rader følger dem: revisjonsrunder per episode og tiden fra en endring i kilden til en godkjent erstatning.
Bør de som vurderer, vite hvilken dub som er hvilken?
Blindt der formatet tillater det. Preferansevurderinger trekkes mot det som lyder kjent, så det nyttige er øyeblikket illusjonen brast: tidsstempelet, og om det var en vits, et navn, en stemme eller to som snakket samtidig som brøt den.
Kan gjennomgangssteget være en del av piloten?
Ja. Familiars pipeline stopper på et gjennomgangssteg der hvilken som helst oversatt linje redigeres før rendering; antallet og typen linjer den språkansvarlige endrer, er et kvalitetsmål, og korreksjonene går inn i den ferdige dubben. Live-dubber oversettes underveis, uten gjennomgang.
Hva publiserer Familiar for de samme dimensjonene?
Parvise studier, august 2026. ElevenLabs Dubbing v2 (Alpha) hadde 270% mer feil i bakgrunnslyden: latteren, musikken, atmosfæren. Familiar hørtes 27.8% mer ut som den ekte taleren enn ElevenLabs Dubbing v1, nærmere på alle 11 språk. Familiars oversettelser lå på nivå med den profesjonelle ekspertoversetterens førsteutkast, 100.3%, over fransk, kinesisk, hindi og indonesisk.
KILDER
- [1]Benchmark-huben for dubbing: de tre parvise studiene
- [2]Verdens beste KI-dubbing: slik måles den (de seks dimensjonene)
- [3]Familiar mot ElevenLabs Dubbing: to parvise studier (metoden)
- [4]KI mot menneskelig oversettelse: testet mot profesjonelle (2026)
- [5]API-referanse: transkripsjon og gjennomgang (gjennomgangssteget)
Endelig er dubbing bra. Se målingene, og snakk så med teamet om katalogen din.
FAMILIAR · LANSERINGSFILMEN · 2:31
