LA RESPOSTA BREU
LA VERSIÓ CURTA
- Els pipelines només d'àudio fusionen els parlants que se solapen en una sola veu, així que una escena amb tres parlants és la primera prova que hauria de fer un estudi.
- ElevenLabs Dubbing v2 (Alpha) tenia un 270% més d'error en el so de fons amb els mateixos clips: les rialles, la música, l'ambient (111 resultats aparellats, 5 d'agost de 2026).
- La traducció en producció de Familiar iguala la primera versió de traductors professionals experts amb el 100.3% de la seva qualitat entre francès, xinès, hindi i indonesi.
- L'estudi edita qualsevol línia traduïda en un pas de revisió abans de renderitzar, i una llista «No traduir» manté els noms dels personatges i les frases característiques exactament tal com es diuen.
01.Què ha de conservar el doblatge d'una pel·lícula?
Una escena de cinema acumula tots els casos difícils alhora: diversos actors intercanviant-se línies, una banda sonora sota el diàleg, un ambient de sala que ha de continuar sense trencar-se entre talls, i un públic que ja sap com sona cada actor.
- La veu. El doblatge no és síntesi de veu a partir de text: pren la línia gravada per l'actor i en conserva la identitat i la interpretació.
- Tota la interpretació. L'espectador llegeix els llavis mentre escolta, així que una boca encara formada per a la llengua original lluita contra la nova línia a cada fotograma; un actor també interpreta una línia amb tota la cara: ulls, celles, galtes, cap (Sincronització labial amb IA: què és, què se li escapa, què la supera (2026)).
- L'escena. La banda sonora, l'ambient de la sala, els efectes i la multitud es queden sota el diàleg: els trams detectats com a música no es doblen mai, i la capa de so de fons es preserva sota la nova parla.
- Cada parlant. Tothom qui és en pantalla queda doblat, cadascú amb la seva pròpia veu; els pipelines només d'àudio fusionen els parlants que se solapen en una sola veu (el problema de la festa de còctel).
- Les paraules. Un doblatge necessita un guió nou escrit en la llengua de destinació: acudits reescrits perquè funcionin, noms de personatges i frases característiques mantinguts exactament tal com es diuen (Què importa en la traducció de vídeo).
02.Com es jutja?
La fitxa de puntuació de sis dimensions i el mètode aparellat són a El millor doblatge amb IA del món: com mesurar-lo; una escena de cinema els comprimeix en cinc preguntes.
| CRITERI | LA PREGUNTA QUE ES FA UN ESTUDI | COM HO MESURA EL BENCHMARK DE FAMILIAR |
|---|---|---|
| Cada parlant conserva la seva veu | Amb els ulls tancats: cada actor en pantalla continua sent la mateixa persona, també quan dos parlen alhora? | Semblança del doblatge amb el parlant real, per clip d'origen i llengua de destinació (estudi amb ElevenLabs Dubbing v1, 11 llengües); les fusions de parlants solapats es registren com una classe d'error a l'auditoria amb els mateixos clips |
| La cara interpreta la línia | La boca, els ulls, les celles, les galtes i el cap porten les noves paraules, o només els llavis? | Costat a costat amb el mateix clip; els estudis publicats comparen l'àudio acabat, així que les eines només d'àudio se salten aquesta fila |
| L'escena sobreviu | La banda sonora continua sota el diàleg? L'ambient de la sala? Els efectes? | Error en el so de fons respecte a l'escena d'origen, en dB (estudi amb ElevenLabs Dubbing v2 (Alpha)) |
| Les paraules porten la intenció | Cada línia diu el que volia dir el guió? L'acudit ha funcionat? El nom del personatge ha sobreviscut? | Errors de traducció importants per resultat contra un sol significat aprovat (estudi amb ElevenLabs Dubbing v2 (Alpha)); qualitat de traducció puntuada a cegues amb edicions de referència d'experts (l'estudi de traducció humana) |
| Està mesurat i publicat | Els mateixos clips per cada sistema, cohorts congelades, dades públiques? | Estudis aparellats de caixa negra amb intervals de confiança, exemples per escoltar i cohorts congelades, publicats a thefamiliarlab.com/benchmark |
- Les renderitzacions de referència. Una escena d'interrogatori amb tres parlants, de l'anglès a l'espanyol, es reprodueix al costat del seu original a /demos; una segona comparativa costat a costat té micròfons davant de la boca i mans creuant la cara: el model entén les oclusions.
03.Què s'ha mesurat?
Els estudis de Familiar són aparellats i de caixa negra: els mateixos clips d'origen passen per cada sistema, només es compara l'àudio acabat, i cada cohort es manté congelada i separada.
ElevenLabs tenia un 270% més d'error en el so de fons: les rialles, la música, l'ambient.
ELEVENLABS DUBBING V2 (ALPHA) · 111 RESULTATS APARELLATS · MANDARÍ, ESPANYOL, JAPONÈS · 5 D'AGOST DE 2026Familiar s'assembla un 27.8% més al parlant real; les 11 llengües van afavorir Familiar.
ELEVENLABS DUBBING V1 · 418 RESULTATS APARELLATS · 11 LLENGÜES · 5 D'AGOST DE 2026La traducció en producció de Familiar iguala la qualitat de la primera versió d'un traductor professional expert, de mitjana entre francès, xinès, hindi i indonesi, puntuada a cegues amb edicions de referència d'experts.
ESTUDI DE TRADUCCIÓ EN PRODUCCIÓ VS PRIMERA VERSIÓ DE TRADUCTORS PROFESSIONALS EXPERTS · FRANCÈS, XINÈS, HINDI, INDONESI · AGOST DE 2026- Les paraules, la mateixa cohort. Familiar va fer un 54.7% menys d'errors de traducció importants en el discurs que ElevenLabs Dubbing v2 (Alpha), 29 vs 64, amb els mateixos 111 resultats aparellats.
04.Què continua controlant l'estudi?
- Cada línia. El pipeline s'atura en un pas de revisió on qualsevol línia traduïda s'edita abans que es renderitzi, i cada llengua es renderitza quan el seu revisor dona el vistiplau (transcripció i revisió).
- Noms i frases característiques. Una llista «No traduir» manté els noms dels personatges, els llocs i les frases emblemàtiques exactament tal com es diuen al doblatge, als subtítols i al títol i la descripció traduïts; una nota de context d'una línia diu qui és en pantalla i de què va la pel·lícula (No traduir).
- La veu. La veu surt de la mateixa presa de l'actor a l'escena; no hi ha pas de càsting.
- Llengües. Un sol origen es renderitza a fins a 29 llengües de destinació, des de qualsevol de les 30, en tres nivells de qualitat publicats, de més a menys (llengües).
- Lliurables per llengua. El vídeo acabat, els subtítols .srt i .vtt a partir de la transcripció revisada, el títol i la descripció traduïts, i l'àudio com a fitxers independents: la mescla completa, o només la veu per a la mescla pròpia de l'estudi (sortides).
- Drets. La confirmació dels drets queda registrada al treball.
05.Abans de comprometre un catàleg
- Triar l'escena més difícil. Tres parlants, una banda sonora sota el diàleg, un acudit, un micròfon o una mà davant de la boca.
- Escriure primer els criteris d'acceptació. La Taula 01 és la fitxa de puntuació; els revisors nadius puntuen cada llengua a cegues amb les imatges pròpies de l'estudi abans que ningú senti el candidat.
- Incloure-hi un canvi d'última hora. Canviar una línia després de la primera renderització i passar-la pel pas de revisió; el nombre de línies que un revisor canvia és en si mateix una mesura de qualitat.
- Fer-ho com una prova pilot. Disseny aparellat, escenes consecutives, dues o tres llengües prioritàries: Com fer una prova pilot de doblatge amb IA (2026).
- Accés. Per contracte Studio, a la mida del catàleg; 30 dies de garantia de devolució en els contractes anuals signats.
PREGUNTES
Cada actor d'una escena conserva la seva pròpia veu?
Sí. Tothom qui és en pantalla queda doblat, cadascú amb la seva pròpia veu. Mesurat contra ElevenLabs Dubbing v1 amb 418 resultats aparellats en 11 llengües, Familiar s'assemblava un 27.8% més al parlant real, més a prop en les 11.
La banda sonora sobreviu al doblatge?
Sí. Els trams detectats com a música no es doblen mai, i la capa de so de fons sota el diàleg es preserva: la banda sonora, l'ambient de la sala, els efectes. Amb els mateixos clips, ElevenLabs Dubbing v2 (Alpha) tenia un 270% més d'error en el so de fons (11.92 vs 3.22 dB; 111 resultats aparellats, 5 d'agost de 2026).
Per què importa la boca si la veu és la correcta?
L'espectador combina el moviment dels llavis amb el so per entendre la parla; quan no coincideixen, costa més d'entendre, o percep un so completament diferent (l'efecte McGurk, McGurk & MacDonald, Nature, 1976). Un doblatge només de veu deixa aquest desajust a cada fotograma; Familiar genera la veu i la sincronització labial alhora.
Quant costa el doblatge humà complet, per comparar?
El doblatge humà complet, traducció més veu, costa entre $70 i $150 per minut acabat i llengua: la traducció, $22–45 per minut parlat a les tarifes per paraula publicades, més la veu i l'estudi, $39–94. Una sola renderització de Familiar porta la traducció, la veu de l'actor, el so de l'escena i la sincronització labial; l'accés és per contracte Studio.
REFERÈNCIES
- [1]Benchmark Familiar vs ElevenLabs: resultats complets, intervals i exemples per escoltar
- [2]Familiar vs traductors humans: qualitat de traducció puntuada a cegues amb edicions de referència d'experts, i preu
- [3]El millor doblatge amb IA del món: com mesurar-lo
- [4]Per què el doblatge grinyola a l'estranger i com ho arreglen els estudis
- [5]Com fer una prova pilot de doblatge amb IA (2026)
- [6]McGurk & MacDonald, "Hearing lips and seeing voices," Nature 264, 746–748 (1976)
El doblatge per fi és bo. Mira les xifres i després parla del teu catàleg amb l'equip.
FAMILIAR · EL VÍDEO DE LLANÇAMENT · 2:31
