GUIA PER A ESTUDIS

Per què el doblatge grinyola a l'estranger i com ho arreglen els estudis

FAMILIAR RECERCATOTS ELS ARTICLES

LA RESPOSTA BREU

Un doblatge grinyola quan tres coses es desencaixen: la veu d'un desconegut substitueix la de l'actor, la boca continua parlant la llengua original, i la música i l'ambient de sota el diàleg queden aplanats. La solució és doblar les tres coses alhora. Un sol model de Familiar conserva la veu pròpia de cada actor, torna a interpretar la cara i preserva el so de l'escena en una sola renderització; qualsevol línia traduïda s'edita abans que es renderitzi.

LA VERSIÓ CURTA

  • Tres defectes fan que un doblatge grinyoli: la veu d'un desconegut, una boca que encara parla la llengua d'origen i una escena aplanada sota el nou diàleg.
  • Amb els mateixos clips, ElevenLabs Dubbing v2 (Alpha) tenia un 270% més d'error en el so de fons: les rialles, la música, l'ambient (111 resultats aparellats, 5 d'agost de 2026).
  • Familiar s'assembla un 27.8% més al parlant real que ElevenLabs Dubbing v1, més a prop en les 11 llengües (418 resultats aparellats, 5 d'agost de 2026).
  • Els traductors del mateix estudi editen qualsevol línia traduïda abans que es renderitzi, i cada llengua es renderitza amb la seva pròpia aprovació.

01.Per què grinyola el doblatge?

Dos dels defectes són més antics que la IA: un actor de doblatge també és la veu d'un desconegut, i cap sessió de gravació mou la boca de l'actor. El doblatge amb IA només d'àudio pot afegir-n'hi un tercer, una escena aplanada, mesurat més avall.

  • La veu d'un desconegut. Tant si llegeix la línia un actor de doblatge com una veu genèrica, qui coneix l'actor ja no el reconeix (El doblatge de vídeo amb IA, explicat (2026)).
  • Una boca que parla una altra llengua. El cervell combina el moviment dels llavis amb el so per entendre la parla; quan no coincideixen, costa més d'entendre, o l'espectador percep un so completament diferent: l'efecte McGurk, part de la integració audiovisual de la parla. Un doblatge només de veu deixa aquest desajust a cada fotograma.
  • Una escena aplanada. Les rialles, la música, els efectes de so i l'ambient de la sala s'eliminen o s'emborronen sota la nova parla.
  • Una traducció frase per frase. Una línia traslladada paraula per paraula sona forastera fins i tot quan és correcta, i els acudits arriben tard o no arriben (Què importa en la traducció de vídeo).
VEU D'UN DESCONEGUTBOCA DESAJUSTADAESCENA APLANADATRADUCCIÓ LITERAL

02.Què diuen les xifres?

FIG. 01 · ESTUDIS APARELLATS · MATEIXOS CLIPS D'ORIGEN · ÀUDIO ACABAT COMPARAT · AGOST DE 2026
270%

ElevenLabs Dubbing v2 (Alpha) tenia un 270% més d'error en el so de fons: les rialles, la música, l'ambient.

11.92 VS 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 RESULTATS APARELLATS · MANDARÍ, ESPANYOL, JAPONÈS · 5 D'AGOST DE 2026
+27.8%

Familiar s'assembla un 27.8% més al parlant real que ElevenLabs Dubbing v1; les 11 llengües van afavorir Familiar.

0.4605 VS 0.3604 · ELEVENLABS DUBBING V1 · 418 RESULTATS APARELLATS · 11 LLENGÜES · 5 D'AGOST DE 2026
100.3%

de la qualitat de la primera versió d'un traductor professional expert, de mitjana entre francès, xinès, hindi i indonesi, puntuat a cegues amb edicions de referència d'experts. Un empat.

ESTUDI DE TRADUCCIÓ EN PRODUCCIÓ VS PRIMERA VERSIÓ DE TRADUCTORS PROFESSIONALS EXPERTS · AGOST DE 2026

Les dues cohorts d'ElevenLabs i l'estudi de traducció humana no s'agreguen mai. Dades completes, intervals i exemples per escoltar: Familiar vs ElevenLabs i vs traductors humans; el mètode, a IA vs traducció humana: provada contra professionals (2026).

  • Les paraules, ElevenLabs Dubbing v2 (Alpha). Familiar va fer un 54.7% menys d'errors de traducció importants en el discurs (29 vs 64).
  • Errors en l'àudio de sortida, ElevenLabs Dubbing v1. Familiar va fer un 48.8% menys d'errors en l'àudio de sortida marcats a la revisió (132 vs 258).

03.Què canvia quan la veu, els llavis i l'escena surten d'un sol model?

Un sol model unificat genera la veu, els llavis i l'escena alhora, amb permanència de les identitats i comprensió de l'escena i del món, de manera que la interpretació del mateix actor es conserva intacta en lloc de la veu d'un desconegut sobre una boca fora de sincronia.

  • La veu surt de la interpretació del mateix actor. El doblatge no és síntesi de veu a partir de text: pren l'àudio original i conserva la identitat i la interpretació del parlant.
  • La cara torna a interpretar: ulls, celles, galtes, cap; no només els llavis. Tota la cara interpreta la nova llengua, de manera que la boca que l'espectador llegeix coincideix amb les paraules que sent (Sincronització labial amb IA: què és, què se li escapa, què la supera (2026)).
  • L'escena sobreviu al doblatge. Les rialles, la música i els baixos, els efectes de so, l'ambient de la sala; els trams que el model detecta com a música passen intactes.
  • Tothom qui és en pantalla queda doblat, cadascú amb la seva pròpia veu; l'escena de cinema amb tres parlants de /demos està doblada de l'anglès a l'espanyol. Micròfons davant de la boca, mans creuant la cara: el model entén les oclusions.
  • Els noms, els llocs i les frases característiques es mantenen exactament tal com es diuen gràcies a una llista «No traduir» que controla l'estudi; els acudits es reescriuen perquè funcionin en la llengua de destinació.
  • Una sola renderització porta la traducció, la veu de l'actor, el so de l'escena i la sincronització labial.

04.Com ho fa servir un estudi?

  • Revisió abans de renderitzar, per llengua. El pipeline s'atura en un pas de revisió on els traductors del mateix estudi editen qualsevol línia traduïda; cada llengua es renderitza amb la seva pròpia aprovació: l'espanyol avui, la resta quan els seus revisors donin el vistiplau (Transcripció i revisió).
  • Una nota de context d'una sola frase. Qui és en pantalla i de què va la sèrie, definida a l'àmbit de creador per a tota una sèrie o a l'àmbit de treball per a un sol episodi; l'àmbit més concret preval (Context).
  • Una llista «No traduir» als mateixos tres àmbits, perquè el nom o la frase característica d'un personatge es mantingui igual a l'episodi 60 que a l'episodi 1 (No traduir).
  • Webhooks. dub.ready_for_review quan la traducció està a punt, dub.output_ready per cada llengua acabada (Webhooks).
  • 30 llengües, de qualsevol a qualsevol, en tres nivells de qualitat publicats, de més a menys (Llengües).
  • El preu de referència. El doblatge humà complet, traducció més veu, costa entre $70 i $150 per minut acabat; l'accés a Familiar és per contracte Studio, a la mida del catàleg.
QUÈ ARRIBA PER LLENGUA · CADA DOBLATGE PORTA ELS SEUS FITXERS
LliurableFormatNota
Vídeo acabatmp4 amb la mescla d'àudio completaA punt per publicar
Subtítols.srt i .vttA partir de la transcripció revisada; no es venen per separat
Àudio per separatLa mescla completa, o només la veuPer a la mescla pròpia de l'estudi
Títol i descripcióTraduïts per llenguaEls enllaços, els @noms, els #hashtags i els capítols es mantenen intactes

05.Què hauria de provar un estudi abans de comprometre una temporada?

  • Triar l'episodi més difícil, un amb diàleg ràpid, un acudit, un gir emocional, noms propis i música sota la parla; una escena neta no demostra res sobre una temporada.
  • Escriure els criteris d'acceptació abans que ningú escolti. Els revisors nadius puntuen les paraules, la veu, l'escena i la cara contra aquests criteris i marquen el moment en què es trenca la immersió; la fitxa de puntuació és a Com fer una prova pilot de doblatge amb IA (2026).
  • Incloure-hi un canvi d'última hora. Un màster modificat és una nova petició de doblatge; el pas de revisió és on es comproven les línies canviades, i la llista «No traduir» i el context es conserven.

PREGUNTES

Per què els espectadors internacionals diuen que el doblatge grinyola?

Tres coses s'han desencaixat: la veu és d'un desconegut, la boca continua parlant la llengua original, i la música i l'ambient de sota el diàleg han quedat aplanats. L'espectador poques vegades en sap dir la causa; una boca que no coincideix amb el so fa que la parla costi més d'entendre.

És la traducció o la veu?

Totes dues, i se sumen: una traducció frase per frase sona forastera fins i tot quan és correcta, i una veu substituïda esborra l'actor. Amb clips aparellats, Familiar s'assemblava un 27.8% més al parlant real que ElevenLabs Dubbing v1; en un estudi a part, les seves traduccions van igualar la primera versió de traductors professionals amb un 100.3%.

Els nostres traductors poden continuar revisant les línies?

Sí. El pipeline s'atura en un pas de revisió on qualsevol línia traduïda s'edita abans que es renderitzi, i cada llengua es renderitza quan el seu revisor dona el vistiplau: l'espanyol pot sortir mentre el japonès encara és en revisió.

Els noms dels personatges i les frases característiques sobreviuen d'un episodi a l'altre?

Sí. Una llista «No traduir» manté els noms, els llocs i les frases característiques exactament tal com es diuen al doblatge, als subtítols i al títol i la descripció traduïts. Definida a l'àmbit de creador, cobreix tots els episodis d'una sèrie; una entrada d'àmbit de treball la substitueix per a una sola pujada.

Què rebem per cada llengua?

El vídeo acabat amb la mescla d'àudio completa, els subtítols en .srt i .vtt a partir de la transcripció revisada, el títol i la descripció traduïts, i l'àudio per separat: la mescla completa, o només la veu per a la mescla pròpia de l'estudi.

REFERÈNCIES

  1. [1]Benchmark Familiar vs ElevenLabs: resultats complets, intervals i exemples per escoltar
  2. [2]Familiar vs traductors humans: l'estudi de qualitat de traducció
  3. [3]Transcripció i revisió: el pas de revisió i la renderització per llengua (documentació de l'API)
  4. [4]Què importa en la traducció de vídeo (els quatre problemes)
  5. [5]McGurk & MacDonald, “Hearing lips and seeing voices,” Nature 264 (1976)

El doblatge per fi és bo. Mira les xifres i després parla del teu catàleg amb l'equip.

FAMILIAR · EL VÍDEO DE LLANÇAMENT · 2:31