LA RESPUESTA CORTA
LA VERSIÓN CORTA
- Tres fallos hacen que un doblaje no convenza: una voz de extraño, una boca que sigue hablando el idioma original y una escena aplanada bajo el nuevo diálogo.
- Con los mismos clips, ElevenLabs Dubbing v2 (Alpha) tuvo un 270% más de errores en el sonido de fondo: las risas, la música, el ambiente (111 pares de resultados, 5 de agosto de 2026).
- Familiar suena un 27.8% más parecido a la voz real de quien habla que ElevenLabs Dubbing v1, más cerca en los 11 idiomas (418 pares de resultados, 5 de agosto de 2026).
- Los propios traductores del estudio editan cualquier línea traducida antes de renderizar, y cada idioma se renderiza con su propia aprobación.
01.¿Por qué el doblaje no convence?
Dos de los fallos son anteriores a la IA: un actor de doblaje también es una voz de extraño, y ninguna sesión de grabación mueve la boca del actor. El doblaje con IA solo de audio puede añadir un tercero, la escena aplanada, medido más abajo.
- Una voz de extraño. Lea la línea un actor de doblaje o una voz genérica, quien conoce al actor deja de reconocerlo (Doblaje de video con IA, explicado (2026)).
- Una boca que habla otro idioma. El cerebro combina el movimiento de los labios con el sonido para entender el habla; cuando no coinciden, cuesta más comprender, o el espectador percibe un sonido completamente distinto: el efecto McGurk, parte de la integración audiovisual del habla. Un doblaje solo de voz deja ese desajuste en cada fotograma.
- Una escena aplanada. Las risas, la música, los efectos de sonido y el ambiente de la sala se pierden o se emborronan bajo el nuevo diálogo.
- Una traducción frase por frase. Una línea calcada palabra por palabra suena extranjera aunque sea correcta, y los chistes llegan tarde o no llegan (Qué importa en la traducción de video).
02.¿Qué dicen las mediciones?
ElevenLabs Dubbing v2 (Alpha) tuvo un 270% más de errores en el sonido de fondo: las risas, la música, el ambiente.
11.92 FRENTE A 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 PARES DE RESULTADOS · MANDARÍN, ESPAÑOL, JAPONÉS · 5 DE AGOSTO DE 2026Familiar suena un 27.8% más parecido a la voz real de quien habla que ElevenLabs Dubbing v1; los 11 idiomas favorecieron a Familiar.
0.4605 FRENTE A 0.3604 · ELEVENLABS DUBBING V1 · 418 PARES DE RESULTADOS · 11 IDIOMAS · 5 DE AGOSTO DE 2026de la calidad de la primera versión del profesional experto, promediando francés, chino, hindi e indonesio, con evaluación a ciegas frente a revisiones de referencia de expertos. Un empate.
ESTUDIO DE TRADUCCIÓN EN PRODUCCIÓN FRENTE A TRADUCTORES PROFESIONALES EXPERTOS (PRIMERA VERSIÓN) · AGOSTO DE 2026Las dos cohortes de ElevenLabs y el estudio de traducción humana nunca se agrupan. Todos los datos, los intervalos y los ejemplos para escuchar: Familiar frente a ElevenLabs y frente a traductores humanos; el método, en IA frente a traducción humana: probada contra profesionales (2026).
- Las palabras, ElevenLabs Dubbing v2 (Alpha). Familiar cometió un 54.7% menos de errores importantes en la traducción hablada (29 frente a 64).
- Fallos en la salida hablada, ElevenLabs Dubbing v1. Familiar cometió un 48.8% menos de fallos en la salida hablada marcados en la revisión (132 frente a 258).
03.¿Qué cambia cuando la voz, los labios y la escena salen de un solo modelo?
Un solo modelo unificado genera la voz, los labios y la escena a la vez, con permanencia de las identidades y comprensión de la escena y del mundo, de modo que se conserva la interpretación del propio actor en lugar de una voz de extraño sobre una boca que no coincide.
- La voz sale de la propia interpretación del actor. Doblar no es texto a voz: toma el audio original y conserva la identidad y la forma de decir de quien habla.
- El rostro vuelve a actuar (ojos, cejas, mejillas, cabeza), no solo los labios. Todo el rostro actúa en el nuevo idioma, así que la boca que lee el espectador coincide con las palabras que escucha (Sincronización labial con IA: qué es, qué se le escapa y qué la supera (2026)).
- La escena sobrevive al doblaje. Las risas, la música y los graves, los efectos de sonido, el ambiente de la sala; los tramos que el modelo detecta como música pasan intactos.
- Todos los que aparecen en cámara quedan doblados, cada uno con su propia voz; la escena de cine con tres personas hablando de /demos está doblada del inglés al español. Micrófonos delante de la boca, manos que cruzan el rostro: el modelo entiende las oclusiones.
- Los nombres, los lugares y las frases características se mantienen exactamente como se dicen gracias a una lista de no traducir que controla el estudio; los chistes se reescriben para que funcionen en el idioma de destino.
- Un solo renderizado incluye la traducción, la voz del actor, el audio de la escena y la sincronización labial.
04.¿Cómo lo opera un estudio?
- Revisión antes de renderizar, por idioma. El proceso se pausa en un paso de revisión donde los propios traductores del estudio editan cualquier línea traducida; cada idioma se renderiza con su propia aprobación: el español hoy, el resto cuando sus revisores den el visto bueno (Transcripción y revisión).
- Una línea de contexto de una sola frase. Quién aparece en pantalla y de qué va la serie, definida en el ámbito de creador para toda una serie o en el ámbito de trabajo para un solo episodio; prevalece el ámbito más específico (Contexto).
- Una lista de no traducir en los mismos tres ámbitos, para que el nombre o la frase característica de un personaje se mantenga igual en el episodio 60 que en el 1 (Lista de no traducir).
- Webhooks. dub.ready_for_review cuando la traducción está lista, dub.output_ready por cada idioma terminado (Webhooks).
- 30 idiomas, de cualquiera a cualquiera, en tres niveles de calidad publicados, de mayor a menor (Idiomas).
- El precio de referencia. El doblaje humano completo, traducción más voz, cuesta entre $70 y $150 por minuto terminado; el acceso a Familiar es por acuerdo de Studio, a la medida del catálogo.
| Entregable | Formato | Nota |
|---|---|---|
| Video terminado | mp4 con la mezcla de audio completa | Listo para publicar |
| Subtítulos | .srt y .vtt | A partir de la transcripción revisada; no se venden por separado |
| Audio por separado | La mezcla completa, o la voz sola | Para la mezcla propia del estudio |
| Título y descripción | Traducidos por idioma | Los enlaces, los @, los #hashtags y los capítulos se quedan tal cual |
05.¿Qué debería probar un estudio antes de comprometer una temporada?
- Elegir el episodio más difícil, uno con diálogo rápido, un chiste, un giro emocional, nombres propios y música bajo el diálogo; una escena limpia no demuestra nada sobre una temporada.
- Escribir los criterios de aceptación antes de que nadie escuche. Revisores nativos puntúan las palabras, la voz, la escena y el rostro contra esos criterios y marcan el momento en que se rompe la inmersión; la tabla de evaluación está en Cómo hacer un piloto de doblaje con IA (2026).
- Incluir un cambio tardío. Un máster modificado es una nueva solicitud de doblaje; el paso de revisión es donde se comprueban las líneas cambiadas, y la lista de no traducir y el contexto se mantienen.
PREGUNTAS
¿Por qué los espectadores internacionales dicen que el doblaje no convence?
Se rompieron tres cosas: la voz es de un extraño, la boca sigue hablando el idioma original, y la música y el ambiente bajo el diálogo quedaron aplanados. El espectador rara vez nombra la causa; una boca que no coincide con el sonido hace que el habla cueste más de entender.
¿Es la traducción o es la voz?
Las dos, y se suman: una traducción frase por frase suena extranjera aunque sea correcta, y una voz sustituida elimina al actor. En clips pareados, Familiar sonó un 27.8% más parecido a la voz real de quien habla que ElevenLabs Dubbing v1; en un estudio aparte, sus traducciones igualaron a los traductores profesionales (primera versión) con un 100.3%.
¿Nuestros propios traductores pueden seguir revisando las líneas?
Sí. El proceso se pausa en un paso de revisión donde cualquier línea traducida se edita antes de renderizar, y cada idioma se renderiza cuando su revisor da el visto bueno: el español puede salir mientras el japonés sigue en revisión.
¿Los nombres y las frases características de los personajes se mantienen entre episodios?
Sí. Una lista de no traducir mantiene nombres, lugares y frases características exactamente como se dicen en el doblaje, en los subtítulos y en el título y la descripción traducidos. Definida en el ámbito de creador, cubre todos los episodios de una serie; una entrada en el ámbito de trabajo la sobrescribe para una sola subida.
¿Qué recibimos por idioma?
El video terminado con la mezcla de audio completa, los subtítulos en .srt y .vtt a partir de la transcripción revisada, el título y la descripción traducidos, y el audio por separado: la mezcla completa, o la voz sola para la mezcla propia del estudio.
REFERENCIAS
- [1]Benchmark Familiar frente a ElevenLabs: resultados completos, intervalos y ejemplos para escuchar
- [2]Familiar frente a traductores humanos: el estudio de calidad de traducción
- [3]Transcripción y revisión: el paso de revisión y el renderizado por idioma (documentación de la API)
- [4]Qué importa en la traducción de video (los cuatro problemas)
- [5]McGurk & MacDonald, “Hearing lips and seeing voices”, Nature 264 (1976)
El doblaje por fin es bueno. Primero, las mediciones; después, hablar con el equipo sobre su catálogo.
FAMILIAR · EL VIDEO DE LANZAMIENTO · 2:31
