A RESPOSTA CURTA
A VERSÃO CURTA
- Esteiras só de áudio embolam falas sobrepostas em uma única voz, então uma cena com três pessoas falando é o primeiro teste que um estúdio deve fazer.
- O ElevenLabs Dubbing v2 (Alpha) teve 270% mais erros no som de fundo nos mesmos clipes: as risadas, a música, o som ambiente (111 pares de resultados, 5 de agosto de 2026).
- A tradução em produção da Familiar empata com a primeira versão de tradutores profissionais especialistas, em 100.3% da qualidade deles, em francês, chinês, hindi e indonésio.
- O estúdio edita qualquer linha traduzida em uma etapa de revisão antes de renderizar, e uma lista de Não Traduzir mantém nomes de personagens e bordões exatamente como foram ditos.
01.O que a dublagem de um filme precisa manter?
Uma cena de filme acumula todos os casos difíceis de uma vez: vários atores trocando falas, uma trilha sob o diálogo, um som ambiente que precisa correr sem cortes entre os planos e um público que já sabe como cada ator soa.
- A voz. Dublagem não é conversão de texto em fala: ela recebe a fala gravada do ator e preserva a identidade e a entrega.
- A interpretação inteira. O espectador lê os lábios enquanto ouve, então uma boca ainda moldada para a língua original briga com a nova fala em cada quadro; um ator também interpreta uma fala com o rosto inteiro: olhos, sobrancelhas, bochechas, cabeça (Lip sync com IA: o que é, o que perde, o que supera (2026)).
- A cena. A trilha, o som ambiente, os efeitos e a multidão ficam sob o diálogo: os trechos detectados como música nunca são dublados, e as camadas de som de fundo são preservadas sob a nova fala.
- Cada pessoa que fala. Todo mundo que aparece na câmera é dublado, cada um com a própria voz; esteiras só de áudio embolam falas sobrepostas em uma única voz (o efeito cocktail party).
- As palavras. Uma dublagem precisa de um roteiro novo escrito na língua de destino: piadas reescritas para funcionar, nomes de personagens e bordões mantidos exatamente como foram ditos (O que importa na tradução de vídeo).
02.Como avaliar?
A tabela de avaliação de seis dimensões e o método pareado estão em A melhor dublagem com IA do mundo: como medir; uma cena de filme os comprime em cinco perguntas.
| CRITÉRIO | A PERGUNTA QUE UM ESTÚDIO FAZ | COMO O BENCHMARK DA FAMILIAR MEDE |
|---|---|---|
| Cada pessoa mantém a própria voz | Feche os olhos: cada ator na câmera continua sendo a mesma pessoa, inclusive quando dois falam ao mesmo tempo? | Semelhança entre a voz da dublagem e a voz real de quem fala, por clipe de origem e língua de destino (estudo ElevenLabs Dubbing v1, 11 línguas); falas sobrepostas emboladas registradas como classe de falha na auditoria dos mesmos clipes |
| O rosto interpreta a fala | Boca, olhos, sobrancelhas, bochechas e cabeça carregam as novas palavras, ou só os lábios? | Lado a lado no mesmo clipe; os estudos publicados comparam o áudio final, então ferramentas só de áudio pulam esta linha |
| A cena sobrevive | A trilha continua sob o diálogo? O som ambiente? Os efeitos? | Erro no som de fundo em relação à cena original, em dB (estudo ElevenLabs Dubbing v2 (Alpha)) |
| As palavras carregam a intenção | Cada fala diz o que o roteiro quis dizer? A piada funcionou? O nome do personagem sobreviveu? | Erros importantes de tradução por resultado contra um sentido aprovado (estudo ElevenLabs Dubbing v2 (Alpha)); qualidade da tradução com avaliação às cegas contra revisões de referência feitas por especialistas (o estudo de tradução humana) |
| É medido e publicado | Os mesmos clipes em cada sistema, coortes congeladas, dados públicos? | Estudos pareados de caixa-preta com intervalos de confiança, exemplos para ouvir e coortes congeladas, publicados em thefamiliarlab.com/benchmark |
- As renderizações de referência. Uma cena de interrogatório com três pessoas falando, do inglês para o espanhol, toca ao lado do original em /demos; um segundo lado a lado ali tem microfones na frente da boca e mãos cruzando o rosto: o modelo entende as oclusões.
03.O que foi medido?
Os estudos da Familiar são pareados e de caixa-preta: os mesmos clipes de origem passam por cada sistema, só o áudio final é comparado, e cada coorte fica congelada e separada.
A ElevenLabs teve 270% mais erros no som de fundo: as risadas, a música, o som ambiente.
ELEVENLABS DUBBING V2 (ALPHA) · 111 PARES DE RESULTADOS · MANDARIM, ESPANHOL, JAPONÊS · 5 DE AGOSTO DE 2026A Familiar soa 27.8% mais parecida com a voz real de quem fala; todas as 11 línguas favoreceram a Familiar.
ELEVENLABS DUBBING V1 · 418 PARES DE RESULTADOS · 11 LÍNGUAS · 5 DE AGOSTO DE 2026A tradução em produção da Familiar empata com a qualidade da primeira versão do profissional especialista, na média de francês, chinês, hindi e indonésio, com avaliação às cegas contra revisões de referência feitas por especialistas.
ESTUDO DE TRADUÇÃO EM PRODUÇÃO VS PRIMEIRA VERSÃO DE TRADUTORES PROFISSIONAIS ESPECIALISTAS · FRANCÊS, CHINÊS, HINDI, INDONÉSIO · AGOSTO DE 2026- Palavras, mesma coorte. A Familiar cometeu 54.7% menos erros importantes de tradução na fala do que o ElevenLabs Dubbing v2 (Alpha), 29 contra 64, nos mesmos 111 pares de resultados.
04.O que o estúdio continua controlando?
- Cada linha. O processo pausa em uma etapa de revisão em que qualquer linha traduzida é editada antes de renderizar, e cada língua renderiza quando o revisor dela aprova (transcrição e revisão).
- Nomes e bordões. Uma lista de Não Traduzir mantém nomes de personagens, lugares e falas marcantes exatamente como foram ditos na dublagem, nas legendas e no título e na descrição traduzidos; uma frase de contexto diz quem está em cena e do que o filme trata (Não Traduzir).
- A voz. A voz vem do próprio take do ator na cena; não existe etapa de casting.
- Línguas. Uma origem renderiza para até 29 línguas de destino, a partir de qualquer das 30, em três níveis de qualidade publicados, começando pelo melhor (línguas).
- Entregas por língua. O vídeo finalizado, legendas .srt e .vtt da transcrição revisada, o título e a descrição traduzidos e o áudio em arquivos separados: a mixagem completa, ou só a voz, para a mixagem do próprio estúdio (saídas).
- Direitos. A confirmação dos direitos fica registrada em cada dublagem.
05.Antes de fechar um catálogo
- Escolha a cena mais difícil. Três pessoas falando, uma trilha sob o diálogo, uma piada, um microfone ou uma mão na frente da boca.
- Escreva os critérios de aceitação primeiro. A Tabela 01 é a tabela de avaliação; revisores nativos avaliam cada língua às cegas, no material do próprio estúdio, antes de alguém ouvir o candidato.
- Inclua uma alteração de última hora. Mude uma linha depois da primeira renderização e passe-a pela etapa de revisão; o número de linhas que um revisor altera é, por si só, uma medida de qualidade.
- Rode como piloto. Desenho pareado, cenas conectadas, duas ou três línguas prioritárias: Como rodar um piloto de dublagem com IA (2026).
- Acesso. Por contrato Studio, sob medida para o catálogo; garantia de reembolso em 30 dias para contratos anuais assinados.
PERGUNTAS
Cada ator em cena mantém a própria voz?
Sim. Todo mundo que aparece na câmera é dublado, cada um com a própria voz. Medida contra o ElevenLabs Dubbing v1 em 418 pares de resultados em 11 línguas, a Familiar soou 27.8% mais parecida com a voz real de quem fala, mais próxima em todas as 11.
A trilha sobrevive à dublagem?
Sim. Os trechos detectados como música nunca são dublados, e as camadas de som de fundo sob o diálogo são preservadas: a trilha, o som ambiente, os efeitos. Nos mesmos clipes, o ElevenLabs Dubbing v2 (Alpha) teve 270% mais erros no som de fundo (11.92 contra 3.22 dB; 111 pares de resultados, 5 de agosto de 2026).
Por que a boca importa se a voz está certa?
O espectador combina o movimento dos lábios com o som para entender a fala; quando os dois não batem, a compreensão fica mais difícil, ou ele ouve um som completamente diferente (o efeito McGurk, McGurk & MacDonald, Nature, 1976). Uma dublagem só de voz deixa esse descompasso em cada quadro; a Familiar gera voz e lip sync juntos.
Quanto custa a dublagem humana completa, para comparar?
A dublagem humana completa, tradução mais voz, custa de $70 a $150 por minuto finalizado por língua: tradução de $22–45 por minuto falado, pelas tarifas por palavra publicadas, mais voz e estúdio de $39–94. Uma única renderização da Familiar carrega a tradução, a voz do ator, o som da cena e o lip sync; o acesso é por contrato Studio.
REFERÊNCIAS
- [1]Benchmark Familiar vs ElevenLabs: resultados completos, intervalos de confiança e exemplos para ouvir
- [2]Familiar vs tradutores humanos: qualidade da tradução com avaliação às cegas contra revisões de referência feitas por especialistas, e preço
- [3]A melhor dublagem com IA do mundo: como medir
- [4]Dublagem que não convence no exterior: como os estúdios resolvem
- [5]Como rodar um piloto de dublagem com IA (2026)
- [6]McGurk & MacDonald, "Hearing lips and seeing voices", Nature 264, 746–748 (1976)
A dublagem finalmente ficou boa. Veja as medições e depois fale com a equipe sobre o seu catálogo.
FAMILIAR · O FILME DE LANÇAMENTO · 2:31
