A RESPOSTA CURTA
A VERSÃO CURTA
- Uma requisição de dublagem leva um título para até 29 línguas de destino; a opção de revisão manual retém cada língua em uma etapa de revisão até um revisor aprovar.
- Cada língua renderiza com a própria aprovação, então o espanhol pode ser publicado enquanto o japonês ainda está em revisão.
- Webhooks reportam cada mudança de estado: uma dublagem pronta para revisão, a saída de cada língua pronta, a dublagem inteira concluída ou uma falha com o erro dela.
- Medido nos mesmos clipes em 5 de agosto de 2026, o ElevenLabs Dubbing v2 (Alpha) teve 270% mais erros no som de fundo: as risadas, a música, o som ambiente.
01.Por que a cobertura é o gargalo?
Um catálogo ganha títulos toda semana; uma esteira que escala o elenco, grava e mixa um título por vez adiciona línguas em ritmo fixo, então é a fila que define quanto do catálogo um mercado consegue assistir na própria língua.
dos 100 maiores canais do YouTube não são em inglês.
- A dublagem humana completa custa de $70 a $150 por minuto finalizado, tradução mais voz: de $4,200 a $9,000 para um título de 60 minutos em uma língua (Quanto custa a dublagem em 2026?).
- Cada língua é a própria fila em uma esteira título a título: dez línguas para um título são dez trabalhos de casting, gravação e mixagem, e o mais lento define a data de lançamento.
- A dublagem só de áudio deixa a boca falando a língua original; o espectador lê lábios que contradizem as palavras que ouve (Dublagem que não convence no exterior: como os estúdios resolvem).
02.Como é dublar no envio?
Uma integração cobre o ciclo inteiro: o fluxo de envio faz uma requisição, a API reporta cada etapa e os arquivos finalizados são servidos pelo player da própria plataforma.
| ETAPA | O QUE ACONTECE | O QUE A PLATAFORMA RECEBE |
|---|---|---|
| Envio | POST /v1/dubs com o arquivo ou uma URL de origem, até 29 códigos de língua de destino e review=manual; a língua de origem é detectada ou fixada. | dub_id, status queued, uma entrada em outputs[] por língua |
| Transcrição e tradução | Transcrição com marcação de tempo por palavra e a fala de cada pessoa separada; cada linha traduzida com a lista de Não Traduzir e a frase de contexto aplicadas. | status transcribing, depois translating |
| Revisão | A dublagem pausa em in_review. GET na transcrição por língua, PATCH em qualquer linha, POST /render para uma língua ou todas. | dub.ready_for_review, depois a transcrição editável |
| Renderização | Voz e lip sync gerados juntos, por língua; cada língua carrega o próprio status. | dub.output_ready por língua; dub.completed quando todas as línguas estiverem renderizadas |
| Entrega | Uma saída por língua: o mp4 finalizado, legendas .srt e .vtt da transcrição revisada, a mixagem completa ou só a faixa de voz, e o título e a descrição traduzidos. | GET /v1/dubs/{dub_id}/output/{lang} com format=mp4, srt, vtt, audio ou voice |
- Falhas também são eventos. dub.failed traz a língua e o erro; uma entrega não confirmada em 10 segundos recebe novas tentativas por 24 horas, e duplicatas são descartadas pelo id do evento (Webhooks).
- Nomes e bordões se mantêm. Uma lista de Não Traduzir os preserva exatamente como foram ditos; uma frase de contexto (quem está em cena, do que a série trata) afina cada linha; as duas valem para um perfil de criador, uma live ou um único título (Não Traduzir, Contexto).
- Os metadados viajam com o título. O título e a descrição traduzidos chegam por língua; links, arrobas, hashtags, códigos promocionais e capítulos ficam exatamente como estão (Tradução de metadados).
03.Por que um único modelo muda a conta da cobertura?
Esteiras costuradas trocam capacidade por qualidade: cada ferramenta a mais é outra passagem e outra conta, e dois modelos não conseguem sustentar uma só identidade. Um único modelo gera voz, lábios e cena juntos.
A ElevenLabs teve 270% mais erros no som de fundo: as risadas, a música, o som ambiente.
11.92 VS 3.22 DB · ELEVENLABS DUBBING V2 (ALPHA) · 111 PARES DE RESULTADOS · MANDARIM, ESPANHOL, JAPONÊS · 5 DE AGOSTO DE 2026A Familiar soa 27.8% mais parecida com a voz real de quem fala; todas as 11 línguas favoreceram a Familiar.
0.4605 VS 0.3604 · ELEVENLABS DUBBING V1 · 418 PARES DE RESULTADOS · 11 LÍNGUAS · 5 DE AGOSTO DE 2026A Familiar cometeu 54.7% menos erros importantes de tradução na fala (29 contra 64).
ELEVENLABS DUBBING V2 (ALPHA) · OS MESMOS 111 PARES DE RESULTADOS DO BLOCO DE 270% · 5 DE AGOSTO DE 2026- A qualidade da tradução se mantém. As traduções da Familiar alcançaram 100.3% da qualidade da primeira versão do profissional especialista, na média de francês, chinês, hindi e indonésio, com avaliação às cegas contra revisões de referência feitas por especialistas (6 de agosto de 2026): um empate (o estudo).
- A cena sobrevive à dublagem. A música nunca é dublada; uma canção passa intacta, e as risadas, os efeitos sonoros e o som ambiente ficam sob a nova fala; todo mundo que aparece na câmera é dublado com a própria voz.
04.Quais títulos primeiro?
A liberação por língua faz da unidade de planejamento um título em uma língua: um mercado entra no ar com as línguas já aprovadas (Lançamento em vários países: dublar todos os mercados de uma vez).
| NÍVEL | LÍNGUAS |
|---|---|
| Nível 1 (14) | alemão, cantonês, coreano, espanhol, francês, indonésio, inglês, italiano, japonês, mandarim, português, russo, tailandês e vietnamita |
| Nível 2 (9) | búlgaro, catalão, croata, eslovaco, grego, holandês, lituano, noruguês e sueco |
| Nível 3 (7) | árabe, bielorrusso, cazaque, dinamarquês, letão, sérvio e ucraniano |
- Os formatos mais limpos primeiro. Podcasts e entrevistas com 2 ou 3 pessoas na câmera, vídeos direto para a câmera, aulas, apresentações e cenas limpas de câmera única.
- Nível 1 primeiro, depois amplie. Cada uma das 30 línguas dubla de e para todas as outras, então a ordem dos níveis é uma ordem de expansão (Línguas).
- Direcione pelo risco. review=manual retém um título em in_review até um revisor do mercado renderizá-lo; review=auto (o padrão) renderiza direto; trabalhos com legenda sempre param, porque o texto delas vem da etapa de revisão.
- Transmissões são uma via separada. Sessões ao vivo dublam uma transmissão de 5 a 9 segundos atrás do original via SRT, RTMP ou WHIP, a partir de 11 línguas de origem para as outras 29, com a transmissão de cada língua enviada para o próprio destino; ao vivo não há etapa de revisão (Dublagem em tempo real para lives).
05.Como fazer um piloto no próprio catálogo?
- Escolha o título mais difícil. Um episódio representativo ou uma sequência de episódios conectados em duas ou três línguas prioritárias, com diálogo rápido, uma piada, música sob a fala, nomes próprios e uma alteração de última hora.
- Escreva os critérios de aceitação antes de alguém ouvir. As palavras, a voz, a cena, o rosto e o tempo, cada um avaliado por um revisor nativo; mais os ciclos de revisão e o tempo entre a mudança na origem e a substituição aprovada.
- Conte as correções. As linhas que um revisor altera na etapa de revisão, em número e tipo, são uma medida direta de qualidade; cada alteração segue na dublagem e nas legendas.
Desenho pareado, tabela de avaliação e como ler os resultados: Como rodar um piloto de dublagem com IA (2026). O acesso é por contrato Studio, sob medida para o catálogo, com garantia de reembolso em 30 dias para contratos anuais assinados.
PERGUNTAS
O que os serviços de streaming estão usando para adicionar dublagens em língua local mais rápido?
Dublagem no envio por API: uma requisição por título para até 29 línguas de destino, uma etapa de revisão por língua, webhooks reportando cada mudança de estado, e o vídeo finalizado, as legendas, as faixas de áudio e o título e a descrição traduzidos servidos pelo player da própria plataforma.
Dublar mais rápido significa dublar pior?
Não quando a voz, o lip sync e a cena vêm de um único modelo. Nos mesmos clipes (5 de agosto de 2026), o ElevenLabs Dubbing v2 (Alpha) teve 270% mais erros no som de fundo do que a Familiar. As traduções da Familiar alcançaram 100.3% da qualidade da primeira versão de profissionais especialistas em francês, chinês, hindi e indonésio: um empate.
Podemos liberar uma língua antes das outras?
Sim. Com review=manual, cada língua fica retida em in_review e renderiza com a própria aprovação: POST /render com uma lista em langs libera o espanhol hoje e as demais depois que os revisores delas aprovarem; cada língua dispara o próprio webhook dub.output_ready quando seus arquivos estão disponíveis para download.
Quanto custa a dublagem humana completa, para comparar?
A dublagem humana completa, tradução mais voz, custa de $70 a $150 por minuto finalizado: de $4,200 a $9,000 para um título de 60 minutos em uma língua. A tradução sozinha custa de $22 a $45 por minuto falado, pelas tarifas por palavra publicadas.
Para quais línguas uma plataforma pode dublar?
30 línguas, de qualquer uma para qualquer uma: um título em qualquer das 30 é dublado para as outras 29, em três níveis de qualidade publicados, começando pelo melhor. O Nível 1 tem 14 línguas, o Nível 2 nove e o Nível 3 sete, em ordem alfabética dentro de cada nível.
REFERÊNCIAS
- [1]A API da Familiar: introdução, início rápido e o ciclo de vida da dublagem
- [2]Transcrição e revisão: reter, editar e renderizar por língua
- [3]Webhooks: o catálogo de eventos, entrega e novas tentativas
- [4]Benchmarks de dublagem da Familiar: três estudos pareados, dados completos e exemplos para ouvir
- [5]Quanto custa a dublagem em 2026? (todas as tarifas de dublagem publicadas, por minuto finalizado)
- [6]Documentação de dublagem da ElevenLabs: cobrança por minuto de mídia de origem, por língua de destino (acessada em 6 de setembro de 2026)
A dublagem finalmente ficou boa. Veja as medições e depois fale com a equipe sobre o seu catálogo.
FAMILIAR · O FILME DE LANÇAMENTO · 2:31
