Há um atraso. Eis o motivo e o que ele custa para você.

Toda forma de ser entendido numa língua que você não fala tem um atraso. A questão não é se Taiwa tem um. É como ele se compara às alternativas e o que fazemos para mantê-lo pequeno.

Três formas de ser traduzido

Três formas de seu cliente ser entendido. Todas têm um atraso. Só uma costuma ser descrita como instantânea, e não é.

Um falante nativo

O atraso: nenhum. A espera: todo o resto.

Sem atraso de tradução, porque não há tradução. Mas é preciso encontrá-los, transferir para eles e torcer para que estejam no turno — o que significa contratar agentes multilíngues para cada idioma em que você atende. Isso não se sustenta para cobertura de horários longos ou para os idiomas em que você recebe poucas chamadas por semana.

Um intérprete por telefone

O atraso: dois a seis segundos, interpretando ao vivo.

Uma terceira pessoa na linha. Na interpretação simultânea, estudos publicados colocam profissionais aproximadamente dois a seis segundos atrás do falante, e após cerca de quatro segundos a precisão cai, porque estão retendo mais da frase na memória. Muitas chamadas são consecutivas — cada lado fala, para e espera — o que evita esse atraso, mas prolonga a chamada.

Taiwa

O atraso: vários segundos atrás, por turno.

Num teste controlado, o áudio traduzido do Taiwa começou cerca de três a sete segundos depois do cliente começar a falar — a maioria dos idiomas dentro da mesma faixa ampla de ear–voice span relatada para intérpretes, coreano e chinês um pouco acima. Uma máquina não retém a frase na memória de trabalho como uma pessoa, mas isso não faz o atraso sumir. Nesse teste, a tradução geralmente já estava tocando antes de o cliente terminar a frase. Sem terceira pessoa na linha, sem transferência, sem espera por alguém disponível.

Dados sobre intérpretes extraídos de pesquisa publicada sobre ear–voice span em interpretação simultânea. ↓

Por que há um piso

Não dá para traduzir uma frase que você não ouviu.

Tradução não é transcrição. Para transformar uma frase em outro idioma, você precisa de parte suficiente dela para saber o que significa, e "suficiente" geralmente é a maior parte.

Veja "Cortei a manga". Até chegarem as próximas palavras, é uma fruta ou a manga de uma camisa, e na maioria dos idiomas são palavras diferentes. Chute cedo e você é rápido e está errado. Espere e você é mais lento e está certo.

Todo intérprete simultâneo vive essa contrapartida o tempo todo: correr colado demais e você se compromete com um sentido antes de o falante terminar de construí-lo.

Parte desse piso é linguística, não técnica. Hardware mais rápido pode reduzir o processamento, mas não permite que nenhum sistema traduza um sentido que ainda não chegou. É o motivo de nenhuma tradução em tempo real ser instantânea, inclusive a nossa.

O problema do alemão

Alguns idiomas pioram isso, e a culpa não é de ninguém.

O alemão frequentemente deixa a parte decisiva do verbo para o fim da oração. O japonês coloca o predicado no fim de forma ainda mais consistente. Até essa peça chegar, você pode saber quem e o que estavam envolvidos, mas não o que realmente aconteceu.

Ich habe den Vertrag gestern zusammen mit meinem Kollegen …

Eu tenho o contrato ontem junto com meu colega …

gekündigt.

cancelado.

Tudo antes dessa última palavra é compatível com assiná-lo, lê-lo ou perdê-lo. A ação decisiva chega por último.

E não é só alemão, nem só verbos. Mandarim, japonês e coreano podem marcar uma pergunta sim/não bem no fim da frase — um 吗, um か ou uma terminação verbal coreana. Muitas vezes há pistas antes, mas a forma segura em inglês pode depender dessa última peça: afirmação ou pergunta?

Intérpretes humanos esbarram exatamente nessa parede — a pesquisa descreve que são forçados a aumentar o atraso ao trabalhar do alemão, esperando um predicado que chega no fim da oração. Não é uma limitação da tradução automática. É uma propriedade da língua.

Então testamos a versão simples desse medo. Numa execução controlada, com vozes sintéticas, uma frase em alemão cujo sentido se decide nas duas últimas palavras começou a ser traduzida tão rápido quanto uma simples. Perguntas curtas em mandarim, japonês e coreano voltaram tão rápido quanto suas afirmações correspondentes — e corretamente como perguntas, com o auxiliar "Did…" que o inglês coloca logo no começo. Isso não prova que toda frase longa se comporta igual. Mostra que o motor não fica simplesmente em silêncio, esperando o verbo ou partícula final: ele começa na abertura e preenche o resto por trás.

Você pode ver acontecer.

Uma frase controlada, falada por uma voz nativa sintética em cada um dos treze idiomas e traduzida para inglês pelo DeepL Voice em tempo real verdadeiro. A barra cinza é a fala original; a barra preta é o primeiro áudio traduzido. Nesta execução única, onze das treze barras pretas começam antes da cinza terminar — a tradução já tocando enquanto a frase ainda está sendo falada.

FalandoÁudio traduzido
0s2s4s6s8s10s12s
Deutsch
Italiano
Español
日本語
Français
Türkçe
Русский
Português
Polski
Nederlands
Svenska
한국어
中文

Medido pelo motor DeepL Voice — uma frase, uma voz nativa sintética por idioma, uma única execução, fonte normalizada em volume e com silêncios removidos. Foi o que aconteceu naquela execução, não um benchmark. Coreano e chinês começaram cerca de 0,6–0,7 segundos depois do fim da fala original. O DeepL segue melhorando seu motor, então refazemos essa medição e atualizamos a página em vez de deixar um snapshot lisonjeiro.

O que fazemos a respeito

Não esperamos pela frase inteira.

O DeepL transmite uma frase enquanto ela se forma, revisando o texto conforme mais chega, em vez de ficar em silêncio até o falante parar. Muitas vezes a tradução começa antes da frase terminar — embora, como o gráfico acima mostra, nem sempre.

A transcrição chega antes do áudio.

O texto geralmente aparece antes da tradução falada, porque a fala precisa ser sintetizada. Assim, seu agente acompanha o sentido do cliente enquanto lê, enquanto a frase termina de se acomodar antes que alguém aja sobre ela.

A transcrição se corrige no próprio lugar.

Uma frase aparece como uma linha provisória e se atualiza conforme se resolve — a fruta vira a manga da camisa, na transcrição, sem ninguém se repetir. O áudio falado é o oposto: depois de tocado, não tem como voltar atrás.

Lendo antes de ouvir

A transcrição, no meio da frase. Itálico ainda está se formando; reto está consolidado. Seu agente lê o sentido um instante antes de ouvir — que é a única vantagem que o Taiwa tem sobre uma pessoa no telefone, porque um intérprete não pode te entregar uma transcrição enquanto está falando.

O atraso é real. Os custos das alternativas também.

Um intérprete por telefone adiciona tempo de setup e mais uma pessoa à chamada. Um falante nativo não tem atraso — se houver um no turno. Taiwa é para as chamadas em que essa contrapartida compensa mais do que esperar, transferir ou montar equipe para cada idioma.