Há um atraso. Porque existe, e o que lhe custa.
Seja de que maneira for, fazer-se entender numa língua que não fala tem um atraso. A questão não é se o Taiwa tem um. É como se compara com as alternativas e o que fazemos para o manter pequeno.
Três formas de ser traduzido
Três formas de o seu cliente se fazer entender. As três têm atraso. Só uma costuma ser descrita como instantânea — e não é.
Um falante nativo
O atraso: nenhum. A espera: tudo o resto.
Não há atraso de tradução porque não há tradução. Mas é preciso encontrar essa pessoa, transferir-lhe a chamada e ter a sorte de ela estar de turno — ou seja, contratar agentes multilingues para todas as línguas em que atende chamadas. Isso não se aguenta em horários alargados nem nas línguas em que lhe entram meia dúzia de chamadas por semana.
Um intérprete telefónico
O atraso: dois a seis segundos, a interpretar em direto.
Uma terceira pessoa em linha. Na interpretação simultânea, a investigação publicada situa os profissionais dois a seis segundos atrás de quem fala, e passados uns quatro segundos a exatidão começa a cair, porque estão a reter mais da frase na memória. Ao telefone, muita interpretação é feita de forma consecutiva: cada lado fala, faz uma pausa e espera. Evita esse atraso, mas estica a chamada.
Taiwa
O atraso: alguns segundos, a cada intervenção.
Num teste controlado, o áudio traduzido do Taiwa começou cerca de três a sete segundos depois de o cliente começar a falar — a maioria das línguas dentro do mesmo intervalo ouvido-voz que se reporta para intérpretes, o coreano e o chinês um pouco acima. Uma máquina não retém a frase na memória de trabalho como uma pessoa, mas isso não faz o atraso desaparecer. Nesse teste, a tradução já estava quase sempre a tocar antes de o cliente acabar a frase. Sem terceiros em linha, sem transferência, sem esperar que alguém esteja disponível.
Números dos intérpretes retirados de investigação publicada sobre o intervalo ouvido-voz na interpretação simultânea. ↓
Porque há sempre um mínimo
Não se traduz uma frase que ainda não se ouviu.
Traduzir não é transcrever. Para passar uma frase para outra língua é preciso ter dela o suficiente para saber o que quer dizer — e "o suficiente" é, muitas vezes, quase a frase toda.
Um exemplo: "Deixei o telemóvel no banco." Enquanto não chegam as palavras seguintes, tanto pode ser o banco de trás do carro como a instituição financeira onde tem a conta — e, na maioria das línguas, são duas palavras diferentes. Adivinhar cedo é ser rápido e estar errado. Esperar é ser mais lento e estar certo.
Qualquer intérprete simultâneo faz esta troca a toda a hora: colar-se demasiado a quem fala é fixar um sentido antes de o orador acabar de o construir.
Parte desse mínimo é linguística, não técnica. Hardware mais rápido pode encurtar o processamento, mas não faz com que um sistema traduza sentido que ainda não chegou. É por isso que nenhuma tradução em tempo real é instantânea, incluindo a nossa.
O problema do alemão
Há línguas que agravam isto, e não é culpa de ninguém.
O alemão deixa muitas vezes a parte decisiva do verbo para o fim da oração. O japonês põe o predicado no fim de forma ainda mais sistemática. Enquanto essa peça não chega, pode saber-se quem e o quê estavam envolvidos, mas não o que aconteceu de facto.
Ich habe den Vertrag gestern zusammen mit meinem Kollegen …
Eu tenho o contrato ontem juntamente com o meu colega …
gekündigt.
rescindido.
Tudo o que vem antes dessa última palavra tanto dá para assinar o contrato como para o ler ou o perder. A ação decisiva é a última a chegar.
E não é só o alemão, nem só os verbos. O mandarim, o japonês e o coreano podem marcar uma pergunta de sim ou não mesmo no fim: um 吗 final, um か, ou a terminação do verbo em coreano. Costuma haver pistas antes disso, mas a forma segura em inglês depende dessa última peça — afirmação ou pergunta?
Os intérpretes humanos batem exatamente nesta parede: a investigação descreve como são obrigados a aumentar o atraso quando trabalham a partir do alemão, à espera de um predicado que só chega no fim da oração. Não é uma limitação da tradução automática. É uma propriedade da língua.
Por isso testámos a versão simples desse receio. Numa execução controlada, com vozes sintéticas, uma frase alemã cujo sentido vira nas duas últimas palavras começou a ser traduzida tão depressa como uma frase banal. Perguntas curtas em mandarim, japonês e coreano voltaram tão depressa como as afirmações equivalentes — e voltaram como perguntas, com o "Did…" que o inglês põe à frente. Isto não prova que todas as frases longas se comportem assim. Mostra que o motor não fica simplesmente calado à espera do verbo ou da partícula final: arranca pelo início e vai preenchendo o resto atrás.
Pode ver isto a acontecer.
Uma frase controlada, dita por uma voz nativa sintética em cada uma de treze línguas e traduzida para inglês pelo DeepL Voice em tempo real verdadeiro. A barra cinzenta é a fala de origem; a barra preta é o primeiro áudio traduzido. Nesta execução, onze das treze barras pretas começam antes de a cinzenta acabar: a tradução já a tocar enquanto a frase ainda está a ser dita.
Medido através do motor DeepL Voice: uma frase, uma voz nativa sintética por língua, uma única execução, com o volume da origem normalizado e os silêncios cortados. É o que aconteceu naquela execução, não um referencial. O coreano e o chinês arrancaram cerca de 0,6–0,7 segundos depois de a fala de origem terminar. O DeepL continua a melhorar o motor, por isso voltamos a correr o teste e atualizamos a página, em vez de deixar cá um instantâneo lisonjeiro.
O que fazemos quanto a isso
Não esperamos pela frase toda.
O DeepL transmite cada segmento à medida que se forma e vai corrigindo o texto conforme chega mais, em vez de ficar calado até o orador parar. Muitas vezes a tradução começa antes de a frase acabar — nem sempre, como mostra o gráfico acima.
A transcrição chega antes do áudio.
O texto aparece normalmente antes da tradução falada, porque a voz ainda tem de ser sintetizada. O seu agente vai acompanhando o sentido pela leitura enquanto a frase acaba de assentar, antes de alguém agir com base nela.
A transcrição corrige-se sozinha, no mesmo sítio.
Um segmento aparece como linha provisória e atualiza-se à medida que a frase se resolve: na transcrição, o banco de trás do carro passa a ser a instituição financeira, sem ninguém ter de se repetir. Com o áudio é ao contrário — depois de tocado, não há como voltar atrás.
Ler à frente do que se ouve
O atraso é real. Os custos das alternativas também.
Um intérprete telefónico acrescenta tempo de preparação e mais uma pessoa à chamada. Um falante nativo não tem atraso nenhum — se estiver de turno. O Taiwa é para as chamadas em que essa troca compensa mais do que esperar, transferir ou manter pessoal para cada língua por conta própria.
