Hay un retraso. Esta es la razón y lo que te cuesta.
Toda forma de hacerte entender en un idioma que no hablas tiene un retraso. La cuestión no es si Taiwa tiene uno. Es cómo se compara con las alternativas y qué hacemos para mantenerlo pequeño.
Tres formas de que te traduzcan
Tres formas de que tu cliente se haga entender. Las tres tienen un retraso. Solo una suele describirse como instantánea, y no lo es.
Un hablante nativo
El retraso: ninguno. La espera: todo lo demás.
Sin retraso de traducción, porque no hay traducción. Pero tienes que encontrarlos, transferirles la llamada y esperar que estén de turno, lo que significa contratar agentes multilingües para cada idioma en el que atiendes llamadas. Eso no aguanta para cubrir horarios largos ni para los idiomas en los que recibes unas pocas llamadas a la semana.
Un intérprete telefónico
El retraso: de dos a seis segundos, interpretando en directo.
Una tercera persona en la línea. En interpretación simultánea, los estudios publicados sitúan a los profesionales unos dos a seis segundos por detrás del hablante, y más allá de unos cuatro segundos la precisión cae, porque retienen más frase en la memoria. Muchas llamadas telefónicas son consecutivas: cada parte habla, se detiene y espera, lo que evita ese retraso pero alarga la llamada.
Taiwa
El retraso: varios segundos por detrás, por turno.
En una prueba controlada, el audio traducido de Taiwa empezó unos tres a siete segundos después de que el cliente comenzara a hablar: la mayoría de los idiomas, dentro del mismo margen amplio de intervalo oído–voz reportado para intérpretes; el coreano y el chino, un poco por encima. Una máquina no retiene la frase en la memoria de trabajo como lo hace una persona, pero eso no hace que el retraso desaparezca. En esa prueba, la traducción solía estar sonando antes de que el cliente hubiera terminado su frase. Sin una tercera persona en la línea, sin transferencia, sin esperar a que alguien esté disponible.
Cifras de intérpretes a partir de investigación publicada sobre el intervalo oído–voz en interpretación simultánea. ↓
Por qué hay un suelo
No puedes traducir una frase que no has oído.
Traducir no es transcribir. Para convertir una frase a otro idioma necesitas lo suficiente de ella para saber qué significa, y "lo suficiente" es a menudo la mayor parte.
Pongamos "Está en el banco". Hasta que llegan las siguientes palabras, eso es un asiento del parque o una entidad financiera, y en la mayoría de los idiomas son palabras distintas. Adivina pronto y serás rápido e incorrecto. Espera, y serás más lento y correcto.
Todo intérprete simultáneo hace esta compensación de forma continua: si va demasiado pegado, se compromete con un significado antes de que el hablante haya terminado de expresarlo.
Parte de ese suelo es lingüística, no técnica. Un hardware más rápido puede recortar el procesamiento, pero no puede hacer que ningún sistema traduzca un significado que aún no ha llegado. Es la razón por la que ninguna traducción en tiempo real es instantánea, la nuestra incluida.
El problema del alemán
Algunos idiomas lo empeoran, y no es culpa de nadie.
El alemán suele dejar la parte decisiva del verbo para el final de la cláusula. El japonés es aún más consistente en tener el predicado al final. Hasta que llega esa pieza, puedes saber quién y qué estaban involucrados, pero no qué ocurrió realmente.
Ich habe den Vertrag gestern zusammen mit meinem Kollegen …
He el contrato ayer junto con mi colega …
gekündigt.
cancelado.
Todo lo anterior a esa última palabra es compatible con firmarlo, leerlo o perderlo. La acción decisiva llega la última.
Y no es solo el alemán, ni solo los verbos. El mandarín, el japonés y el coreano pueden marcar una pregunta de sí o no justo al final: un 吗, un か o una terminación verbal coreana. A menudo hay pistas antes, pero la forma segura en inglés puede depender de esa última pieza: ¿enunciado o pregunta?
Los intérpretes humanos topan exactamente con esta pared: la investigación describe cómo se ven obligados a aumentar su retraso cuando trabajan desde el alemán, esperando un predicado que llega al final de la cláusula. No es una limitación de la traducción automática. Es una propiedad del idioma.
Así que probamos la versión simple de ese miedo. En una ejecución controlada, con voces sintéticas, una frase en alemán cuyo significado cambia en sus dos últimas palabras empezó a traducirse no más lento que una normal. Preguntas cortas en mandarín, japonés y coreano volvieron tan rápido como sus enunciados equivalentes, y correctamente como preguntas, con el "Did…" que el inglés pone al principio. Eso no prueba que cada frase larga se comporte igual. Sí muestra que el motor no se queda simplemente en silencio, esperando al verbo o partícula final: empieza con el arranque y rellena el resto por detrás.
Puedes verlo ocurrir.
Una frase controlada, hablada por una voz nativa sintética en cada uno de trece idiomas y traducida al inglés mediante DeepL Voice en tiempo real verdadero. La barra gris es el habla original; la barra negra es el primer audio traducido. En esta única ejecución, once de las trece barras negras empiezan antes de que termine la gris: la traducción ya suena mientras la frase aún se está diciendo.
Medido a través del motor DeepL Voice: una frase, una voz nativa sintética por idioma, una única ejecución, fuente normalizada en volumen y con silencios recortados. Esto es lo que ocurrió en esa ejecución, no un benchmark. El coreano y el chino empezaron unos 0,6–0,7 segundos después de que terminara el habla original. DeepL sigue mejorando su motor, así que volvemos a ejecutar esto y actualizamos la página en lugar de dejar una instantánea favorecedora.
Qué hacemos al respecto
No esperamos a la frase completa.
DeepL transmite una frase a medida que se forma, revisando el texto conforme llega más, en lugar de quedarse en silencio hasta que el hablante para. A menudo la traducción empieza antes de que termine la frase, aunque, como muestra el gráfico de arriba, no siempre.
La transcripción llega antes que el audio.
El texto suele aparecer antes de la traducción hablada, porque el habla tiene que sintetizarse. Así tu agente puede seguir el significado del cliente mientras lo lee, mientras la frase termina de asentarse antes de que nadie actúe sobre ella.
La transcripción se corrige sola en su sitio.
Una frase aparece como una línea tentativa y se actualiza a medida que la oración se resuelve: el asiento del parque se convierte en la entidad financiera, en la transcripción, sin que nadie tenga que repetirse. El audio hablado es lo contrario: una vez que se reproduce, no se puede retirar.
Leyendo antes de escuchar
El retraso es real. También lo son los costes de las alternativas.
Un intérprete telefónico añade tiempo de configuración y otra persona a la llamada. Un hablante nativo no tiene retraso, si está de turno. Taiwa es para las llamadas en las que esa compensación supera a esperar, transferir o tener plantilla propia para cada idioma.
