Il y a un délai. Voici pourquoi, et ce que ça vous coûte.

Toute façon d'être compris dans une langue que vous ne parlez pas a un délai. La question n'est pas de savoir si Taiwa en a un. C'est de savoir comment il se compare aux alternatives, et ce que nous faisons pour le garder court.

Trois façons d'être traduit

Trois façons dont votre client est compris. Les trois ont un délai. Une seule est habituellement décrite comme instantanée, et elle ne l'est pas.

Un locuteur natif

Le délai : aucun. L'attente : tout le reste.

Aucun délai de traduction, car il n'y a pas de traduction. Mais il faut les trouver, leur transférer l'appel, et espérer qu'ils sont en service — ce qui signifie embaucher des agents multilingues pour chaque langue dans laquelle vous prenez des appels. Ça ne tient pas pour des horaires longs ou pour les langues où vous recevez une poignée d'appels par semaine.

Un interprète téléphonique

Le délai : deux à six secondes, interprétant en direct.

Une troisième personne en ligne. En interprétation simultanée, des études publiées situent les professionnels à environ deux à six secondes derrière l'orateur, et au-delà d'environ quatre secondes la précision chute, parce qu'ils retiennent davantage de la phrase en mémoire. Beaucoup d'appels téléphoniques sont en consécutive à la place — chaque côté parle, s'arrête, et attend — ce qui évite ce délai mais étire l'appel.

Taiwa

Le délai : plusieurs secondes de retard, par tour.

Dans un test contrôlé, l'audio traduit de Taiwa a commencé environ trois à sept secondes après que le client a commencé à parler — la plupart des langues dans la même fourchette oreille-voix large rapportée pour les interprètes, le coréen et le chinois un peu au-dessus. Une machine ne retient pas la phrase en mémoire de travail comme une personne, mais ça ne fait pas disparaître le délai. Dans ce test, la traduction était généralement déjà en cours de lecture avant que le client ait fini sa phrase. Pas de troisième personne en ligne, pas de transfert, pas d'attente que quelqu'un soit disponible.

Chiffres d'interprète tirés de recherches publiées sur le décalage oreille-voix en interprétation simultanée. ↓

Pourquoi il y a un plancher

On ne peut pas traduire une phrase qu'on n'a pas entendue.

Traduire n'est pas transcrire. Pour transformer une phrase en une autre langue, il en faut assez pour savoir ce qu'elle signifie, et « assez » est souvent la majeure partie.

Prenons « Je vous appelle au sujet d'un vol ». Tant que les mots suivants n'arrivent pas, il s'agit soit d'un avion, soit d'un délit, et dans la plupart des langues ce sont deux mots différents. Devinez trop tôt et vous êtes rapide et faux. Attendez et vous êtes plus lent et juste.

Chaque interprète simultané fait continuellement ce compromis : suivez l'orateur de trop près et vous vous engagez sur un sens avant qu'il ait fini de le formuler.

Une partie de ce plancher est linguistique, pas technique. Du matériel plus rapide peut raccourcir le traitement, mais il ne peut laisser aucun système traduire un sens qui n'est pas encore arrivé. C'est la raison pour laquelle aucune traduction en temps réel n'est instantanée, la nôtre incluse.

Le problème allemand

Certaines langues l'aggravent, et ce n'est la faute de personne.

L'allemand laisse souvent la partie décisive du verbe à la fin de la proposition. Le japonais est encore plus systématiquement à prédicat final. Tant que cet élément n'arrive pas, vous pouvez savoir qui et quoi étaient impliqués, mais pas ce qui s'est réellement passé.

Ich habe den Vertrag gestern zusammen mit meinem Kollegen …

J'ai le contrat hier avec mon collègue …

gekündigt.

résilié.

Jusqu'à ce dernier mot, le contrat peut tout aussi bien avoir été signé, lu, ou perdu. L'action décisive arrive en dernier.

Et ce n'est pas seulement l'allemand, ou seulement les verbes. Le mandarin, le japonais et le coréen peuvent marquer une question oui/non tout à la fin — un 吗, un か, ou une terminaison verbale coréenne finale. Il y a souvent des indices plus tôt, mais la forme anglaise sûre peut dépendre de ce dernier élément : affirmation, ou question ?

Les interprètes humains butent sur ce même mur — la recherche décrit qu'ils sont contraints d'augmenter leur délai quand ils travaillent depuis l'allemand, attendant un prédicat qui arrive en fin de proposition. Ce n'est pas une limite de la traduction automatique. C'est une propriété de la langue.

Alors nous avons testé la version simple de cette crainte. Dans une exécution contrôlée, avec des voix synthétiques, une phrase allemande dont le sens bascule sur ses deux derniers mots n'a pas commencé à être traduite plus lentement qu'une phrase simple. De courtes questions en mandarin, japonais et coréen sont revenues aussi vite que leurs affirmations correspondantes — et correctement comme questions, avec le « Est-ce que… » que l'anglais place en premier. Ça ne prouve pas que chaque longue phrase se comporte de la même façon. Ça montre que le moteur ne reste pas simplement silencieux, en attendant le verbe ou la particule finale : il commence sur l'ouverture et complète la suite derrière.

Vous pouvez le regarder se produire.

Une phrase contrôlée, prononcée par une voix native synthétique dans chacune de treize langues et traduite vers l'anglais via DeepL Voice en vrai temps réel. La barre grise est la parole source ; la barre noire est le premier audio traduit. Dans cette unique exécution, onze des treize barres noires commencent avant que la grise ne finisse — la traduction déjà en cours pendant que la phrase est encore prononcée.

ParoleAudio traduit
0s2s4s6s8s10s12s
Deutsch
Italiano
Español
日本語
Français
Türkçe
Русский
Português
Polski
Nederlands
Svenska
한국어
中文

Mesuré via le moteur DeepL Voice — une phrase, une voix native synthétique par langue, une seule exécution, volume source normalisé et silence coupé. Voici ce qui s'est passé dans cette exécution, pas un benchmark. Le coréen et le chinois ont commencé environ 0,6–0,7 secondes après la fin de la parole source. DeepL continue d'améliorer son moteur, donc nous ré-exécutons ceci et mettons à jour la page plutôt que de laisser un instantané flatteur en ligne.

Ce que nous faisons à ce sujet

Nous n'attendons pas la phrase complète.

DeepL diffuse un segment au fur et à mesure qu'il se forme, en révisant le texte à mesure que davantage arrive, plutôt que de rester silencieux jusqu'à ce que l'orateur s'arrête. Souvent, la traduction commence avant que la phrase ne finisse — bien que, comme le montre le graphique ci-dessus, pas toujours.

La transcription arrive avant l'audio.

Le texte apparaît généralement avant la traduction orale, parce que la parole doit être synthétisée. Ainsi votre agent peut suivre le sens du client en le lisant, pendant que la phrase finit de se stabiliser avant que quiconque n'agisse dessus.

La transcription se corrige d'elle-même en place.

Un segment apparaît comme une ligne provisoire et se met à jour au fur et à mesure que la phrase se résout — l'avion devient le délit, dans la transcription, sans que personne ne se répète. L'audio parlé est l'inverse : une fois joué, il ne peut pas être repris.

Lire avant d'écouter

La transcription, en milieu de phrase. L'italique est encore en formation ; le droit est stabilisé. Votre agent lit le sens un instant avant de l'entendre — ce qui est le seul avantage que Taiwa a sur une personne au téléphone, parce qu'un interprète ne peut pas vous remettre une transcription pendant qu'il parle.

Le délai est réel. Les coûts des alternatives le sont aussi.

Un interprète téléphonique ajoute du temps d'installation et une autre personne à l'appel. Un locuteur natif n'a pas de délai — s'il y en a un en service. Taiwa est fait pour les appels où ce compromis vaut mieux qu'attendre, transférer, ou recruter vous-même dans chaque langue.