Er zit vertraging op de lijn. Dit is waarom, en wat het je kost.

Elke manier om begrepen te worden in een taal die je niet spreekt, loopt achter. De vraag is niet of Taiwa vertraging heeft. De vraag is hoe die zich verhoudt tot de alternatieven, en wat wij doen om die klein te houden.

Drie manieren om vertaald te worden

Drie manieren waarop je klant begrepen wordt. Alle drie hebben vertraging. Van één ervan wordt meestal gezegd dat het direct gaat. Dat is niet zo.

Een moedertaalspreker

De vertraging: geen. Het wachten: al het andere.

Geen vertaalvertraging, want er valt niets te vertalen. Alleen moet je zo iemand eerst vinden, het gesprek doorverbinden en maar hopen dat diegene dienst heeft. Dat betekent meertalige agents aannemen voor elke taal waarin je gebeld wordt. Voor ruime openingstijden houdt dat geen stand, en voor de talen waarin je een handvol gesprekken per week krijgt evenmin.

Een telefonische tolk

De vertraging: twee tot zes seconden bij live tolken.

Een derde persoon op de lijn. Bij simultaan tolken lopen professionals volgens gepubliceerd onderzoek ruwweg twee tot zes seconden achter op de spreker. Voorbij een seconde of vier zakt de nauwkeurigheid, omdat ze meer van de zin in hun geheugen moeten vasthouden. Veel telefoongesprekken gaan in plaats daarvan consecutief: ieder spreekt, stopt en wacht. Dat scheelt die vertraging, maar rekt het gesprek.

Taiwa

De vertraging: een paar seconden achterstand, per spreekbeurt.

In één gecontroleerde test begon de vertaalde audio van Taiwa ongeveer drie tot zeven seconden nadat de klant begon te praten. De meeste talen vielen binnen dezelfde brede ear-voice span die voor tolken gerapporteerd wordt; Koreaans en Chinees zaten er iets boven. Een machine houdt de zin niet in haar werkgeheugen zoals een mens dat doet, maar daarmee verdwijnt de vertraging niet. In die test speelde de vertaling meestal al voordat de klant de zin had afgemaakt. Geen derde persoon op de lijn, geen doorverbinden, geen wachten tot iemand beschikbaar is.

Tolkcijfers uit gepubliceerd onderzoek naar ear–voice span bij simultaan tolken. ↓

Waarom er een ondergrens is

Je kunt geen zin vertalen die je nog niet gehoord hebt.

Vertalen is geen transcriberen. Om een zin naar een andere taal om te zetten, heb je er genoeg van nodig om te weten wat hij betekent. En “genoeg” is vaak bijna de hele zin.

Neem “ik ging naar de bank”. Tot de volgende paar woorden binnen zijn, is dat de bank in je woonkamer of de bank met een pinautomaat, en in de meeste talen zijn dat twee verschillende woorden. Gok te vroeg en je bent snel en fout. Wacht, en je bent trager en goed.

Elke simultaantolk maakt die afweging continu. Blijf je te dicht op de spreker zitten, dan kies je een betekenis voordat die af is.

Een deel van die ondergrens is talig, niet technisch. Snellere hardware kan de verwerking iets bekorten, maar geen enkel systeem kan betekenis vertalen die nog niet binnen is. Daarom is geen enkele realtime vertaling direct, de onze ook niet.

Het Duitse probleem

Sommige talen maken het erger, en dat is niemands schuld.

Het Duits bewaart het beslissende deel van het werkwoord vaak tot het eind van de zin. Het Japans zet het gezegde nog consequenter achteraan. Tot dat stuk binnen is, weet je misschien wie en wat erbij betrokken waren, maar niet wat er gebeurd is.

Ich habe den Vertrag gestern zusammen mit meinem Kollegen …

Ik heb het contract gisteren samen met mijn collega …

gekündigt.

opgezegd.

Alles vóór dat laatste woord past net zo goed bij tekenen, lezen of kwijtraken. De beslissende handeling komt pas aan het eind.

En het is niet alleen het Duits, en niet alleen werkwoorden. Mandarijn, Japans en Koreaans kunnen een ja/nee-vraag helemaal aan het eind markeren: een slot-吗, een か, of een Koreaanse werkwoordsuitgang. Vaak zijn er eerder al aanwijzingen, maar de veilige vorm van de vertaling hangt aan dat laatste stukje. Mededeling of vraag?

Menselijke tolken lopen tegen precies dezelfde muur. Het onderzoek beschrijft hoe ze hun vertraging moeten vergroten zodra ze uit het Duits werken, wachtend op een gezegde dat pas aan het eind van de zin komt. Het is geen beperking van machinevertaling. Het is een eigenschap van de taal.

Dus hebben we de simpele versie van die angst getest. In één gecontroleerde run, met synthetische stemmen, begon een Duitse zin waarvan de betekenis op de laatste twee woorden omslaat niet later met vertalen dan een gewone zin. Korte vragen in het Mandarijn, Japans en Koreaans kwamen even snel terug als hun bijbehorende mededelingen, en ook echt als vraag, met de “Did…” die het Engels vooraan zet. Dat bewijst niet dat elke lange zin zich zo gedraagt. Het laat wel zien dat de engine niet stil blijft zitten wachten op het laatste werkwoord of partikel: hij begint bij het begin en werkt de rest bij naarmate die binnenkomt.

Je kunt het zien gebeuren.

Eén gecontroleerde zin, in dertien talen ingesproken door een synthetische moedertaalstem en via DeepL Voice in echte realtime naar het Engels vertaald. De grijze balk is de bronspraak, de zwarte balk de eerste vertaalde audio. In deze ene run beginnen elf van de dertien zwarte balken voordat de grijze afloopt. De vertaling speelt dus al terwijl de zin nog uitgesproken wordt.

SprekenVertaalde audio
0s2s4s6s8s10s12s
Deutsch
Italiano
Español
日本語
Français
Türkçe
Русский
Português
Polski
Nederlands
Svenska
한국어
中文

Gemeten via de DeepL Voice-engine: één zin, per taal één synthetische moedertaalstem, één run, de bron genormaliseerd op volume en ontdaan van stiltes. Dit is wat er in die run gebeurde, geen benchmark. Koreaans en Chinees begonnen ongeveer 0,6–0,7 seconde nadat de bronspraak was afgelopen. DeepL blijft de engine verbeteren, dus we draaien dit opnieuw en werken de pagina bij, in plaats van een vleiende momentopname te laten staan.

Wat we eraan doen

We wachten niet op de hele zin.

DeepL streamt een zinsdeel zodra het zich vormt en herziet de tekst naarmate er meer binnenkomt, in plaats van stil te blijven tot de spreker stopt. Vaak begint de vertaling al voordat de zin af is. Niet altijd, zoals de grafiek hierboven laat zien.

Het transcript is er eerder dan de audio.

De tekst verschijnt meestal vóór de gesproken vertaling, omdat de spraak nog gesynthetiseerd moet worden. Je agent kan de bedoeling van de klant dus al lezend volgen, terwijl de zin verder uitkristalliseert voordat iemand ernaar handelt.

Het transcript corrigeert zichzelf ter plekke.

Een zinsdeel verschijnt als voorlopige regel en werkt zichzelf bij zodra de zin oplost: de bank in de woonkamer wordt de bank met de pinautomaat, in het transcript, zonder dat iemand zich hoeft te herhalen. Met de gesproken audio werkt het andersom. Wat afgespeeld is, kun je niet terugnemen.

Lezen loopt voor op luisteren

Het transcript, halverwege de zin. Cursief vormt zich nog, recht staat vast. Je agent leest de betekenis een tel eerder dan die te horen is. Dat is het enige voordeel dat Taiwa heeft op een mens aan de telefoon: een tolk kan onder het praten geen transcript aanreiken.

De vertraging is echt. De kosten van de alternatieven ook.

Een telefonische tolk kost tijd om in te bellen en zet er nog iemand bij op het gesprek. Een moedertaalspreker heeft geen vertraging, als er tenminste iemand dienst heeft. Taiwa is voor de gesprekken waar die afweging beter uitpakt dan wachten, doorverbinden of elke taal zelf bemensen.