Det finns en fördröjning. Här är varför – och vad den kostar dig.

Alla sätt att bli förstådd på ett språk du inte talar har en fördröjning. Frågan är inte om Taiwa har en. Det är hur den står sig mot alternativen och vad vi gör för att hålla den liten.

Tre sätt att få en översättning

Tre sätt för din kund att bli förstådd. Alla tre har en fördröjning. Bara ett brukar beskrivas som omedelbart, men är det inte.

En person med språket som modersmål

Fördröjningen: ingen. Väntan: allt annat.

Ingen översättningsfördröjning, eftersom inget översätts. Men du måste hitta någon, koppla vidare samtalet och hoppas att personen är i tjänst – vilket innebär att anställa flerspråkiga agenter för varje språk du tar emot samtal på. Det håller inte för bemanning under långa öppettider eller språk där du bara får några få samtal i veckan.

En telefontolk

Fördröjningen: två till sex sekunder vid simultantolkning.

En tredje person på linjen. Publicerade studier visar att professionella tolkar vid simultantolkning ligger ungefär två till sex sekunder efter talaren. Vid mer än cirka fyra sekunder sjunker precisionen, eftersom tolken måste hålla mer av meningen i minnet. Många telefonsamtal tolkas i stället konsekutivt – ena sidan talar, stannar och väntar – vilket undviker den fördröjningen men gör samtalet längre.

Taiwa

Fördröjningen: flera sekunder efter, för varje replik.

I ett kontrollerat test startade Taiwas översatta ljud ungefär tre till sju sekunder efter att kunden började tala — de flesta språk inom samma breda spann mellan öra och röst som rapporteras för tolkar, koreanska och kinesiska strax över. En maskin håller inte meningen i arbetsminnet på det sätt en person gör, men det får inte fördröjningen att försvinna. I det testet spelades översättningen oftast redan innan kunden hade avslutat sin mening. Ingen tredje person på linjen, ingen överföring, ingen väntan på att någon skulle bli tillgänglig.

Tolksiffrorna kommer från publicerad forskning om öron–röstintervall vid simultantolkning. ↓

Varför det finns en undre gräns

Du kan inte översätta en mening du inte har hört.

Översättning är inte transkribering. För att översätta en mening till ett annat språk behöver du höra tillräckligt mycket av den för att förstå vad den betyder, och "tillräckligt" är ofta större delen av meningen.

Ta den engelska meningen "I went to the bank". Innan de nästa orden kommer vet du inte om det är en flodbank eller ett finansinstitut, och på de flesta språk är det olika ord. Gissa tidigt så går det fort och blir fel. Vänta, så går det långsammare och blir rätt.

Alla simultantolkar gör den här avvägningen hela tiden: ligger de för nära måste de välja en betydelse innan talaren har talat klart.

En del av den undre gränsen är språklig, inte teknisk. Snabbare hårdvara kan korta bearbetningen, men kan inte låta något system översätta en innebörd som ännu inte har sagts. Därför är ingen realtidsöversättning omedelbar, inte vår heller.

Problemet med tyska

Vissa språk gör det svårare, och det är ingens fel.

I tyskan kommer den avgörande delen av verbet ofta sist i satsen. Japanskan har predikatet i slutet ännu mer konsekvent. Innan den delen kommer kan du veta vem och vad som är inblandat, men inte vad som faktiskt hände.

Ich habe den Vertrag gestern zusammen mit meinem Kollegen …

Jag har avtalet i går tillsammans med min kollega …

gekündigt.

sagt upp.

Fram till det sista ordet kan det handla om att underteckna, läsa eller tappa bort avtalet. Den avgörande handlingen kommer sist.

Och det gäller inte bara tyska eller bara verb. Mandarin, japanska och koreanska kan markera en ja/nej-fråga allra sist – med ett avslutande 吗, か eller en koreansk verbändelse. Det finns ofta ledtrådar tidigare, men den säkra engelska formen kan bero på den sista delen: påstående eller fråga?

Mänskliga tolkar stöter på exakt samma vägg – forskningen beskriver hur de tvingas öka sin fördröjning när de tolkar från tyska och väntar på ett predikat som kommer sist i satsen. Det är inte en begränsning i maskinöversättning. Det är en egenskap hos språket.

Därför testade vi den enkla versionen av den farhågan. I en kontrollerad körning med syntetiska röster började en tysk mening vars betydelse ändras av de två sista orden översättas lika snabbt som en enkel mening. Korta frågor på mandarin, japanska och koreanska kom tillbaka lika snabbt som motsvarande påståenden – och korrekt som frågor, med engelskans "Did…" först. Det bevisar inte att alla långa meningar fungerar likadant. Men det visar att motorn inte bara sitter tyst och väntar på det sista verbet eller partikeln: den börjar med inledningen och fyller på resten efterhand.

Du kan se det hända.

En kontrollerad mening, uppläst av en syntetisk modersmålstalare på vart och ett av tretton språk och översatt till engelska via DeepL Voice i faktisk realtid. Den grå stapeln är källtalet; den svarta stapeln är det första översatta ljudet. I just den här körningen börjar elva av de tretton svarta staplarna innan den grå slutar – översättningen spelas redan upp medan meningen fortfarande uttalas.

TalÖversatt ljud
0s2s4s6s8s10s12s
Deutsch
Italiano
Español
日本語
Français
Türkçe
Русский
Português
Polski
Nederlands
Svenska
한국어
中文

Mätt via DeepL Voice-motorn – en mening, en syntetisk modersmålstalare per språk, en enda körning, källjudet normaliserat i ljudstyrka och tystnad bortklippt. Det här är vad som hände i den körningen, inte ett jämförelsetest. För koreanska och kinesiska började det översatta ljudet cirka 0,6–0,7 sekunder efter att källtalet slutade. DeepL fortsätter att förbättra sin motor, så vi kör om testet och uppdaterar sidan i stället för att låta en smickrande ögonblicksbild ligga kvar.

Vad vi gör åt det

Vi väntar inte på hela meningen.

DeepL strömmar ut en fras medan den tar form och ändrar texten när mer tal kommer, i stället för att vara tyst tills talaren slutar. Ofta startar översättningen innan meningen är slut – men som diagrammet ovan visar, inte alltid.

Transkriptionen kommer före ljudet.

Texten visas vanligtvis före den talade översättningen, eftersom talet måste syntetiseras. Din agent kan därför läsa och följa kundens innebörd medan meningen hinner bli klar innan någon agerar på den.

Transkriptionen rättar sig själv på plats.

En fras visas som en preliminär rad och uppdateras när meningen klarnar – flodbanken blir finansinstitutet i transkriptionen, utan att någon behöver upprepa sig. Med talat ljud är det tvärtom: när det väl har spelats upp går det inte att ta tillbaka.

Läs före du lyssnar

Din agent läser innebörden ett ögonblick innan ljudet hörs – den enda fördel Taiwa har jämfört med en person i telefon, eftersom en tolk inte kan ge dig en transkription samtidigt som de talar.

Fördröjningen är verklig. Det är kostnaderna för alternativen också.

En telefontolk lägger till starttid och ännu en person i samtalet. En person med språket som modersmål har ingen fördröjning – om någon sådan är i tjänst. Taiwa är till för de samtal där den avvägningen är bättre än att vänta, koppla över eller själv bemanna alla språk.