Es gibt eine Verzögerung. Hier ist der Grund und was sie Sie kostet.
Jede Art, in einer Sprache verstanden zu werden, die man nicht spricht, hat eine Verzögerung. Die Frage ist nicht, ob Taiwa eine hat. Sondern wie sie im Vergleich zu den Alternativen aussieht und was wir tun, um sie klein zu halten.
Drei Wege, übersetzt zu werden
Drei Wege, wie Ihr Kunde verstanden wird. Alle drei haben eine Verzögerung. Nur einer davon wird meist als sofort beschrieben, und er ist es nicht.
Ein Muttersprachler
Die Verzögerung: keine. Die Wartezeit: alles andere.
Keine Übersetzungsverzögerung, weil keine Übersetzung stattfindet. Aber Sie müssen ihn finden, den Anruf weiterleiten und hoffen, dass er im Dienst ist – was bedeutet, für jede Sprache, in der Sie Anrufe entgegennehmen, mehrsprachige Agenten einzustellen. Das funktioniert nicht bei langen Servicezeiten und nicht bei den Sprachen, in denen Sie ein paar Anrufe pro Woche haben.
Ein Telefondolmetscher
Die Verzögerung: zwei bis sechs Sekunden, live gedolmetscht.
Eine dritte Person in der Leitung. Beim Simultandolmetschen zeigen veröffentlichte Studien, dass Fachleute etwa zwei bis sechs Sekunden hinter dem Sprecher liegen, und ab etwa vier Sekunden sinkt die Genauigkeit, weil sie mehr vom Satz im Gedächtnis halten. Viele Telefongespräche sind stattdessen konsekutiv – jede Seite spricht, stoppt und wartet –, was diese Verzögerung vermeidet, aber das Gespräch verlängert.
Taiwa
Die Verzögerung: einige Sekunden, pro Gesprächsbeitrag.
In einem kontrollierten Test begann das von Taiwa übersetzte Audio etwa drei bis sieben Sekunden, nachdem der Kunde zu sprechen begann – die meisten Sprachen innerhalb der gleichen Ohr-Stimme-Spanne, die für Dolmetscher berichtet wird, Koreanisch und Chinesisch etwas darüber. Eine Maschine hält den Satz nicht im Arbeitsgedächtnis wie ein Mensch, aber das lässt die Verzögerung nicht verschwinden. In diesem Test lief die Übersetzung meist schon, bevor der Kunde seinen Satz beendet hatte. Keine dritte Person in der Leitung, keine Weiterleitung, kein Warten, bis jemand verfügbar ist.
Dolmetscher-Zahlen aus veröffentlichter Forschung zur Ohr-Stimme-Spanne beim Simultandolmetschen. ↓
Warum es eine Untergrenze gibt
Sie können keinen Satz übersetzen, den Sie noch nicht gehört haben.
Übersetzen ist nicht Transkribieren. Um einen Satz in eine andere Sprache zu verwandeln, brauchen Sie genug davon, um zu wissen, was er bedeutet, und „genug" ist oft der größte Teil.
Nehmen Sie „I went to the bank". Bis die nächsten Wörter kommen, ist das entweder ein Flussufer oder eine Bank, und in den meisten Sprachen sind das verschiedene Wörter. Früh raten und Sie sind schnell und falsch. Warten, und Sie sind langsamer und richtig.
Jeder Simultandolmetscher macht diesen Kompromiss ständig: Wer zu dicht dranbleibt, legt sich auf eine Bedeutung fest, bevor der Sprecher sie zu Ende geäußert hat.
Ein Teil dieser Untergrenze ist sprachlich, nicht technisch. Schnellere Hardware kann die Verarbeitung verkürzen, aber sie kann kein System Bedeutung übersetzen lassen, die noch nicht angekommen ist. Deshalb ist keine Echtzeit-Übersetzung sofort, unsere eingeschlossen.
Das deutsche Problem
Manche Sprachen machen es schlimmer, und es ist niemandes Schuld.
Deutsch lässt den entscheidenden Teil des Verbs oft bis ans Ende des Satzes warten. Japanisch ist noch konsequenter prädikatsfinal. Bis dieser Teil ankommt, wissen Sie möglicherweise, wer und was beteiligt waren, aber nicht, was tatsächlich passiert ist.
Ich habe den Vertrag gestern zusammen mit meinem Kollegen …
Englisch: I have the contract yesterday together with my colleague …
gekündigt.
cancelled.
Alles vor diesem letzten Wort ist kompatibel mit dem Unterzeichnen, dem Lesen oder dem Verlieren. Die entscheidende Handlung kommt zuletzt.
Und es betrifft nicht nur Deutsch oder nur Verben. Mandarin, Japanisch und Koreanisch können eine Ja/Nein-Frage ganz am Ende markieren – ein finales 吗, か oder eine koreanische Verb-Endung. Oft gibt es frühere Hinweise, aber die sichere englische Form kann an diesem letzten Teil hängen: Aussage oder Frage?
Menschliche Dolmetscher stoßen an genau diese Wand – die Forschung beschreibt, dass sie ihre Verzögerung erhöhen müssen, wenn sie aus dem Deutschen arbeiten, weil sie auf ein Prädikat warten, das am Satzende ankommt. Das ist keine Einschränkung der maschinellen Übersetzung. Es ist eine Eigenschaft der Sprache.
Also haben wir die einfache Version dieser Angst getestet. In einem kontrollierten Lauf mit synthetischen Stimmen begann ein deutscher Satz, dessen Bedeutung sich an seinen letzten zwei Wörtern entscheidet, nicht langsamer zu übersetzen als ein einfacher. Kurze Fragen auf Mandarin, Japanisch und Koreanisch kamen so schnell zurück wie ihre passenden Aussagen – und korrekt als Fragen, mit dem „Did…", das Englisch voranstellt. Das beweist nicht, dass sich jeder lange Satz genauso verhält. Es zeigt, dass die Engine nicht einfach schweigt und auf das letzte Verb oder die letzte Partikel wartet: Sie beginnt mit dem Anfang und füllt den Rest nach.
Sie können zusehen, wie es passiert.
Ein kontrollierter Satz, gesprochen von einer synthetischen Muttersprachler-Stimme in dreizehn Sprachen und ins Englische übersetzt durch DeepL Voice in echter Echtzeit. Der graue Balken ist das gesprochene Original; der schwarze Balken ist das erste übersetzte Audio. In diesem einzelnen Lauf beginnen elf der dreizehn schwarzen Balken, bevor der graue endet – die Übersetzung läuft bereits, während der Satz noch gesprochen wird.
Gemessen durch die DeepL Voice-Engine – ein Satz, eine synthetische Muttersprachler-Stimme pro Sprache, ein einzelner Lauf, Quelllautstärke normalisiert und Stille entfernt. Das ist, was in diesem Lauf passiert ist, kein Benchmark. Koreanisch und Chinesisch begannen etwa 0,6–0,7 Sekunden, nachdem das gesprochene Original endete. DeepL verbessert seine Engine ständig, also führen wir das erneut aus und aktualisieren die Seite, statt eine schmeichelhafte Momentaufnahme stehen zu lassen.
Was wir dagegen tun
Wir warten nicht auf den vollständigen Satz.
DeepL streamt eine Phrase, während sie sich bildet, und überarbeitet den Text, wenn mehr ankommt, statt still zu sein, bis der Sprecher aufhört. Oft beginnt die Übersetzung, bevor der Satz endet – obwohl, wie die obige Grafik zeigt, nicht immer.
Das Transkript kommt vor dem Audio.
Text erscheint normalerweise vor der gesprochenen Übersetzung, weil die Sprache erst synthetisiert werden muss. Ihr Agent folgt der Bedeutung des Kunden also schon beim Lesen – während der Satz sich noch fertig bildet, bevor jemand darauf reagiert.
Das Transkript korrigiert sich selbst an Ort und Stelle.
Eine Phrase erscheint als vorläufige Zeile und aktualisiert sich, wenn der Satz sich auflöst – das Flussufer wird zur Bank, im Transkript, ohne dass sich jemand wiederholt. Das gesprochene Audio ist das Gegenteil: Sobald es abgespielt wurde, kann es nicht zurückgenommen werden.
Lesen vor dem Hören
Die Verzögerung ist real. Die Kosten der Alternativen auch.
Ein Telefondolmetscher bringt Vorlaufzeit und eine weitere Person in das Gespräch. Ein Muttersprachler hat keine Verzögerung – wenn einer im Dienst ist. Taiwa ist für die Anrufe, bei denen dieser Kompromiss besser ist, als zu warten, weiterzuleiten oder jede Sprache selbst zu besetzen.
