Jest opóźnienie. Oto dlaczego i ile cię to kosztuje.
Każdy sposób bycia zrozumianym w języku, którego nie znasz, ma opóźnienie. Pytanie brzmi nie czy Taiwa je ma, lecz jak wypada na tle alternatyw i co robimy, żeby było małe.
Trzy sposoby tłumaczenia
Trzy sposoby, w jakie klient zostaje zrozumiany. Każdy ma opóźnienie. Tylko jeden bywa opisywany jako natychmiastowy — i to nie on.
Rodzimy użytkownik języka
Opóźnienie: żadne. Czekanie: cała reszta.
Brak opóźnienia tłumaczenia, bo nie ma tłumaczenia. Ale musisz ich znaleźć, przełączyć do nich i mieć nadzieję, że są na zmianie — co oznacza zatrudnianie wielojęzycznych agentów dla każdego języka, w jakim odbierasz telefony. To się nie trzyma przy wielogodzinnym pokryciu ani przy językach, w których masz kilka telefonów tygodniowo.
Tłumacz telefoniczny
Opóźnienie: dwie do sześciu sekund, tłumaczenie na żywo.
Trzecia osoba na linii. W tłumaczeniu symultanicznym opublikowane badania wskazują, że profesjonaliści są mniej więcej dwie do sześciu sekund za mówcą, a powyżej około czterech sekund dokładność spada, bo trzymają w pamięci więcej zdania. Wiele rozmów telefonicznych jest zamiast tego konsekutywnych — każda strona mówi, milknie i czeka — co omija to opóźnienie, ale wydłuża rozmowę.
Taiwa
Opóźnienie: kilka sekund za, na każdą wypowiedź.
W jednym kontrolowanym teście przetłumaczony dźwięk Taiwa zaczynał się około trzy do siedmiu sekund po tym, jak klient zaczął mówić — większość języków w tej samej szerokiej rozpiętości ucho–głos raportowanej u tłumaczy, koreański i chiński odrobinę powyżej. Maszyna nie trzyma zdania w pamięci roboczej tak jak człowiek, ale to nie sprawia, że opóźnienie znika. W tym teście tłumaczenie zwykle już leciało, zanim klient skończył zdanie. Bez trzeciej osoby na linii, bez przełączania, bez czekania, aż ktoś będzie dostępny.
Dane o tłumaczach z opublikowanych badań nad rozpiętością ucho–głos w tłumaczeniu symultanicznym. ↓
Dlaczego istnieje dolna granica
Nie da się przetłumaczyć zdania, którego się nie słyszało.
Tłumaczenie to nie transkrypcja. Żeby zamienić zdanie na inny język, trzeba mieć jego wystarczającą część, żeby wiedzieć, co znaczy, a „wystarczająca" to często większość.
Weź „I went to the bank". Dopóki nie pojawi się kilka kolejnych słów, to albo brzeg rzeki, albo instytucja finansowa — a w większości języków to są różne słowa. Zgadnij wcześnie — będziesz szybki i niedokładny. Poczekaj — będziesz wolniejszy i trafny.
Każdy tłumacz symultaniczny nieustannie dokonuje tego wyboru: trzymaj się zbyt blisko mówcy, a przesądzisz o znaczeniu, zanim zdąży je dokończyć.
Część tej granicy jest językowa, nie techniczna. Szybszy sprzęt może skrócić przetwarzanie, ale nie pozwoli żadnemu systemowi przetłumaczyć znaczenia, które jeszcze nie nadeszło. To dlatego żadne tłumaczenie w czasie rzeczywistym nie jest natychmiastowe — nasze też.
Problem niemieckiego
Niektóre języki to pogarszają i to nie czyjaś wina.
Niemiecki często zostawia decydującą część czasownika na koniec zdania. Japoński robi to jeszcze bardziej konsekwentnie — orzeczenie zawsze na końcu. Dopóki ten element nie nadejdzie, możesz wiedzieć, kto i co, ale nie wiesz, co się właściwie wydarzyło.
Ich habe den Vertrag gestern zusammen mit meinem Kollegen …
Ja mam kontrakt wczoraj razem z moim kolegą …
gekündigt.
wypowiedziany.
Wszystko przed tym ostatnim słowem pasuje do podpisania go, przeczytania go albo zgubienia go. Decydująca czynność nadchodzi na końcu.
I nie chodzi tylko o niemiecki ani tylko o czasowniki. Mandaryński, japoński i koreański mogą oznaczać pytanie tak/nie na samym końcu — końcowe 吗, か albo koreańska końcówka czasownika. Często są wcześniej wskazówki, ale bezpieczna angielska forma może wisieć na tym ostatnim elemencie: stwierdzenie czy pytanie?
Tłumacze-ludzie trafiają na dokładnie tę samą ścianę — badania opisują, że są zmuszani zwiększać swoje opóźnienie przy pracy z niemieckiego, czekając na orzeczenie, które pojawia się na końcu zdania. To nie ograniczenie tłumaczenia maszynowego. To cecha języka.
Przetestowaliśmy więc prostą wersję tej obawy. W jednym kontrolowanym przebiegu, z syntetycznymi głosami, niemieckie zdanie, którego znaczenie zmienia się na ostatnich dwóch słowach, zaczęło się tłumaczyć nie wolniej niż zwykłe. Krótkie pytania mandaryńskie, japońskie i koreańskie wracały tak szybko jak ich odpowiedniki twierdzące — i poprawnie jako pytania, z „Did…", które angielski stawia na początku. To nie dowodzi, że każde długie zdanie zachowuje się tak samo. Pokazuje, że silnik po prostu nie siedzi cicho, czekając na ostatni czasownik lub partykułę: zaczyna od otwarcia i dopisuje resztę z tyłu.
Możesz to zobaczyć.
Jedno kontrolowane zdanie, wypowiedziane syntetycznym rodzimym głosem w każdym z trzynastu języków i przetłumaczone na angielski przez DeepL Voice w prawdziwym czasie rzeczywistym. Szary słupek to mowa źródłowa; czarny to pierwszy przetłumaczony dźwięk. W tym jednym przebiegu jedenaście z trzynastu czarnych słupków zaczyna się, zanim szary się kończy — tłumaczenie już leci, gdy zdanie jest jeszcze wypowiadane.
Zmierzone przez silnik DeepL Voice — jedno zdanie, jeden syntetyczny rodzimy głos na język, jeden przebieg, źródło znormalizowane pod względem głośności i przycięte z ciszy. To się wydarzyło w tym przebiegu, nie benchmark. Koreański i chiński zaczęły się około 0,6–0,7 sekundy po zakończeniu mowy źródłowej. DeepL stale ulepsza swój silnik, więc przeprowadzamy ten test ponownie i aktualizujemy stronę, zamiast zostawiać pochlebną migawkę.
Co z tym robimy
Nie czekamy na całe zdanie.
DeepL streamuje frazę w miarę jej powstawania, korygując tekst, gdy nadchodzi więcej, zamiast siedzieć cicho, aż mówca przestanie. Często tłumaczenie zaczyna się, zanim zdanie się skończy — choć, jak pokazuje wykres powyżej, nie zawsze.
Transkrypcja pojawia się przed dźwiękiem.
Tekst zwykle pojawia się przed wypowiedzianym tłumaczeniem, bo mowa musi zostać zsyntetyzowana. Dzięki temu agent może śledzić sens wypowiedzi klienta, gdy ją czyta, a zdanie kończy się ustalać, zanim ktokolwiek na nią zadziała.
Transkrypcja koryguje się na bieżąco.
Fraza pojawia się jako wstępna linia i aktualizuje się, gdy zdanie się rozstrzyga — brzeg rzeki staje się instytucją finansową w transkrypcji, bez powtarzania się przez kogokolwiek. Z dźwiękiem mówionym jest odwrotnie: gdy raz zostanie odtworzony, nie da się go cofnąć.
Czytanie przed słuchaniem
Opóźnienie jest prawdziwe. Koszty alternatyw też.
Tłumacz telefoniczny dodaje czas konfiguracji i kolejną osobę do rozmowy. Rodzimy użytkownik języka nie ma opóźnienia — jeśli jest na zmianie. Taiwa jest do rozmów, gdzie ten wybór wygrywa z czekaniem, przełączaniem i obstawianiem każdego języka własnym zespołem.
