Есть задержка. Вот почему — и вот во что она вам обходится.

Любой способ понять человека на языке, которого вы не знаете, работает с задержкой. Вопрос не в том, есть ли она у Taiwa. Вопрос в том, как она соотносится с альтернативами и как мы её сокращаем.

Три способа перевода

Три способа понять вашего клиента. У всех есть задержка. Только один обычно называют мгновенным, хотя это не так.

Носитель языка

Задержка: нет. Ожидание: всё остальное.

Задержки перевода нет, потому что нет самого перевода. Но такого специалиста нужно найти, соединить с ним звонок и надеяться, что он на смене. Для этого нужны операторы со знанием каждого языка, на котором вы принимаете звонки. Такой подход не годится для работы по расширенному графику или языков, на которых поступает лишь несколько звонков в неделю.

Телефонный переводчик

Задержка: от двух до шести секунд при синхронном переводе.

Третий человек на линии. Согласно опубликованным исследованиям, при синхронном переводе профессионалы отстают от говорящего примерно на две–шесть секунд. После четырёх секунд точность падает: переводчику приходится удерживать в памяти большую часть предложения. Но многие телефонные разговоры переводят последовательно: каждая сторона говорит, останавливается и ждёт. Это устраняет такую задержку, но удлиняет звонок.

Taiwa

Задержка: несколько секунд на каждую реплику.

В одном контролируемом тесте перевод аудио в Taiwa начинался примерно через три–семь секунд после начала речи клиента. Для большинства языков результат находился в том же широком диапазоне задержки между восприятием и воспроизведением, который указывают для переводчиков. Для корейского и китайского он был немного выше. Машине не нужно удерживать предложение в рабочей памяти так, как человеку, но задержка от этого не исчезает. В том тесте перевод обычно начинал звучать ещё до того, как клиент заканчивал предложение. Без третьего человека на линии, без переадресации, без ожидания свободного специалиста.

Данные о переводчиках взяты из опубликованных исследований задержки между восприятием и воспроизведением при синхронном переводе. ↓

Почему есть предел

Нельзя перевести предложение, которое ещё не услышано.

Перевод — не транскрибация. Чтобы перевести предложение на другой язык, нужно услышать достаточно, чтобы понять его смысл. Часто «достаточно» означает почти всё предложение.

Возьмём фразу «I went to the bank». Пока не прозвучат следующие несколько слов, непонятно, идёт ли речь о берегу реки или финансовом учреждении. В большинстве языков это разные слова. Угадаете раньше — будет быстро и неправильно. Подождёте — будет медленнее и правильно.

Каждый синхронный переводчик постоянно ищет баланс: если идти слишком близко за говорящим, придётся выбрать смысл до того, как тот закончит его формулировать.

Отчасти этот предел связан с языком, а не с техникой. Более быстрое оборудование сокращает время обработки, но не позволяет перевести смысл, который ещё не прозвучал. Поэтому ни один перевод в реальном времени не бывает мгновенным. Наш тоже.

Проблема немецкого языка

Некоторые языки усложняют задачу. И никто в этом не виноват.

В немецком языке решающая часть глагола часто стоит в конце придаточного предложения. В японском сказуемое ещё последовательнее ставится в конец. Пока эта часть не прозвучала, можно знать, кто и что участвовали в событии, но не знать, что именно произошло.

Ich habe den Vertrag gestern zusammen mit meinem Kollegen …

Я имею договор вчера вместе с моим коллегой …

gekündigt.

расторг.

До последнего слова речь с тем же успехом могла идти о подписании, чтении или потере договора. Решающим оказывается последнее действие.

И дело не только в немецком языке и не только в глаголах. В китайском, японском и корейском языках признак общего вопроса может стоять в самом конце: финальная частица 吗, か или окончание корейского глагола. Ранее часто появляются подсказки, но безопасная английская конструкция может зависеть от последней части: утверждение это или вопрос?

Переводчики сталкиваются с той же преградой. Исследования описывают, как при переводе с немецкого им приходится увеличивать задержку и ждать сказуемого в конце придаточного предложения. Это не ограничение машинного перевода. Это свойство языка.

Поэтому мы проверили простую версию этого опасения. В одном контролируемом тесте с синтетическими голосами перевод немецкого предложения, смысл которого меняется на последних двух словах, начинался не медленнее перевода обычного предложения. Короткие вопросы на китайском, японском и корейском возвращались так же быстро, как соответствующие утверждения, и правильно распознавались как вопросы — с «Did…», которое в английском ставится в начале. Это не доказывает, что каждое длинное предложение ведёт себя так же. Но показывает, что система не молчит в ожидании финального глагола или частицы. Она начинает с первых слов и дополняет остальное по мере поступления.

Можно увидеть, как это происходит.

Одно контрольное предложение, произнесённое синтетическим голосом носителя каждого из тринадцати языков и переведённое на английский через DeepL Voice в настоящем реальном времени. Серая полоса — исходная речь, чёрная — начало переведённого аудио. В этом отдельном тесте одиннадцать из тринадцати чёрных полос начинаются до окончания серых: перевод уже звучит, пока предложение ещё произносят.

Исходная речьПереведённое аудио
0s2s4s6s8s10s12s
Deutsch
Italiano
Español
日本語
Français
Türkçe
Русский
Português
Polski
Nederlands
Svenska
한국어
中文

Измерено с помощью DeepL Voice: одно предложение, один синтетический голос носителя для каждого языка, один запуск. Громкость исходного аудио нормализована, тишина удалена. Это результат одного запуска, а не эталонный тест. Перевод корейского и китайского начался примерно через 0,6–0,7 секунды после окончания исходной речи. DeepL продолжает улучшать систему, поэтому мы повторяем тест и обновляем страницу, а не оставляем выгодный результат навсегда.

Что мы с этим делаем

Мы не ждём окончания предложения.

DeepL передаёт фразу по мере её формирования и корректирует текст с поступлением новых слов, а не молчит до конца речи. Часто перевод начинается до окончания предложения, хотя, как видно на графике выше, не всегда.

Транскрипт приходит раньше аудио.

Текст обычно появляется раньше озвученного перевода, потому что речь ещё нужно синтезировать. Поэтому ваш оператор может читать и понимать клиента, пока предложение уточняется, ещё до того, как нужно действовать.

Транскрипция исправляет себя на месте.

Фраза появляется как предварительная строка и обновляется, когда смысл предложения проясняется. В транскрипции берег реки превращается в финансовое учреждение, и никому не нужно повторяться. С аудио всё наоборот: если оно уже прозвучало, его не вернуть.

Читать раньше, чем слушать

Транскрипция в середине предложения. Курсивом показан текст, который ещё формируется, прямым шрифтом — уже подтверждённый. Ваш оператор читает смысл за мгновение до того, как слышит его. В этом преимущество Taiwa перед человеком на линии: переводчик не может передать вам транскрипцию во время своей речи.

Задержка реальна. Как и издержки альтернатив.

Телефонный переводчик добавляет время на подключение и ещё одного человека к звонку. У носителя языка задержки нет — если он на смене. Taiwa предназначена для звонков, где такой компромисс лучше, чем ожидание, перевод звонка или содержание операторов для каждого языка.