确实有延迟。原因如下,以及你要为此付出的代价。

在你不会说的语言里让人听懂你,任何方式都有延迟。问题不在于 Taiwa 是否有延迟,而在于它与其他方案相比如何,以及我们如何尽量缩短延迟。

三种翻译方式

让客户被听懂有三种方式。三种都有延迟。通常只有一种被称为即时,但它并不是。

母语人士

延迟:没有。等待:其他所有环节。

没有翻译延迟,因为根本不需要翻译。但你必须找到合适的人,把电话转给他们,并希望他们正在值班——这意味着要为接听的每种语言都雇用多语客服。需要覆盖长时段,或某种语言每周只有几通电话时,这种做法撑不了多久。

电话口译员

延迟:两到六秒,实时口译。

通话中多了第三个人。公开的同声传译研究显示,专业口译员通常比说话者慢约两到六秒;超过约四秒后,准确率会下降,因为他们要在记忆中保留更多句子内容。许多电话口译改用交替传译——双方轮流说、停、等——这样避免了这类延迟,却会拉长通话。

Taiwa

延迟:每轮对话慢几秒。

在一次受控测试中,Taiwa 的翻译音频在客户开始说话后约三到七秒开始播放——大多数语言都落在口译员研究报告的大致耳口时距内,韩语和中文略高于这个范围。机器不像人那样把句子保存在工作记忆中,但延迟不会因此消失。该测试中,客户通常还没说完整句话,翻译就已经开始播放。通话中没有第三个人,无需转接,也不用等人有空。

口译员数据来自已发表的同声传译耳口时距研究。 ↓

为什么延迟有下限

你无法翻译还没听到的句子。

翻译不是转写。要把一句话译成另一种语言,必须先听到足够多的内容才能判断含义,而“足够”往往是句子的大部分。

以“I went to the bank”为例。在接下来的几个词出现前,这既可能指河岸,也可能指金融机构,而大多数语言会用不同的词表示两者。提早猜,快但会错。等一等,慢但正确。

每位同声传译员都在持续做这种取舍:跟得太紧,就会在说话者表达完整前确定含义。

部分下限来自语言,而非技术。更快的硬件可以缩短处理时间,但无法让任何系统翻译尚未出现的含义。这就是实时翻译都不可能即时完成的原因,我们也不例外。

德语问题

有些语言会让情况更难,这不是任何人的错。

德语常把动词中决定含义的部分留到从句末尾。日语则更一贯地把谓语放在句末。在那部分出现前,你可能知道涉及谁、涉及什么,却不知道实际发生了什么。

Ich habe den Vertrag gestern zusammen mit meinem Kollegen …

我昨天和我的同事一起把合同……

gekündigt.

取消了。

在最后一个词出现前,前面的内容既可能接“签署了”,也可能接“读了”或“弄丢了”。决定性动作最后才出现。

而且不只德语,也不只是动词。普通话、日语和韩语都可能在句末才标记是非问句——最后出现一个 吗、か,或韩语动词词尾。前面通常已有线索,但稳妥的英语句式可能取决于最后这部分:陈述句,还是疑问句?

口译员也会遇到完全相同的障碍——研究指出,他们从德语口译时会被迫增加延迟,等待从句末尾才出现的谓语。这不是机器翻译的局限,而是语言本身的特性。

所以,我们对这种担忧做了个简单测试。在一次使用合成语音的受控运行中,一句含义在最后两个词才发生转折的德语句子,开始翻译的时间并不比普通句子晚。简短的普通话、日语和韩语疑问句,翻译速度与对应陈述句一样快,也被正确译成疑问句,带有英语置于句首的“Did…”。这不能证明所有长句都表现相同。但它说明,引擎不会一直沉默,等最后的动词或助词出现:它会从开头开始,随后补齐其余部分。

你可以看到这个过程。

一个受控句子,由十三种语言各自的合成母语语音说出,并通过 DeepL Voice 真正实时翻译成英语。灰条代表源语音,黑条代表首次出现的翻译音频。在这一次运行中,十三条黑条有十一条在灰条结束前开始——句子还没说完,翻译已经在播放。

说话翻译音频
0s2s4s6s8s10s12s
Deutsch
Italiano
Español
日本語
Français
Türkçe
Русский
Português
Polski
Nederlands
Svenska
한국어
中文

通过 DeepL Voice 引擎测量——一个句子,每种语言一条合成母语语音,单次运行;源音频已做响度归一化并裁剪静音。这是该次运行的结果,并非基准测试。韩语和中文的翻译音频在源语音结束后约 0.6–0.7 秒开始。DeepL 持续改进引擎,所以我们会重跑测试并更新页面,而不是一直挂着一张对我们有利的快照。

我们的做法

我们不等完整句子。

DeepL 会随着短语形成而流式输出,并在更多内容到来时修订文本,不会沉默地等说话者停下。翻译常在句子结束前开始——但如上图所示,并非每次都如此。

文字记录先于音频到达。

文本通常先于语音翻译出现,因为语音还要合成。因此,客服可以边读边理解客户的意思,等句子稳定后再行动。

文字记录会原地自我修正。

短语先以暂定行出现,随着句意明确而更新——文字记录中的河岸会变成金融机构,无需任何人重说。语音则相反:一旦播放,就无法收回。

先读,后听

句子说到一半时的文字记录。斜体仍在形成,正体已经确定。客服会早一拍读懂含义,再听到音频——这是 Taiwa 相比电话中真人口译员的一项优势,因为口译员无法一边说,一边把文字记录交给你。

延迟确实存在。其他方案的成本也确实存在。

电话口译员会增加准备时间,也让通话中多一个人。母语人士没有延迟——前提是有人当班。若这种取舍优于等待、转接,或自行配齐每种语言的人员,Taiwa 就适合这类通话。