遅延があります。その理由と、あなたへの負担。
話せない言語で理解されるためのあらゆる手段には遅れがあります。問いは、Taiwaに遅れがあるかどうかではありません。代替手段と比較してどうか、そして私たちがその遅れを小さく保つために何をしているか、です。
翻訳の3つの方法
お客様が理解される手段は3つあります。すべてに遅れがあります。通常「即時」と呼ばれるのはそのうちの1つだけですが、実際にはそうではありません。
ネイティブスピーカー
遅れ: なし。待ち: すべてそれ以外。
翻訳がないので、翻訳の遅れもありません。ただし、探して、転送して、シフトに入っていることを祈る必要があります。つまり、通話を受けるすべての言語について多言語オペレーターを雇うということです。長い営業時間をカバーする場合や、週に数本しか来ない言語では、これは成り立ちません。
電話通訳者
遅れ: 同時通訳で2〜6秒。
電話に第三者が加わります。同時通訳では、公表された研究によれば、プロは話者の約2〜6秒遅れで、4秒を超えると記憶する文が増えるため正確性が落ちます。多くの電話は代わりに逐次通訳となり、双方の発話ごとに区切って待つため、その遅れは避けられますが、通話が長くなります。
Taiwa
遅れ: ターンごとに数秒。
ある統制されたテストでは、Taiwaの翻訳音声は顧客が話し始めてから約3〜7秒後に始まりました。ほとんどの言語は通訳者について報告されるのと同じ程度の耳-音声スパンに収まり、韓国語と中国語はやや上でした。機械は人間のように文を作業記憶に保持しているわけではありませんが、それで遅れが消えるわけではありません。そのテストでは、顧客が文を言い終える前に翻訳がすでに再生されていることがほとんどでした。電話に第三者はなく、転送もなく、誰かの対応を待つ必要もありません。
通訳者の数値は、同時通訳における耳–音声スパンに関する公表研究に基づく。 ↓
なぜ下限があるのか
まだ聞いていない文は翻訳できません。
翻訳は文字起こしではありません。文を別の言語に変えるには、意味が分かるのに十分な量が必要で、「十分」は多くの場合、文のほとんどです。
たとえば「I went to the bank」。次の数語が来るまで、それが川岸なのか金融機関なのかは分かりません。多くの言語では別の単語です。早合点すれば、速いが間違い。待てば、遅いが正確です。
同時通訳者は誰もが、このトレードオフを絶えず選び続けています。近づきすぎれば、話者が意味を作り終える前に、その意味に賭けることになります。
その下限の一部は技術ではなく言語に由来します。ハードウェアを高速化すれば処理は削れますが、まだ到来していない意味を翻訳することはできません。これが、あらゆるリアルタイム翻訳が即時になりえない理由で、私たちのものも含まれます。
ドイツ語の問題
言語によっては遅れが大きくなります。誰のせいでもありません。
ドイツ語はしばしば動詞の決め手を節の最後に残します。日本語は一貫して述語が最後です。その部分が現れるまでは、誰が、何が、に関わるかは分かっても、実際に何が起きたかが分かりません。
Ich habe den Vertrag gestern zusammen mit meinem Kollegen …
私は その契約書を 昨日 同僚と一緒に …
gekündigt.
解約した。
最後の単語より前の部分は全て、署名する、読む、失う、のどれとも整合します。決め手となる動作は最後に来ます。
また、ドイツ語に限った話でも動詞に限った話でもありません。中国語、日本語、韓国語は文末の一点で疑問を区別でき — 末尾の 吗、 か、韓国語の動詞語尾です。前触れがあることも多いですが、安全な英語形はその最後の一点、平叙か疑問か、に左右されます。
人間の通訳もまさにこの壁に突き当たります。研究では、ドイツ語から訳す際に遅れを延ばさざるを得ず、節の最後に来る述語を待つ様子が記述されています。機械翻訳の限界ではなく、言語の性質です。
そこで、その懸念の単純版を試しました。統制された一回の実行で、合成音声を使い、意味が最後の2語で決まるドイツ語の文が、平凡な文と変わらない速さで翻訳を始めました。中国語、日本語、韓国語の短い疑問文は、対になる平叙文と同じ速さで返ってきました — しかも英語が先頭に置く「Did…」を伴い、疑問文として正しく返ってきました。これは、あらゆる長文が同じように振る舞うことを証明するものではありません。ただ、エンジンが黙って最後の動詞や助詞を待っているのではなく、冒頭から訳し始めて残りを後から埋めていくことは示しています。
実際に起きているのが見えます。
一つの統制された文を、13言語それぞれの合成ネイティブ音声で読み上げ、DeepL Voiceで真のリアルタイムを通じて英語に翻訳します。灰色の帯が原語音声、黒い帯が最初の翻訳音声です。この単一の実行では、13言語中11言語で黒い帯が灰色の帯の終了より前に始まっています — 文がまだ話されている間に翻訳がすでに再生されています。
DeepL Voiceエンジンで計測 — 1文、言語ごとに合成ネイティブ音声1種類、単一実行、原語は音量正規化と無音トリム済み。これはその実行で起きたことであって、ベンチマークではありません。韓国語と中国語は原語音声の終了から約0.6〜0.7秒後に始まりました。DeepLはエンジンを改善し続けているので、私たちはこれを再実行してページを更新し、よく見えるスナップショットを据え置くことはしません。
私たちが行っている対策
文全体が来るのを待ちません。
DeepLは、話者が止まるまで黙っているのではなく、句が形成されるたびにストリーム配信し、増えるたびにテキストを改訂します。多くの場合、翻訳は文が終わる前に始まります — ただし、上のチャートが示すように、常にではありません。
文字起こしは音声より先に届きます。
テキストは通常、音声合成が必要な分だけ、翻訳音声より先に表示されます。そのためオペレーターは、顧客の言っていることをテキストで先に追いながら、誰かが動き出す前に文が確定するのを待てます。
文字起こしは、その場で自己修正します。
句は仮の行として現れ、文が確定するにつれて更新されます — 川岸が金融機関に変わる過程が、誰も繰り返すことなく文字起こし内で起こります。翻訳音声は逆で、一度再生したら取り消せません。
聞く前に読む
遅れは本物です。代替手段のコストも本物です。
電話通訳は、セットアップの時間と、通話に加わるもう一人を増やします。ネイティブスピーカーに遅れはありません — シフトに入っていれば。待つ、転送する、全言語分の人員を自前で抱える。そのどれよりこのトレードオフのほうがマシな通話のために、Taiwaはあります。
