C'è un ritardo. Ecco perché, e cosa ti costa.
Ogni modo di farsi capire in una lingua che non parli ha un ritardo. La domanda non è se Taiwa ne abbia uno. È come si confronta con le alternative, e cosa facciamo per mantenerlo basso.
Tre modi per essere tradotti
Tre modi in cui il tuo cliente si fa capire. Tutti e tre hanno un ritardo. Di solito solo uno viene descritto come istantaneo, e non lo è.
Un madrelingua
Il ritardo: nessuno. L'attesa: tutto il resto.
Nessun ritardo di traduzione, perché non c'è traduzione. Ma devi trovarli, trasferirgli la chiamata, e sperare che siano in turno — il che significa assumere agenti multilingue per ogni lingua in cui ricevi chiamate. Non regge per copertura a lungo orario o per le lingue in cui ricevi una manciata di chiamate a settimana.
Un interprete telefonico
Il ritardo: da due a sei secondi, interpretando in diretta.
Una terza persona in linea. Nell'interpretazione simultanea, studi pubblicati indicano che i professionisti sono circa due-sei secondi dietro chi parla, e oltre i quattro secondi l'accuratezza cala, perché tengono in memoria una porzione più lunga della frase. Molte telefonate sono invece consecutive — ogni parte parla, si ferma, e aspetta — il che evita quel ritardo ma allunga la chiamata.
Taiwa
Il ritardo: diversi secondi dietro, per turno.
In un test controllato, l'audio tradotto di Taiwa è iniziato circa tre-sette secondi dopo che il cliente aveva cominciato a parlare — la maggior parte delle lingue entro lo stesso ampio ear–voice span riportato per gli interpreti, coreano e cinese un po' sopra. Una macchina non trattiene la frase nella memoria di lavoro come una persona, ma questo non fa sparire il ritardo. In quel test la traduzione era spesso già in riproduzione prima che il cliente avesse finito la frase. Nessuna terza persona in linea, nessun trasferimento, nessuna attesa che qualcuno sia disponibile.
Dati sugli interpreti da ricerche pubblicate sull'ear–voice span nell'interpretazione simultanea. ↓
Perché c'è un limite minimo
Non puoi tradurre una frase che non hai ancora sentito.
Tradurre non è trascrivere. Per trasformare una frase in un'altra lingua ti serve abbastanza di essa per sapere cosa significa, e "abbastanza" è spesso la maggior parte.
Prendi "I went to the bank". Finché non arrivano le parole successive, è una sponda di fiume o un istituto finanziario, e nella maggior parte delle lingue sono parole diverse. Indovina presto e sei veloce e sbagliato. Aspetta, e sei più lento e giusto.
Ogni interprete simultaneo fa questo compromesso continuamente: se resti troppo vicino a chi parla, ti impegni su un significato prima che abbia finito di costruirlo.
Parte di quel limite è linguistica, non tecnica. Hardware più veloce può tagliare l'elaborazione, ma non può permettere a nessun sistema di tradurre un significato non ancora arrivato. È il motivo per cui nessuna traduzione in tempo reale è istantanea, la nostra inclusa.
Il problema del tedesco
Alcune lingue lo peggiorano, e non è colpa di nessuno.
Il tedesco spesso rimanda la parte decisiva del verbo alla fine della frase. Il giapponese è ancora più coerentemente a predicato finale. Finché quel pezzo non arriva, puoi sapere chi e cosa erano coinvolti, ma non cosa è effettivamente successo.
Ich habe den Vertrag gestern zusammen mit meinem Kollegen …
Ho il contratto ieri insieme al mio collega …
gekündigt.
disdetto.
Tutto prima di quell'ultima parola è compatibile con firmarlo, leggerlo, o perderlo. L'azione decisiva arriva per ultima.
E non è solo il tedesco, o solo i verbi. Mandarino, giapponese e coreano possono marcare una domanda sì/no proprio alla fine — un 吗, か, o desinenza verbale coreana finale. Spesso ci sono indizi prima, ma la forma inglese sicura può dipendere da quell'ultimo pezzo: affermazione, o domanda?
Gli interpreti umani sbattono contro questo stesso muro — la ricerca descrive che sono costretti ad aumentare il loro ritardo quando lavorano dal tedesco, aspettando un predicato che arriva alla fine della frase. Non è un limite della traduzione automatica. È una proprietà della lingua.
Quindi abbiamo testato la versione semplice di quella paura. In un'esecuzione controllata, con voci sintetiche, una frase tedesca il cui significato si ribalta nelle ultime due parole ha iniziato a tradursi non più lentamente di una normale. Domande brevi in mandarino, giapponese e coreano sono tornate veloci quanto le corrispondenti affermazioni — e correttamente come domande, con il "Did…" che l'inglese mette all'inizio. Questo non prova che ogni frase lunga si comporti allo stesso modo. Mostra però che il motore non se ne sta semplicemente in silenzio, aspettando il verbo o la particella finale: parte dall'inizio della frase e recupera il resto strada facendo.
Puoi vederlo succedere.
Una frase controllata, pronunciata da una voce nativa sintetica in ciascuna di tredici lingue e tradotta in inglese tramite DeepL Voice in vero tempo reale. La barra grigia è il parlato originale; la barra nera è il primo audio tradotto. In questa singola esecuzione, undici delle tredici barre nere iniziano prima che quella grigia finisca — la traduzione già in riproduzione mentre la frase viene ancora pronunciata.
Misurato tramite il motore DeepL Voice — una frase, una voce nativa sintetica per lingua, una singola esecuzione, volume sorgente normalizzato e silenzio tagliato. Questo è ciò che è accaduto in quell'esecuzione, non un benchmark. Coreano e cinese sono partiti circa 0,6–0,7 secondi dopo la fine del parlato originale. DeepL continua a migliorare il suo motore, quindi ripetiamo la misurazione e aggiorniamo la pagina invece di lasciare uno snapshot troppo favorevole.
Cosa facciamo a riguardo
Non aspettiamo la frase intera.
DeepL trasmette una frase mentre si forma, rivedendo il testo man mano che ne arriva dell'altro, invece di restare in silenzio finché chi parla non si ferma. Spesso la traduzione inizia prima che la frase finisca — anche se, come mostra il grafico sopra, non sempre.
La trascrizione arriva prima dell'audio.
Il testo di solito appare prima della traduzione parlata, perché la voce deve essere sintetizzata. Così il tuo agente può seguire il senso del cliente mentre lo legge, mentre la frase finisce di assestarsi prima che qualcuno agisca su di essa.
La trascrizione si corregge sul posto.
Una frase appare come una riga provvisoria e si aggiorna mentre la frase si risolve — la sponda del fiume diventa l'istituto finanziario, nella trascrizione, senza che nessuno debba ripetersi. L'audio parlato è l'opposto: una volta emesso, non si può ritirare.
Leggere prima di ascoltare
Il ritardo è reale. Anche i costi delle alternative lo sono.
Un interprete telefonico aggiunge tempo di setup e un'altra persona alla chiamata. Un madrelingua non ha ritardo — se è in turno. Taiwa è per le chiamate in cui quel compromesso batte l'aspettare, il trasferire, o l'avere in organico ogni lingua.
