Un prodotto funzionante con ricerca e sviluppo in corso
My Words esiste per via di un problema più difficile che tradurre una frase: tenere insieme una conversazione oltre il confine di una lingua quando in gioco c'è la casa, la sicurezza o la salute di qualcuno, e farlo dicendo la verità sulla propria incertezza. Quel problema non è risolto, quindi la ricerca non si è fermata quando il prodotto è uscito.
Da dove nasce
Il lavoro è iniziato come Project Keystone, una ricerca di INT6 Ltd sulla mediazione di conversazioni bilingui in tempo reale tramite modelli linguistici. INT6 ha costruito l'applicazione dimostrativa, Turnstone, poi sviluppata in un sistema funzionante e testata in contesti reali.
L'applicazione è stata successivamente trasferita a C2 Discovery Labs CIC affinché sia detenuta per il beneficio della collettività. My Words è quello stesso sistema testato, con un nuovo nome e portato avanti, e lo sviluppo prosegue al suo interno.
Validazione accademica
È in corso di definizione una validazione indipendente con un'università partner del Regno Unito. L'intenzione è lavorare con studenti di dottorato e laboratori di ricerca accademici su due fronti insieme: migliorare il prodotto e verificare che faccia ciò che questo sito dichiara.
Quel lavoro non è concluso e nulla di ciò che si trova in questo sito dipende da esso. Quando ci saranno risultati, compresi quelli che ci daranno torto, verranno pubblicati qui insieme al metodo. Fino ad allora, consideri le affermazioni di questo sito come nostre e non come verificate in modo indipendente.
Che cosa il progetto sta davvero cercando di scoprire
Sono le domande attorno a cui è organizzato il lavoro, e quelle che porteremmo domani stesso a un partner di ricerca. Nessuna di esse è risolta.
Una macchina può tenere il contesto come fa un interprete?
Un interprete umano porta con sé la stanza, la storia e il registro senza che glielo si chieda. Quanto di tutto questo può essere reso esplicito come contesto strutturato, e che cosa si perde nel renderlo esplicito?
Un sistema può sapere in modo utile quando sbaglia?
Il punteggio di fedeltà è un modello che giudica un modello. Dove correla con l'errore reale, e dove sbaglia nella stessa direzione di ciò che sta controllando?
Una domanda di chiarimento aiuta o interrompe?
In linea di principio, chiedere è meglio che indovinare. Ma con davanti una persona in difficoltà, quante volte si può interrompere prima di aver danneggiato proprio ciò che si voleva proteggere?
Come va mostrata l'incertezza a un professionista sotto pressione?
Un indicatore che viene ignorato non vale più di nessun indicatore. Un indicatore che blocca la conversazione a ogni turno è peggio. È una domanda di ricerca sull'interfaccia tanto quanto sui modelli.
Che cosa cambia quando è la persona a tenere in mano il dispositivo?
Leggere tra le proprie mani, nella propria lingua, è un atto diverso dal leggere dall'altra parte di una scrivania. Se questo cambi ciò che le persone raccontano è una domanda da misurare, e non l'abbiamo ancora misurata.
Dove si colloca davvero il limite?
Sosteniamo che questo strumento sia per le conversazioni iniziali e non per quelle previste dalla legge. Quel limite andrebbe verificato rispetto a ciò che accade davvero nei servizi, non difeso perché lo abbiamo messo per iscritto.
Come viene valutato il lavoro
Il sistema produce le proprie evidenze come sottoprodotto del suo funzionamento: ogni turno porta con sé un testo di partenza, una traduzione, un punteggio di fedeltà, le eventuali revisioni e le eventuali domande di chiarimento. Questo rende misurabili diverse cose senza aggiungere alcuna strumentazione.
- Quanto spesso una traduzione viene rivista prima della consegna, e di quanto si sposta il punteggio.
- Quanto spesso il mediatore chiede invece di rispondere, e che cosa succede poi nella conversazione.
- Come si distribuiscono i punteggi per lingua, così che una copertura disomogenea emerga invece di sparire dentro una media.
- Dove gli operatori hanno forzato il sistema, si sono ripetuti o hanno abbandonato lo scambio.
Ciò che la strumentazione non può dirci è se la conversazione sia stata buona. Per questo servono il servizio e, dove è possibile farlo bene, la persona che si trova dall'altra parte.
Come ci teniamo fedeli a tutto questo
Testare prima di andare in produzione. I nuovi comportamenti vengono provati su conversazioni registrate e sintetiche prima di incontrare quelle reali di qualcuno.
Misurare ciò che è stato misurato. Nessun dato di accuratezza a effetto che sostituisca una distribuzione che possiamo davvero mostrare.
Pubblicare il metodo. Ciò che impariamo su come fare questo lavoro in sicurezza viene scritto perché altri possano riutilizzarlo, comprese le parti che non hanno funzionato.
I risultati negativi contano. Una funzione che ha peggiorato le conversazioni è un risultato, e come tale viene riportata.
Che cosa è costruito e funzionante
Questa è un'applicazione funzionante, non una dimostrazione. A grandi linee, oggi comprende:
Mediazione dal vivo turno per turno
Traduzione in streaming con la cronologia della conversazione, i fatti strutturati e il contesto di settore disponibili a ogni turno.
Punteggio di fedeltà e auto-revisione
Punteggi per ogni turno, revisione prima della consegna quando si scende sotto la soglia e richiesta di chiarimento a chi ha scritto quando il testo di partenza è ambiguo.
Due modalità di conversazione
Una modalità a schermo condiviso e una modalità accoppiata in cui la seconda persona si collega dal proprio dispositivo tramite una connessione dal vivo.
Un'interfaccia localizzata
Le stringhe dell'interfaccia sono tradotte nelle lingue già caricate e messe in cache, così l'interfaccia stessa non è solo in inglese.
Account, gruppi e audit
Raggruppamenti e permessi a livello di organizzazione, autenticazione con passkey e password con codici a due fattori, e un registro di audit su conversazioni e amministrazione.
Conversazioni riproducibili
Gli scambi registrati possono essere rieseguiti su una nuova versione, così una modifica viene testata su dialoghi reali e non su qualcosa improvvisato per la dimostrazione.
Un normale stack web
Un'applicazione PHP e MariaDB servita via HTTPS. Deliberatamente poco esotica, così da poter essere compresa, verificata e ospitata altrove rispetto a dove si trova oggi, se questa diventerà la scelta giusta.
Lavori con noi su questo
Cerchiamo studenti di dottorato e laboratori di ricerca con una domanda in questo campo, servizi disposti a far studiare il proprio utilizzo e finanziatori che sostengano un lavoro basato sulle evidenze sulla lingua come barriera all'accesso all'aiuto.