Il nostro sito è disponibile in più lingue
Ricerca e sviluppo

Un prodotto funzionante con ricerca e sviluppo in corso

My Words esiste per via di un problema più difficile che tradurre una frase: tenere insieme una conversazione oltre il confine di una lingua quando in gioco c'è la casa, la sicurezza o la salute di qualcuno, e farlo dicendo la verità sulla propria incertezza. Quel problema non è risolto, quindi la ricerca non si è fermata quando il prodotto è uscito.

Da dove nasce

Il lavoro è iniziato come Project Keystone, una ricerca di INT6 Ltd sulla mediazione di conversazioni bilingui in tempo reale tramite modelli linguistici. INT6 ha costruito l'applicazione dimostrativa, Turnstone, poi sviluppata in un sistema funzionante e testata in contesti reali.

L'applicazione è stata successivamente trasferita a C2 Discovery Labs CIC affinché sia detenuta per il beneficio della collettività. My Words è quello stesso sistema testato, con un nuovo nome e portato avanti, e lo sviluppo prosegue al suo interno.

Validazione accademica

È in corso di definizione una validazione indipendente con un'università partner del Regno Unito. L'intenzione è lavorare con studenti di dottorato e laboratori di ricerca accademici su due fronti insieme: migliorare il prodotto e verificare che faccia ciò che questo sito dichiara.

Quel lavoro non è concluso e nulla di ciò che si trova in questo sito dipende da esso. Quando ci saranno risultati, compresi quelli che ci daranno torto, verranno pubblicati qui insieme al metodo. Fino ad allora, consideri le affermazioni di questo sito come nostre e non come verificate in modo indipendente.

Domande aperte

Che cosa il progetto sta davvero cercando di scoprire

Sono le domande attorno a cui è organizzato il lavoro, e quelle che porteremmo domani stesso a un partner di ricerca. Nessuna di esse è risolta.

01

Una macchina può tenere il contesto come fa un interprete?

Un interprete umano porta con sé la stanza, la storia e il registro senza che glielo si chieda. Quanto di tutto questo può essere reso esplicito come contesto strutturato, e che cosa si perde nel renderlo esplicito?

02

Un sistema può sapere in modo utile quando sbaglia?

Il punteggio di fedeltà è un modello che giudica un modello. Dove correla con l'errore reale, e dove sbaglia nella stessa direzione di ciò che sta controllando?

03

Una domanda di chiarimento aiuta o interrompe?

In linea di principio, chiedere è meglio che indovinare. Ma con davanti una persona in difficoltà, quante volte si può interrompere prima di aver danneggiato proprio ciò che si voleva proteggere?

04

Come va mostrata l'incertezza a un professionista sotto pressione?

Un indicatore che viene ignorato non vale più di nessun indicatore. Un indicatore che blocca la conversazione a ogni turno è peggio. È una domanda di ricerca sull'interfaccia tanto quanto sui modelli.

05

Che cosa cambia quando è la persona a tenere in mano il dispositivo?

Leggere tra le proprie mani, nella propria lingua, è un atto diverso dal leggere dall'altra parte di una scrivania. Se questo cambi ciò che le persone raccontano è una domanda da misurare, e non l'abbiamo ancora misurata.

06

Dove si colloca davvero il limite?

Sosteniamo che questo strumento sia per le conversazioni iniziali e non per quelle previste dalla legge. Quel limite andrebbe verificato rispetto a ciò che accade davvero nei servizi, non difeso perché lo abbiamo messo per iscritto.

Come viene valutato il lavoro

Il sistema produce le proprie evidenze come sottoprodotto del suo funzionamento: ogni turno porta con sé un testo di partenza, una traduzione, un punteggio di fedeltà, le eventuali revisioni e le eventuali domande di chiarimento. Questo rende misurabili diverse cose senza aggiungere alcuna strumentazione.

  1. Quanto spesso una traduzione viene rivista prima della consegna, e di quanto si sposta il punteggio.
  2. Quanto spesso il mediatore chiede invece di rispondere, e che cosa succede poi nella conversazione.
  3. Come si distribuiscono i punteggi per lingua, così che una copertura disomogenea emerga invece di sparire dentro una media.
  4. Dove gli operatori hanno forzato il sistema, si sono ripetuti o hanno abbandonato lo scambio.

Ciò che la strumentazione non può dirci è se la conversazione sia stata buona. Per questo servono il servizio e, dove è possibile farlo bene, la persona che si trova dall'altra parte.

Impegni di metodo

Come ci teniamo fedeli a tutto questo

Testare prima di andare in produzione. I nuovi comportamenti vengono provati su conversazioni registrate e sintetiche prima di incontrare quelle reali di qualcuno.

Misurare ciò che è stato misurato. Nessun dato di accuratezza a effetto che sostituisca una distribuzione che possiamo davvero mostrare.

Pubblicare il metodo. Ciò che impariamo su come fare questo lavoro in sicurezza viene scritto perché altri possano riutilizzarlo, comprese le parti che non hanno funzionato.

I risultati negativi contano. Una funzione che ha peggiorato le conversazioni è un risultato, e come tale viene riportata.

Realizzato finora

Che cosa è costruito e funzionante

Questa è un'applicazione funzionante, non una dimostrazione. A grandi linee, oggi comprende:

Mediazione dal vivo turno per turno

Traduzione in streaming con la cronologia della conversazione, i fatti strutturati e il contesto di settore disponibili a ogni turno.

Punteggio di fedeltà e auto-revisione

Punteggi per ogni turno, revisione prima della consegna quando si scende sotto la soglia e richiesta di chiarimento a chi ha scritto quando il testo di partenza è ambiguo.

Due modalità di conversazione

Una modalità a schermo condiviso e una modalità accoppiata in cui la seconda persona si collega dal proprio dispositivo tramite una connessione dal vivo.

Un'interfaccia localizzata

Le stringhe dell'interfaccia sono tradotte nelle lingue già caricate e messe in cache, così l'interfaccia stessa non è solo in inglese.

Account, gruppi e audit

Raggruppamenti e permessi a livello di organizzazione, autenticazione con passkey e password con codici a due fattori, e un registro di audit su conversazioni e amministrazione.

Conversazioni riproducibili

Gli scambi registrati possono essere rieseguiti su una nuova versione, così una modifica viene testata su dialoghi reali e non su qualcosa improvvisato per la dimostrazione.

Un normale stack web

Un'applicazione PHP e MariaDB servita via HTTPS. Deliberatamente poco esotica, così da poter essere compresa, verificata e ospitata altrove rispetto a dove si trova oggi, se questa diventerà la scelta giusta.

Collaborazione

Lavori con noi su questo

Cerchiamo studenti di dottorato e laboratori di ricerca con una domanda in questo campo, servizi disposti a far studiare il proprio utilizzo e finanziatori che sostengano un lavoro basato sulle evidenze sulla lingua come barriera all'accesso all'aiuto.