En fungerande produkt med pågående forskning och utveckling
My Words finns på grund av ett svårare problem än att översätta en mening: att hålla ihop ett samtal över en språkgräns när det som står på spel är någons boende, säkerhet eller hälsa, och att göra det på ett sätt som är ärligt om sin egen osäkerhet. Det problemet är inte löst, så forskningen tog inte slut när produkten lanserades.
Var det kom ifrån
Arbetet började som Project Keystone, forskning av INT6 Ltd om tvåspråkig samtalsmedling i realtid med hjälp av språkmodeller. INT6 byggde prototypapplikationen Turnstone, som sedan utvecklades till ett fungerande system och testades i verkliga miljöer.
Applikationen har sedan förts över till C2 Discovery Labs CIC så att den förvaltas till samhällets nytta. My Words är samma testade system, omprofilerat och vidareutvecklat, och utvecklingen fortsätter där.
Akademisk validering
Oberoende validering håller på att ordnas med ett brittiskt universitet. Avsikten är att arbeta med forskarstuderande och akademiska forskningsmiljöer med två saker samtidigt: att förbättra produkten, och att kontrollera att den gör det som den här webbplatsen säger att den gör.
Det arbetet är inte klart och inget på den här webbplatsen är beroende av det. När det finns resultat, även sådana som talar emot oss, publiceras de här tillsammans med metoden. Fram till dess: betrakta påståendena på webbplatsen som våra egna och inte som oberoende granskade.
Vad projektet faktiskt försöker ta reda på
Det här är frågorna arbetet är organiserat kring, och de vi skulle lägga fram för en forskningspartner i morgon. Ingen av dem är avgjord.
Kan en maskin hålla kontext så som en tolk gör?
En mänsklig tolk bär med sig rummet, historien och stilnivån utan att bli ombedd. Hur mycket av det kan göras explicit som strukturerad kontext, och vad går förlorat när det görs explicit?
Kan ett system på ett användbart sätt veta när det har fel?
Trohetsbedömning är en modell som bedömer en modell. Var korrelerar det med verkliga fel, och var brister det åt samma håll som det den granskar?
Hjälper en förtydligande fråga, eller avbryter den?
Att fråga slår att gissa, i princip. Men med en person i kris framför dig: hur många gånger kan du avbryta innan du har skadat just det du skulle skydda?
Hur bör osäkerhet visas för en pressad yrkesperson?
En markering som ignoreras är inte bättre än ingen markering alls. En markering som stoppar samtalet varje tur är sämre. Det här är lika mycket en gränssnittsfråga som en modelleringsfråga.
Vad förändras när personen själv håller i enheten?
Att läsa i sin egen hand, på sitt eget språk, är något annat än att läsa tvärs över ett skrivbord. Om det förändrar vad människor berättar är en fråga för mätning, och det har vi ännu inte mätt.
Var går gränsen egentligen?
Vi hävdar att det här är till för tidiga samtal och inte för myndighetsutövning. Den gränsen bör prövas mot vad som faktiskt händer i verksamheterna, inte försvaras bara för att vi har skrivit ner den.
Hur arbetet utvärderas
Systemet producerar sitt eget underlag som en biprodukt av att köra: varje tur bär med sig en källtext, en översättning, en trohetspoäng, eventuell revidering och eventuell förtydligande fråga. Det gör flera saker mätbara utan att något extra behöver byggas in.
- Hur ofta en översättning revideras innan den levereras, och hur mycket poängen flyttar sig.
- Hur ofta medlaren frågar i stället för att svara, och vad samtalet gör därefter.
- Hur poängen fördelar sig per språk, så att ojämn täckning syns i stället för att försvinna in i ett medelvärde.
- Var medarbetare gick förbi verktyget, upprepade sig eller avbröt utbytet.
Vad mätningen inte kan säga oss är om samtalet var något bra. Det kräver verksamheten och, där det kan göras ordentligt, personen på andra sidan.
Hur vi håller oss till det
Testa före drift. Nytt beteende körs mot inspelade och syntetiska samtal innan det möter någons verkliga.
Mät det som faktiskt mättes. Ingen rubriksiffra för träffsäkerhet som får ersätta en fördelning vi faktiskt kan visa.
Publicera metoden. Det vi lär oss om att göra det här säkert skrivs ner så att andra kan återanvända det, inklusive de delar som inte fungerade.
Negativa resultat räknas. En funktion som gjorde samtalen sämre är ett resultat, och redovisas som ett.
Vad som är byggt och i drift
Det här är en fungerande applikation, inte en demonstration. I grova drag har den i dag:
Medling tur för tur i realtid
Strömmande översättning med samtalshistorik, strukturerade fakta och domänkontext tillgängligt för varje tur.
Trohetsbedömning och självrevidering
Poäng per tur, revidering av det som hamnar under tröskelvärdet innan leverans, och förtydligande tillbaka till talaren där källan är tvetydig.
Två samtalsytor
Ett läge med delad skärm och ett parkopplat läge där den andra personen ansluter från sin egen enhet över en live-anslutning.
Ett lokaliserat gränssnitt
Gränssnittstexter översatta till de förberedda språken och cachade, så att själva ytan inte bara finns på engelska.
Konton, grupper och spårbarhet
Gruppering och behörigheter på organisationsnivå, inloggning med passkey eller lösenord med tvåfaktorskoder, och en granskningslogg över både samtal och administration.
Återspelbara samtal
Inspelade utbyten kan spelas upp mot en ny version, så att en ändring testas mot verklig dialog och inte mot något improviserat för demot.
En helt vanlig webbstack
En PHP- och MariaDB-applikation som levereras över HTTPS. Medvetet oexotisk, så att den går att förstå, granska och driftsätta någon annanstans än där den ligger i dag om det skulle bli det rätta svaret.
Arbeta med det här tillsammans med oss
Vi söker forskarstuderande och forskningsmiljöer med en fråga inom området, verksamheter som är villiga att låta sin användning studeras, och finansiärer som stöttar evidensbaserat arbete om språk som hinder för att få hjälp.