Onze website is beschikbaar in meerdere talen
Onderzoek en ontwikkeling

Een werkend product met doorlopend onderzoek en ontwikkeling

My Words bestaat vanwege een lastiger probleem dan het vertalen van een zin: een gesprek bijeenhouden over een taalgrens heen wanneer iemands huisvesting, veiligheid of gezondheid op het spel staat, en dat doen op een manier die eerlijk is over de eigen onzekerheid. Dat probleem is niet opgelost, dus het onderzoek stopte niet toen het product er eenmaal was.

Waar het vandaan komt

Het werk begon als Project Keystone, onderzoek van INT6 Ltd naar realtime bemiddeling van tweetalige gesprekken met behulp van taalmodellen. INT6 bouwde de proof-of-concept-applicatie Turnstone, die vervolgens werd uitgewerkt tot een werkend systeem en in de praktijk is getest.

De applicatie is sindsdien ondergebracht bij C2 Discovery Labs CIC, zodat zij wordt beheerd ten behoeve van de gemeenschap en de samenleving. My Words is datzelfde geteste systeem, onder een nieuwe naam voortgezet, en de ontwikkeling loopt daaronder door.

Academische validatie

Onafhankelijke validatie wordt geregeld met een Britse universitaire partner. Het is de bedoeling om met masterstudenten, promovendi en academische onderzoekslabs aan twee dingen tegelijk te werken: het product verbeteren, en controleren of het doet wat deze site zegt dat het doet.

Dat werk is niet afgerond en niets op deze site hangt ervan af. Zodra er resultaten zijn, ook resultaten die ons ongelijk geven, worden ze hier gepubliceerd met de methode erbij. Beschouw de uitspraken op deze site tot die tijd als de onze, en niet als onafhankelijk gecontroleerd.

Open vragen

Wat het project daadwerkelijk probeert uit te zoeken

Dit zijn de vragen waar het werk omheen is georganiseerd, en de vragen die wij morgen aan een onderzoekspartner zouden voorleggen. Geen ervan is beslecht.

01

Kan een machine context vasthouden zoals een tolk dat doet?

Een menselijke tolk draagt de situatie, de voorgeschiedenis en het register mee zonder dat erom gevraagd wordt. Hoeveel daarvan is expliciet te maken als gestructureerde context, en wat gaat er verloren door het expliciet te maken?

02

Kan een systeem op een bruikbare manier weten dat het fout zit?

Bij betrouwbaarheidsscores beoordeelt een model een model. Waar hangt dat samen met echte fouten, en waar gaat het de mist in in dezelfde richting als datgene wat het controleert?

03

Helpt een verhelderende vraag, of onderbreekt zij?

Navragen is in beginsel beter dan gokken. Maar hoe vaak kunt u iemand die overstuur voor u zit onderbreken voordat u beschadigt wat u probeerde te beschermen?

04

Hoe moet onzekerheid worden getoond aan een drukbezette professional?

Een markering die genegeerd wordt, is niet beter dan geen markering. Een markering die elke beurt het gesprek stillegt, is slechter. Dit is net zozeer een interfacevraag als een modelvraag.

05

Wat verandert er als de persoon het apparaat zelf vasthoudt?

Lezen in uw eigen handen, in uw eigen taal, is iets anders dan meelezen over een bureau heen. Of dat verandert wat mensen vertellen, is een kwestie van meten, en dat hebben wij nog niet gemeten.

06

Waar ligt de grens werkelijk?

Wij stellen dat dit bedoeld is voor eerste gesprekken en niet voor wettelijke procedures. Die grens hoort te worden getoetst aan wat er werkelijk in diensten gebeurt, en niet verdedigd omdat wij haar hebben opgeschreven.

Hoe het werk wordt geëvalueerd

Het systeem levert zijn eigen bewijs op als bijproduct van het gebruik: elke beurt bevat een bron, een vertaling, een betrouwbaarheidsscore, eventuele herzieningen en eventuele verhelderende vragen. Daardoor is een aantal zaken meetbaar zonder dat er iets extra's hoeft te worden ingebouwd.

  1. Hoe vaak een vertaling vóór aflevering wordt herzien, en hoeveel de score dan verschuift.
  2. Hoe vaak de bemiddelaar navraagt in plaats van antwoordt, en wat het gesprek daarna doet.
  3. Hoe de scores per taal verdeeld zijn, zodat ongelijke dekking zichtbaar wordt in plaats van te verdwijnen in een gemiddelde.
  4. Waar medewerkers ingrepen, zichzelf herhaalden of de uitwisseling afbraken.

Wat de meetgegevens ons niet kunnen vertellen, is of het gesprek ergens toe deed. Daarvoor is de dienst zelf nodig en, waar dat zorgvuldig kan, de persoon aan de andere kant ervan.

Methodische toezeggingen

Hoe wij onszelf eraan houden

Testen vóór livegang. Nieuw gedrag wordt beproefd op opgenomen en synthetische gesprekken voordat het iemands echte gesprek raakt.

Meten wat er gemeten is. Geen kopcijfer voor nauwkeurigheid dat in de plaats komt van een verdeling die wij daadwerkelijk kunnen laten zien.

De methode publiceren. Wat wij leren over hoe dit veilig te doen, schrijven wij op zodat anderen het kunnen hergebruiken, inclusief de delen die niet werkten.

Negatieve resultaten tellen mee. Een functie die gesprekken slechter maakte, is een bevinding en wordt ook zo gerapporteerd.

Tot nu toe gebouwd

Wat er gebouwd is en draait

Dit is een werkende applicatie, geen demonstratie. In grote lijnen beschikt zij nu over:

Live bemiddeling, beurt voor beurt

Vertaling die meteen verschijnt, met de gespreksgeschiedenis, gestructureerde feiten en domeincontext binnen bereik bij elke beurt.

Betrouwbaarheidsscores en zelfcorrectie

Scores per beurt, herziening vóór aflevering wanneer de score onder de drempel blijft, en een verhelderende vraag terug aan de spreker wanneer de bron dubbelzinnig is.

Twee gespreksmodi

Een modus met een gedeeld scherm en een gekoppelde modus waarin de tweede persoon via een live verbinding meedoet vanaf zijn eigen apparaat.

Een gelokaliseerde interface

Interfaceteksten zijn vertaald naar de opgenomen talen en worden gecachet, zodat het scherm zelf niet alleen Engelstalig is.

Accounts, groepen en audit

Groepering en rechten op organisatieniveau, aanmelden met passkey of wachtwoord met tweefactorcodes, en een auditlogboek over gesprekken en beheer heen.

Gesprekken die opnieuw af te spelen zijn

Vastgelegde uitwisselingen kunnen opnieuw worden afgespeeld tegen een nieuwe build, zodat een wijziging wordt getest op echte dialoog en niet op iets wat voor de demo is bedacht.

Een gewone webstack

Een applicatie in PHP en MariaDB, geserveerd over HTTPS. Bewust weinig exotisch, zodat erover te redeneren valt, zij te auditen is en elders te hosten is dan waar zij nu staat, mocht dat het juiste antwoord blijken.

Samenwerking

Werk hieraan mee

Wij zoeken masterstudenten, promovendi en onderzoekslabs met een vraag op dit terrein, diensten die hun gebruik willen laten bestuderen, en financiers die evidence-based werk steunen rond taal als drempel om hulp te krijgen.