Nuestro sitio web está disponible en varios idiomas
Investigación y desarrollo

Un producto en funcionamiento con investigación y desarrollo continuos

My Words nace de un problema más difícil que traducir una frase: sostener una conversación por encima de una barrera idiomática cuando lo que está en juego es la vivienda, la seguridad o la salud de alguien, y hacerlo de un modo que diga la verdad sobre su propia incertidumbre. Ese problema no está resuelto, así que la investigación no se detuvo cuando el producto salió al mercado.

De dónde viene

El trabajo comenzó como Project Keystone, una investigación de INT6 Ltd sobre la mediación de conversaciones bilingües en tiempo real mediante modelos de lenguaje. INT6 construyó la aplicación de prueba de concepto, Turnstone, que después se desarrolló hasta convertirse en un sistema en funcionamiento y se probó en entornos reales.

Desde entonces, la aplicación se ha trasladado a C2 Discovery Labs CIC para que se mantenga al servicio del beneficio comunitario y social. My Words es ese mismo sistema ya probado, con una nueva marca y con continuidad, y el desarrollo prosigue bajo ella.

Validación académica

Se está gestionando una validación independiente con una universidad británica asociada. La intención es colaborar con estudiantes de posgrado y laboratorios de investigación académica en dos frentes a la vez: mejorar el producto y comprobar que hace lo que este sitio dice que hace.

Ese trabajo no ha concluido y nada de lo que hay en este sitio depende de él. Cuando haya resultados, incluidos los que nos resulten desfavorables, se publicarán aquí junto con el método empleado. Hasta entonces, considere las afirmaciones de este sitio como nuestras y no como verificadas de forma independiente.

Preguntas abiertas

Qué intenta averiguar realmente el proyecto

Estas son las preguntas en torno a las que se organiza el trabajo, y las que plantearíamos mañana mismo a un socio investigador. Ninguna de ellas está resuelta.

01

¿Puede una máquina sostener el contexto como lo hace un intérprete?

Un intérprete humano capta la sala, el historial y el registro sin que nadie se lo pida. ¿Cuánto de eso puede explicitarse como contexto estructurado, y qué se pierde al explicitarlo?

02

¿Puede un sistema saber de forma útil cuándo se equivoca?

La puntuación de fidelidad es un modelo que juzga a otro modelo. ¿Dónde se correlaciona eso con el error real, y dónde falla en la misma dirección que aquello que está comprobando?

03

¿Una pregunta aclaratoria ayuda o interrumpe?

En principio, preguntar es mejor que suponer. Con una persona angustiada delante, ¿cuántas veces se puede interrumpir antes de haber dañado justo aquello que se quería proteger?

04

¿Cómo debe mostrarse la incertidumbre a un profesional con poco tiempo?

Un marcador que se ignora no es mejor que la ausencia de marcador. Un marcador que detiene la conversación en cada turno es peor. Esta es una cuestión de investigación sobre la interfaz tanto como sobre el modelado.

05

¿Qué cambia cuando es la persona quien sostiene el dispositivo?

Leer en las propias manos, en el propio idioma, es un acto distinto de leer al otro lado de una mesa. Si eso cambia lo que las personas revelan es una cuestión que hay que medir, y todavía no la hemos medido.

06

¿Dónde está realmente el límite?

Afirmamos que esto sirve para las conversaciones iniciales y no para las reguladas por ley. Ese límite debería contrastarse con lo que ocurre realmente en los servicios, y no defenderse por el hecho de que lo hayamos escrito.

Cómo se evalúa el trabajo

El sistema genera sus propias evidencias como subproducto de su funcionamiento: cada turno lleva un original, una traducción, una puntuación de fidelidad, cualquier revisión y cualquier pregunta aclaratoria. Eso hace medibles varias cosas sin necesidad de instrumentar nada más.

  1. Con qué frecuencia se revisa una traducción antes de entregarla, y cuánto se mueve la puntuación.
  2. Con qué frecuencia el mediador pregunta en lugar de responder, y qué hace la conversación a continuación.
  3. Cómo se distribuyen las puntuaciones por idioma, de modo que una cobertura desigual salga a la luz en lugar de diluirse en una media.
  4. En qué puntos los profesionales anularon el resultado, se repitieron o abandonaron el intercambio.

Lo que la instrumentación no puede decirnos es si la conversación fue buena. Para eso hace falta el servicio y, cuando pueda hacerse como es debido, la persona que estaba al otro lado.

Compromisos de método

Cómo nos lo exigimos

Probar antes de pasar a producción. El comportamiento nuevo se pone a prueba con conversaciones grabadas y sintéticas antes de encontrarse con la conversación real de nadie.

Medir lo que se midió. Ninguna cifra de precisión de titular que sustituya a una distribución que podamos mostrar de verdad.

Publicar el método. Lo que aprendemos sobre cómo hacer esto de forma segura se documenta para que otras personas lo reutilicen, incluidas las partes que no funcionaron.

Los resultados negativos cuentan. Una función que empeoró las conversaciones es un hallazgo, y se informa como tal.

Construido hasta ahora

Qué está construido y en funcionamiento

Esta es una aplicación en funcionamiento, no una demostración. A grandes rasgos, actualmente cuenta con:

Mediación en directo, turno a turno

Traducción en streaming con el historial de la conversación, los datos estructurados y el contexto del dominio disponibles en cada turno.

Puntuación de fidelidad y autorrevisión

Puntuaciones por turno, revisión antes de la entrega cuando quedan por debajo del umbral, y una aclaración devuelta al hablante cuando el original es ambiguo.

Dos superficies de conversación

Un modo de pantalla compartida y un modo emparejado en el que la segunda persona se une desde su propio dispositivo mediante una conexión en directo.

Una interfaz localizada

Los textos de la interfaz traducidos a los idiomas incorporados y guardados en caché, de modo que la propia superficie no esté solo en inglés.

Cuentas, grupos y auditoría

Agrupación y permisos a nivel de organización, autenticación con passkey y con contraseña más códigos de doble factor, y un registro de auditoría que abarca las conversaciones y la administración.

Conversaciones reproducibles

Los intercambios grabados pueden reproducirse contra una versión nueva, de modo que un cambio se prueba sobre diálogo real y no sobre algo improvisado para la demostración.

Una pila web corriente

Una aplicación PHP y MariaDB servida por HTTPS. Deliberadamente poco exótica, para que se pueda razonar sobre ella, auditarla y alojarla en un sitio distinto del actual si eso llega a ser lo más adecuado.

Colaboración

Trabaje en esto con nosotros

Buscamos estudiantes de posgrado y laboratorios de investigación con una pregunta en este ámbito, servicios dispuestos a que se estudie su uso, y financiadores que respalden el trabajo basado en evidencia sobre el idioma como barrera para acceder a la ayuda.