Работающий продукт с продолжающимися исследованиями и разработкой
My Words появился из-за задачи более трудной, чем перевод одного предложения: удержать разговор через языковую границу, когда на кону чьё-то жильё, безопасность или здоровье, и сделать это так, чтобы честно говорить о собственной неуверенности. Эта задача не решена до конца, поэтому исследования не прекратились с выходом продукта.
Откуда всё началось
Работа началась как Project Keystone, исследование компании INT6 Ltd, посвящённое посредничеству в двуязычном разговоре в реальном времени с помощью языковых моделей. INT6 создала приложение-прототип Turnstone, которое затем было доработано до рабочей системы и испытано в реальных условиях.
С тех пор приложение было передано в C2 Discovery Labs CIC, чтобы оно принадлежало обществу и служило общественной пользе. My Words - это та же самая проверенная система под новым названием, и разработка продолжается уже в её рамках.
Академическая проверка
Независимая проверка готовится совместно с университетом-партнёром в Великобритании. Замысел в том, чтобы работать с аспирантами и академическими исследовательскими лабораториями сразу над двумя задачами: улучшать продукт и проверять, что он делает то, о чём говорится на этом сайте.
Эта работа не завершена, и ничто на этом сайте от неё не зависит. Когда появятся результаты, в том числе те, что окажутся не в нашу пользу, они будут опубликованы здесь вместе с методикой. До тех пор считайте утверждения на этом сайте нашими собственными, а не независимо проверенными.
Что проект на самом деле пытается выяснить
Вокруг этих вопросов и построена работа, и именно их мы завтра же поставили бы перед исследовательским партнёром. Ни один из них не решён.
Может ли машина удерживать контекст так, как это делает переводчик?
Живой переводчик держит в голове обстановку, предысторию и регистр речи, и его не приходится об этом просить. Какую часть этого можно выразить явно, в виде структурированного контекста, и что теряется при таком переходе к явному виду?
Может ли система с пользой понимать, что она ошиблась?
Оценка точности - это модель, судящая модель. Где такая оценка совпадает с реальной ошибкой, а где ошибается в ту же сторону, что и проверяемое?
Уточняющий вопрос помогает или прерывает?
В принципе, спросить лучше, чем угадать. Но когда перед вами человек в тяжёлом состоянии, сколько раз можно его прервать, прежде чем вы навредите тому, что пытались уберечь?
Как показывать неуверенность занятому специалисту?
Пометка, которую не замечают, ничем не лучше её отсутствия. Пометка, останавливающая разговор на каждой реплике, ещё хуже. Это вопрос исследования интерфейса не в меньшей степени, чем вопрос моделирования.
Что меняется, когда устройство держит сам человек?
Читать в собственных руках и на собственном языке - это не то же самое, что читать через стол. Меняется ли от этого то, о чём люди готовы рассказать, следует измерить, а мы этого пока не измеряли.
Где на самом деле проходит граница?
Мы утверждаем, что инструмент предназначен для первых разговоров, а не для официальных процедур. Эту границу следует проверять по тому, что действительно происходит в службах, а не защищать потому, что мы её однажды записали.
Как оценивается работа
Система порождает доказательную базу как побочный продукт своей работы: в каждой реплике сохраняются исходный текст, перевод, оценка точности, любая правка и любой уточняющий вопрос. Благодаря этому измеримыми становятся сразу несколько вещей, и никаких дополнительных измерительных средств для этого не нужно.
- Как часто перевод правится до выдачи и насколько при этом меняется оценка.
- Как часто посредник спрашивает вместо того, чтобы отвечать, и что происходит в разговоре дальше.
- Как распределяются оценки по языкам, чтобы неравномерность охвата была видна, а не растворялась в среднем значении.
- Где сотрудники вмешивались вручную, повторяли сказанное или прерывали обмен репликами.
Чего эти измерения нам не скажут, так это был ли разговор хорошим. Для этого нужна сама служба и, там, где это можно сделать корректно, человек по другую сторону разговора.
Как мы себя этому подчиняем
Испытания до боевой работы. Новое поведение прогоняется на записанных и синтетических разговорах, прежде чем попадёт в чей-то настоящий.
Измеряем то, что действительно измерено. Никаких броских цифр точности вместо распределения, которое мы можем показать.
Публикуем методику. То, что мы узнаём о безопасном применении, описывается так, чтобы этим могли воспользоваться другие, включая то, что не сработало.
Отрицательные результаты тоже считаются. Функция, из-за которой разговоры стали хуже, это результат, и о нём сообщается как о результате.
Что построено и работает
Это работающее приложение, а не демонстрация. В общих чертах сейчас в нём есть:
Живое посредничество реплика за репликой
Потоковый перевод, при котором в каждой реплике учитываются история разговора, структурированные факты и предметный контекст.
Оценка точности и самопроверка
Оценки для каждой реплики, правка до выдачи при результате ниже порога и уточняющий вопрос говорящему, если исходная фраза допускает разные толкования.
Два варианта интерфейса разговора
Режим общего экрана и парный режим, в котором второй участник подключается со своего устройства по живому соединению.
Локализованный интерфейс
Строки интерфейса переведены на подготовленные языки и кэшируются, поэтому сама оболочка не является англоязычной.
Учётные записи, группы и аудит
Группировка и права на уровне организации, вход по ключу доступа и по паролю с двухфакторными кодами, а также журнал аудита по разговорам и администрированию.
Воспроизводимые разговоры
Записанные обмены репликами можно заново прогнать на новой сборке, поэтому изменение проверяется на настоящем диалоге, а не на чём-то придуманном для демонстрации.
Обычный веб-стек
Приложение на PHP и MariaDB, работающее по HTTPS. Намеренно без экзотики, чтобы его можно было разобрать, проверить и при необходимости разместить не там, где оно находится сегодня.
Работайте над этим вместе с нами
Мы ищем аспирантов и исследовательские лаборатории со своим вопросом в этой области, службы, готовые дать изучить их практику, и тех, кто финансирует доказательную работу по преодолению языка как барьера на пути к помощи.