Робочий продукт із безперервними дослідженнями та розробкою
My Words існує через складнішу проблему, ніж переклад одного речення: утримати розмову цілісною через мовний барʼєр тоді, коли на кону чиєсь житло, безпека чи здоровʼя, і зробити це так, щоб чесно говорити про власну непевність. Ця проблема не розвʼязана, тож дослідження не припинилися з випуском продукту.
Звідки це походить
Робота почалася як Project Keystone, дослідження компанії INT6 Ltd щодо опосередкування двомовної розмови в реальному часі за допомогою мовних моделей. INT6 створила застосунок-прототип Turnstone, який згодом розвинули до робочої системи й перевірили в реальних умовах.
Відтоді застосунок передано до C2 Discovery Labs CIC, щоб він належав громаді та суспільству. My Words є тією самою перевіреною системою під новим брендом, і розробка триває вже в її межах.
Академічна валідація
Незалежну валідацію готуємо разом з університетом-партнером у Великій Британії. Задум полягає в тому, щоб працювати з аспірантами та академічними дослідницькими лабораторіями одразу над двома завданнями: покращувати продукт і перевіряти, чи робить він те, про що говорить цей сайт.
Ця робота не завершена, і ніщо на цьому сайті від неї не залежить. Коли зʼявляться результати, зокрема й ті, що будуть не на нашу користь, ми опублікуємо їх тут разом з методикою. До того часу сприймайте твердження на цьому сайті як наші власні, а не як незалежно перевірені.
Що саме проєкт намагається зʼясувати
Це питання, навколо яких вибудувана робота і які ми хоч завтра поставили б перед дослідницьким партнером. Жодне з них не закрите.
Чи може машина утримувати контекст так, як це робить перекладач?
Людина-перекладач без нагадувань тримає в голові ситуацію, історію розмови та регістр. Наскільки це можна виразити як структурований контекст і що втрачається під час такого вираження?
Чи може система з користю розпізнавати власні помилки?
Оцінювання точності означає, що одна модель судить іншу. Де це корелює зі справжньою помилкою, а де хибить у тому самому напрямку, що й те, що перевіряється?
Уточнювальне запитання допомагає чи перебиває?
У принципі, запитати краще, ніж угадувати. Але коли перед вами людина у стресі, скільки разів можна перебити, перш ніж зруйнувати те, що ви намагалися зберегти?
Як показувати непевність зайнятому фахівцеві?
Позначка, яку ігнорують, не краща за її відсутність. Позначка, яка зупиняє розмову на кожній репліці, ще гірша. Це питання дослідження інтерфейсу не меншою мірою, ніж моделювання.
Що змінюється, коли пристрій у руках самої людини?
Читати у власних руках і власною мовою це інша дія, ніж читати через стіл. Чи змінює це те, чим люди готові поділитися, є питанням для вимірювання, а ми його ще не виміряли.
Де насправді проходить межа?
Ми стверджуємо, що це для перших розмов, а не для формальних процедур. Цю межу слід перевіряти тим, що насправді відбувається у службах, а не обстоювати лише тому, що ми її записали.
Як оцінюється робота
Система створює власні свідчення як побічний продукт роботи: кожна репліка має оригінал, переклад, оцінку точності, будь-яку правку та будь-яке уточнювальне запитання. Це робить низку речей вимірюваними без жодних додаткових інструментів.
- Як часто переклад правиться перед показом і наскільки змінюється оцінка.
- Як часто посередник запитує замість того, щоб відповідати, і що відбувається в розмові далі.
- Як оцінки розподіляються за мовами, щоб нерівномірне покриття було видно, а не розчинялося в середньому значенні.
- Де працівники втручалися, повторювалися або припиняли обмін.
Чого ці дані не скажуть, так це чи була розмова доброю. Для цього потрібна сама служба і, там де це можна зробити належно, людина з іншого боку розмови.
Як ми себе цього тримаємо
Перевірка до запуску. Нова поведінка випробовується на записаних і синтетичних розмовах, перш ніж потрапити в чиюсь справжню.
Вимірювати те, що виміряно. Жодних гучних цифр точності замість розподілу, який ми справді можемо показати.
Публікувати методику. Те, що ми дізнаємося про безпечне виконання цієї роботи, ми описуємо, щоб інші могли цим скористатися, зокрема й ті частини, які не спрацювали.
Негативні результати мають значення. Функція, яка погіршила розмови, є результатом дослідження, і ми повідомляємо про неї саме так.
Що вже створено і працює
Це робочий застосунок, а не демонстрація. Загалом він наразі має:
Живе опосередкування репліка за реплікою
Потоковий переклад, у якому для кожної репліки враховується історія розмови, структуровані факти та контекст предметної галузі.
Оцінювання точності та самоправка
Оцінки для кожної репліки, правка перед показом, якщо оцінка нижча за поріг, і уточнювальне запитання до мовця, якщо оригінал неоднозначний.
Два формати розмови
Режим спільного екрана та парний режим, у якому друга людина приєднується зі свого пристрою через живе зʼєднання.
Локалізований інтерфейс
Рядки інтерфейсу перекладено доступними мовами та закешовано, тож сама поверхня застосунку не є лише англомовною.
Облікові записи, групи та аудит
Групування та права доступу на рівні організації, автентифікація за допомогою ключів доступу й паролів із двофакторними кодами, а також журнал аудиту для розмов і адміністрування.
Розмови з можливістю відтворення
Записані обміни можна відтворити на новій збірці, тож зміна перевіряється на справжньому діалозі, а не на чомусь імпровізованому для демонстрації.
Звичайний вебстек
Застосунок на PHP і MariaDB, який працює через HTTPS. Свідомо неекзотичний, щоб його можна було зрозуміти, перевірити та розмістити не там, де він розміщений сьогодні, якщо це виявиться правильним рішенням.
Працюйте над цим разом з нами
Ми шукаємо аспірантів і дослідницькі лабораторії, які мають запитання в цій царині, служби, готові до вивчення їхнього досвіду використання, і донорів, які підтримують доказову роботу над мовою як перешкодою в отриманні допомоги.