Ce que cet outil fait mal
Chaque page produit de ce site décrit quelque chose qui fonctionne. Celle-ci fait l'inverse, parce qu'un service qui décide d'utiliser ou non cet outil a besoin des deux.
Ce que la vérification ne vous donne pas
Le produit part du principe qu'il se trompera parfois, et la tâche qui en découle est de vous montrer quand. Être clair sur ce que le score vous apporte suppose d'être tout aussi clair sur ses limites.
- Un score n'est pas une garantie. Il décrit la vérification réellement effectuée sur ce tour de parole, et rien de ce qui se passe au-delà.
- L'évaluateur est un modèle de langage, tout comme le traducteur. Il donne l'avis d'un modèle sur le travail d'un autre modèle, et il peut se tromper dans le même sens que la traduction qu'il note.
- Un score élevé sur un tour de parole ne rend pas la conversation adaptée à l'outil. Ce jugement vous revient, et la liste des conversations qui restent toujours hors périmètre, sur la page garde-fous, en est le point de départ.
- Lorsqu'un élément concernant la personne a été déduit de la conversation plutôt que renseigné dans le système, il est visible par l'intervenant et peut être corrigé. La tranche d'âge et le genre changent la façon dont une traduction désigne quelqu'un : une supposition laissée sans correction est une erreur qui se répercute sur tous les tours suivants.
Limites connues
- La couverture linguistique est inégale. La qualité n'est pas la même d'une langue disponible à l'autre, et les langues qui disposent du moins de données d'entraînement sont souvent celles dont un service de terrain a le plus besoin.
- Le dialecte et le registre varient. Une variante régionale peut être moins bien traitée que la forme standard de la même langue.
- C'est de l'écrit, pas de l'oral. Aujourd'hui, les deux personnes écrivent. Cela convient à un bureau et à un téléphone ; c'est plus lent que de parler, et cela suppose que les deux personnes savent lire et écrire leur propre langue. La parole en entrée et en sortie est en cours de construction et apportera ses propres limites.
- Le score est lui-même une sortie de modèle. Un score de fidélité est l'avis d'un modèle sur le travail d'un autre modèle. Il peut se tromper dans le même sens que la traduction qu'il note.
- Le produit est en développement actif. Le comportement change d'une version à l'autre. C'est ainsi que le produit s'améliore, et cela signifie qu'une vérification faite il y a six mois n'est pas une vérification faite aujourd'hui.
Données
Le contenu des conversations doit être envoyé à un modèle de langage hébergé pour être traduit, et il est stocké afin que l'échange puisse être relu et audité. Pour un service qui recueille des informations sensibles, cela compte : c'est donc écrit noir sur blanc dans la politique de confidentialité.
Si une organisation a des contraintes auxquelles cela ne répond pas, dites-le tôt. Les options de déploiement sont une question ouverte sur laquelle nous travaillons, et nous préférons entendre la contrainte plutôt que la contester.
Cette page décrit les limites actuelles du produit. Si vous estimez qu'un point y est inexact, ou si vous avez rencontré une limite qui n'y figure pas, dites-le-nous. C'est plus utile au projet qu'un compliment.
Ne jamais affirmer plus que ce qui a été mesuré
Tout ce qui figure sur l'écran de l'intervenant est soit une action du système, soit une mesure qu'il a effectuée. Une vérification qui n'a pas eu lieu est représentée comme absente. Un score est rattaché au tour de parole qu'il a noté. Rien n'est lissé en une impression générale de fiabilité, car toute la conception vise à ce que la personne qui l'utilise puisse faire la différence.