Évaluateurs IA
Les évaluations IA sont des contrôles qualité automatisés qui analysent les traductions produites par votre moteur de localisation. Après chaque requête de traduction, Lingo.dev lance des évaluations LLM indépendantes pour vérifier le résultat — conformité au glossaire, respect des règles et tout critère personnalisé que vous définissez. Ces évaluations s’exécutent de façon asynchrone et ne bloquent jamais la réponse de traduction.
Dans le tableau de bord, les évaluateurs IA sont appelés measurements. Ils se trouvent dans Observability → Measurements (AI Reviews). Les deux termes désignent la même chose.
Fonctionnement#
Lorsque le moteur de localisation termine une requête de traduction, il met en file d’attente les évaluations applicables pour un traitement asynchrone. Chaque évaluation s’appuie sur un LLM indépendant qui reçoit le texte source, la traduction produite, le contexte et les critères d’évaluation. Elle renvoie un résultat structuré — réussite/échec ou score en pourcentage — accompagné d’une justification pour les résultats imparfaits.
Il existe trois types de relecture, qui s'activent à différents endroits :
| Type | Ce qui est vérifié | Type de résultat | Où l'activer |
|---|---|---|---|
| Respect du glossaire | Si les traductions respectent les termes du glossaire appliqués par le moteur | Réussite / Échec | Intégré. Un interrupteur par moteur, dans Automatic review de l'onglet Évaluateurs du moteur |
| Respect des règles | Si les traductions respectent chacune des règles appliquées par le moteur | Réussite/échec pour chaque règle | Intégré. Un interrupteur par moteur, dans Automatic review de l'onglet Évaluateurs du moteur |
| Measurements personnalisées | Vos propres critères d’évaluation, définis au niveau de l’organisation | Réussite ou échec, ou de 0 à 100 | Directement sur la measurement, dans Where it runs |
Évaluations IA intégrées#
Chaque moteur de localisation inclut deux types de relecture intégrés qui vérifient les traductions par rapport à la configuration appliquée par le moteur : Respect du glossaire et Respect des règles. Sur la page Measurements, ils apparaissent dans System managed. Vous pouvez les activer ou les désactiver par moteur dans l'onglet Évaluateurs du moteur, ou en ouvrir un depuis la page Measurements pour obtenir un interrupteur pour chaque moteur. Il n'existe pas de réglage permettant d'activer un type intégré sur tous les moteurs en une seule fois.
Respect du glossaire #
Vérifie si la traduction respecte tous les termes du glossaire applicables. Si le moteur applique des traductions personnalisées (par ex. "Deploy" → "Bereitstellen") ou des termes non traduisibles (par ex. "OAuth"), l’évaluation vérifie que la traduction les a bien respectés.
L’évaluation tient compte des variations grammaticales — un terme du glossaire dans un cas grammatical donné s’applique à toutes les formes de ce terme. En présence de termes de glossaire contradictoires, la traduction est considérée comme conforme dès lors qu’au moins l’un d’eux a été respecté.
Le résultat prend la forme d’un verdict unique de réussite/échec pour l’ensemble de la requête de traduction, avec une justification en cas d’échec.
Respect des règles #
Évalue chaque règle indépendamment. Si le moteur applique trois règles, l’évaluation produit trois verdicts réussite/échec distincts — chacun accompagné de sa propre explication en cas d’échec.
Les règles s’appelaient auparavant instructions
Le tableau de bord, le bouton bascule de l’onglet Reviewers et le rapport Rule adherence les désignent tous comme des règles. L’API REST expose toujours une règle individuelle à l’adresse /instructions.
Une règle peut renvoyer N/A lorsque ses critères ne s’appliquent pas au contenu traduit. Par exemple, une règle sur le vouvoiement renvoie N/A lorsque la traduction contient uniquement un nom de produit ou un terme technique pour lequel le niveau de formalité n’est pas pertinent. Les résultats N/A sont exclus des scores agrégés.
Les deux relectures intégrées ne se déclenchent que lorsque le moteur dispose d'une configuration pertinente. Par exemple, si aucun terme du glossaire ne correspond à la paire de langues, aucune relecture de respect du glossaire n'est exécutée.
Configurer les évaluations par moteur#
L'onglet Évaluateurs du moteur comporte deux sections :
Automatic review regroupe les interrupteurs des deux types intégrés, Respect du glossaire et Respect des règles. Ils sont indépendants : vous pouvez activer l'un sans l'autre, selon ce qui est configuré dans le moteur.
Suggestions regroupe les interrupteurs de Suggestions du moteur, qui s'appuient sur des scores faibles au lieu de les produire.
Les measurements personnalisées ne s'activent pas dans cet onglet. Vous rattachez une measurement à des moteurs depuis la measurement elle-même : dans Where it runs, activez soit Run on every engine — ce qui inclut les moteurs créés par la suite — soit sélectionnez les moteurs manuellement. Cela vous permet de maintenir une bibliothèque partagée de contrôles qualité et de les appliquer de façon sélective.
Un même moteur peut exécuter simultanément des relectures intégrées et plusieurs measurements personnalisées. Toutes les relectures s'exécutent de manière asynchrone après chaque requête de traduction, et les résultats apparaissent dans Observability → Events, dans l'onglet Events de chaque measurement, ainsi que dans Reports.
Types d’évaluateurs IA#
Évaluateurs IA booléens#
Renvoyez un verdict binaire : pass ou fail. Dans le formulaire, cela correspond à Pass or fail sous What it answers. Utilisez ce format pour les règles qui sont soit respectées, soit non respectées.
Exemples :
- "La traduction préserve-t-elle toutes les balises et attributs HTML ?"
- "Les règles de pluriel sont-elles correctement appliquées pour la langue cible ?"
- "La traduction utilise-t-elle le vouvoiement (Sie) en allemand ?"
Les résultats sont agrégés sous forme de taux de réussite — 75 % signifie que 3 traductions évaluées sur 4 ont réussi.
Évaluateurs IA en pourcentage#
Renvoyez un score de 0 à 100. Dans le formulaire, cela correspond à 0 to 100 sous What it answers. Utilisez ce format pour les dimensions de qualité qui se situent sur un continuum.
Exemples :
- "Évaluez le naturel de la traduction pour un locuteur natif (0–100)"
- "Notez dans quelle mesure la traduction préserve le ton et l’intention d’origine (0–100)"
- "Évaluez la correction grammaticale sur une échelle de 0 à 100"
Les résultats sont agrégés sous forme de moyennes sur la période d’évaluation.
Configuration de l’évaluateur IA#
Créez-en une avec New measurement sur la page Measurements. Le formulaire demande :
| Champ | Description |
|---|---|
| Nom | Un libellé permettant d'identifier la measurement (par ex. "Vérification de la pluralisation") |
| Résumé | Facultatif. Une ligne expliquant à quoi elle sert, pour les personnes qui ne l'ont pas rédigée |
| Quelles traductions elle lit | Translated from et Translated into — les langues source et cible à faire correspondre, ou Any locale pour l'une ou l'autre |
| Ce à quoi elle répond | Pass or fail ou 0 to 100. Les scores passés conservent le format dans lequel ils ont été enregistrés |
| Instruction | Les critères d’évaluation, rédigés en langage naturel |
| Où elle s'exécute | Run on every engine, ou les moteurs que vous sélectionnez. Une measurement qui n'est rattachée à aucun moteur ne s'exécute jamais |
| Abstention | Let it answer N/A — indique si la measurement peut renvoyer "not applicable" pour des paires non pertinentes. Activé par défaut |
Le formulaire ne contient aucun champ pour le fournisseur, le modèle, l'échantillonnage ou l'activation. Une measurement s'exécute partout où elle est rattachée ; pour l'arrêter, détachez-la de ses moteurs ou supprimez-la. Dans l'API, les champs sont name, description, sourceLocale, targetLocale, type (boolean ou percentage), instruction et allowsNA, ainsi que le champ facultatif sampling décrit ci-dessous.
Rédiger les instructions d’un évaluateur IA#
Le champ d’instruction est au cœur d’un évaluateur IA. Il indique précisément au LLM d’évaluation ce qu’il doit vérifier. Rédigez-le comme un critère spécifique et testable.
Bonnes instructions#
Booléen :
Check whether all HTML tags in the source text are preserved
exactly in the translation. Tags must not be added, removed,
modified, or reordered. Pass if all tags are preserved, fail
if any tag is missing or altered.Pourcentage :
Rate the fluency of the translation on a scale of 0-100.
100 means a native speaker would find it completely natural.
0 means it reads like machine output. Deduct points for
awkward phrasing, unnatural word order, or overly literal
constructions.Ce qui fait une bonne instruction#
- Critères spécifiques — définissez précisément ce que signifient réussite/échec, ou ce que représentent 0 et 100
- Résultats observables — le LLM doit pouvoir évaluer en lisant le texte, sans devoir deviner l’intention
- Une seule dimension par évaluateur IA — scindez les contrôles qualité multidimensionnels en plusieurs évaluateurs IA distincts
Correspondance des langues#
Les évaluateurs IA font correspondre les requêtes de traduction selon la langue source et la langue cible. Le joker * correspond à n'importe quelle langue : dans le formulaire, c'est Any locale.
| Langue source | Langue cible | Correspond à |
|---|---|---|
en | de | Uniquement les traductions anglais → allemand |
en | * | Toute traduction depuis l’anglais |
* | ja | Toute traduction vers le japonais |
* | * | Toutes les traductions |
Une seule requête de traduction peut déclencher plusieurs évaluateurs IA si plusieurs correspondent à sa paire de langues.
Échantillonnage#
Toutes les traductions n'ont pas besoin d'être évaluées. Le tableau de bord ne propose pas de réglage d'échantillonnage : une measurement créée ici évalue chaque requête correspondante. Via l'API ou le serveur MCP, vous pouvez définir sampling : la fraction des requêtes correspondantes à évaluer, de 0 (aucune) à 1 (toutes).
sampling | Comportement |
|---|---|
| 1 | Chaque requête correspondante est évaluée (par défaut ; plus complet, mais plus coûteux) |
| 0.5 | Environ la moitié des requêtes correspondantes sont évaluées |
| 0.1 | Une sur dix — utile pour les moteurs à fort volume, où les tendances comptent davantage que les scores individuels |
| 0 | La measurement est effectivement mise en pause sans être détachée |
L'échantillonnage est appliqué au moment de la requête au moyen d'une vérification aléatoire. Avec un volume de requêtes suffisant, le taux réel d'évaluation converge vers la fraction configurée.
Prise en charge de N/A#
Lorsque Let it answer N/A est activé (allowsNA dans l'API), le LLM de relecture peut renvoyer "not applicable" au lieu d'un score. C'est utile pour les évaluateurs IA dont les critères ne s'appliquent pas à toutes les paires de langues.
Exemple : un évaluateur IA qui vérifie les conventions de vouvoiement renvoie N/A pour les traductions anglais → anglais (l’anglais ne fait pas la distinction entre registre formel et informel), mais renvoie un score pour anglais → allemand.
Les résultats N/A sont exclus des moyennes et des taux de réussite dans les rapports — ils ne font ni baisser les scores ni les gonfler artificiellement.
Justification#
Les évaluateurs IA fournissent une justification pour les résultats imparfaits afin de vous aider à comprendre ce qui n’a pas fonctionné :
- Score parfait (réussite ou 100 %) — la justification est nulle (rien à expliquer)
- N/A — la justification est nulle
- Score imparfait — une brève explication en une phrase
Les résultats restent ainsi exploitables : lorsqu’une traduction échoue à une vérification, la justification vous indique pourquoi, sans investigation manuelle.
Modèle d’évaluation#
Vous ne choisissez pas le modèle d'évaluation. Une nouvelle measurement est évaluée par un modèle défini par la plateforme, configuré séparément des modèles avec lesquels le moteur traduit. Le formulaire ne comporte aucun champ pour le fournisseur ni pour le modèle.
Rapports des évaluateurs IA#
Les résultats de relecture sont présentés dans Observability → Reports, dans le groupe What the AI gets wrong :
- Average scores — la moyenne quotidienne de tous les scores enregistrés par chaque measurement. Filtrez par période, moteur et langue, puis basculez entre les vues Aggregated et Breakdown.
- Respect des règles — les résultats de respect des règles, en part des exécutions.
La même page regroupe aussi les rapports de volume dans Where time goes — voir Reports. Ensemble, ils vous donnent une vision complète du débit comme de la qualité.
Gérer les évaluateurs IA via MCP#
Si vous utilisez le serveur MCP Lingo.dev, votre assistant IA de développement peut créer et configurer directement des évaluateurs IA :
"Create a boolean AI reviewer for all locale pairs that checks
whether HTML tags are preserved in translations.""Add a percentage AI reviewer for English to German that rates
translation fluency on a 0-100 scale, sampling 50% of requests."