KI-Bewerter

Zuletzt aktualisiert: vor 4 Tagen · 8 Min. Lesezeit

KI-Bewertungen sind automatisierte Qualitätsprüfungen für Übersetzungen, die von deiner Lokalisierungs-Engine erstellt werden. Nach jeder Übersetzungsanfrage führt Lingo.dev unabhängige LLM-Auswertungen durch, um die Ausgabe zu prüfen — auf Glossarkonformität, Regeleinhaltung und alle benutzerdefinierten Kriterien, die du festlegst. Die Bewertungen laufen asynchron und blockieren die Übersetzungsantwort nie.

Im Dashboard heißen KI-Bewerter Measurements. Sie finden Sie unter Observierbarkeit → Measurements (AI Reviews). Beide Bezeichnungen meinen dasselbe.

So funktioniert's#

Sobald die Lokalisierungs-Engine eine Übersetzungsanfrage abgeschlossen hat, stellt sie die passenden Bewertungen zur asynchronen Auswertung in die Warteschlange. Jede Bewertung nutzt ein unabhängiges LLM, das den Ausgangstext, die übersetzte Ausgabe, den Kontext und die Bewertungskriterien erhält. Es liefert ein strukturiertes Ergebnis zurück – Bestanden/Nicht bestanden oder einen Prozentwert – inklusive Begründung bei nicht perfekten Ergebnissen.

Es gibt drei Arten von Prüfung, und sie werden an unterschiedlichen Stellen aktiviert:

ArtWas geprüft wirdErgebnistypWo Sie sie aktivieren
GlossareinhaltungOb Übersetzungen die von der Engine angewendeten Glossar-Begriffe einhaltenBestanden / Nicht bestandenIntegriert. Ein Schalter pro Engine unter Automatic review im Tab Reviewers der Engine
RegeleinhaltungOb Übersetzungen jede von der Engine angewendete Regel einhaltenBestanden / Nicht bestanden pro RegelIntegriert. Ein Schalter pro Engine unter Automatic review im Tab Reviewers der Engine
Benutzerdefinierte MeasurementsIhre eigenen Bewertungskriterien, auf Organisationsebene definiertBestanden oder nicht bestanden oder 0 bis 100Direkt in der Measurement selbst unter Where it runs

Integrierte KI-Bewertungen#

Jede Lokalisierungs-Engine umfasst zwei integrierte Prüfungstypen, die Übersetzungen anhand der Konfiguration überprüfen, die die Engine anwendet: Glossareinhaltung und Regeleinhaltung. Auf der Seite „Measurements“ sind sie unter System managed aufgeführt. Sie können sie pro Engine im Tab Reviewers der jeweiligen Engine ein- oder ausschalten oder eine davon auf der Seite „Measurements“ öffnen, um einen Schalter für jede Engine zu erhalten. Es gibt keine Einstellung, mit der sich eine integrierte Prüfung für alle Engines gleichzeitig aktivieren lässt.

Glossareinhaltung #

Prüft, ob die Übersetzung alle zutreffenden Glossarbegriffe eingehalten hat. Wenn die Engine benutzerdefinierte Übersetzungen (z. B. "Deploy" → "Bereitstellen") oder nicht übersetzbare Begriffe (z. B. "OAuth") anwendet, prüft die Bewertung, ob die Übersetzung diese Vorgaben berücksichtigt hat.

Die Prüfung berücksichtigt grammatische Varianten — ein Glossarbegriff in einem bestimmten grammatischen Fall gilt für alle Formen dieses Begriffs. Wenn widersprüchliche Glossarbegriffe vorhanden sind, gilt die Übersetzung als konform, solange einer davon eingehalten wurde.

Das Ergebnis ist ein einzelnes Bestanden/Nicht bestanden-Ergebnis für die gesamte Übersetzungsanfrage, mit Begründung, wenn das Ergebnis Nicht bestanden ist.

Regeleinhaltung #

Bewertet jede Regel unabhängig. Wenn die Engine drei Regeln anwendet, liefert die Prüfung drei separate Bestanden-/Nicht-bestanden-Urteile — jeweils mit eigener Begründung, wenn das Ergebnis „Nicht bestanden“ lautet.

Regeln hießen früher Anweisungen

Im Dashboard, im Umschalter des Tabs Prüfer und im Bericht Regelkonformität werden sie alle als Regeln bezeichnet. Die REST API stellt eine einzelne Regel weiterhin unter /instructions bereit.

Eine Regel kann N/A zurückgeben, wenn ihre Kriterien auf den zu übersetzenden Inhalt nicht zutreffen. Zum Beispiel gibt eine Regel zur formellen Anrede N/A zurück, wenn die Übersetzung nur einen Produktnamen oder einen Fachbegriff enthält, bei dem Formalität keine Rolle spielt. N/A-Ergebnisse werden aus aggregierten Bewertungen ausgeschlossen.

Beide integrierten Prüfungen werden nur ausgelöst, wenn die Engine über eine passende Konfiguration verfügt – wenn keine Glossarbegriffe zum Sprachpaar passen, wird keine Prüfung der Glossareinhaltung ausgeführt.

Bewertungen pro Engine konfigurieren#

Der Tab Reviewers der Engine hat zwei Abschnitte:

Automatic review enthält die Schalter für die beiden integrierten Funktionen Glossareinhaltung und Regeleinhaltung. Sie arbeiten unabhängig voneinander – Sie können die eine ohne die andere aktivieren, je nachdem, was für die Engine konfiguriert ist.

Suggestions enthält die Schalter für Engine Suggestions, die auf niedrige Scores reagieren, statt sie zu erzeugen.

Benutzerdefinierte Measurements werden in diesem Tab nicht aktiviert. Sie fügen eine Measurement von der Measurement selbst zu Engines hinzu: unter Where it runs entweder Run on every engine aktivieren – das schließt auch später erstellte Engines ein – oder die Engines manuell auswählen. So können Sie eine gemeinsame Bibliothek von Qualitätsprüfungen pflegen und gezielt einsetzen.

Eine einzelne Engine kann gleichzeitig sowohl integrierte Prüfungen als auch mehrere benutzerdefinierte Measurements ausführen. Alle Prüfungen laufen asynchron nach jeder Übersetzungsanfrage, und die Ergebnisse erscheinen unter Observierbarkeit → Events, im Tab Events jeder Measurement und in Reports.

Arten von KI-Bewertern#

Boolesche KI-Bewerter#

Gibt ein binäres Urteil zurück: bestanden oder nicht bestanden. Im Formular ist das Pass or fail unter What it answers. Verwenden Sie das für Regeln, die entweder erfüllt sind oder nicht.

Beispiele:

  • "Bewahrt die Übersetzung alle HTML-Tags und Attribute?"
  • "Werden die Pluralisierungsregeln für die Zielsprache korrekt angewendet?"
  • "Verwendet die Übersetzung im Deutschen die formelle Anrede (Sie)?"

Die Ergebnisse werden als Erfolgsquote aggregiert – 75 % bedeutet, dass 3 von 4 bewerteten Übersetzungen bestanden haben.

Prozentuale KI-Bewerter#

Gibt einen Score von 0 bis 100 zurück. Im Formular ist das 0 to 100 unter What it answers. Verwenden Sie das für Qualitätsdimensionen, die auf einem Spektrum liegen.

Beispiele:

  • "Bewerte die Natürlichkeit der Übersetzung aus Sicht eines Muttersprachlers (0–100)"
  • "Bewerte, wie gut die Übersetzung den ursprünglichen Ton und die ursprüngliche Absicht bewahrt (0–100)"
  • "Bewerte die grammatische Korrektheit auf einer Skala von 0–100"

Die Ergebnisse werden als Durchschnittswerte über den Bewertungszeitraum aggregiert.

Konfiguration von KI-Bewertern#

Erstellen Sie eine mit New measurement auf der Seite „Measurements“. Im Formular werden folgende Angaben abgefragt:

FeldBeschreibung
NameEine Bezeichnung zur Identifizierung der Measurement (z. B. „Pluralisierungs-Check“)
ZusammenfassungOptional. Eine Zeile dazu, wofür sie gedacht ist, für Personen, die sie nicht selbst erstellt haben
Welche Übersetzungen sie liestTranslated from und Translated into – die passende Ausgangs- und Zielsprache oder bei beiden Any locale
Was sie beantwortetPass or fail oder 0 to 100. Frühere Scores behalten die Form, in der sie geschrieben wurden
AnweisungDie Bewertungskriterien, in natürlicher Sprache formuliert
Wo sie läuftRun on every engine oder die Engines, die Sie auswählen. Eine Measurement, die keiner Engine hinzugefügt ist, läuft nie
EnthaltungLet it answer N/A – ob die Measurement für irrelevante Paare „nicht zutreffend“ zurückgeben kann. Standardmäßig aktiviert

Im Formular gibt es kein Feld für Anbieter, Modell, Sampling oder Ein/Aus. Eine Measurement läuft überall dort, wo sie hinzugefügt wurde; um sie zu stoppen, entfernen Sie sie von ihren Engines oder löschen Sie sie. In der API sind die Felder name, description, sourceLocale, targetLocale, type (boolean oder percentage), instruction und allowsNA sowie das optionale sampling, das unten beschrieben wird.

Anweisungen für KI-Bewerter schreiben#

Das Feld für die Anweisung ist das Herzstück eines KI-Bewerters. Es sagt dem bewertenden LLM genau, worauf es achten soll. Formulieren Sie es als spezifisches, testbares Kriterium.

Gute Anweisungen#

Boolesch:

text
Check whether all HTML tags in the source text are preserved
exactly in the translation. Tags must not be added, removed,
modified, or reordered. Pass if all tags are preserved, fail
if any tag is missing or altered.

Prozentual:

text
Rate the fluency of the translation on a scale of 0-100.
100 means a native speaker would find it completely natural.
0 means it reads like machine output. Deduct points for
awkward phrasing, unnatural word order, or overly literal
constructions.

Was eine gute Anweisung ausmacht#

  • Spezifische Kriterien – definieren Sie genau, was Bestanden/Nicht bestanden bedeutet oder wofür 0 und 100 stehen
  • Beobachtbare Ergebnisse – das LLM sollte den Text anhand dessen bewerten können, was tatsächlich darin steht, statt die Absicht zu erraten
  • Ein Aspekt pro KI-Bewerter – teilen Sie mehrdimensionale Qualitätsprüfungen in separate KI-Bewerter auf

Abgleich nach Sprache#

KI-Bewerter gleichen Übersetzungsanfragen anhand von Ausgangs- und Zielsprache ab. Das Platzhalterzeichen * passt zu jeder Sprache – im Formular heißt das Any locale.

AusgangsspracheZielspracheTrifft zu auf
endeNur Übersetzungen Englisch → Deutsch
en*Jede Übersetzung aus dem Englischen
*jaJede Übersetzung ins Japanische
**Alle Übersetzungen

Eine einzelne Übersetzungsanfrage kann mehrere KI-Bewerter auslösen, wenn mehrere auf ihr Sprachpaar passen.

Sampling#

Nicht jede Übersetzung muss einer Prüfung unterzogen werden. Das Dashboard hat keine Sampling-Einstellung – eine dort erstellte Measurement führt bei jeder passenden Anfrage eine Prüfung durch. Über die API oder den MCP server können Sie sampling festlegen: den Anteil passender Anfragen, die ausgewertet werden sollen, von 0 (keine) bis 1 (alle).

samplingVerhalten
1Jede passende Anfrage wird einer Prüfung unterzogen (Standard; gründlich, aber mit höheren Kosten)
0.5Ungefähr die Hälfte der passenden Anfragen wird bewertet
0.1Eine von zehn – nützlich für Engines mit hohem Volumen, bei denen Trends wichtiger sind als einzelne Bewertungen
0Die Measurement ist faktisch pausiert, ohne sie zu entfernen

Sampling wird zum Zeitpunkt der Anfrage per Zufallsprüfung angewendet. Bei ausreichend vielen Anfragen nähert sich die tatsächliche Auswertungsrate dem konfigurierten Anteil an.

N/A-Unterstützung#

Wenn Let it answer N/A aktiviert ist (allowsNA in der API), kann das Prüfungs-LLM statt eines Scores „nicht zutreffend“ zurückgeben. Das ist nützlich für KI-Bewerter, deren Kriterien nicht auf jedes Sprachpaar anwendbar sind.

Beispiel: Ein KI-Bewerter, der die Konventionen formeller Anrede prüft, gibt für Englisch → Englisch N/A zurück (im Englischen gibt es keine formell/informell-Unterscheidung), liefert aber einen Wert für Englisch → Deutsch.

N/A-Ergebnisse werden in Berichten aus Durchschnittswerten und Erfolgsquoten ausgeschlossen – sie drücken die Werte nicht nach unten und blähen sie auch nicht künstlich auf.

Begründung#

KI-Bewerter liefern bei nicht perfekten Ergebnissen eine Begründung, damit Sie nachvollziehen können, was schiefgelaufen ist:

  • Perfektes Ergebnis (bestanden oder 100 %) – Begründung ist null (nichts zu erklären)
  • N/A – Begründung ist null
  • Nicht perfektes Ergebnis – eine kurze Erklärung in einem Satz

So bleiben die Bewertungsergebnisse direkt nutzbar: Wenn eine Übersetzung eine Prüfung nicht besteht, erfahren Sie durch die Begründung warum – ganz ohne manuelle Nachforschung.

Bewertungsmodell#

Sie wählen das Auswertungsmodell nicht selbst aus. Eine neue Measurement wird von einem Modell bewertet, das die Plattform festlegt und das getrennt von den Modellen konfiguriert ist, mit denen die Engine übersetzt. Im Formular gibt es kein Feld für Anbieter oder Modell.

Berichte zu KI-Bewertern#

Prüfungsergebnisse werden unter Observierbarkeit → Reports in der Gruppe What the AI gets wrong dargestellt:

  • Average scores – der tägliche Durchschnitt aller Scores, die jede Measurement geschrieben hat. Filtern Sie nach Zeitraum, Engine und Sprache und wechseln Sie zwischen den Ansichten Aggregated und Breakdown
  • Regeleinhaltung – die Ergebnisse der Regeleinhaltung als Anteil der Durchläufe

Auf derselben Seite finden Sie auch die Volumenberichte unter Where time goes – siehe Reports. Zusammen ergeben sie ein vollständiges Bild von Durchsatz und Qualität.

KI-Bewerter über MCP verwalten#

Wenn Sie den Lingo.dev MCP server verwenden, kann Ihr KI-Coding-Assistent KI-Bewerter direkt erstellen und konfigurieren:

text
"Create a boolean AI reviewer for all locale pairs that checks
whether HTML tags are preserved in translations."
text
"Add a percentage AI reviewer for English to German that rates
translation fluency on a 0-100 scale, sampling 50% of requests."

Nächste Schritte#