AI評価者

更新日:4 日前 · 読了目安 2分

AI評価は、ローカライゼーションエンジンが生成した翻訳を自動でチェックする品質評価です。各翻訳リクエストの後、Lingo.dev は独立したLLM評価を実行して出力を検証し、用語集への準拠、ルールの遵守、さらに定義したカスタム基準を確認します。レビューは非同期で実行されるため、翻訳レスポンスをブロックすることはありません。

ダッシュボードでは、AI評価者は測定と呼ばれます。場所は**Observability → 測定(AI評価)**です。どちらも同じものを指します。

仕組み#

ローカライゼーションエンジンが翻訳リクエストを完了すると、該当するレビューが非同期評価用のキューに追加されます。各レビューでは、ソーステキスト、翻訳結果、コンテキスト、評価基準を受け取る独立したLLMが実行されます。返されるのは、合否またはパーセンテージスコアの構造化された結果で、結果が完全でない場合はその理由も含まれます。

レビューには三つの種類があり、それぞれ有効にする場所が異なります。

種類チェック内容結果タイプ有効にする場所
用語集準拠翻訳が、エンジンで適用される用語集の用語に従っているかどうか合否組み込み。エンジンごとの切り替えで、エンジンのAI評価者タブ内の自動レビューにあります
ルール準拠翻訳が、エンジンで適用される各ルールに従っているかどうかルールごとの合否組み込み。エンジンごとの切り替えで、エンジンのAI評価者タブ内の自動レビューにあります
カスタム測定組織レベルで定義した独自の評価基準合格または不合格、または〇から一〇〇測定自体の実行場所内

組み込みAI評価#

すべてのローカライゼーションエンジンには、エンジンに設定された内容に照らして翻訳を検証する組み込みレビューが二つあります。用語集準拠とルール準拠です。測定ページでは、これらはシステム管理の下に表示されます。オンとオフは各エンジンのAI評価者タブで切り替えられます。また、測定ページでいずれかを開けば、エンジンごとの切り替えも表示されます。すべてのエンジンで一括して組み込みレビューをオンにする設定はありません。

用語集準拠 #

翻訳が、該当するすべての用語集の用語に準拠しているかどうかを確認します。エンジンがカスタム翻訳(例: "Deploy" → "Bereitstellen")や非翻訳対象の用語(例: "OAuth")を適用している場合、このレビューでは翻訳がそれらに従っているかを検証します。

このレビューでは文法上のバリエーションも考慮されます。用語集の用語がある文法形式で登録されていても、その用語のすべての形に適用されます。競合する用語集の用語がある場合でも、そのうち1つに従っていれば、その翻訳は準拠していると見なされます。

結果は、翻訳リクエスト全体に対する単一の合否判定として返され、不合格の場合は理由も含まれます。

ルール準拠 #

各ルールを個別に評価します。エンジンに3つのルールが適用されている場合、このレビューでは3つの個別の合否判定が返され、結果が不合格のときはそれぞれに理由も表示されます。

以前、ルールは instructions と呼ばれていました

ダッシュボード、Reviewersタブのトグル、ルール準拠レポートでは、いずれもこれらをルールと呼んでいます。REST APIでは、個々のルールは引き続き/instructionsで公開されています。

ルールの条件が翻訳対象のコンテンツに当てはまらない場合、そのルールは N/A を返すことがあります。たとえば、敬体・常体のような文体に関するルールは、翻訳に製品名や、文体が関係ない技術用語しか含まれていない場合、N/A を返します。N/A の結果は集計スコアには含まれません。

どちらの組み込みレビューも、エンジンに関連する設定がある場合にのみ実行されます。たとえば、ロケールの組み合わせに一致する用語集の用語がなければ、用語集準拠レビューは実行されません。

エンジンごとのレビュー設定#

エンジンのAI評価者タブには、二つのセクションがあります。

自動レビューには、二つの組み込みレビューである用語集準拠とルール準拠の切り替えがあります。これらはそれぞれ独立しているため、エンジンに設定されている内容に応じて、片方だけを有効にすることもできます。

提案には、エンジンの提案の切り替えがあります。これはスコアを出すのではなく、低いスコアに応じて動作します。

カスタム測定はそのタブでは有効にしません。測定をエンジンに紐づけるのは、測定自体から行います。実行場所で、すべてのエンジンで実行をオンにするか、エンジンを手動で選択します。前者には、あとから作成されたエンジンも含まれます。これにより、品質チェックの共通ライブラリを管理しながら、必要なものだけを選んで適用できます。

一つのエンジンで、組み込みレビューと複数のカスタム測定を同時に実行できます。すべてのレビューは各翻訳リクエストの後に非同期で実行され、結果はObservability → イベント、各測定のイベントタブ、そしてレポートに表示されます。

AI評価者の種類#

ブール型AI評価者#

二値の判定を返します。合格または不合格です。フォームでは、何を返すかの下にある合格または不合格です。満たしているかどうかが明確なルールに向いています。

例:

  • "翻訳ですべてのHTMLタグと属性が保持されていますか?"
  • "対象言語の複数形ルールは正しく適用されていますか?"
  • "翻訳でドイツ語の敬称(Sie)が使われていますか?"

結果は合格率として集計されます。75% は、評価された4件の翻訳のうち3件が合格したことを意味します。

パーセンテージ型AI評価者#

〇から一〇〇のスコアを返します。フォームでは、何を返すかの下にある〇から一〇〇です。品質を連続的な尺度で見たい項目に向いています。

例:

  • "ネイティブ話者にとっての翻訳の自然さを評価してください(0〜100)"
  • "翻訳が元のトーンと意図をどの程度維持しているかを採点してください(0〜100)"
  • "文法的な正確さを0〜100の尺度で評価してください"

結果は、評価期間全体の平均として集計されます。

AI評価者の設定#

測定ページの新しい測定から作成します。フォームでは次の項目を設定します。

項目説明
名前測定を識別するラベル(例:「複数形チェック」)
概要任意。作成者以外の人にもわかるように、用途を一行で説明します
どの翻訳を読むか翻訳元と翻訳先。一致させるソースロケールとターゲットロケール、またはいずれかを任意のロケールにできます
何を返すか合格または不合格または〇から一〇〇。過去のスコアは、記録された形式のまま保持されます
指示自然言語で記述する評価基準
実行場所すべてのエンジンで実行、または選択したエンジン。どのエンジンにも紐づいていない測定は実行されません
判定保留該当なしで返答を許可。無関係な組み合わせに対して、測定が「該当なし」を返せるかどうかです。既定ではオンです

フォームには、プロバイダー、モデル、サンプリング、オンオフの項目はありません。測定は紐づいている場所で実行され、停止するにはエンジンから外すか削除します。APIでは、項目はname、description、sourceLocale、targetLocale、type(booleanまたはpercentage)、instruction、allowsNAで、これに加えて下で説明する任意のsamplingがあります。

AI評価者の指示を書く#

指示フィールドはAI評価者の中核です。評価用LLMに、何をチェックすべきかを正確に伝える役割を持ちます。具体的で、検証可能な基準として記述してください。

良い指示#

ブール型:

text
Check whether all HTML tags in the source text are preserved
exactly in the translation. Tags must not be added, removed,
modified, or reordered. Pass if all tags are preserved, fail
if any tag is missing or altered.

パーセンテージ型:

text
Rate the fluency of the translation on a scale of 0-100.
100 means a native speaker would find it completely natural.
0 means it reads like machine output. Deduct points for
awkward phrasing, unnatural word order, or overly literal
constructions.

良い指示の条件#

  • 具体的な基準 - 合否の意味、または 0 と 100 が何を表すかを明確に定義する
  • 観察可能な結果 - LLM が意図を推測するのではなく、テキストを読んで評価できる必要がある
  • AI評価者ごとに1つの観点 - 多面的な品質チェックは、別々のAI評価者に分ける

ロケールのマッチング#

AI評価者は、ソースロケールとターゲットロケールで翻訳リクエストに一致させます。ワイルドカードの*は任意のロケールに一致し、フォームでは任意のロケールとして表示されます。

ソースロケールターゲットロケール一致する対象
ende英語 → ドイツ語の翻訳のみ
en*英語からのすべての翻訳
*ja日本語へのすべての翻訳
**すべての翻訳

1つの翻訳リクエストに対して、ロケールペアに一致するAI評価者が複数ある場合は、複数のAI評価者が同時に実行されることがあります。

サンプリング#

すべての翻訳をレビューする必要はありません。ダッシュボードにはサンプリング設定がないため、そこで作成した測定は一致するすべてのリクエストをレビューします。APIまたはMCPサーバーでは、samplingを設定できます。これは評価対象にする一致リクエストの割合で、0(なし)から1(すべて)まで指定できます。

sampling動作
一一致するすべてのリクエストがレビューされます(既定値。網羅的ですが、コストは高くなります)
〇・五一致するリクエストのおよそ半分をレビュー
〇・一10件に1件。個別スコアより傾向把握を重視する高ボリュームのエンジンに有効
〇紐づけを外さなくても、測定を実質的に一時停止できます

サンプリングは、リクエスト時にランダムな判定で適用されます。十分な件数のリクエストがあれば、実際の評価率は設定した割合に近づいていきます。

N/A サポート#

該当なしで返答を許可がオンのとき(APIではallowsNA)、レビュー用の大規模言語モデルはスコアの代わりに「該当なし」を返せます。これは、基準がすべてのロケールの組み合わせに当てはまるわけではないAI評価者に便利です。

例: 敬称の慣習をチェックするAI評価者は、英語 → 英語の翻訳では N/A を返します(英語にはフォーマル/インフォーマルの区別がないため)が、英語 → ドイツ語ではスコアを返します。

レポートでは、N/A の結果は平均値や合格率から除外されます。スコアを下げたり、不自然に押し上げたりすることはありません。

理由#

AI評価者は、結果が完全でない場合に理由も返すため、何が問題だったのかを把握しやすくなります。

  • 完全スコア(合格または100%) - 理由は null(説明不要)
  • N/A - 理由は null
  • 不完全なスコア - 1文の簡潔な説明

これによりレビュー結果をすぐに活用できます。翻訳がチェックに失敗した場合も、手動で調査しなくても理由を把握できます。

レビューモデル#

評価モデルは選べません。新しい測定は、プラットフォーム側で設定されたモデルで採点され、エンジンが翻訳に使うモデルとは別に管理されます。フォームにはプロバイダーやモデルの項目はありません。

AI評価者レポート#

レビュー結果は、Observability → レポートのAIが誤る内容グループにグラフで表示されます。

  • Average Scores - 各測定が記録したすべてのスコアの日次平均です。期間、エンジン、言語で絞り込み、集計表示と内訳表示を切り替えられます
  • ルール準拠 - ルール準拠の結果を、実行回数に対する割合で表示します

同じページには、時間の使われ方の下にボリュームレポートもあります。レポートを参照してください。あわせて見ることで、処理量と品質の両方を全体像として把握できます。

MCP 経由でAI評価者を管理する#

Lingo.dev MCP server を使っている場合は、AIコーディングアシスタントからAI評価者を直接作成・設定できます。

text
"Create a boolean AI reviewer for all locale pairs that checks
whether HTML tags are preserved in translations."
text
"Add a percentage AI reviewer for English to German that rates
translation fluency on a 0-100 scale, sampling 50% of requests."

次のステップ#