レポート
レポートでは、ローカライゼーションエンジンの稼働状況をひと目で把握できます。翻訳量、ロケールのカバー範囲、用語集の充実度、コードベースの変更率、AI評価者による品質指標などを確認できます。すべてのレポートは組織単位で表示され、リクエストがエンジンを通過するたびに自動更新されます。
トークン使用量とコスト
トークン使用量とコストの詳細データは、設定の使用量ページで確認できます。
利用できるレポート#
| レポート | 測定内容 |
|---|---|
| 単語生成数 | 1日あたりの翻訳語数 |
| 上位ロケール | 最も多くのリソースを消費しているロケール |
| 用語集の充実度 | ロケールごとの用語集登録数 |
| 変更率 | GitHub上のローカライズファイルの変更状況(ロケール別) |
| 平均スコア | AI評価者による1日あたりの平均翻訳スコア |
| 用語適用率 | 翻訳で用語集の用語がどれだけ一貫して適用されているか |
| ルール遵守 | 翻訳でカスタムルールがどれだけ一貫して守られているか |
単語生成数#
ローカライゼーションエンジンで処理された総単語数を、日別に集計して追跡します。翻訳量の推移を把握し、キャパシティ計画に役立てられます。
フィルター: エンジン、期間(月)、言語(対象ロケールをひとつに絞り込む)
グラフには、選択した月の各日ごとに1本の棒が表示されます。翻訳アクティビティがなかった日は0として表示されます。
上位ロケール#
リソース消費量に基づいてロケールをランキングし、どの言語が翻訳量とコストの大半を占めているかを把握できます。ソースロケール別またはターゲットロケール別に表示でき、入力トークン、出力トークン、または単語数で比較できます。
フィルター: エンジン、期間(月)、ロケール種別(ソースまたはターゲット)、指標(入力トークン、出力トークン、または単語数)
このレポートでは、たとえば「どのターゲットロケールが最も多くのトークンを消費しているか?」や「どのソース言語が最も多くの単語を生成しているか?」といった問いに答えられます。
用語集の充実度#
各エンジンで、ロケールごとにどれだけの用語集項目が登録されているかを表示します。他のレポートと違い、これは時系列データではなく現在のスナップショットであり、用語集設定の現時点での状態を反映します。
フィルター: エンジン、ロケール種別(ソースまたはターゲット)
不足している領域の特定に役立ちます。たとえば、エンジンが12のロケールに翻訳していても、用語集エントリがあるのが3つだけなら、未カバーのロケールでは用語選択をモデルの判断に完全に委ねることになります。
変更率#
接続中の GitHub リポジトリ内にあるローカライズファイルの変更頻度を、ロケール別・日別に追跡します。このレポートでは接続中の GitHub リポジトリからローカライズファイルの変更内容を読み取るため、有効な GitHub 連携が必要です。
フィルター: 期間(月)、リポジトリ
変更率レポートは、「各ロケールがどれくらい活発に更新されているか?」や「どのリポジトリで最も多くのローカライズ変更が発生しているか?」といった問いに答えるのに役立ちます。
タイムゾーン対応
日付のグループ化は、組織で設定されたタイムゾーンに従います。たとえば23:30 UTC のコミットも、翌日にずれることなく正しいローカル日付で表示されます。
平均スコア#
AI評価者による日次の平均翻訳スコアを、パーセンテージで表示します。これにより、品質の推移を時系列で追跡し、エンジン、モデル、または用語集の変更後に起きた品質低下を見つけやすくなります。
フィルター: エンジン、期間(月)、言語(対象ロケールをひとつに絞り込む)、表示形式(集計または内訳)
単一のエンジンを表示している場合、各線はそのエンジンに紐づく1つの採点者を表します。すべてのエンジンを横断して表示している場合は、すべてのエンジンのすべての採点者を平均した1本の線を表示する 集計 と、採点者ごとに並べて比較できる 内訳 を選べます。
AI評価者が必要です
このレポートにデータが表示されるのは、少なくとも1人のAI評価者が設定され、翻訳の採点を行っている場合のみです。
用語適用率#
翻訳で用語集の用語が毎日どれだけ一貫して正しく適用されているかを追跡します。折れ線は日次の適用率(正しく適用された用語 ÷ 関連する全用語)を示し、棒は適用された用語の絶対数を示します。ホバーすると、適用数/総数の内訳と、そのデータポイントのもとになったレビュー件数を確認できます。
フィルター: エンジン、期間(月)、言語(対象ロケールをひとつに絞り込む)
適用された用語数が多い一方でカバレッジ率が下がっている場合、処理量の増加に伴って、用語集の用語の見落としや誤訳が増えているサインです。これは、用語集やエンジンのルールを見直すべきことを示す、役立つ早期警告になります。
ルール遵守#
エンジンのカスタムルールが、日々の翻訳でどれだけ一貫して守られているかを追跡します。この割合は、ルールが実際に関連していたレビューのみを対象に算出されます。ツールチップにはfollowed / relevantが表示されるため、割合とサンプル数の両方を確認できます。
フィルター: エンジン、期間(月)、言語(対象ロケールをひとつに絞り込む)
新しく追加したルールが実際に挙動を変えているかを確認したり、モデルの切り替えやプロンプトの変更後にエンジンがルールを無視し始めるといったリグレッションを見つけたりするのに役立ちます。
フィルタリングと期間#
時間ベースのレポートはすべて月単位で動作します。デフォルトは当月です。フィルターはURLに保持されるため、絞り込み済みの表示を共有したり、ブックマークしたりできます。
レポート全体で共通して使えるフィルター:
| フィルター | 利用可能なレポート | 説明 |
|---|---|---|
| エンジン | Word Gen、主要ロケール、用語集の充実度、平均スコア、用語カバレッジ、ルール準拠率 | 特定のエンジンに絞り込むか、すべてを表示 |
| 期間 | Word Gen、主要ロケール、変更率、平均スコア、用語カバレッジ、ルール準拠率 | 月を選択(YYYY-MM) |
| 言語 | Word Gen、平均スコア、用語カバレッジ、ルール遵守率 | 対象ロケールをひとつに絞り込む |
| リポジトリ | 変更率 | GitHubリポジトリで絞り込む |
| 表示 | 平均スコア | 集計した1本の線、または採点者ごとの内訳 |
品質と量#
レポートは、相互に補完し合う2つのビューで構成されています。量とコスト(Word Generations、主要ロケール、用語集の充実度、変更率)と、品質(平均スコア、用語カバレッジ、ルール準拠率)です。品質レポートの利用には、少なくとも1つのAI評価者が設定されている必要があります。