評価 (LLM-as-judge)

3 時間ごとの自動スキャンが LLM の応答を採点し、品質ドリフトを検知します。

自動スキャンの評価サマリーの例(平均スコアと直近 24 時間の推移)

平均スコア

4.40

↑ +0.18

前回スキャン比

平均スコアの推移(直近 24 時間)

5.04.54.03.53.000:0006:0012:0018:0024:00
最終スキャン: 2 時間前

判定 AI 自身を毎週検証

実呼び出しから作った変異コピーで判定 AI を毎週試験し、識別・安定・人手一致の成分で信頼度を表示します。

判定 AI の信頼度の例(週次の自動検証)

Judge reliability96%
先週比 +2%

24 件の見抜きテストから算出

識別(見抜き率)96%劣化コピー 24 件
安定(整形不変)100%意味が同じなら同じ点
人手一致(±1 以内)92%対 12 件

5 つの既定基準

有用性・正確さ・関連性・安全性・簡潔さの 5 基準を最初から同梱し、設定なしで採点に使えます。各基準は 1〜5 のルーブリックとして登録され、点数ごとの読み方まで画面で展開して確認できます。既定基準も判定 AI の検証・較正の対象に入るので、テンプレートのまま放置されません。

助けになるか / 正確さ / 関連性 / 安全性 / 簡潔さ正確さ簡潔さ有用性関連性安全性

自作基準も

「自社の用語に揃っているか」等、自由に追加(Pro 以上)。採点基準の本文も編集できます。

「自社の用語に揃っているか」社内用語・表現の一貫性をチェック Pro 以上
基準を追加