論文の概要: Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks
- arxiv url: http://arxiv.org/abs/2608.24258v1
- Date: Tue, 25 Aug 2026 08:49:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.890409
- Title: Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks
- Title(参考訳): 法定グラウンドタスクにおけるビジョンランゲージモデルのための2段階評価プロトコル
- Authors: Su Myat Noe, Ha Thanh Nguyen, May Myo Zin, Ken Satoh,
- Abstract要約: 我々は、標準の0-10品質判断と厳密な二項意味等価判定とを、人為的な基準に対して組み合わせた二重判断プロトコルを寄贈する。
我々は、制御された視覚的基盤を持つ規制課題について研究し、その意味は、すべての入力に対して既知の参照を持つコーデレートされた質問である。
- 参考スコア(独自算出の注目度): 1.2555090617748867
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI systems are increasingly evaluated for legally accountable settings, where correct outputs must also be justifiable against an applicable legal standard. Existing legal-AI benchmarks and LLM-as-judge protocols provide important infrastructure for measuring task performance and open-ended response quality. We contribute one additional evaluation signal: a dual-judge protocol that pairs a standard 0-10 quality judge with a strict binary semantic-equivalence judge against a human-curated reference. We study a controlled, visually grounded regulatory task - UK traffic-sign interpretation, whose meaning is a codified question with a known reference for every input - and measure not merely whether the two judges disagree (by construction they must) but how much and where. On 4,680 evaluations under seven visibility levels and two occlusion modes, the two judges are moderately associated (point-biserial r = 0.644), while revealing an asymmetric Type II pattern affecting 8.0% of all evaluations. Its distribution is instructive: the marginal rate peaks at high visibility (14.2% at v = 0.8) simply because high-scoring answers are common there, but conditioned on the answer already scoring above 7, the rate is highest under heavy occlusion (54-63% at v <= 0.3), so a high quality score is least trustworthy when the input is most degraded. We are explicit that the signal is a property of this judge and reference: a 49-row human check shows the 0-10 judge aligns closely with everyday-reader judgement (Pearson r = 0.81; r = 0.80 with the LLM accuracy sub-score), while the equivalence judge is fairly but one-directionally stricter. The protocol adds one LLM call per evaluation and surfaces a signal single-judge protocols do not report. We release the prompt template, occluded variants, and full evaluation results.
- Abstract(参考訳): AIシステムは、適切なアウトプットを、適用可能な法的基準に対して正当化する必要がある、法的に説明可能な設定に対して、ますます評価されている。
既存の法律AIベンチマークとLCM-as-judgeプロトコルは、タスクパフォーマンスとオープンな応答品質を測定するための重要なインフラを提供する。
我々は、標準の0-10品質判定と厳密な二項意味等価判定とを、人為的な参照に対してペアリングするデュアルジャッジプロトコルという、さらなる評価信号を提供する。
制御された、視覚的に根ざした規制課題 - 英国の交通信号解釈 – は、すべての入力に対して既知の参照を持つコーデレートな質問を意味する。
7つの視認レベルと2つのオクルージョンモードでの4,680の評価では、2人の審査員は適度に関連している(ポイントビセリアル r = 0.644)が、一方、非対称なタイプIIパターンは全ての評価の8.0%に影響を及ぼしている。
その分布は、高い可視性(v = 0.8で14.2%)でピークに達するのは、単に高いスコアの答えがそこにあるのが一般的であるからであるが、既にスコアが7以上の答えに条件付けされているため、高いオクルージョン率(v <= 0.3で54-63%)が最も高い(v <= 0.3で54-63%)ため、入力が最も劣化すると、高い品質スコアは最も信頼できない。
49列のヒューマンチェックでは、0-10の判定が日常の読み手判定と密接に一致している(Pearson r = 0.81; r = 0.80とLLM精度のサブスコア)。
このプロトコルは評価毎に1つのLSMコールを追加し、信号単一ジャッジプロトコルは報告しない。
我々は、プロンプトテンプレート、隠された変種、そして完全な評価結果をリリースする。
関連論文リスト
- Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution [0.0]
ディープリサーチシステムにおける励磁品質の校正問題について検討する。
LLM審査員8名に対し、1248件の粗悪な判断を下し、金のラベルに異議を唱えた。
以上の結果から,このキャリブレーションは最も高価なモデルを必要としないことがわかった。
論文 参考訳(メタデータ) (2026-07-09T17:01:40Z) - JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems [0.0]
大規模言語モデルは、他のモデルを評価するための自動判断器として、ますます多くデプロイされている。
我々は、判断感度スコア(JSS)を通じて、このプロパティを定量化するフレームワークとベンチマークであるJiceSenseを紹介します。
事実として、すべての審査員は、極性反転プロンプトアーティファクトによって駆動されるJSS付近に約0.63のクラスタをクラスタする。
コード、意思決定ログ、検証済みのパラフレーズデータセットをリリースし、標準化されたJSSレポートをサポートします。
論文 参考訳(メタデータ) (2026-04-26T00:08:30Z) - When LLM Judge Scores Look Good but Best-of-N Decisions Fail [0.29465623430708904]
大規模言語モデルは、しばしば審査員が候補の応答を採点し、単一のグローバルメトリックで検証するために使用される。
プロンプト内で実際のデプロイメントタスクが最良選択である場合、これは誤解を招く可能性がある。
審査に基づく選択においては、関連する監査は、グローバルな合意だけでは無く、インイン・プロンプト信号、タイレート、リカバリ/トップ-1の精度を報告すべきである。
論文 参考訳(メタデータ) (2026-03-12T23:40:03Z) - Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment [26.786161923794115]
大規模言語モデル(LLM)は、推論品質の評価手段としてますます使われていますが、その信頼性と支払いリスク設定の偏りはよく分かっていません。
本稿では,Merchant Category Code(MCC)に基づく商業リスク評価において,LCM推論を評価するための構造化マルチ評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-04T22:55:16Z) - Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior [0.0]
審査員は一貫性があるが、互いに一致していない。
評価は3,240件を超え、中間合意はほぼゼロに近い。
審査員の平均得点は、審査員の実際の値に該当しない合成判定を生成する。
論文 参考訳(メタデータ) (2026-01-08T17:02:22Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards [72.44810390478229]
CompassJudger-2は、タスク駆動のマルチドメインデータキュレーション戦略によって制限を克服する新しいジェネラリストジャッジモデルである。
CompassJudger-2は、複数の判定と報奨ベンチマークで優れた結果を得る。
論文 参考訳(メタデータ) (2025-07-12T01:34:24Z) - J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization [69.23273504123941]
私たちは、より複雑な評価設定で生じる位置バイアスに対して堅牢であるように、裁判官を訓練します。
我々はReasoningJudgeBenchというベンチマークを紹介します。
EIS-GRPOで訓練を受けた7B判事であるReasoning判事(J4R)は、GPT-4oを6.7%、そして9%で上回ります。
論文 参考訳(メタデータ) (2025-05-19T16:50:35Z) - Validating LLM-as-a-Judge Systems under Rating Indeterminacy [65.137380612741]
評価の不確定性の下でLLM-as-a-judgeシステムを検証するための枠組みを提案する。
本研究では, 強制選択評価指示に応答する際の評価の不確定性を人間とLLMがどう解決するかの相違が, 偏見の検証に大きく寄与することを示した。
論文 参考訳(メタデータ) (2025-03-07T22:09:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。