論文の概要: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
- arxiv url: http://arxiv.org/abs/2610.02492v1
- Date: Thu, 01 Oct 2026 21:14:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.088155
- Title: Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
- Title(参考訳): 正しい順序、間違ったスケール: 職業AI測定のためのLLM審査員の監査
- Abstract要約: LLMの審査員は、AIの出力が職場の要求を満たすかどうかを評価するためにますます使われている。
O*NET-BENCHは、既存の45,796人の労働者評価調査から得られた監査スイートである。
205の配置は少なくとも0.60のタイアップ・アウェア・ペアの精度を達成しているが、列車に適合する応答のみのTF-IDFベースラインは最強の審査員とほぼ一致している。
- 参考スコア(独自算出の注目度): 1.879797642940596
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM judges are increasingly used to assess whether AI outputs meet workplace requirements, but agreement on response rankings does not establish agreement on acceptance rates or occupational aggregates. We introduce O*NET-BENCH, an audit suite derived from an existing survey of 45,796 worker ratings, and evaluate 33 pre-existing judge configurations across six model families on 4,501 test ratings. Twenty-five configurations achieve tie-aware pair accuracy of at least 0.60, although a train-fitted response-only TF-IDF baseline nearly matches the strongest judge. Despite this ordering agreement, judges estimate that 3.0%-97.9% of responses are acceptable, compared with 61.1% for occupation-matched workers. In one fine-tuned lineage, changing from pointwise scoring to a bundled few-shot/listwise protocol improves response ordering while reducing agreement with worker means at the task and occupation levels; this reversal replicates on a task- and worker-disjoint validation split under prespecified criteria. Cross-validated calibration largely removes mean bias, but calibrated scores explain at most 8.5% of individual worker-rating variance. Prediction-assisted estimation yields at most small precision gains at the studied label budgets. These results show that ranking agreement alone is insufficient for occupational measurement. Judges should be validated against the acceptance rates and aggregates their scores will be used to estimate.
- Abstract(参考訳): LLMの審査員は、AIのアウトプットが職場の要求を満たすかどうかを評価するのにますます使われているが、回答ランキングに関する合意は、受理率や職業集約に関する合意を定めていない。
O*NET-BENCHは、既存の45,796人の労働者格付けから派生した監査スイートであり、6つのモデルファミリーで4,501の試験格付けで33の審査構成を評価する。
205の配置は少なくとも0.60のタイアップ・アウェア・ペアの精度を達成しているが、列車に適合する応答のみのTF-IDFベースラインは最強の審査員とほぼ一致している。
この命令に拘わらず、判事は3.0%-97.9%の回答が受け入れられると見積もっている。
ある微調整された系統では、ポイントワイドスコアから束ねられた数ショット/リストワイズプロトコルへの変更は、タスクおよび職業レベルでのワーカ手段との合意を低減しつつ、応答順序を改善する。
クロスバリデーションのキャリブレーションは平均偏差をほとんど排除するが、キャリブレーションのスコアは、労働者の比率の少なくとも8.5%で説明できる。
予測支援による評価は、研究されたラベル予算において、最も小さな精度で得られる。
これらの結果から,職業測定ではランキング合意だけでは不十分であることが示唆された。
審査員は受理率に対して検証され、スコアを集計して見積もる必要がある。
関連論文リスト
- Frozen Judges, Moving Agents: Version-Dependent LLM-Judge Error and the Limits of Judge-Assisted Agent Evaluation [7.504639516424482]
言語モデル審査員はエージェントのアップグレードを前任者と比較するが、固定された審査員はバージョンに依存した誤りを犯すことがある。
公開コーディングエージェント35件、カスタマーサービスエージェント2件、専門家ラベル付きエージェントRewardBenchトラジェクトリ1,106件を分析した。
論文 参考訳(メタデータ) (2026-09-28T03:10:18Z) - Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration [0.5294698352039444]
より現実的なユースケースを反映した絶対スコアリングタスクについて検討する。
モデルのタスク精度は、その判断精度を強く予測することを示す。
より有能な試験モデルは、すべての裁判官からより寛大な判断を受ける。
論文 参考訳(メタデータ) (2026-09-10T00:25:39Z) - Small Language Models as Judges for Rubric-Based Reinforcement Learning [57.707881387886516]
より小型の言語モデルが,より効率的かつ信頼性の高いルーリック・ベース・ジャッジとして機能するかどうかを考察する。
生成的評定,Yes/No Logprobマージン,Probe judgesの3つの基準レベルの判断を,小モデルから抽出する方法を比較した。
どちらのデータセットでも、Qwen3-1.7B Probeの審査員はこれらの方法の中で最強の基準レベルの合意を達成している。
論文 参考訳(メタデータ) (2026-08-30T20:00:17Z) - The Architect, the Adversary, and the Judge: Closed-Loop Generation of Standards-Aligned Assessment Items at Scale [13.85834524293015]
CLAIMは、K-12アセスメント・イテム生成のための生産パイプラインである。
パイプラインは9,074イテムの生産で97.8%のエキスパート評価パスレートに達する。
論文 参考訳(メタデータ) (2026-08-26T08:54:32Z) - Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks [1.2555090617748867]
我々は、標準の0-10品質判断と厳密な二項意味等価判定とを、人為的な基準に対して組み合わせた二重判断プロトコルを寄贈する。
我々は、制御された視覚的基盤を持つ規制課題について研究し、その意味は、すべての入力に対して既知の参照を持つコーデレートされた質問である。
論文 参考訳(メタデータ) (2026-08-25T08:49:46Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization [69.23273504123941]
私たちは、より複雑な評価設定で生じる位置バイアスに対して堅牢であるように、裁判官を訓練します。
我々はReasoningJudgeBenchというベンチマークを紹介します。
EIS-GRPOで訓練を受けた7B判事であるReasoning判事(J4R)は、GPT-4oを6.7%、そして9%で上回ります。
論文 参考訳(メタデータ) (2025-05-19T16:50:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。