論文の概要: Criterion-referenceability determines LLM-as-a-judge validity across physics assessment formats
- arxiv url: http://arxiv.org/abs/2603.14732v1
- Date: Mon, 16 Mar 2026 02:09:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-17 16:19:35.995897
- Title: Criterion-referenceability determines LLM-as-a-judge validity across physics assessment formats
- Title(参考訳): 物理評価フォーマットにおけるLCM-as-a-judge妥当性の基準参照性による決定
- Abstract要約: 我々は、GPT-5.2、Grok 4.1、Claude Opus 4.5、DeepSeek-V3.2、Gemini Pro 3、および盲目、解答、偽解、そして模範的な条件下でのヒトマーカーに対する委員会集計を比較した。
n=771ドルのブラインド大学試験の質問に対して、モデルは差別的妥当性の強い分数平均絶対誤差(fMAE)$approx 0.22$を達成する。
$n=55$スクリプト全体において、盲目のAIマーキングは人間のマーキングよりも厳格で可変的であり、差別的妥当性はすでに貧弱である。
- 参考スコア(独自算出の注目度): 0.01116979912801043
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models (LLMs) are increasingly considered for automated assessment and feedback, understanding when LLM marking can be trusted is essential. We evaluate LLM-as-a-judge marking across three physics assessment formats - structured questions, written essays, and scientific plots - comparing GPT-5.2, Grok 4.1, Claude Opus 4.5, DeepSeek-V3.2, Gemini Pro 3, and committee aggregations against human markers under blind, solution-provided, false-solution, and exemplar-anchored conditions. For $n=771$ blind university exam questions, models achieve fractional mean absolute errors (fMAE) $\approx 0.22$ with robust discriminative validity (Spearman $ρ> 0.6$). For secondary and university structured questions ($n=1151$), providing official solutions reduces MAE and strengthens validity (committee $ρ= 0.88$); false solutions degrade absolute accuracy but leave rank ordering largely intact (committee $ρ= 0.77$; individual models $ρ\geq 0.59$). Essay marking behaves fundamentally differently. Across $n=55$ scripts ($n=275$ essays), blind AI marking is harsher and more variable than human marking, with discriminative validity already poor ($ρ\approx 0.1$). Adding a mark scheme does not improve discrimination ($ρ\approx 0$; all confidence intervals include zero). Anchored exemplars shift the AI mean close to the human mean and compress variance below the human standard deviation, but discriminative validity remains near-zero - distributional agreement can occur without valid discrimination. For code-based plot elements ($n=1400$), models achieve exceptionally high discriminative validity ($ρ> 0.84$) with near-linear calibration. Across all task types, validity tracks criterion-referenceability - the extent to which a task maps to explicit, observable grading features - and benchmark reliability, rather than raw model capability.
- Abstract(参考訳): 大規模言語モデル(LLM)は、自動評価とフィードバックのためにますます検討されているため、LLMマーキングがいつ信頼できるかを理解することが不可欠である。
GPT-5.2、Grok 4.1、Claude Opus 4.5、DeepSeek-V3.2、Gemini Pro 3、委員会による盲目、解答、偽解、そして模範的解答条件の比較を行った。
n=771$ブラインド大学試験の質問に対して、モデルは差別的妥当性の強い分数平均絶対誤差(fMAE)$\approx 0.22$を達成する(Spearman $ρ> 0.6$)。
二次および大学の構造化された質問(n=1151$)に対して、公式なソリューションを提供することで、MAEを減らし、妥当性を強化する($ρ=0.88$)。
エッセイマーキングは基本的に異なる振る舞いをする。
n=55$スクリプト(n=275$エッセイ)全体で、盲目のAIマーキングは人間のマーキングよりも厳格で変動し、差別的妥当性はすでに低い(ρ\approx 0.1$)。
マークスキームを追加すると差別が改善しない(ρ\approx 0$; すべての信頼区間はゼロを含む)。
AIは人間の平均に近づき、人間の標準偏差より下の分散を圧縮するが、差別的妥当性は依然としてゼロに近い - 分配的合意は有効な差別なしに起こりうる。
コードベースのプロット要素(n=1400$)の場合、モデルは非常に高い差別的妥当性(ρ> 0.84$)をほぼ線形キャリブレーションで達成する。
すべてのタスクタイプにおいて、妥当性は基準参照可能性(タスクが生のモデル能力ではなく、明示的で観測可能なグレーディング機能にマップされる程度)を追跡します。
関連論文リスト
- Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models [49.45276299939287]
大規模言語モデル(LLM)は、ますます複雑な主観的タスクを扱うようになっている。
LLMは、マイナーな単語変更で予測不能に変動する。
この双対性を解決することは 信頼できるAIアライメントに 不可欠です
論文 参考訳(メタデータ) (2026-09-15T03:35:04Z) - Evidential Rule Learning for Interpretable Classification with Abstention [3.0509197593879853]
Fast Evidential Rule Learning (FERL)は、アウトプットが明確である解釈可能な、正確なファジィルールモデルを学ぶ。
FERLの信念、妥当性、および棄権能力は、単一の決定論的パスにおけるファジィなメンバーシップから直接生じる。
論文 参考訳(メタデータ) (2026-08-06T10:39:48Z) - Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation [25.235899757379844]
2つの応答は同じ最終回答スコアを受信できるが、トレースが明示的にバイアスコンテンツを注入するかどうかが異なる。
本稿では,2つの軸を持つ最小限のトレースレベル診断法について紹介する: バイアスが以前に正しい答えを破るかどうか) と強調(トレースが注入されたコンテンツに対するルーリック定義の表面参照を含むかどうか)である。
論文 参考訳(メタデータ) (2026-06-13T05:41:57Z) - A Spectral Phase Diagram for Binary Few-Shot Classification: Intrinsic Dimensionality, Geometric Saturation, and Representational Diagnosis [0.0]
飽和指数 $S(K) = operatornameerank(widehat_W(K)) / K$ は、プールされたクラス内サンプルの有効ランクとショットカウントとの比を測る。
インデックスはサポート機能だけで$O(d3)$ timeで計算可能で、テストラベルやトレーニングされた分類子を必要としない。
論文 参考訳(メタデータ) (2026-06-12T16:46:24Z) - The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains [0.0]
AIと安全クリティカルドメイン間のベンチマーク評価は、圧倒的に単純な平均化に依存している。
2つの条件が共起した場合に、このプラクティスがかなり誤解を招くことを実証する。
論文 参考訳(メタデータ) (2026-05-11T20:17:55Z) - Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR [1.7107991816118835]
我が国の金融インシシデント・コミット認識における測定リスクについて検討する。
ルーブリックな単語は、モデル指定ラベルを根本的に変えることが判明した。
すべての計量は、JF-ICRクラス分布の下では情報的ではない。
論文 参考訳(メタデータ) (2026-04-30T03:39:14Z) - Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection [68.37351671559675]
アクティブな学習は、無視可能なコストで短いプロンプトから何千ものインスタンスに注釈を付けることができる。
LLMラベルはALループ内で人間のラベルを置き換えることができ、ALはコーパス全体を一度にラベル付けできるときに必要か?
277,902人のドイツの政治的TikTokコメントの新しいデータセットについて、両方の質問を調査した。
論文 参考訳(メタデータ) (2026-04-15T14:10:58Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - From Global to Granular: Revealing IQA Model Performance via Correlation Surface [83.65597122328133]
我々は, IQA 性能の構造化, きめ細かな解析を行う textbfGranularity-Modulated correlation (GMC) を提案する。
GMCにはtextbfDistribution Regulatorが含まれており、相関関係を規則化し、非均一な品質分布からのバイアスを軽減する。
標準ベンチマークの実験では、GCCはスカラーメトリクスに見えないパフォーマンス特性を示し、IQAモデルを分析、比較、デプロイするためのより情報に富んだ信頼性の高いパラダイムを提供する。
論文 参考訳(メタデータ) (2026-01-29T13:55:26Z) - Spectral Sentinel: Scalable Byzantine-Robust Decentralized Federated Learning via Sketched Random Matrix Theory on Blockchain [0.0]
ビザンチンのクライアントは、不均一な(Non-IID)データの下での濃度勾配を中毒する。
本稿では,ビザンチン検出・集約フレームワークであるSpectral Sentinelを提案する。
Polygonネットワーク上でブロックチェーンを統合することで,完全なシステムを実現しています。
論文 参考訳(メタデータ) (2025-12-14T09:43:03Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Technical report on label-informed logit redistribution for better domain generalization in low-shot classification with foundation models [3.938980910007962]
信頼度校正は、基礎モデルに基づく現実世界の意思決定システムにおいて、新たな課題である。
本研究では,微調整の際,不正分類を罰する損失目標に組み込んだペナルティを提案する。
CMP(textitconfidence misalignment penalty)と呼ぶ。
論文 参考訳(メタデータ) (2025-01-29T11:54:37Z) - Robust Reinforcement Learning from Corrupted Human Feedback [86.17030012828003]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の嗜好データを調整するための原則化されたフレームワークを提供する。
我々はRLHFのロバストなアプローチ-$R3M$を提案し、これは、潜在的に破損した選好ラベルをスパースアウトリーとしてモデル化する。
大規模言語モデル(LLM)を用いたロボット制御と自然言語生成の実験により、R3M$は、好みデータに対する様々な摂動に対する報酬の堅牢性を向上することを示した。
論文 参考訳(メタデータ) (2024-06-21T18:06:30Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z) - Evaluating the Fairness of Discriminative Foundation Models in Computer
Vision [51.176061115977774]
本稿では,CLIP (Contrastive Language-Pretraining) などの差別基盤モデルのバイアス評価のための新しい分類法を提案する。
そして、これらのモデルにおけるバイアスを緩和するための既存の手法を分類学に関して体系的に評価する。
具体的には,ゼロショット分類,画像検索,画像キャプションなど,OpenAIのCLIPとOpenCLIPモデルをキーアプリケーションとして評価する。
論文 参考訳(メタデータ) (2023-10-18T10:32:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。