論文の概要: Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques
- arxiv url: http://arxiv.org/abs/2608.06609v1
- Date: Thu, 06 Aug 2026 21:52:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.296983
- Title: Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques
- Title(参考訳): 自動項目評価:LCM生成批判を用いた項目の受け入れと拒絶の予測
- Authors: Hotaka Maeda, Yikai Lu,
- Abstract要約: 自動項目評価 (AIE) とは、評価対象の項目の専門的なレビューやフィールドテストを必要とせずに、項目の品質を評価するための計算手法をいう。
我々は,大規模標準化試験プログラムの歴史的拒絶データを用いて,項目の受理と拒絶を予測し,ほぼ包括的AIEモデルを構築することを目的とした。
拒絶の理由は、心理測定の質の悪い性質、内容の問題、偏見と感受性の懸念、非コンテンツの問題であった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated item evaluation (AIE) refers to the use of computational methods to assess item quality without requiring manual expert review or field testing of the items under evaluation. We aimed to build a near-comprehensive AIE model by predicting item acceptance and rejection from item text using historical rejection data from a large-scale standardized testing program. The dataset contained 52,759 English language arts (ELA) and mathematics items with 34% permanently rejected from future operational use. Rejection reasons included poor psychometric properties, content issues, bias and sensitivity concerns, and non-content issues. We fine-tuned a DeBERTaV3-large classifier on raw item text, a second DeBERTa classifier on Qwen3-generated item critiques, and a fusion model combining representations from both. The fusion model achieved the strongest overall performance (Accuracy = .75, F1 = .64, AUC = .80, Sensitivity = .64, Specificity = .81). Prediction for math (F1 = .73, AUC = .86) was considerably more accurate than ELA (F1 = .51, AUC = .72). Lowering the decision threshold from .5 to .25 raised average sensitivity for ELA and math to .88 and .91, while reducing specificity to .31 and .56, respectively, which may be preferable in automated item generation contexts where generating items is cheaper than evaluating them. Incorporating item critiques alongside raw item text improved performance across most rejection reasons. The model assigned higher rejection probabilities to more difficult items. However, the fusion model struggled to identify items flagged for bias, sensitivity, fairness, or accessibility, especially for ELA. These findings suggest that text-based AIE is feasible in some areas and may offer a practical tool for reducing the burden of manual review and field testing, while also underscoring the importance of human review for items with fairness concerns.
- Abstract(参考訳): 自動項目評価 (AIE) とは、評価対象の項目を手作業でレビューしたり、フィールドテストしたりすることなく、項目の品質を評価するための計算手法をいう。
我々は,大規模標準化試験プログラムの歴史的拒絶データを用いて,項目の受容と拒絶を予測し,ほぼ包括的AIEモデルを構築することを目的とした。
このデータセットには52,759の英語の芸術品と数学のアイテムが含まれており、そのうち34%は将来の運用から永久に拒絶された。
拒絶の理由は、心理測定の質の悪い性質、内容の問題、偏見と感受性の懸念、非コンテンツの問題であった。
我々は、生の項目テキスト上でDeBERTaV3大分類器を微調整し、Qwen3生成項目批判に対して第2のDeBERTa分類器と、両者の表現を組み合わせた融合モデルを構築した。
融合モデルは最高性能(精度 = .75, F1 = .64, AUC = .80, Sensitivity = .64, specificity = .81)を達成した。
数学の予測 (F1 = .73, AUC = .86) は ELA (F1 = .51, AUC = .72) よりもかなり正確であった。
判定閾値を.5から.25に下げると、ESAと数学の平均感度は.88と.91に上昇し、特異度は.31と.56に低下した。
項目批判を生の項目テキストと組み合わせることで、ほとんどの拒絶理由においてパフォーマンスが向上した。
モデルはより難しい項目に高い拒絶確率を割り当てた。
しかし、融合モデルは、特にERAにおいてバイアス、感度、公平性、アクセシビリティのためにフラグ付けされたアイテムを特定するのに苦労した。
これらの結果から,テキストベースのAIEは,一部の領域で実現可能であり,手作業によるレビューやフィールドテストの負担を軽減するための実践的ツールとして有効であるとともに,公平性に配慮した項目に対する人間によるレビューの重要性を強調できる可能性が示唆された。
関連論文リスト
- Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews [69.66583722746904]
私たちは、AIレビュアーを5次元にわたって評価する総合的な評価フレームワークであるBeyond Ratingを紹介します。
本稿では,専門家の不一致に対応するためのMax-Recall戦略を提案する。
提案したテキスト中心の指標は、特に弱みの議論のリコールであり、評価精度と強く相関している。
論文 参考訳(メタデータ) (2026-04-21T14:21:15Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review [18.045716459188366]
アイテムの難しさは、テストパフォーマンス、スコアの解釈可能性、そして、特に大規模な評価において、すべてのテストテイカーにとって重要な役割を担います。
アイテム困難モデリングへの伝統的なアプローチは、フィールドテストと古典的テスト理論(CTT)に基づくアイテム分析またはアイテム応答理論(IRT)キャリブレーションに依存している。
本稿では,2025年5月までの大規模評価設定において,自動項目難易度予測に関する37項目をレビューし,合成する。
論文 参考訳(メタデータ) (2025-09-27T20:19:39Z) - Prediction of Item Difficulty for Reading Comprehension Items by Creation of Annotated Item Repository [2.5984661605688397]
テキストの内容に基づいてアイテムの難易度を予測することは大きな関心事である。
我々は、もともと報告されたアイテムp-値のデータをIRTベースの難易度を回復する関連問題に焦点をあてる。
本リポジトリには,(1)読解項目の言語的特徴,(2)読解項目のテスト特徴,(3)文脈特徴に関するメタデータが付加されている。
論文 参考訳(メタデータ) (2025-02-28T02:42:13Z) - How Many Ratings per Item are Necessary for Reliable Significance Testing? [7.422152765037947]
機械学習評価の基盤は、モデルと人間の反応が一元的、権威的、金標準のデータに対するモデルを評価するのに十分な信頼性を持つという仮定である。
我々は、(既存のまたは計画された)データセットが、信頼できるヌル仮説の統計的テストを保証するのに十分な応答を持っているかどうかを判断するために、メソッドを適用する。
我々の手法は、AI研究者がAI評価のためのデータ収集方法に関するより良い決定を下すのにどのように役立つかを示す。
論文 参考訳(メタデータ) (2024-12-04T02:31:28Z) - AES Systems Are Both Overstable And Oversensitive: Explaining Why And
Proposing Defenses [66.49753193098356]
スコアリングモデルの驚くべき逆方向の脆さの原因について検討する。
のモデルとして訓練されているにもかかわらず、単語の袋のように振る舞うことを示唆している。
高い精度で試料を発生させる過敏性と過敏性を検出できる検出ベース保護モデルを提案する。
論文 参考訳(メタデータ) (2021-09-24T03:49:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。