論文の概要: Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors
- arxiv url: http://arxiv.org/abs/2603.25674v1
- Date: Thu, 26 Mar 2026 17:29:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.400099
- Title: Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors
- Title(参考訳): 物事を計測する -- あるいは、何が便利なのか?--LLMに基づくスコーリングシステムのロバスト性-
- Authors: Cole Walsh, Rodica Ivan,
- Abstract要約: 本研究では, 2重構造LPMに基づくスコアリングシステムにおける構成非関連因子の影響について検討する。
スコアリングシステムは,無意味な文章で回答をパディングし,スペルの誤りを指摘し,難解な文章を書けるのが一般的であった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated systems have been widely adopted across the educational testing industry for open-response assessment and essay scoring. These systems commonly achieve performance levels comparable to or superior than trained human raters, but have frequently been demonstrated to be vulnerable to the influence of construct-irrelevant factors (i.e., features of responses that are unrelated to the construct assessed) and adversarial conditions. Given the rising usage of large language models in automated scoring systems, there is a renewed focus on ``hallucinations'' and the robustness of these LLM-based automated scoring approaches to construct-irrelevant factors. This study investigates the effects of construct-irrelevant factors on a dual-architecture LLM-based scoring system designed to score short essay-like open-response items in a situational judgment test. It was found that the scoring system was generally robust to padding responses with meaningless text, spelling errors, and writing sophistication. Duplicating large passages of text resulted in lower scores predicted by the system, on average, contradicting results from previous studies of non-LLM-based scoring systems, while off-topic responses were heavily penalized by the scoring system. These results provide encouraging support for the robustness of future LLM-based scoring systems when designed with construct relevance in mind.
- Abstract(参考訳): 自動システムは、オープン・レスポンス・アセスメントとエッセイ・スコアリングのために、教育試験業界で広く採用されている。
これらのシステムは一般に、訓練されたヒトのラッカーに匹敵する、または優れたパフォーマンスのレベルを達成するが、しばしば構成非関連因子(すなわち、評価された構造と無関係な応答の特徴)や敵の条件の影響に弱いことが示されている。
自動スコアリングシステムにおける大規模言語モデルの利用が増加していることを踏まえ、'hallucinations' に新たな焦点が当てられている。
本研究では, コンストラクタ非関連因子が, 短時間のエッセイのようなオープンレスポンスアイテムを状況判断テストでスコアリングするために, デュアルアーキテクチャLLMに基づくスコアリングシステムに与える影響について検討した。
スコアリングシステムは,無意味な文章で回答をパディングし,スペルの誤りを指摘し,難解な文章を書けるのが一般的であった。
大量のテキストを重複させた結果,システムによって予測される低得点は,非LLMに基づくスコアリングシステムの従来の研究結果と矛盾する結果となり,オフトピー応答はスコアリングシステムによって大きく罰せられている。
これらの結果は,構造的妥当性を念頭に設計した将来のLCMに基づくスコアリングシステムの堅牢性向上を支援するものである。
関連論文リスト
- Pitfalls in Evaluating Interpretability Agents [91.49742416116635]
我々は,実験を反復的に設計し,仮説を洗練するエージェントシステムを構築した。
我々の研究は、複雑な自動解釈可能性システムを評価する上での根本的な課題を実証している。
論文 参考訳(メタデータ) (2026-03-20T16:27:17Z) - Comparison of Scoring Rationales Between Large Language Models and Human Raters [3.4283859937936705]
本研究では,評価の不整合性の原因を明らかにするために,人間とLLMラッカーの理性について検討した。
大規模試験から得られたエッセイを用いて, GPT-4o, Geminiおよびその他のLLMの評価精度を検討した。
コサイン類似性は、与えられた有理量の類似性を評価するために用いられる。
論文 参考訳(メタデータ) (2025-09-27T16:58:51Z) - RAFFLES: Reasoning-based Attribution of Faults for LLM Systems [4.950398945013938]
RAFFLESは、推論と反復的な洗練を取り入れた評価アーキテクチャである。
RAFFLESは繰り返し多成分パイプラインとして動作し、中央ジャッジを使用して障害を体系的に調査する。
その結果,自律システムに自動故障検出を導入するための重要なステップが示された。
論文 参考訳(メタデータ) (2025-09-08T15:57:14Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z) - Limitations of Automatic Relevance Assessments with Large Language Models for Fair and Reliable Retrieval Evaluation [2.9180406633632523]
大規模言語モデル(LLM)は,自動関連性評価ツールとして注目されている。
近年の研究では、LLMに基づく評価が、人為的判断と高いシステムランキングの相関をもたらすことが示されている。
我々は,LLMによる判断が,上位評価システム間の順位差をいかに保っているか,また,人間の判断として相互に重要な評価を保っているかを検討する。
論文 参考訳(メタデータ) (2024-11-20T11:19:35Z) - Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation [52.76508734756661]
Auto-PREはピアレビュープロセスにインスパイアされた自動評価フレームワークである。
人間のアノテーションに依存する従来のアプローチとは異なり、Auto-PREは自動的に3つのコア特性に基づいて評価子を選択する。
要約,非ファクトイドQA,対話生成を含む3つの代表的なタスクの実験は,Auto-PREが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2024-10-16T06:06:06Z) - Evaluating Human Alignment and Model Faithfulness of LLM Rationale [66.75309523854476]
大規模言語モデル(LLM)が,その世代を理論的にどのように説明するかを考察する。
提案手法は帰属に基づく説明よりも「偽り」が少ないことを示す。
論文 参考訳(メタデータ) (2024-06-28T20:06:30Z) - Evaluating Interventional Reasoning Capabilities of Large Language Models [58.52919374786108]
大規模言語モデル(LLM)は意思決定タスクを自動化するために使用される。
本稿では,LPMが介入に応じてデータ生成プロセスの知識を正確に更新できるかどうかを評価する。
さまざまな因果グラフ(例えば、コンバウンディング、仲介)と変数タイプにまたがるベンチマークを作成します。
これらのベンチマークにより、LLMが事実を記憶したり、他のショートカットを見つけたりすることで、変化を正確に予測する能力を切り離すことができます。
論文 参考訳(メタデータ) (2024-04-08T14:15:56Z) - HGOT: Hierarchical Graph of Thoughts for Retrieval-Augmented In-Context Learning in Factuality Evaluation [20.178644251662316]
本稿では,文脈内学習における関連する文節の検索を促進するために,階層的思考グラフ(HGOT)を導入する。
このフレームワークは、複雑なクエリを管理可能なサブクエリに分割する、分割/クエリ戦略を採用している。
それは、最近提案された引用リコールと精度の指標を取り入れた、回答の選択のための自己一貫性の過半数投票を洗練する。
論文 参考訳(メタデータ) (2024-02-14T18:41:19Z) - Perspectives on Large Language Models for Relevance Judgment [56.935731584323996]
大型言語モデル(LLM)は、関連判断を支援することができると主張している。
自動判定が検索システムの評価に確実に利用できるかどうかは不明である。
論文 参考訳(メタデータ) (2023-04-13T13:08:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。