論文の概要: Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards
- arxiv url: http://arxiv.org/abs/2607.19219v1
- Date: Tue, 21 Jul 2026 15:49:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.481394
- Title: Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards
- Title(参考訳): スコア予測を超えて:ルブリックリワードを用いた強化学習によるLCMに基づく評価とフィードバック生成
- Abstract要約: 大規模言語モデル(LLM)は、自動エッセイスコア(AES)と自動フィードバック生成(AFG)に広く応用されている。
RLによるエッセイ評価とフィードバック生成を協調的に最適化する統一LLMフレームワークであるRLAESを提案する。
フィードバック品質を計測し、解釈し、トレーニングに役立てるために、RLに基づくフィードバック評価(RFE)を導入する。
- 参考スコア(独自算出の注目度): 6.002323709229882
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have been widely applied to automated essay scoring (AES) and automated feedback generation (AFG). However, existing studies rely primarily on prompt engineering or supervised fine-tuning, while systematic research on reinforcement learning (RL) post-training and automated evaluation of feedback quality remains limited. We propose RLAES, a unified LLM framework that jointly optimizes essay scoring and feedback generation through RL. To make feedback quality measurable, interpretable, and usable for training, we introduce Rubric-based Feedback Evaluation (RFE), an essay-grounded feedback evaluation framework comprising 166 fine-grained binary rubric items and an LLM-as-judge. Building on RFE, we propose Adaptive Gated Feedback Optimization (AGFO), which activates rubric-based feedback rewards on demand during RL, reducing evaluation overhead while improving feedback quality. We also propose Adjacent Contrastive Reasoning (ACR) to improve ordinal score calibration by explicitly contrasting adjacent score levels. Experimental results show that the RFE framework captures essay-feedback consistency, exhibits strong pairwise discriminative power, and closely aligns with expert preferences. On the ASAP benchmark, RLAES-AGFO achieves the best scoring performance among LLM-based methods (QWK = 0.803), while maintaining feedback quality comparable to GPT-5.5 and avoiding the feedback degradation observed under score-only RL. Code and datasets are publicly available at https://github.com/hellomuyi/RLAES.
- Abstract(参考訳): 大規模言語モデル(LLM)は、自動エッセイスコア(AES)と自動フィードバック生成(AFG)に広く応用されている。
しかし、既存の研究は主に素早い工学や教師付き微調整に依存しているが、強化学習(RL)の系統的研究やフィードバック品質の自動評価は依然として限られている。
RLによるエッセイ評価とフィードバック生成を協調的に最適化する統一LLMフレームワークであるRLAESを提案する。
フィードバック品質を計測し,解釈し,トレーニングに利用できるようにするために,166個の細粒なバイナリルーリックアイテムとLLM-as-judgeからなるエッセイ付きフィードバック評価フレームワークであるRubric-based Feedback Evaluation (RFE)を紹介した。
RFE上に構築したAdaptive Gated Feedback Optimization (AGFO) は,RL中の要求に対するルーブリックフィードバックの報奨を活性化し,評価オーバーヘッドを低減し,フィードバック品質を向上する。
また、隣接したスコアレベルを明示的に対比することにより、順序のスコアキャリブレーションを改善するために、ACR(Adjacent Contrastive Reasoning)を提案する。
実験結果から, RFEフレームワークはエッセイフィードバックの一貫性を捉え, 強力なペア識別能力を示し, 専門家の好みと密接に一致していることがわかった。
ASAPベンチマークでは、RLAES-AGFOはLPMベースの手法(QWK = 0.803)の中で最高のスコアリング性能を達成し、GPT-5.5に匹敵するフィードバック品質を維持し、スコアオンリーのRLで観測されるフィードバック劣化を回避する。
コードとデータセットはhttps://github.com/hellomuyi/RLAESで公開されている。
関連論文リスト
- Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation [50.696688705287755]
我々は、強化学習におけるスパース報酬課題を克服するために、相互情報自己評価を提案する。
MISEにより、エージェントは、疎外的信号を補う高密度な内部報酬から自律的に学習することができる。
我々は、後見自己評価報酬を利用することは、政策と代行報酬政策の間のKL分散項と相互情報を組み合わせた目的を最小化することと等価であることを示す。
論文 参考訳(メタデータ) (2026-04-13T15:18:51Z) - Evaluating LLM-Based Grant Proposal Review via Structured Perturbations [18.689211845609623]
我々は、6つの品質軸にまたがるLLM感度を探索する摂動型フレームワークを開発した。
我々は, 単一パスレビュー, セクション・バイ・セクション分析, 専門家パネルをエミュレートした「ペルソナのカウンシル」という3つのレビューアーキテクチャを比較した。
論文 参考訳(メタデータ) (2026-03-09T11:53:50Z) - FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback [6.88204255655161]
本稿では,LLM生成エッセイフィードバックを評価するためのフレームワークFeedEvalを提案する。
ASAP++ベンチマークの実験では、FeedEvalは人間の専門家による判断と密接に一致しており、FeedEvalでフィルタされた高品質なフィードバックでトレーニングされたモデルを評価するエッセイは、優れたスコアリング性能を実現している。
論文 参考訳(メタデータ) (2026-01-08T04:04:29Z) - IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation [87.38454788767545]
本稿では,大規模言語モデルにおける命令追従の評価モデルであるIF-CRITICを提案する。
IF-CRITICが提供するスケーラブルな報酬信号により、LLMは命令追従最適化においてかなりの性能向上を達成することができる。
論文 参考訳(メタデータ) (2025-11-02T17:06:49Z) - Benchmarking and Studying the LLM-based Code Review [34.93646390349726]
現在のベンチマークでは、きめ細かいコード単位、完全なプロジェクトコンテキストの欠如、不適切な評価指標の使用に重点を置いています。
SWRBenchはPR中心のレビューと完全なプロジェクトコンテキストを提供する新しいベンチマークです。
我々の貢献には、SWRBenchベンチマーク、その客観的評価方法、現在のACR機能に関する包括的な研究、効果的な拡張アプローチが含まれる。
論文 参考訳(メタデータ) (2025-09-01T14:13:34Z) - Training Language Model to Critique for Better Refinement [58.73039433159486]
textbfRefinement-oriented textbfCritique textbfOptimization (RCO)を導入する。
RCOは、批評家モデルによって生成された批評がアクターモデルに応答を洗練させるためのフィードバックループを使用する。
より良い改善につながる批判に焦点を当てることで、RCOは直接的な批判的嗜好評価の必要性を排除している。
論文 参考訳(メタデータ) (2025-06-27T12:10:57Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z) - Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation [57.380464382910375]
評価のためのフィードバックプロトコルの選択は,評価信頼性に大きく影響し,系統的なバイアスを生じさせることを示す。
ジェネレータモデルは、気を散らす機能を埋め込むことで好みをひっくり返すことができる。
我々は,データセットの特徴と評価目標に基づくフィードバックプロトコルの選択を推奨する。
論文 参考訳(メタデータ) (2025-04-20T19:05:59Z) - Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators [48.54465599914978]
大規模言語モデル(LLM)は、生成された自然言語の品質を評価するための自動評価器として有望な能力を示した。
LLMは依然として評価のバイアスを示しており、人間の評価と整合したコヒーレントな評価を生成するのに苦労することが多い。
Pairwise-preference Search (PAIRS) は、LLMを用いた不確実性誘導検索に基づくランクアグリゲーション手法で、局所的にペアワイズ比較を行い、グローバルに候補テキストを効率よくランク付けする。
論文 参考訳(メタデータ) (2024-03-25T17:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。