論文の概要: When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring
- arxiv url: http://arxiv.org/abs/2607.13433v1
- Date: Wed, 15 Jul 2026 04:34:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.638481
- Title: When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring
- Title(参考訳): ラグビーが変わるとき:批判的思考評価のためのクロスルーブリックな一般化
- Abstract要約: 本研究では,一組のルーブリックでラベル付けされたエッセイのトレーニングと,それまで見られなかったルーブリックの評価を行うクロスルーブリック一般化について検討する。
我々は2つのコンポーネントを持つLarge Language Model (LLM)ファインチューニングフレームワークを使用している。
- 参考スコア(独自算出の注目度): 0.8214139379818158
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated essay scoring (AES) research has largely focused on cross-prompt generalization, where essays from unseen prompts are scored while the scoring criteria are typically held constant. In practice, however, educators may revise or even introduce new rubrics in their scoring task, to evaluate different aspects of essays. We study cross-rubric generalization: training on essays labeled under one set of rubrics and evaluating on previously unseen rubrics, which target different aspects of the essay. We use a Large Language Model (LLM) fine-tuning framework with two components: rubric-agnostic intermediate representations, called traits, and target-essay supervision under seen rubrics during training. On an AES dataset augmented with multiple rubric-defined labels of student critical thinking skills, we find that traits improve macro F1 by 5.0% over a baseline without traits in the hardest setting, where both target rubrics and target essays are unseen during training. We further find that increasing target-essay supervision improves performance, with our best fine-tuned open-source Llama-based model outperforming GPT-5-mini prompting by 2.1% macro F1 and trailing GPT-5 by 1.9%. These results show that trait-based intermediate structure and controlled supervision improve generalization to unseen rubrics.
- Abstract(参考訳): 自動エッセイスコアリング(AES)研究は主にクロスプロンプトの一般化に焦点を当てており、そこでは目に見えないプロンプトからのエッセイがスコアされ、スコアリング基準は通常一定である。
しかし実際には、教育者は、エッセイの異なる側面を評価するために、彼らのスコアリングタスクに新しいルーリックを改訂したり、導入したりすることができる。
我々は,一組のルーブリックの下にラベル付けされたエッセイのトレーニングと,エッセイの異なる側面をターゲットとした以前は目に見えないルーブリックの評価について,クロスルーブリックの一般化について研究する。
我々は2つのコンポーネントを持つLarge Language Model (LLM)ファインチューニングフレームワークを使用している。
学生の批判的思考スキルの複数のルーリック定義ラベルを付加したAESデータセットでは,学習中にターゲットのルーリックと対象のエッセイの両方が見つからない,最も難しい条件下で,特徴のないベースライン上でのマクロF1を5.0%改善することがわかった。
さらに,GPT-5-miniを2.1%,GPT-5を1.9%,微調整したオープンソースLlamaベースのモデルでGPT-5-miniを2.1%,追従率1.9%に向上させることにより,目標評価の監視が向上することを見出した。
これらの結果から, 特性に基づく中間構造と制御された監督により, 目に見えないルーリックへの一般化が促進されることが示唆された。
関連論文リスト
- GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation [74.44235943118994]
GenRubricは、ラベルのないクエリからルーブリック生成を改善する自己進化フレームワークである。
我々はこの原理を強化学習により実現し、ルーブリック間の包括性信号とグループレベルの報酬と基準レベルの報酬を組み合わせる。
人間の注釈付きルーブリックベンチマークの実験では、自己進化は生成されたルーブリックと専門家によるルーブリックによる評価の一致を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-30T15:39:39Z) - SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators [50.129606229339146]
SurveyReviewは、調査評価のためのレビューアラインで多次元のベンチマークとデータセットである。
我々は、自由形式のコメントを4次元のスコアに変換することによって、ピアレビューレポートを構築する。
我々は,自動評価器と人間レビュアーのアライメントを測定するための,標準化された列車/テスト分割と評価プロトコルをリリースする。
論文 参考訳(メタデータ) (2026-08-07T16:11:46Z) - Cost-efficient generative AI summarization for scalable automated essay scoring in educational assessment [0.40611352512781873]
本研究では,長文エッセイ表現を改善するためのAI支援要約フレームワークを提案する。
3種類のGPT-5変異体(GPT-5, GPT-5 mini, GPT-5 nano)の制御長サマリーを生成し, 下流AESモデルの入力として使用する。
オリジナルの筆記信号を保存するため,全エッセイから抽出した手書き言語特徴を要約表現と統合する。
論文 参考訳(メタデータ) (2026-07-17T10:39:58Z) - S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings [2.010691774041283]
長いエッセイから短い事実回答への学生の反応を評価することは、NLPの教育において重要な課題である。
S-GRADESは、14の多様なグレーティングデータセットを統一インターフェースで統合するWebベースのベンチマークである。
S-GRADESの実用性を実証するために,複数の推論手法を用いて,ベンチマーク全体で最先端の3つの大規模言語モデルを評価した。
論文 参考訳(メタデータ) (2026-03-10T21:11:51Z) - Beyond Holistic Scores: Automatic Trait-Based Quality Scoring of Argumentative Essays [15.895792302323883]
教育の文脈では、教師と学習者は解釈可能な特性レベルのフィードバックを必要とする。
本稿では,2つの相補的モデリングパラダイムを用いた特徴量に基づく自動弁別評価手法について検討する。
スコア・オーディナリティを明示的にモデル化することは、人間のレーダとの合意を著しく改善することを示します。
論文 参考訳(メタデータ) (2026-02-04T14:30:52Z) - AWARE, Beyond Sentence Boundaries: A Contextual Transformer Framework for Identifying Cultural Capital in STEM Narratives [0.5514573274011145]
AWAREは、この微妙なタスクに対するトランスフォーマーモデルの認識を改善するためのフレームワークである。
入力の特性を明示的に認識させることにより、AWAREはマクロF1において2.1ポイントの強いベースラインを上回ります。
この研究は、物語の文脈に依存するあらゆるテキスト分類タスクに対して、堅牢で一般化可能な方法論を提供する。
論文 参考訳(メタデータ) (2025-10-06T16:19:57Z) - CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution [74.41064280094064]
textbfJudger-1は、最初のオープンソースのtextbfall-in-one judge LLMである。
CompassJudger-1は、優れた汎用性を示す汎用LLMである。
textbfJudgerBenchは、様々な主観評価タスクを含む新しいベンチマークである。
論文 参考訳(メタデータ) (2024-10-21T17:56:51Z) - Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation [50.60733773088296]
音声言語翻訳国際ワークショップ(IWSLT 2023)における共有タスクの結果を総合的に評価する。
本稿では,セグメントコンテキストによる自動回帰と直接評価に基づく効果的な評価戦略を提案する。
分析の結果,1) 提案した評価戦略は頑健であり,他の種類の人的判断とよく相関している,2) 自動測定基準は通常,必ずしも直接評価スコアとよく関連しているわけではない,3) COMET は chrF よりもわずかに強い自動測定基準である,といった結果を得た。
論文 参考訳(メタデータ) (2024-06-06T09:18:42Z) - Can GPT-4 do L2 analytic assessment? [34.445391091278786]
第二言語(L2)の習熟度を評価するための自動エッセイスコア(AES)は、何十年にもわたって教育の文脈で使われている、しっかりと確立された技術である。
本稿では,GPT-4をゼロショット方式で,総合的なスコアを付加したデータセット上で,一連の実験を行う。
自動予測された分析スコアと,個々の習熟度成分に関連する複数の特徴との間に有意な相関関係が認められた。
論文 参考訳(メタデータ) (2024-04-29T10:00:00Z) - LLM-as-a-tutor in EFL Writing Education: Focusing on Evaluation of Student-LLM Interaction [40.76665188171691]
LLM-as-a-tutorは、英語を外国語(EFL)として書く場合、エッセイにリアルタイムでフィードバックを提供することで、学生を支援することができる。
このギャップを埋めるために、学生とLLMの相互作用を評価する教育原則を統合する。
論文 参考訳(メタデータ) (2023-10-08T15:00:04Z) - How to Handle Different Types of Out-of-Distribution Scenarios in Computational Argumentation? A Comprehensive and Fine-Grained Field Study [59.13867562744973]
この研究は、オフ・オブ・ディストリビューション(OOD)シナリオにおけるLMの能力を体系的に評価する。
このような学習パラダイムの有効性は,OODの種類によって異なることがわかった。
具体的には、ICLはドメインシフトに優れているが、プロンプトベースの微調整はトピックシフトに勝っている。
論文 参考訳(メタデータ) (2023-09-15T11:15:47Z) - Investigating Fairness Disparities in Peer Review: A Language Model
Enhanced Approach [77.61131357420201]
我々は、大規模言語モデル(LM)の助けを借りて、ピアレビューにおける公平性格差の徹底した厳密な研究を行う。
我々は、2017年から現在までのICLR(International Conference on Learning Representations)カンファレンスで、包括的なリレーショナルデータベースを収集、組み立て、維持しています。
我々は、著作者性別、地理、著作者、機関的名声など、興味のある複数の保護属性に対する公平性の違いを仮定し、研究する。
論文 参考訳(メタデータ) (2022-11-07T16:19:42Z) - News Summarization and Evaluation in the Era of GPT-3 [73.48220043216087]
GPT-3は,大規模な要約データセット上で訓練された微調整モデルと比較する。
我々は,GPT-3サマリーが圧倒的に好まれるだけでなく,タスク記述のみを用いることで,現実性に乏しいようなデータセット固有の問題に悩まされることも示している。
論文 参考訳(メタデータ) (2022-09-26T01:04:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。