論文の概要: Cost-efficient generative AI summarization for scalable automated essay scoring in educational assessment
- arxiv url: http://arxiv.org/abs/2607.15829v1
- Date: Fri, 17 Jul 2026 10:39:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.827487
- Title: Cost-efficient generative AI summarization for scalable automated essay scoring in educational assessment
- Title(参考訳): 教育評価におけるスケーラブルな自動エッセイ評価のためのコスト効率な生成AI要約
- Authors: Haowei Hua,
- Abstract要約: 本研究では,長文エッセイ表現を改善するためのAI支援要約フレームワークを提案する。
3種類のGPT-5変異体(GPT-5, GPT-5 mini, GPT-5 nano)の制御長サマリーを生成し, 下流AESモデルの入力として使用する。
オリジナルの筆記信号を保存するため,全エッセイから抽出した手書き言語特徴を要約表現と統合する。
- 参考スコア(独自算出の注目度): 0.40611352512781873
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated essay scoring (AES) enables scalable assessment and timely feedback but remains challenged by transformer input-length limitations, which can cause information loss when processing long essays. This study proposes a generative AI-assisted summarization framework to improve long-form essay representation while maintaining scoring reliability. Using the ASAP 2.0 dataset, we generate controlled-length summaries with three GPT-5 variants (GPT-5, GPT-5 mini, and GPT-5 nano) and use them as inputs for downstream AES models. To preserve original writing signals, handcrafted linguistic features extracted from full essays are integrated with summary representations to form a hybrid framework. The approach is evaluated in terms of scoring performance, summarization quality, and computational cost. Scoring reliability is measured using quadratic weighted kappa (QWK), while summary quality is assessed through lexical overlap, semantic similarity, information retention, and redundancy metrics. Results show that GPT-5 mini achieves the highest agreement with human ratings, whereas GPT-5 produces the strongest summarization quality. Summary quality decreases for higher-scoring essays, indicating that more complex writing is more difficult to compress without information loss. These findings reveal trade-offs among model capacity, summary fidelity, cost efficiency, and preservation of educational constructs. This study provides an initial controlled evaluation of GPT-based summarization for AES and identifies important baselines and ablation studies required for future generalization. Overall, generative AI summarization offers a promising approach for scalable writing assessment while requiring careful validation of information preservation and fairness.
- Abstract(参考訳): 自動エッセイスコア(AES)は、スケーラブルな評価とタイムリーなフィードバックを可能にするが、長いエッセイを処理する際に情報損失を生じさせる入力長制限によって依然として課題が残る。
本研究では,信頼度を維持しつつ,長期的エッセイ表現を改善するためのAI支援要約フレームワークを提案する。
ASAP 2.0データセットを用いて、3種類のGPT-5変異体(GPT-5, GPT-5 mini, GPT-5 nano)の制御長サマリーを生成し、下流AESモデルの入力として使用する。
オリジナルの筆記信号を保存するため、全エッセイから抽出した手書き言語特徴を要約表現と統合し、ハイブリッドフレームワークを形成する。
この手法は, 評価性能, 要約品質, 計算コストの観点から評価する。
スコアリング信頼性は2次重み付きカッパ(QWK)を用いて測定され、要約品質は語彙重なり合い、意味的類似性、情報保持性、冗長性測定によって評価される。
その結果, GPT-5 miniは人間の評価と最も一致しているのに対し, GPT-5 miniは最強の要約品質を実現していることがわかった。
より複雑な文章は、情報を失うことなく圧縮することがより困難であることを示している。
これらの結果から, モデル能力, 要約忠実度, コスト効率, 教育施設の保全のトレードオフが明らかになった。
本研究は,AESにおけるGPTに基づく要約の初期制御評価を行い,今後の一般化に必要な重要なベースラインとアブレーション研究を同定する。
全体として、生成的AI要約は、情報保存と公正性の慎重な検証を必要としながら、スケーラブルな書き込み評価に有望なアプローチを提供する。
関連論文リスト
- AI Overviews in Academic Search: Evaluating AI-generated Summaries of Search Results in a Domain-specific Search Engine [4.04785724664289]
社会科学情報のための学術検索エンジンにおいて,AI生成サマリーを支援機能として評価する。
主観的な作業負荷,有用性,満足感,意思決定の信頼感など,AIサマリーを支持する重要なトレンドは見つからない。
論文 参考訳(メタデータ) (2026-07-03T15:35:08Z) - S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings [2.010691774041283]
長いエッセイから短い事実回答への学生の反応を評価することは、NLPの教育において重要な課題である。
S-GRADESは、14の多様なグレーティングデータセットを統一インターフェースで統合するWebベースのベンチマークである。
S-GRADESの実用性を実証するために,複数の推論手法を用いて,ベンチマーク全体で最先端の3つの大規模言語モデルを評価した。
論文 参考訳(メタデータ) (2026-03-10T21:11:51Z) - LCFO: Long Context and Long Form Output Dataset and Benchmarking [50.44679440167169]
LCFO(Long Context and Form Output)ベンチマークは、段階的な要約と要約拡張機能を評価するための新しいフレームワークである。
LCFOは、長さの異なる3つの要約を持つ長い入力文書(平均長5k語)から構成される。
GPT-4o-miniは,要約処理と要約処理の両方において,自動システム間で最高の人間のスコアを得る。
論文 参考訳(メタデータ) (2024-12-11T10:35:45Z) - "I understand why I got this grade": Automatic Short Answer Grading with Feedback [33.63970664152288]
本稿では,フィードバックによる短時間回答自動グルーピングのためのデータセットであるEngineering Short Answer Feedback (EngSAF)を紹介する。
我々は,我々のラベル認識合成フィードバック生成(LASFG)戦略を用いて,最先端の大規模言語モデル(LLM)の生成能力を活用することで,データセットにフィードバックを組み込む。
最高のパフォーマンスモデル(Mistral-7B)は、それぞれ75.4%と58.7%の精度で、未確認の回答と未確認の質問テストセットで達成している。
論文 参考訳(メタデータ) (2024-06-30T15:42:18Z) - Information-Theoretic Distillation for Reference-less Summarization [67.51150817011617]
本稿では,要約のための情報理論的目的に基づいて,強力な要約器を蒸留する新しい枠組みを提案する。
我々は,教師モデルとしてPythia-2.8Bから出発する。
我々は,ChatGPTと競合する5億8800万のパラメータしか持たないコンパクトだが強力な要約器に到達した。
論文 参考訳(メタデータ) (2024-03-20T17:42:08Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。