論文の概要: WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays
- arxiv url: http://arxiv.org/abs/2607.14524v1
- Date: Thu, 16 Jul 2026 03:23:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.97132
- Title: WrAFT: a Modularized Automated Writing Evaluation System for Argumentative Essays
- Title(参考訳): WrAFT:説明的評価のためのモジュール化された自動筆記評価システム
- Abstract要約: WrAFTは議論的エッセイのための文章評価とフィードバックツールである。
システムは2次重み付きカッパ(QWK)は0.84で、根平均二乗誤差(RMSE)は0.44で、スコアは0.5である。
インタラクティブなユーザインタフェースがシステム用に開発され、公開されており、無料で利用できる。
- 参考スコア(独自算出の注目度): 16.22466124017634
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: This study presents WrAFT, a Writing Assessment and Feedback Tool, that delivers both accurate and reliable scores and effective comprehensive feedback to argumentative essays. WrAFT adopts a modular design by dividing automated writing evaluation (AWE) tasks into scoring, surface-level feedback, and deep-level feedback. In building the system, various Large Language Models (LLMs) have been evaluated, including LLaMA-3.3-70B-Instruct, GPT-4o, and Claude 3.7, through both direct prompting and supervised fine-tuning approaches. A proprietary dataset of 480 TOEFL Independent Writing essays with official benchmark scores was utilized. Benchmark-based evaluation shows that WrAFT achieves state-of-the-art performance in scoring, with a quadratic weighted kappa (QWK) of 0.84 and a root mean square error (RMSE) of 0.44 against official scores on a scale of 0-5. Human evaluation of system-generated feedback also reveals high approval ratings: 96.14 percent for surface-level feedback, 93.03 percent for deep-level macro feedback, and 94.69 percent for deep-level micro feedback. An interactive user interface has been developed for the system and is publicly available and free to use.
- Abstract(参考訳): 本研究は、正確で信頼性の高いスコアと効果的な総合的なフィードバックを議論的なエッセイに提供し、評価・フィードバックツールであるWrAFTを提案する。
WrAFTは、自動筆記評価(AWE)タスクをスコアリング、表面フィードバック、深層フィードバックに分割することでモジュラー設計を採用する。
システム構築において、LLaMA-3.3-70B-インストラクト、GPT-4o、Claude 3.7など様々なLarge Language Model (LLM) が、直接的なプロンプトと教師付き微調整のアプローチによって評価されている。
公式ベンチマークスコア付き480TOEFL独立著作エッセイのプロプライエタリデータセットが利用された。
ベンチマークに基づく評価の結果,WrAFTは2次重み付きカッパ(QWK)が0.84で,根平均二乗誤差(RMSE)が0.44で,スコアが0-5で達成された。
システム生成フィードバックの人的評価も高い評価率を示しており、表面フィードバックは96.14パーセント、マクロフィードバックは93.03%、マイクロフィードバックは94.69パーセントである。
インタラクティブなユーザインタフェースがシステム用に開発され、公開されており、無料で利用できる。
関連論文リスト
- SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators [50.129606229339146]
SurveyReviewは、調査評価のためのレビューアラインで多次元のベンチマークとデータセットである。
我々は、自由形式のコメントを4次元のスコアに変換することによって、ピアレビューレポートを構築する。
我々は,自動評価器と人間レビュアーのアライメントを測定するための,標準化された列車/テスト分割と評価プロトコルをリリースする。
論文 参考訳(メタデータ) (2026-08-07T16:11:46Z) - Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes [0.0]
大規模言語モデル(LLM)システムは、ピアレビューを支援するためにますます提案されている。
ほとんどの評価は、システムが割り当てる数値スコアの妥当性ではなく、機械生成レビューテキストの散文を判断する。
提案した原稿を読み取って5つの0-100品質ディメンションと重み付き総合スコアを出力するAIPRを検証する。
論文 参考訳(メタデータ) (2026-06-14T16:13:15Z) - Automatic Essay Scoring and Feedback Generation in Basque Language Learning [4.218073067465283]
本稿では,CEFR C1の習熟度を目標とした,AES(Automatic Essay Scoring)とフィードバック生成のための最初の公開データセットを紹介する。
データセットは、HABEから3,200のエッセイで構成され、それぞれ専門家評価者によって注釈付けされ、正確さ、豊かさ、一貫性、凝集度、タスクアライメントを詳細にフィードバックとエラーの例で表現する。
RoBERTa-EusCrawlやLatxa 8B/70Bといったオープンソースモデルを、スコアリングと説明生成の両方のために微調整します。
論文 参考訳(メタデータ) (2025-12-09T15:28:35Z) - Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation [57.380464382910375]
評価のためのフィードバックプロトコルの選択は,評価信頼性に大きく影響し,系統的なバイアスを生じさせることを示す。
ジェネレータモデルは、気を散らす機能を埋め込むことで好みをひっくり返すことができる。
我々は,データセットの特徴と評価目標に基づくフィードバックプロトコルの選択を推奨する。
論文 参考訳(メタデータ) (2025-04-20T19:05:59Z) - HREF: Human Response-Guided Evaluation of Instruction Following in Language Models [61.273153125847166]
我々は新しい評価ベンチマークHREF(Human Response-Guided Evaluation of Instruction following)を開発した。
HREFは信頼性の高い評価を提供するだけでなく、個々のタスクのパフォーマンスを強調し、汚染を受けない。
本稿では,評価セットのサイズ,判断モデル,ベースラインモデル,プロンプトテンプレートなど,HREFにおける鍵設計選択の影響について検討する。
論文 参考訳(メタデータ) (2024-12-20T03:26:47Z) - SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits [31.98028879922584]
SummExecEditという新しいパイプラインとベンチマークを導入し、実際のエラーを検知し、正確な説明を提供する能力についてモデルを評価する。
トップパフォーマンスモデルであるClaude3-Opusは、ベンチマークでわずか0.49のジョイント検出と説明スコアを達成している。
説明ミスの4つの主要なタイプを特定し、その45.4%は、要約の完全に無関係な部分に焦点を当てている。
論文 参考訳(メタデータ) (2024-12-17T23:26:44Z) - A Large-Scale Study of Relevance Assessments with Large Language Models: An Initial Look [52.114284476700874]
本稿では,4つの異なる関連性評価手法が展開された大規模評価(TREC 2024 RAG Track)の結果について報告する。
自動生成UMBRELA判定は、完全に手動による判断を置き換えて、実行レベルの有効性を正確に捉えることができる。
意外なことに、LLMアシストは完全な手作業による評価と相関を増さないようで、人間のループプロセスに関連するコストは明らかな有意義な利益をもたらすものではないことを示唆している。
論文 参考訳(メタデータ) (2024-11-13T01:12:35Z) - Prometheus: Inducing Fine-grained Evaluation Capability in Language
Models [66.12432440863816]
我々は,GPT-4の評価能力に匹敵する,完全にオープンソースなLarge Language Model (LLM) であるPrometheusを提案する。
プロメテウスは45種類の楽譜を用いた評価において、Pearsonの0.897の相関を人間の評価値と比較した。
Prometheusは2つの人間の選好ベンチマークで最も精度が高い。
論文 参考訳(メタデータ) (2023-10-12T16:50:08Z) - Split and Merge: Aligning Position Biases in LLM-based Evaluators [22.265542509143756]
PortIAは、人間の比較戦略を模倣して位置バイアスを校正するアライメントベースのシステムである。
その結果, Portia はテスト対象のモデルと比較形態の整合性を著しく向上させることがわかった。
GPT-4モデルにおける位置バイアスの約80%を修正し、一貫性を98%まで高める。
論文 参考訳(メタデータ) (2023-09-29T14:38:58Z) - C-PMI: Conditional Pointwise Mutual Information for Turn-level Dialogue
Evaluation [68.59356746305255]
本稿では,システムとユーザ間のターンレベルインタラクションを測定するための,モデルに依存しない新しいアプローチを提案する。
提案手法は,既存の評価システムと比較して,人間の判断との相関性を大幅に改善する。
論文 参考訳(メタデータ) (2023-06-27T06:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。