論文の概要: Can GPT-4 do L2 analytic assessment?
- arxiv url: http://arxiv.org/abs/2404.18557v1
- Date: Mon, 29 Apr 2024 10:00:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-04-30 14:07:29.239939
- Title: Can GPT-4 do L2 analytic assessment?
- Title(参考訳): GPT-4はL2分析に有効か?
- Abstract要約: 第二言語(L2)の習熟度を評価するための自動エッセイスコア(AES)は、何十年にもわたって教育の文脈で使われている、しっかりと確立された技術である。
本稿では,GPT-4をゼロショット方式で,総合的なスコアを付加したデータセット上で,一連の実験を行う。
自動予測された分析スコアと,個々の習熟度成分に関連する複数の特徴との間に有意な相関関係が認められた。
- 参考スコア(独自算出の注目度): 34.445391091278786
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated essay scoring (AES) to evaluate second language (L2) proficiency has been a firmly established technology used in educational contexts for decades. Although holistic scoring has seen advancements in AES that match or even exceed human performance, analytic scoring still encounters issues as it inherits flaws and shortcomings from the human scoring process. The recent introduction of large language models presents new opportunities for automating the evaluation of specific aspects of L2 writing proficiency. In this paper, we perform a series of experiments using GPT-4 in a zero-shot fashion on a publicly available dataset annotated with holistic scores based on the Common European Framework of Reference and aim to extract detailed information about their underlying analytic components. We observe significant correlations between the automatically predicted analytic scores and multiple features associated with the individual proficiency components.
- Abstract(参考訳): 第二言語(L2)の習熟度を評価するための自動エッセイスコア(AES)は、何十年にもわたって教育の文脈で使われている、しっかりと確立された技術である。
総合的なスコアリングは、人間のパフォーマンスと一致したり、超えたりするようなAESの進歩を見てきたが、解析的なスコアリングは、人間のスコアリングプロセスから欠陥や欠点を継承するので、依然として問題に直面している。
近年の大規模言語モデルの導入は,L2書記能力の特定の面の評価を自動化する新たな機会を提供する。
本稿では,GPT-4をゼロショット方式で,共通ヨーロッパ参照フレームワークに基づく総合的なスコアを付加した公開データセット上で一連の実験を行い,その基盤となる分析成分に関する詳細な情報を抽出することを目的とする。
自動予測された分析スコアと,個々の習熟度成分に関連する複数の特徴との間に有意な相関関係が認められた。
関連論文リスト
- ICLE++: Modeling Fine-Grained Traits for Holistic Essay Scoring [16.481654889824448]
提案するICLE++は,包括的スコアと特徴特異的スコアの両方を付加した,説得力のある学生エッセイのコーパスである。
ICLE++はASAPでトレーニングされたAESモデルの一般化性をテストするのに使えるだけでなく、新しいAES問題のために開発されたモデルの評価を容易にすることもできる。
論文 参考訳(メタデータ) (2026-07-30T04:35:02Z) - Towards Self-Referential Analytic Assessment: A Profile-Based Approach to L2 Writing Evaluation with LLMs [1.3819918262591997]
ランクに基づく相関尺度は、分析次元間の内在的相互関係を曖昧にしている。
高い相関関係はシステムの真の診断行動を隠蔽する可能性がある。
ラーナー内強度と弱点の同定に焦点をあてた自己参照評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-05T21:05:25Z) - Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams [1.6955250288861923]
STEMアセスメントにおける学生の反応は手書きで、記号表現、計算、図表を組み合わせたものが多い。
大規模言語モデル(LLM)の最近の進歩は、AIによるスコアリングに注意を向けている。
本研究は, GPT-4o を用いた学部理科構築応答のAI支援スコアリングの信頼性について検討した。
論文 参考訳(メタデータ) (2026-04-14T03:04:44Z) - Beyond Accuracy: Towards a Robust Evaluation Methodology for AI Systems for Language Education [0.0]
AIによる言語教育における大規模言語モデルの急速な採用は、教育的効果を評価するための評価を緊急に必要としてきた。
L2-Benchは、検証済みの「言語学習経験設計者」構築に基礎を置いた、新しい評価ベンチマークである。
本手法は,教育学理論,社会工学的AI評価手法を統合し,階層的な分類法を運用し,専門家が計算したデータセットを構築する。
論文 参考訳(メタデータ) (2026-03-20T16:13:03Z) - Machine-Assisted Grading of Nationwide School-Leaving Essay Exams with LLMs and Statistical NLP [0.0]
大規模言語モデル(LLM)は、オープンエンド試験応答の迅速かつ一貫した自動評価を可能にする。
我々は、公式カリキュラムベースのルーリックを運用し、LLMと統計自然言語処理(NLP)に基づく評価と人間のパネルスコアを比較した。
その結果, 自動スコアリングは, 人間のレーダに匹敵する性能を達成でき, 人間のスコアリング範囲に該当する傾向にあることがわかった。
論文 参考訳(メタデータ) (2026-01-22T20:44:39Z) - Exploring LLM Autoscoring Reliability in Large-Scale Writing Assessments Using Generalizability Theory [2.5163150839708948]
本研究では,大言語モデル(LLM)の信頼性をAP中国語・文化試験から評価する。
一般化可能性理論を用いて、人間とAIのレーダ間のスコア一貫性を評価し比較する。
人間とAIの両方のレーダを組み込んだ複合スコアリングでは信頼性が向上し、ハイブリッドスコアリングモデルが大規模書き込みアセスメントにメリットをもたらす可能性がある。
論文 参考訳(メタデータ) (2025-07-26T15:33:05Z) - Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework [61.38174427966444]
大規模言語モデル(LLM)は、様々なシナリオにおける自動評価のために、より広く使われている。
従来の研究では、強力なプロプライエタリモデルの評価と判断を再現するために、オープンソースのLLMを微調整しようと試みてきた。
本稿では,評価基準を適応的に定式化し,テキストベースとコード駆動分析の両方を合成する新しい評価フレームワークARJudgeを提案する。
論文 参考訳(メタデータ) (2025-02-26T06:31:45Z) - Evaluating AI-Generated Essays with GRE Analytical Writing Assessment [15.993966092824335]
本研究は,10個のLLMが生成したエッセイを用いて,研究記録エグゼクティブ(GRE)の分析書面アセスメントについて検討する。
我々はこれらのエッセイを、GREスコアリングパイプラインで用いられるように、人間のレーダとe-rater自動スコアリングエンジンの両方を用いて評価した。
GPT-4oは平均4.78点、GPT-4oは4.67点だった。
論文 参考訳(メタデータ) (2024-10-22T21:30:58Z) - Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation [50.60733773088296]
音声言語翻訳国際ワークショップ(IWSLT 2023)における共有タスクの結果を総合的に評価する。
本稿では,セグメントコンテキストによる自動回帰と直接評価に基づく効果的な評価戦略を提案する。
分析の結果,1) 提案した評価戦略は頑健であり,他の種類の人的判断とよく相関している,2) 自動測定基準は通常,必ずしも直接評価スコアとよく関連しているわけではない,3) COMET は chrF よりもわずかに強い自動測定基準である,といった結果を得た。
論文 参考訳(メタデータ) (2024-06-06T09:18:42Z) - Tell Me Why: Explainable Public Health Fact-Checking with Large Language Models [21.280725490520798]
本稿では,大規模言語モデルによる公衆衛生クレームの検証に焦点をあてる。
各種オープンおよびクローズドソースモデルにおける0/fwショットプロンプトとパラメータ効率の微調整の有効性について検討する。
論文 参考訳(メタデータ) (2024-05-15T15:49:06Z) - Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models [92.66784679667441]
プロメテウス2は、人間とGPT-4の判断を密接に反映するより強力な評価器である。
ユーザ定義評価基準でグループ化された、直接評価とペアのランキングフォーマットの両方を処理できる。
4つの直接評価ベンチマークと4つのペアのランキングベンチマークで、Prometheus 2は人間と独自のLM判事との相関と合意を最も高く評価している。
論文 参考訳(メタデータ) (2024-05-02T17:59:35Z) - From Voices to Validity: Leveraging Large Language Models (LLMs) for
Textual Analysis of Policy Stakeholder Interviews [14.135107583299277]
本研究では,米国内におけるK-12教育政策に関するステークホルダインタビューのテキスト分析を強化するために,大規模言語モデル(LLM)と人間の専門知識の統合について検討する。
混合メソッドのアプローチを用いて、ドメイン知識や教師なしトピックモデリングの結果から情報を得たコードブックとコーディングプロセスを開発した。
結果、GPT-4のテーマは、特定のテーマで77.89%の精度で人間のコーディングと一致しているが、より広いテーマが一致し96.02%に拡大し、従来の自然言語処理(NLP)の手法を25%以上上回った。
論文 参考訳(メタデータ) (2023-12-02T18:55:14Z) - SOUL: Towards Sentiment and Opinion Understanding of Language [96.74878032417054]
我々は、言語感覚とオピニオン理解(SOUL)と呼ばれる新しいタスクを提案する。
SOULは2つのサブタスクを通して感情理解を評価することを目的としている:レビュー(RC)と正当化生成(JG)。
論文 参考訳(メタデータ) (2023-10-27T06:48:48Z) - A Large Language Model Approach to Educational Survey Feedback Analysis [0.0]
本稿では,大規模言語モデル(LLM) GPT-4 と GPT-3.5 が教育フィードバック調査から洞察を得るのに役立つ可能性について検討する。
論文 参考訳(メタデータ) (2023-09-29T17:57:23Z) - Large Language Models on Wikipedia-Style Survey Generation: an Evaluation in NLP Concepts [21.150221839202878]
大規模言語モデル(LLM)は、様々な一般的なタスクで大きな成功を収めた。
本研究では,コンピュータ科学におけるNLPのニッチ分野に特有な簡潔な調査項目を生成する上で,LCMsの有効性について検討する。
人間の評価スコアとGPTによる評価スコアを比較し,詳細な分析を行った。
論文 参考訳(メタデータ) (2023-08-21T01:32:45Z) - Investigating Fairness Disparities in Peer Review: A Language Model
Enhanced Approach [77.61131357420201]
我々は、大規模言語モデル(LM)の助けを借りて、ピアレビューにおける公平性格差の徹底した厳密な研究を行う。
我々は、2017年から現在までのICLR(International Conference on Learning Representations)カンファレンスで、包括的なリレーショナルデータベースを収集、組み立て、維持しています。
我々は、著作者性別、地理、著作者、機関的名声など、興味のある複数の保護属性に対する公平性の違いを仮定し、研究する。
論文 参考訳(メタデータ) (2022-11-07T16:19:42Z) - Evaluation Toolkit For Robustness Testing Of Automatic Essay Scoring
Systems [64.4896118325552]
モデル逆算評価スキームと関連するメトリクスを用いて、現状のAESモデルを評価する。
AESモデルは非常に過大評価されていることがわかった。質問の話題に関係のない内容の重い修正(25%まで)でさえ、モデルが生み出すスコアを低下させることはない。
論文 参考訳(メタデータ) (2020-07-14T03:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。