論文の概要: L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education
- arxiv url: http://arxiv.org/abs/2607.08842v2
- Date: Wed, 15 Jul 2026 16:06:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.295045
- Title: L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education
- Title(参考訳): L2-Bench:第二言語教育におけるLLM能力評価ベンチマーク
- Abstract要約: 教育におけるAIの急速な普及にもかかわらず、AIによる教育システムの厳格な評価はいまだに過小評価されている。
L2-Benchは、1000以上のタスク応答ペアのオープンソースベンチマークで、教育主導による言語学習と評価を支援する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Despite rapid AI adoption in education, rigorous evaluation of AI-powered educational (AIED) systems remains critically underdeveloped, particularly in second language (L2) education, one of the most common yet least evaluated AI applications. We introduce L2-Bench, an open-source benchmark of 1,000+ task-response pairs to aid the pedagogy-led evaluation of LLM capabilities relating to language learning and assessment. Crucially, L2-Bench measures model performativity on the application of learning experience design principles rather than mere knowledge of those principles or broad learning outcomes. Our contributions include: (1) a validated taxonomy of 12 competencies and 31 subcompetencies validated by 200+ expert practitioners (task authenticity: 4.42/5.00, criteria adequacy: 4.18/5.00); (2) a rubric-based evaluation methodology that we believe can, if adapted, generalize to similar (open-ended, qualitative) disciplines; (3) an evaluation dataset that produces reliable signal about model strengths, weaknesses, and contextual robustness across diverse L2 education scenarios. We find that, among large models, Claude Opus 4.7 performs best overall (85.5%), though is marginally outperformed on several constituent tasks. We also find that performance drops notably on harder tasks (69.9% to 73.4%). L2-Bench provides education stakeholders better methods to make more informed decisions about real-world AIED adoption, use, and governance, while advancing the maturing science of AI evaluations for education.
- Abstract(参考訳): 教育におけるAIの採用は急速に進んでいるが、AIによる教育(AIED)システムの厳格な評価は、特に第2言語(L2)教育において、いまだに過小評価されている。
L2-Benchは、1000以上のタスク応答ペアのオープンソースベンチマークで、言語学習と評価に関するLLM能力の評価を支援する。
重要なのは、L2-Benchは、これらの原則や幅広い学習結果の知識よりも、学習経験設計原則の適用に関するパフォーマンスをモデル化する。
コントリビューションには,(1)200人以上の専門家によって検証された12の能力と31のサブコンピテンス(タスク認証:4.42/5.00,基準精度:4.18/5.00),(2)類似の(オープンな,定性的な)規律に適応可能なルーリックな評価方法論,(3)モデル強度,弱点,文脈的堅牢性に関する信頼性の高い信号を生成する評価データセットなどが含まれている。
大型モデルの中では、Claude Opus 4.7 が最高性能 (85.5%) を達成しているが、いくつかの構成的タスクでは極端に優れていた。
また、特に難しいタスク(69.9%から73.4%)でパフォーマンスが低下していることもわかりました。
L2-Benchは、教育関係者に対して、教育のためのAI評価の成熟した科学を進めながら、現実のAIEDの採用、使用、およびガバナンスについてより情報的な決定を行うための、より良い方法を提供する。
関連論文リスト
- Beyond Accuracy: Towards a Robust Evaluation Methodology for AI Systems for Language Education [0.0]
AIによる言語教育における大規模言語モデルの急速な採用は、教育的効果を評価するための評価を緊急に必要としてきた。
L2-Benchは、検証済みの「言語学習経験設計者」構築に基礎を置いた、新しい評価ベンチマークである。
本手法は,教育学理論,社会工学的AI評価手法を統合し,階層的な分類法を運用し,専門家が計算したデータセットを構築する。
論文 参考訳(メタデータ) (2026-03-20T16:13:03Z) - EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education [11.130206904690745]
我々は,中国語K-12教育における大規模言語モデル(LLM)を評価するための包括的な階層的ベンチマークであるEduEvalを紹介する。
EduEvalは24種類のタスクタイプで構成され、11,000以上の質問が小学校から高校に分散している。
ゼロショットと少数ショットの両方の条件下で14のLLMを評価した結果,モデルが実際のタスクで良好に機能する一方で,教室での対話の分類に苦慮し,創造的コンテンツ生成において矛盾する結果を示すことが明らかとなった。
論文 参考訳(メタデータ) (2025-11-29T03:09:50Z) - OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education [72.40048732210055]
中国の総合的な教育ベンチマークであるOmniEduBenchを紹介する。
データは、知識次元と栽培次元の2つの中核次元に分けられる。
データセットには、11の一般的な試験質問タイプを含む、さまざまな質問形式がある。
論文 参考訳(メタデータ) (2025-10-30T12:16:29Z) - Learning to Use AI for Learning: How Can We Effectively Teach and Measure Prompting Literacy for K-12 Students? [1.413488665073795]
次世代に応用し、対話し、評価し、AIシステムと協力する能力を持たせる必要性が高まっている。
このニーズに対処するため,我々はLarge-Language Model (LLM) ベースのモジュールを設計した。
第1報,第1報,第2報,第2報,第2報,第1報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第2報,第
論文 参考訳(メタデータ) (2025-08-19T15:54:51Z) - MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams [50.293164501645975]
MLLM(Multimodal large language model)は、言語と視覚を統合して問題解決を行う。
MLLMのインテリジェンスを測定するための現在のベンチマークは、限られた規模、狭い範囲、構造化されていない知識に悩まされている。
MDK12-Benchは、6つの分野にまたがる実世界のK-12試験から構築された大規模マルチディシプリナベンチマークである。
論文 参考訳(メタデータ) (2025-08-09T06:21:10Z) - J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning [54.85131761693927]
意思決定前にLLM審査員に思考を教えるための強化学習フレームワークであるJ1を紹介する。
私たちのコアコントリビューションは、検証不可能で検証可能なプロンプトのすべての判断タスクを、検証可能な報酬を持った統一フォーマットに変換することです。
次に、RLを用いて8B、32B、70Bのスケールで思考判断を訓練し、彼らが最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2025-05-15T14:05:15Z) - R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation [75.33671166231096]
我々は、Reasoning Bench(R-Bench)と呼ばれる、大学院レベルの多学派、英語の中国語ベンチマークを導入する。
RBenchは108の被験者に1,094の質問を、83の被験者に665の質問を、マルチモーダルなモデルテストに当てはめている。
我々は,OpenAI o1,GPT-4o,DeepSeek-R1など,広く使用されているモデルを評価した。
論文 参考訳(メタデータ) (2025-05-04T07:48:36Z) - Unifying AI Tutor Evaluation: An Evaluation Taxonomy for Pedagogical Ability Assessment of LLM-Powered AI Tutors [7.834688858839734]
我々は,現在最先端の大規模言語モデル (LLM) がAI家庭教師として有効かどうかを検討する。
本研究では,キーラーニング科学の原則に基づく8つの教育次元を持つ統一的な評価分類法を提案する。
MRBench - 192の会話と1,596の回答を含む新しい評価ベンチマーク。
論文 参考訳(メタデータ) (2024-12-12T16:24:35Z) - ZhuJiu: A Multi-dimensional, Multi-faceted Chinese Benchmark for Large
Language Models [17.562961249150295]
大規模言語モデル(LLM)評価のためのZhuJiuベンチマークを提案する。
ZhuJiuは中国語でLLMを十分に評価する先駆的なベンチマークであり、英語でも同様に堅牢な評価能力を提供している。
ZhuJiuベンチマークとオープンパーティのリーダーボードはhttp://www.zhujiu-benchmark.com/で公開されている。
論文 参考訳(メタデータ) (2023-08-28T06:56:44Z) - L-Eval: Instituting Standardized Evaluation for Long Context Language
Models [91.05820785008527]
長い文脈言語モデル(LCLM)のより標準化された評価を行うためにL-Evalを提案する。
20のサブタスク、508の長いドキュメント、2000以上の人間ラベルのクエリ応答対を含む新しい評価スイートを構築した。
その結果、一般的なn-gramマッチングの指標は人間の判断とよく相関しないことがわかった。
論文 参考訳(メタデータ) (2023-07-20T17:59:41Z) - KoLA: Carefully Benchmarking World Knowledge of Large Language Models [87.96683299084788]
我々は知識指向LLMアセスメントベンチマーク(KoLA)を構築した。
人間の認知を模倣して、知識関連能力の4段階の分類を形成し、19ドルのタスクをカバーします。
私たちは、LLMによって事前訓練されたコーパスであるウィキペディアと、継続的に収集された新興コーパスを使用して、目に見えないデータや進化する知識を扱う能力を評価します。
論文 参考訳(メタデータ) (2023-06-15T17:20:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。