論文の概要: LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents
- arxiv url: http://arxiv.org/abs/2607.13041v1
- Date: Fri, 12 Jun 2026 07:00:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.40844
- Title: LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents
- Title(参考訳): LessonBench-V1: AIレッスン生成エージェント評価のためのベンチマークデータセット
- Abstract要約: 本研究では,LLMをベースとしたリバースエンジニアリングの授業計画と組み合わせた647の人書きの授業からなるベンチマークデータセットであるLessonBench-V1を紹介する。
このレッスンは、LibreTexts、Brilliant.org、GeeksForGeeksを含む97の信頼できるオープンソースから引き出された。
授業計画では、教育メタデータを用いて3,620の学習目標をキャプチャし、授業生成AIエージェントの体系的かつ再現可能な評価を可能にする。
- 参考スコア(独自算出の注目度): 1.8866564236122627
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large Language Model (LLM) based AI educational content generation systems are increasingly being developed, yet no standardised benchmark exists to systematically evaluate them. This study introduces LessonBench-V1, a benchmark dataset comprising 647 human-written lessons paired with LLM-based reverse-engineered lesson plans across 240 STEM topics spanning mathematics, physics, chemistry, and computer science. The lessons are drawn from 97 trusted open sources, including LibreTexts, Brilliant.org and GeeksForGeeks. Each lesson plan is human-reviewed and produced through a pedagogically grounded methodology that synthesises Bloom's Taxonomy, Gagné's Events, Merrill's First Principles, and the 5E Instructional Model. The lesson plans capture 3,620 learning objectives with pedagogical metadata, enabling systematic, reproducible evaluation of lesson-generation AI agents and supporting further research. The study further proposes a three-dimensional evaluation pipeline for use with the dataset.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づくAI教育コンテンツ生成システムの開発が進んでいるが、それらを体系的に評価するための標準ベンチマークは存在しない。
本研究では, 数学, 物理, 化学, 計算機科学を対象とする240のSTEMトピックを対象とした, LLMをベースとしたリバースエンジニアリングの授業計画と組み合わせた647の人間による授業からなるベンチマークデータセットであるLesonBench-V1を紹介する。
このレッスンは、LibreTexts、Brilliant.org、GeeksForGeeksを含む97の信頼できるオープンソースから引き出された。
各レッスンプランは、ブルームの分類学、ガグネの出来事、メリルの第一原理、および5Eの教育モデルを合成する、教育学的に根ざした方法論によって、人間によってレビューされ、作成される。
授業計画では、教育メタデータによる3,620の学習目標をキャプチャし、授業生成AIエージェントの体系的かつ再現可能な評価を可能にし、さらなる研究を支援する。
さらに,データセットを用いた3次元評価パイプラインを提案する。
関連論文リスト
- Benchmarking data-driven material models on the classic Treloar dataset [0.0]
機械学習ベースのアプローチは実際にどのように比較できるのか?
我々は、Treloarの古典的な実験データを使って、超弾性の一般的なフレームワークをベンチマークします。
それぞれのアプローチの長所と短所を強調し、それらの使用に関する実践的なガイダンスを提供します。
論文 参考訳(メタデータ) (2026-08-14T08:21:26Z) - Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF [0.0]
このプレプリントは、最新のNLPパイプライン全体を通して読者をガイドする、体系的で研究指向のプラクティスを提示する。
TajikとTatarのオリジナルコントリビューションには、サブワードトークン、単語埋め込み、語彙データベース、翻訳ベンチマークなどがある。
大学院生、大学院生、そして古典的なMLから最先端のLLMベースのシステムにメソッドを実装し、比較し、デプロイしようとする実践的な開発者のために設計された。
論文 参考訳(メタデータ) (2026-05-05T14:25:48Z) - Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation [63.302074484672424]
本稿では,知識蒸留のための教育的な枠組みを提案する。
提案手法は,学生モデルにおける知識不足を識別し,進歩的カリキュラムを通して知識提供を組織化し,学生モデルの認知能力に合わせた表現を適応させる。
我々のフレームワークは特に複雑な推論タスクに優れており、最先端のベースラインと比較してMATHが19.2%、HumanEvalが22.3%改善している。
論文 参考訳(メタデータ) (2026-02-12T17:00:36Z) - An Evaluation of the Pedagogical Soundness and Usability of AI-Generated Lesson Plans Across Different Models and Prompt Frameworks in High-School Physics [0.7310043452300737]
本研究では,5大言語モデルを対象としたAIによる授業計画の教育的健全性とユーザビリティについて検討した。
高校の物理学のトピックである電磁スペクトルに関する15のレッスンプランが作成された。
論文 参考訳(メタデータ) (2025-10-22T02:53:06Z) - Machine Learning: a Lecture Note [51.31735291774885]
この講義ノートは、データサイエンスの初等生と博士課程の学生、あるいは機械学習の基礎的アイデアに関する規律を準備することを目的としている。
それは、機械学習の基本的なアイデアから始まり、分類を主なターゲットタスクとする。
これらの基本的な考え方に基づいて、講義ノートは教師なし学習に対する確率論的アプローチを深く探求する。
論文 参考訳(メタデータ) (2025-05-06T16:03:41Z) - LecEval: An Automated Metric for Multimodal Knowledge Acquisition in Multimedia Learning [58.98865450345401]
本稿では,マイアーのマルチメディア学習認知理論に基礎を置く自動計量であるLecEvalを紹介する。
LecEvalは、コンテンツ関連(CR)、表現的明瞭度(EC)、論理構造(LS)、聴取エンゲージメント(AE)の4つのルーリックを用いて効果を評価する
私たちは、50以上のオンラインコースビデオから2000以上のスライドからなる大規模なデータセットをキュレートします。
論文 参考訳(メタデータ) (2025-05-04T12:06:47Z) - Can Large Language Models Match Tutoring System Adaptivity? A Benchmarking Study [0.0]
大規模言語モデル(LLM)は動的命令補助として約束を守る。
しかし、LLMが知的チューリングシステム(ITS)の適応性を再現できるかどうかは不明である。
論文 参考訳(メタデータ) (2025-04-07T23:57:32Z) - Detecting AI-Generated Text in Educational Content: Leveraging Machine Learning and Explainable AI for Academic Integrity [1.1137087573421256]
本研究は、学生労働におけるAI生成コンテンツを検出するツールを提供することにより、学術的整合性を高めることを目的とする。
我々は,CyberHumanAIデータセットを用いて,機械学習(ML)およびディープラーニング(DL)アルゴリズムの評価を行った。
GPTZeroは、Pure AI、Pure Human、Mixed Classの分類を行う場合、48.5%の精度で約77.5%の精度を達成した。
論文 参考訳(メタデータ) (2025-01-06T18:34:20Z) - Scalable Early Childhood Reading Performance Prediction [5.413138072912236]
将来の読み出し性能をモデル化し予測するための適切な教育データセットは存在しない。
本稿では,拡張コア読み取り命令ECRIデータセットを紹介する。
我々は、このデータセットを活用して、幼児期の教育パターンを認識する最先端の機械学習モデルの有効性を実証的に評価する。
論文 参考訳(メタデータ) (2024-12-05T18:59:50Z) - VisIT-Bench: A Benchmark for Vision-Language Instruction Following
Inspired by Real-World Use [49.574651930395305]
VisIT-Benchは、命令追従型視覚言語モデルの評価のためのベンチマークである。
提案データセットは592個のテストクエリからなり,それぞれに人手による指示条件付きキャプションを付与した。
人的評価と自動評価の両方を用いて,モデルと参照間の品質ギャップを定量化する。
論文 参考訳(メタデータ) (2023-08-12T15:27:51Z) - CodeGen2: Lessons for Training LLMs on Programming and Natural Languages [116.74407069443895]
我々はエンコーダとデコーダベースのモデルを単一のプレフィックスLMに統一する。
学習方法は,「フリーランチ」仮説の主張を考察する。
データ配信においては,混合分布と多言語学習がモデル性能に及ぼす影響について検討した。
論文 参考訳(メタデータ) (2023-05-03T17:55:25Z) - A Survey of Learning on Small Data: Generalization, Optimization, and
Challenge [101.27154181792567]
ビッグデータの一般化能力を近似した小さなデータについて学ぶことは、AIの究極の目的の1つである。
この調査はPACフレームワークの下でのアクティブサンプリング理論に従い、小さなデータにおける学習の一般化誤差とラベルの複雑さを分析した。
効率的な小さなデータ表現の恩恵を受けるかもしれない複数のデータアプリケーションについて調査する。
論文 参考訳(メタデータ) (2022-07-29T02:34:19Z) - Few-Shot Named Entity Recognition: A Comprehensive Study [92.40991050806544]
マルチショット設定のモデル一般化能力を向上させるための3つの手法を検討する。
ラベル付きデータの比率の異なる10の公開nerデータセットについて経験的比較を行う。
マルチショットとトレーニングフリーの両方の設定で最新の結果を作成します。
論文 参考訳(メタデータ) (2020-12-29T23:43:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。