論文の概要: EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration
- arxiv url: http://arxiv.org/abs/2607.18529v1
- Date: Mon, 20 Jul 2026 21:45:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.248787
- Title: EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration
- Title(参考訳): EduPanel: ビデオの信頼性、相補性、人間信頼の校正のための3段階のLCM判決
- Abstract要約: EduPanel(エドゥパネル)は、特殊なエージェント間で評価を分解するルーリックグラウンドの学習者条件付きLLM審査員である。
信頼性は、専門家の研究、アーキテクチャの実践、学習者・人格分析の中央値に匹敵する。
これらの結果から,EduPanelは人的専門家の代替ではなく,教育評価のための効果的なアシスタントとして機能することが示唆された。
- 参考スコア(独自算出の注目度): 49.59690207400984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Teaching videos are becoming a major medium for education, creating a growing need for scalable evaluation of their pedagogical quality. Existing automatic judges do not fully address this setting because teaching quality depends on multimodal evidence and should be evaluated with respect to the intended learner rather than as a universal property. We present EduPanel, a rubric-grounded, learner-conditioned LLM judge that decomposes evaluation across specialized agents to produce interpretable assessments for different aspects of teaching quality. Across expert studies, architecture ablations, and learner-persona analyses, EduPanel achieves reliability comparable to a median human expert. In expert evaluation, its feedback improves scoring accuracy (MAE 0.87 to 0.73), while experts remain able to detect unreliable outputs (AUC = 0.77) instead of accepting them blindly. These results suggest that EduPanel can serve as effective assistants for educational evaluation rather than replacements for human experts.
- Abstract(参考訳): 教育ビデオは教育の主要なメディアとなり、教育的品質のスケーラブルな評価の必要性が高まっている。
教育の質は多モーダルな証拠に依存しており、普遍的な財産としてではなく、意図した学習者に対して評価されるべきである。
EduPanelは, 学習者条件付きLLM判定器であり, 専門エージェント間で評価を分解し, 授業品質の異なる側面の解釈可能な評価を行う。
EduPanelは、専門家の研究、アーキテクチャの短縮、学習者-人格分析などを通じて、中央値の人間専門家に匹敵する信頼性を実現している。
専門家評価では、そのフィードバックはスコアの精度(MAE 0.87から0.73)を改善し、専門家は盲目的に受け入れる代わりに信頼できない出力(AUC = 0.77)を検出することができる。
これらの結果から,EduPanelは人的専門家の代替ではなく,教育評価のための効果的なアシスタントとして機能することが示唆された。
関連論文リスト
- Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows [48.61619205237941]
EduAgentBenchは、教授作業の全範囲でチューターエージェントを評価するための、ソースグラウンドのベンチマークである。
専門的な教育的判断、複数ターンのチューターの配置、Canvasスタイルの教育ワークフローの補完という、3つの機能面にわたる品質管理タスクが150種類含まれている。
我々の知る限り、EduAgentBenchは、チューターエージェントの総合的な教育能力を評価するための理論的かつ現実的なベンチマークである。
論文 参考訳(メタデータ) (2026-05-14T03:34:25Z) - An Explainable AI Assistant for Introductory Programming Education: Improving Feedback Reliability with Instructor-AI Collaboration [6.172982108802445]
説明可能なAIモデルを利用して、生徒のコードを分析し、論理的誤りをインストラクターが特定した誤解にマップし、インストラクターが承認したフィードバックを提供する。
以上の結果から,学生に正の体験を育みながら,正確な指導者によるフィードバックを提示できることが示唆された。
論文 参考訳(メタデータ) (2026-05-12T06:35:55Z) - AI Judges in Design: Statistical Perspectives on Achieving Human Expert Equivalence With Vision-Language Models [3.092385483349516]
本稿では、AI審査員のレーティングが人間の専門家のレーティングと一致するかどうかを判断する厳密な統計枠組みを提案する。
この枠組みを,VLMに基づく4人の審査員を主要な設計基準で評価するケーススタディに適用する。
その結果,トップパフォーマンスのAI審査員は,一意性や描画品質に関する専門家レベルの合意を達成できることがわかった。
論文 参考訳(メタデータ) (2025-04-01T16:20:29Z) - MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors [82.91830877219822]
我々は、総合的なチューリングモデル評価のためのオープンソースのベンチマークであるMathTutorBenchを紹介する。
MathTutorBenchには、ダイアログベースの教育における科学の研究によって定義された、家庭教師の能力をカバーするデータセットとメトリクスが含まれている。
閉鎖的およびオープンウェイトなモデルの幅広いセットを評価し、問題解決能力によって示される課題の専門知識が、すぐには良い教育に変換されないことを発見した。
論文 参考訳(メタデータ) (2025-02-26T08:43:47Z) - Intelligent Tutors Beyond K-12: An Observational Study of Adult Learner Engagement and Academic Impact [0.0]
本研究では,州立工業大学における成人学習者を対象に,新しい授業システム Apprentice Tutors の採用,利用パターン,有効性について検討した。
本研究は,教師間の知識コンポーネントのスキル改善を通じて,教師の関与の鍵となる時間的パターンを明らかにし,教師内での学習の証拠を提供するものである。
これらの結果は、知的家庭教師が成人学習者にとって有効なツールであり、この人口に対する長期的な影響についてさらなる研究を保証していることを示唆している。
論文 参考訳(メタデータ) (2025-02-23T15:36:22Z) - Unifying AI Tutor Evaluation: An Evaluation Taxonomy for Pedagogical Ability Assessment of LLM-Powered AI Tutors [7.834688858839734]
我々は,現在最先端の大規模言語モデル (LLM) がAI家庭教師として有効かどうかを検討する。
本研究では,キーラーニング科学の原則に基づく8つの教育次元を持つ統一的な評価分類法を提案する。
MRBench - 192の会話と1,596の回答を含む新しい評価ベンチマーク。
論文 参考訳(メタデータ) (2024-12-12T16:24:35Z) - Evaluating and Optimizing Educational Content with Large Language Model Judgments [52.33701672559594]
言語モデル(LM)を教育専門家として活用し,学習結果に対する様々な指導の影響を評価する。
本稿では,一方のLMが他方のLMの判断を報酬関数として利用して命令材料を生成する命令最適化手法を提案する。
ヒトの教師によるこれらのLM生成ワークシートの評価は、LM判定と人間の教師の嗜好との間に有意な整合性を示す。
論文 参考訳(メタデータ) (2024-03-05T09:09:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。