論文の概要: Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math
- arxiv url: http://arxiv.org/abs/2603.24961v1
- Date: Thu, 26 Mar 2026 02:57:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.062533
- Title: Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math
- Title(参考訳): MLLMは学生の心を読むことができるか? 手書き数学のマルチモーダル誤差解析を解き放つ
- Authors: Dingjie Song, Tianlong Xu, Yi-Fan Zhang, Hang Li, Zhiling Yan, Xing Fan, Haoyang Li, Lichao Sun, Qingsong Wen,
- Abstract要約: スクラッチマス(ScratchMath)は,手書き数学のスクラッチワークにおける誤りの説明と分類のための新しいベンチマークである。
本データセットは,中国初等・中等生の1,720個の数学サンプルからなる。
我々は,ScratchMath上での16のMLLMを系統的に評価し,人的専門家に対する顕著な性能差を明らかにした。
- 参考スコア(独自算出の注目度): 55.83696908107408
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Assessing student handwritten scratchwork is crucial for personalized educational feedback but presents unique challenges due to diverse handwriting, complex layouts, and varied problem-solving approaches. Existing educational NLP primarily focuses on textual responses and neglects the complexity and multimodality inherent in authentic handwritten scratchwork. Current multimodal large language models (MLLMs) excel at visual reasoning but typically adopt an "examinee perspective", prioritizing generating correct answers rather than diagnosing student errors. To bridge these gaps, we introduce ScratchMath, a novel benchmark specifically designed for explaining and classifying errors in authentic handwritten mathematics scratchwork. Our dataset comprises 1,720 mathematics samples from Chinese primary and middle school students, supporting two key tasks: Error Cause Explanation (ECE) and Error Cause Classification (ECC), with seven defined error types. The dataset is meticulously annotated through rigorous human-machine collaborative approaches involving multiple stages of expert labeling, review, and verification. We systematically evaluate 16 leading MLLMs on ScratchMath, revealing significant performance gaps relative to human experts, especially in visual recognition and logical reasoning. Proprietary models notably outperform open-source models, with large reasoning models showing strong potential for error explanation. All evaluation data and frameworks are publicly available to facilitate further research.
- Abstract(参考訳): 学生の手書きスクラッチワークの評価は、個別の教育的フィードバックには不可欠であるが、多様な手書き、複雑なレイアウト、様々な問題解決アプローチによる固有の課題が提示される。
既存のNLPは、主にテキスト応答に焦点を合わせ、真に手書きのスクラッチワークに固有の複雑さと多モード性を無視している。
現在のMLLM(Multimodal large language model)は、視覚的推論において優れているが、通常は「検査的視点」を採用し、学生の誤りを診断するよりも正しい回答を生成することを優先している。
これらのギャップを埋めるために、我々はScratchMathという新しいベンチマークを紹介した。
本データセットは,中国小中学生の1,720個の数学サンプルからなり,誤り原因説明(ECE)と誤り原因分類(ECC)の2つの主要なタスクをサポートする。
このデータセットは、専門家のラベル付け、レビュー、検証の複数の段階を含む厳密な人間と機械の協力的なアプローチを通じて、慎重に注釈付けされている。
我々は,ScratchMathにおける16のMLLMを系統的に評価し,特に視覚認識と論理的推論において,人的専門家に対する顕著な性能差を明らかにした。
プロプライエタリモデルは特にオープンソースモデルより優れており、大きな推論モデルはエラー説明の可能性が強い。
すべての評価データとフレームワークは、さらなる研究を促進するために公開されている。
関連論文リスト
- MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection [53.325457460187046]
これらの課題に対処するために設計された新しいMixture-of-Math-AgentフレームワークであるMathAgentを紹介する。
MathAgentはエラー検出を3つのフェーズに分解し、それぞれが特別なエージェントによって処理される。
実世界の教育データに基づいてMathAgentを評価し,誤差ステップ同定の精度を約5%向上した。
論文 参考訳(メタデータ) (2025-03-23T16:25:08Z) - Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework [79.40678802098026]
数学の単語問題は、大規模言語モデルの推論能力を評価するための重要なベンチマークとなる。
現在のエラー分類法は静的および事前定義されたカテゴリに依存している。
本稿では,共通なエラーパターンを明示的なガイダンスとして組み込んだEAP(Error-Aware Prompting)を提案する。
論文 参考訳(メタデータ) (2025-01-26T16:17:57Z) - ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection [60.297079601066784]
エラー検出におけるMLLMの能力を評価するために設計された最初のベンチマークであるErrorRadarを紹介する。
ErrorRadarはエラーステップ識別とエラー分類という2つのサブタスクを評価している。
2500の高品質なマルチモーダルK-12数学問題で構成され、実世界の学生相互作用から収集される。
GPT-4oの優れた性能は、まだ人間の評価に約10%遅れているため、大きな課題が残っている。
論文 参考訳(メタデータ) (2024-10-06T14:59:09Z) - DiVERT: Distractor Generation with Variational Errors Represented as Text for Math Multiple-choice Questions [42.148511874019256]
算数多重選択問題(MCQ)において,障害の背後にある誤りの解釈可能な表現を学習する新しい変分法であるDiVERTを導入する。
提案手法は,7Bパラメータを持つベース・オープンソース LLM を用いているにもかかわらず,GPT-4o を用いた最先端の手法を下流のイントラクタ生成において上回っていることを示す。
数学教育者による人間評価も行っており、DiVERTが人間による評価に匹敵する品質のエラーラベルを導いていることを発見した。
論文 参考訳(メタデータ) (2024-06-27T17:37:31Z) - Can Large Language Models Replicate ITS Feedback on Open-Ended Math Questions? [3.7399138244928145]
本研究では,大規模言語モデルのオープンエンド数学質問に対するフィードバック生成能力について検討する。
オープンソースのモデルとプロプライエタリなモデルの両方が、トレーニング中に見たフィードバックを複製する可能性を示していますが、以前は見つからなかった学生のエラーに対して、十分に一般化していません。
論文 参考訳(メタデータ) (2024-05-10T11:53:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。