論文の概要: GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns
- arxiv url: http://arxiv.org/abs/2606.12419v1
- Date: Fri, 08 May 2026 10:54:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.87903
- Title: GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns
- Title(参考訳): GeoDial: 幾何問題解決のための多モード対話型チューニングデータセット-ビジュアル・チュータ・ターンを用いた検討
- Authors: Sankalan Pal Chowdhury, Junling Wang, Donya Rooein, April Yi Wang, Mrinmaya Sachan,
- Abstract要約: 幾何学領域における1.3K以上の教師-学生対話のデータセットであるGeoDialを紹介する。
本稿では,対話行動,視覚的ハイライト,フィードバックを統合したスケーラブルなアノテーションプロトコルを提案する。
- 参考スコア(独自算出の注目度): 55.28321614854968
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Several educational domains rely heavily on diagrams and visual cues, yet most existing tutoring datasets are limited to text-only interactions. This limits the development of AI tutors that can teach in visually grounded ways used by human instructors. Thus, we introduce GeoDial, a multimodal tutoring dataset of over 1.3K teacher-student dialogs in the domain of geometry collected from experienced math teachers, where instructional turns are explicitly grounded in diagram highlights. We propose a scalable annotation protocol that integrates dialog acts, visual highlighting, and feedback, enabling fine-grained supervision of both language and visual tutoring behavior. To illustrate the challenges posed by this setting, we fine-tune several vision-language models on GeoDial and evaluate their ability to generate tutoring utterances and diagram highlights. While supervised fine-tuning substantially improves the quality of generated dialog, it struggles to produce accurate diagram highlights, revealing a key limitation of current methods and highlighting the need for approaches that more effectively integrate visual reasoning with pedagogical interaction.
- Abstract(参考訳): いくつかの教育領域は図や視覚的手がかりに大きく依存しているが、既存の学習データセットはテキストのみのインタラクションに限られている。
これにより、人間のインストラクターが使用する視覚的に基礎的な方法を教えることができるAI家庭教師の開発が制限される。
そこで我々は、経験豊富な数学教師から収集された幾何学領域における1,3K以上の教師と学生の対話のマルチモーダル学習データセットであるGeoDialを紹介した。
本稿では,対話行動,視覚的ハイライト,フィードバックを統合したスケーラブルなアノテーションプロトコルを提案する。
この設定によって引き起こされる課題を説明するため、GeoDial上で複数の視覚言語モデルを微調整し、学習発話や図表ハイライトを生成する能力を評価する。
教師付き微調整は生成されたダイアログの品質を大幅に向上させるが、正確なダイアログのハイライトの作成に苦労し、現在のメソッドのキーとなる制限を明らかにし、視覚的推論をより効果的に統合するアプローチの必要性を強調している。
関連論文リスト
- MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors [82.91830877219822]
我々は、総合的なチューリングモデル評価のためのオープンソースのベンチマークであるMathTutorBenchを紹介する。
MathTutorBenchには、ダイアログベースの教育における科学の研究によって定義された、家庭教師の能力をカバーするデータセットとメトリクスが含まれている。
閉鎖的およびオープンウェイトなモデルの幅広いセットを評価し、問題解決能力によって示される課題の専門知識が、すぐには良い教育に変換されないことを発見した。
論文 参考訳(メタデータ) (2025-02-26T08:43:47Z) - MathDial: A Dialogue Tutoring Dataset with Rich Pedagogical Properties
Grounded in Math Reasoning Problems [74.73881579517055]
そこで本稿では,一般学生の誤りを表現した大規模言語モデルを用いて,人間教師の対話を生成する枠組みを提案する。
このフレームワークを用いて3kの1対1の教師-学生対話のデータセットであるMathDialを収集する方法について述べる。
論文 参考訳(メタデータ) (2023-05-23T21:44:56Z) - Opportunities and Challenges in Neural Dialog Tutoring [54.07241332881601]
言語学習のための2つの対話学習データセットを用いて、様々な生成言語モデルを厳密に分析する。
現在のアプローチでは、制約のある学習シナリオでチューリングをモデル化できますが、制約の少ないシナリオではパフォーマンスが悪くなります。
人的品質評価では, モデルと接地木アノテーションの両方が, 同等のチュータリングの点で低い性能を示した。
論文 参考訳(メタデータ) (2023-01-24T11:00:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。