論文の概要: Exploring Agentic Workflows for Generating High Quality Math Visual Aids
- arxiv url: http://arxiv.org/abs/2607.09839v1
- Date: Fri, 10 Jul 2026 17:12:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.227064
- Title: Exploring Agentic Workflows for Generating High Quality Math Visual Aids
- Title(参考訳): 高品質な数学ビジュアルエイドを生成するためのエージェントワークフローの探索
- Authors: Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan,
- Abstract要約: 本稿では,大規模言語モデル(LLM)が生成した視覚の質を評価するためのエージェントワークフローを提案する。
この自己改善ループは、AI生成ダイアグラムの正確性と教育的適切性を高めることを目的としている。
- 参考スコア(独自算出の注目度): 0.8228126670075446
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mathematical diagrams play a crucial role in K 12 education, both as problem components and as scaffolding for student comprehension. However, current AI tools, including Large Language Models (LLMs), struggle to reliably generate accurate and pedagogically sound visual diagrams, even when provided with detailed descriptions. A significant gap therefore remains in the reliable generation of diagrams for middle school mathematics. To address this, we introduce an agentic workflow that enables LLM agents to evaluate the quality of generated visuals and use this feedback to iteratively improve their outputs. This self improvement loop aims to enhance the accuracy and educational appropriateness of AI generated diagrams. Our research investigates two questions. First, can LLMs accurately generate quality assurance questions for a visual aid given specific criteria for visual quality? Second, given valid quality assurance questions, can Vision Language Models effectively evaluate generated K 12 visual aids and use the resulting feedback to improve them iteratively? We conduct an exploratory evaluation of our agentic workflow and identify key areas for improvement, including stronger spatial reasoning and more comprehensive coverage of diagram features in the generated quality assurance questions. Our results provide preliminary evidence that this approach can improve the reliability and educational value of AI generated mathematical diagrams.
- Abstract(参考訳): 数学図は、問題要素と学生理解のための足場として、K12教育において重要な役割を担っている。
しかし、LLM(Large Language Models)を含む現在のAIツールは、詳細な説明が提供されても、正確で教育的な視覚図を生成するのに苦労している。
したがって、重要なギャップは中学数学の信頼できる図形の生成に残されている。
そこで本研究では,LLMエージェントが生成した視覚の質を評価するためのエージェントワークフローを導入し,このフィードバックを用いて出力を反復的に改善する。
この自己改善ループは、AI生成ダイアグラムの正確性と教育的適切性を高めることを目的としている。
我々の研究は2つの質問を調査する。
まず、LLMは視覚品質の特定の基準を満たす視覚支援のための品質保証質問を正確に生成できるか?
第二に、有効な品質保証質問が与えられた場合、視覚言語モデルは生成したK12ビジュアルエイズを効果的に評価し、得られたフィードバックを使って反復的に改善することができるか?
我々はエージェントワークフローの探索的評価を行い、より強力な空間推論や、生成された品質保証問題における図の特徴の包括的カバレッジを含む改善のための重要な領域を特定する。
提案手法は,AI生成した数学図の信頼性と教育的価値を向上させることができることを示す予備的証拠を提供する。
関連論文リスト
- CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences [51.86576932800981]
CV-Arenaは、プロの規模でこの能力を評価するために設計されたオープンベンチマークである。
CV-Arenaは16の命令ベースの視覚タスクタイプにまたがる12Kの高解像度実像命令ペアを含んでいる。
我々は,計画,編集,検証を組み合わせた軽量エージェントモデルCV-Agentを開発した。
論文 参考訳(メタデータ) (2026-05-30T23:37:55Z) - Can We Improve Educational Diagram Generation with In-Context Examples? Not if a Hallucination Spoils the Bunch [3.430175346274554]
本研究では、RSTに基づく文脈内例を用いた新しい図形コード生成手法を提案する。
提案手法は,論理的構造,接続性,レイアウト美学,AI幻覚のために,大規模言語モデル(LLM)で生成した150の図をコンピュータサイエンス教育者によって評価した。
論文 参考訳(メタデータ) (2026-01-28T10:45:28Z) - QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding [80.66379018208568]
視覚的品質評価は、予測から解釈可能な品質理解へとシフトしている。
現在のアプローチは、教師付き微調整や強化学習に頼っている。
本稿では,視覚的品質知覚のための大規模マルチモーダルモデルの潜在知覚的知識を体系的に活用するフレームワークであるVbfQualiRAGを提案する。
論文 参考訳(メタデータ) (2026-01-26T06:27:03Z) - Towards Efficient Educational Chatbots: Benchmarking RAG Frameworks [2.362412515574206]
大規模言語モデル(LLM)は、大量の文献に基づく情報を収集することで、教育において非常に有益であることが証明されている。
本稿では,LLMを活用してGATEソリューションを説明し,学生の試験準備を支援するAIを活用した質問応答フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-02T08:11:07Z) - Multi-Modal Prompt Learning on Blind Image Quality Assessment [65.0676908930946]
画像品質評価(IQA)モデルは意味情報から大きな恩恵を受け、異なる種類のオブジェクトを明瞭に扱うことができる。
十分な注釈付きデータが不足している従来の手法では、セマンティックな認識を得るために、CLIPイメージテキスト事前学習モデルをバックボーンとして使用していた。
近年のアプローチでは、このミスマッチに即時技術を使って対処する試みがあるが、これらの解決策には欠点がある。
本稿では、IQAのための革新的なマルチモーダルプロンプトベースの手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:45:32Z) - CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning [61.21923643289266]
カオス・オブ・マニピュレーション(Chain of Manipulations)は、視覚言語モデル(Vision-Language Models)が、エビデンスを段階的に解決するメカニズムである。
トレーニング後、モデルは外部ツールを介さずに、本質的な操作(グラウンド、ズームインなど)を積極的に行うことで、様々な視覚的問題を解決することができる。
トレーニングされたモデルである textbfCogCoM は、4つのカテゴリの9つのベンチマークで最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-02-06T18:43:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。