論文の概要: MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems
- arxiv url: http://arxiv.org/abs/2608.15006v1
- Date: Sat, 15 Aug 2026 03:24:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.159564
- Title: MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems
- Title(参考訳): MetaReason: 幾何学問題の解法のためのメタ情報編集による精密インターリーブ型マルチモーダル推論
- Abstract要約: 平面幾何学におけるマルチモーダル推論のためのフレームワークであるMetaReasonを提案する。
TutorGeoは、17kのイメージ・ツー・ミータ変換サンプル、60kのテキストのみの推論トレース、60kのインターリーブされたマルチモーダル推論トレースを含む包括的なデータセットである。
また,現実の検査問題から派生したベンチマークであるExamGeoを導入し,様々な難易度で体系的な評価を可能にする。
- 参考スコア(独自算出の注目度): 27.014878843975854
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although visual reasoning is crucial for solving complex geometry tasks, existing vision-language models rely heavily on text-only reasoning. Some recent methods introduce intermediate visual states to facilitate reasoning, but they are often hindered by inaccurate geometric representations and low rendering fidelity, ultimately leading to unreliable outputs. To address these limitations, we propose MetaReason, a framework for multimodal reasoning in plane geometry that leverages structured meta-information to enable accurate auxiliary-line construction. The framework first parses geometric images into meta-information, performs controllable edits with predefined tools to synthesize high-fidelity visual states, and then conducts reasoning based on these augmented views. To support this framework, we construct TutorGeo, a comprehensive dataset containing 17k image-to-meta conversion samples, 60k text-only reasoning traces, and 60k interleaved multimodal reasoning traces. Using this dataset, we combine supervised fine-tuning and reinforcement learning to develop robust multimodal reasoning capabilities. We also introduce ExamGeo, a benchmark derived from real-world examination problems that enables systematic evaluation across varying difficulty levels. Experimental results demonstrate that MetaReason significantly outperforms existing open-source models and achieves competitive performance against proprietary models.
- Abstract(参考訳): 視覚的推論は複雑な幾何学的タスクの解決には不可欠であるが、既存の視覚言語モデルはテキストのみの推論に大きく依存している。
いくつかの最近の手法では、推論を容易にするために中間的な視覚状態を導入しているが、しばしば不正確な幾何学的表現と低いレンダリング忠実さによって妨げられ、最終的には信頼性の低い出力につながる。
これらの制約に対処するため,平面幾何学におけるマルチモーダル推論のためのフレームワークであるMetaReasonを提案する。
このフレームワークは、まず幾何学的画像をメタ情報に解析し、予め定義されたツールで制御可能な編集を行い、高忠実度な視覚状態を合成し、これらの拡張されたビューに基づいて推論を行う。
このフレームワークをサポートするためにTutorGeoを構築した。このデータセットは、17kのイメージ・ツー・ミータ変換サンプル、60kのテキストのみの推論トレース、60kのインターリーブされたマルチモーダル推論トレースを含む包括的データセットである。
このデータセットを用いて、教師付き微調整と強化学習を組み合わせて、堅牢なマルチモーダル推論機能を開発する。
また,現実の検査問題から派生したベンチマークであるExamGeoを導入し,様々な難易度で体系的な評価を可能にする。
実験の結果、MetaReasonは既存のオープンソースモデルよりも大幅に優れており、プロプライエタリモデルと競合する性能を実現していることがわかった。
関連論文リスト
- Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language [60.70116693224378]
我々は平面と固体の幾何学を統合した統一形式言語を設計し、幾何学構造と意味関係を包括的に網羅する。
GDP-29Kは,実世界の様々な情報源から収集した20k平面と9k固体形状のサンプルからなる大規模データセットである。
論文 参考訳(メタデータ) (2026-04-13T15:09:56Z) - Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning [45.18040184559187]
本稿では,Visual-Text Interleaved Chain-of-Thoughtを提案する。
最初にGeoAux-Benchを紹介した。GeoAux-Benchは、4,334の幾何学的問題からなる最初のベンチマークで、テキスト構築ステップと地平線による視覚的更新を一致させる。
パイロット実験では,(1)視覚・テクスチュアル・エイズが,幾何学的相乗効果を損なわない単一モダリティ・エイズよりも優れており,(2)エントロピー・リデューサとして機能し,推論の難易度と強く関連している,という2つの重要な知見が得られた。
論文 参考訳(メタデータ) (2026-03-19T09:27:20Z) - VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations [47.94531550391802]
多視点視覚推論は、スパースと離散的な視点から複雑な環境を理解する必要があるインテリジェントシステムにとって不可欠である。
現実のシナリオでは、ビュー間の推論は、明示的なガイダンスなしで部分的な観察を統合する必要がある。
我々は物理基底シミュレーションを利用して、ビュー毎の正確なメタデータを持つ多種多様な高忠実な3Dシーンを構築する。
論文 参考訳(メタデータ) (2026-03-17T13:36:30Z) - M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering [10.491266031106774]
M3-ACE(M3-ACE)は、数学の推論において視覚的知覚を正すために設計された多言語コンテキストエンジニアリングフレームワークである。
提案手法は,MathVisionベンチマークで89.1の新たな結果を確立し,他の関連するデータセットに対して一貫した改善を実現する。
論文 参考訳(メタデータ) (2026-03-09T13:32:25Z) - PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning [82.55361351483005]
我々は,3次元データに対する明示的なチェーン・オブ・ソート(CoT)推論でMLLMを強化する新しいフレームワークであるPointCoTを提案する。
両ストリームのマルチモーダルアーキテクチャを活用することで,幾何学的真理とセマンティックな外観を相乗化することができる。
論文 参考訳(メタデータ) (2026-02-27T11:47:45Z) - TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning [104.66714520975837]
古典的タングラムゲームのレンズを通して構成空間推論を評価するために,幾何グラウンドのベンチマークを導入する。
本稿では,タングラム集合を正確に機械で検証可能な座標仕様でグルーピングする記号幾何学的枠組みであるタングラム構成式(TCE)を提案する。
MLLMは、幾何学的制約を無視しながら、ターゲットのシルエットとのマッチングを優先する傾向がある。
論文 参考訳(メタデータ) (2026-01-23T07:35:05Z) - GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation [28.500787311066563]
GeoSketchは、幾何学的推論をインタラクティブな知覚・推論・アクションループとして再キャストする、ニューラルシンボリックなフレームワークである。
階層的な意思決定、実行可能な視覚行動、象徴的な検証を統一することにより、GeoSketchは静的解釈から動的相互作用へのマルチモーダル推論を前進させる。
論文 参考訳(メタデータ) (2025-09-26T15:12:04Z) - Explain Before You Answer: A Survey on Compositional Visual Reasoning [74.27548620675748]
構成的視覚推論は、マルチモーダルAIにおける重要な研究フロンティアとして登場した。
本調査は,トップ会場(CVPR,ICCV,NeurIPS,ICML,ACLなど)から260以上の論文を体系的にレビューする。
次に60以上のベンチマークとそれに対応するメトリクスを、基底精度、連鎖忠実性、高分解能知覚などの次元に沿って探索する。
論文 参考訳(メタデータ) (2025-08-24T11:01:51Z) - Fuse, Reason and Verify: Geometry Problem Solving with Parsed Clauses from Diagram [78.79651421493058]
平面幾何学的問題解法 (PGPS) のニューラルネットワークモデルを提案し, モーダル融合, 推論過程, 知識検証の3つの重要なステップについて述べる。
推論のために、幾何学的推論過程を記述するための説明可能な解プログラムを設計し、自己限定デコーダを用いて解プログラムを自動回帰的に生成する。
また, PGPS9Kと呼ばれる大規模幾何学的問題データセットを構築し, テキスト節, 解法プログラム, 関連知識解決器の詳細なアノテーションを含む。
論文 参考訳(メタデータ) (2024-07-10T02:45:22Z) - GeomVerse: A Systematic Evaluation of Large Models for Geometric
Reasoning [17.61621287003562]
幾何学問題のレンズを用いて視覚言語モデル(VLM)を様々な軸に沿って評価する。
複数の軸に沿った制御可能な難易度を持つ幾何学的質問の合成データセットを手続き的に作成する。
最新のVLMのベンチマークを用いて得られた実験結果から,これらのモデルが幾何学的対象に適さないことが示された。
論文 参考訳(メタデータ) (2023-12-19T15:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。