論文の概要: Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.14779v1
- Date: Sun, 13 Sep 2026 20:39:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.967846
- Title: Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models
- Title(参考訳): Func-R1:マルチモーダル大言語モデルにおける数学的関数推論のインセンティブ化
- Abstract要約: 本稿では,正確な視覚知覚と厳密な論理的推論を調和させるFunc-R1を提案する。
Func-R1 はオープンソース MLLM の最適性能を提供し、GPT-5 を超え、MathVerse の関数指向タスクは 8.4% 改善されている。
- 参考スコア(独自算出の注目度): 47.0185752409638
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Performing deliberate mathematical reasoning in visual contexts is a hallmark of advanced Multimodal Large Language Models (MLLMs) and requires a sophisticated synthesis of perceptual grounding and symbolic logic. However, in the realm of mathematical functions, our investigation reveals a critical modality interference phenomenon: even advanced models, while performing textual computational reasoning, tend to disregard or misinterpret essential visual cues. To address this challenge, we propose Func-R1, which synergistically harmonizes precise visual perception and rigorous logical reasoning. Concretely, built upon an explicitly decoupled architecture, we employ a hierarchical post-training framework to progressively identify critical visual evidence and conduct in-depth theoretical reasoning. Furthermore, the Perception-Aligned Theoretic Optimization (PATO) strategy is proposed to steer policy updating towards internalizing fundamental theoretical properties while dynamically rectifying heterogeneous visual information throughout the reasoning process. Extensive experiments across diverse benchmarks demonstrate that Func-R1 delivers the optimal performance among open-source MLLMs, even surpassing GPT-5 with an 8.4% improvement on MathVerse's function-oriented tasks.
- Abstract(参考訳): 視覚的文脈で故意に数学的推論を実行することは、先進的マルチモーダル大言語モデル(MLLM)の目印であり、知覚基底と記号論理の洗練された合成を必要とする。
しかし, 数理関数の領域では, 高度なモデルであっても, テキスト計算による推論を行う一方で, 重要な視覚的手がかりを無視したり誤解したりする傾向にある。
この課題に対処するため,Func-R1を提案する。
具体的には,明確に分離されたアーキテクチャ上に構築された階層的なポストトレーニングフレームワークを用いて,重要な視覚的証拠を段階的に識別し,詳細な理論的推論を行う。
さらに, 基本理論的特性の内在化をめざして, 不均一な視覚情報を推論過程を通じて動的に修正する政策を策定するために, パーセプションアラインメント理論最適化(PATO)戦略を提案する。
さまざまなベンチマークにわたる大規模な実験により、Func-R1はオープンソースのMLLM間で最適なパフォーマンスを提供し、MathVerseの関数指向タスクは8.4%改善され、GPT-5を超えた。
関連論文リスト
- On Theoretically-Driven LLM Agents for Multi-Dimensional Discourse Analysis [0.0]
本稿では,この課題に明示的な理論的知識を取り入れることのメリットを定量化するために,比較マルチエージェントフレームワークを提案する。
我々は、注釈付き政治討論のデータセットを利用して、4つの異なる言い換え機能を含む新しい標準を確立する。
我々は,2つの並列LLMエージェントシステムの評価を行った。1つはRetrieval-Augmented Generation (RAG)による議論理論により強化され,もう1つはゼロショットベースラインである。
論文 参考訳(メタデータ) (2026-02-14T10:30:39Z) - ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking [25.939489188497106]
CoTはLLMの推論能力を大幅に向上させ、マルチモーダルドメインに拡張する際の課題に直面している。
マルチモーダルな数学的タスクのための ViRC フレームワークを提案し,CoT を連続的に臨界推論ユニットに構成する Reason Chunking 機構を提案する。
結果として得られたViRC-7Bモデルは、複数の数学ベンチマークでベースラインよりも平均18.8%向上した。
論文 参考訳(メタデータ) (2025-12-16T18:13:54Z) - Deep Unfolding: Recent Developments, Theory, and Design Guidelines [99.63555420898554]
この記事では、最適化アルゴリズムを構造化されたトレーニング可能なMLアーキテクチャに変換するフレームワークであるDeep Unfoldingのチュートリアルスタイルの概要を提供する。
推論と学習のための最適化の基礎を概観し、深層展開のための4つの代表的な設計パラダイムを導入し、その反復的な性質から生じる特有なトレーニングスキームについて議論する。
論文 参考訳(メタデータ) (2025-12-03T13:16:35Z) - Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs [59.66595230543127]
概念図はメンタルモデルを外部化し、関係のない詳細を抽象化して、エンティティの相互作用を効率的に捉える。
大規模言語モデル (LLM) と大規模マルチモーダルモデル (LMM) は、主にテキストを通して推論される。
我々は、LMMが複数の自己生成概念図を通した推論を可能にする、一般化可能なフレームワークであるVisual Thinkingを提案する。
論文 参考訳(メタデータ) (2025-03-14T18:27:02Z) - R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization [26.757458496178437]
視覚知覚と深い推論のギャップを埋めるために設計されたマルチモーダル推論モデルであるR1-Onevisionを紹介する。
我々はR1-Onevisionデータセットを構築し、多様なドメインにまたがる詳細かつステップバイステップのマルチモーダル推論アノテーションを提供する。
先進的推論を育成するために,教師付き微調整と強化学習によりR1-Onevisionモデルをさらに発展させる。
実験結果から,R1-OnevisionはGPT-4oやQwen2.5-VLなど,最先端のモデルよりも優れた性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-03-13T17:56:05Z) - BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning [78.63421517563056]
大規模言語モデル(LLM)は複雑な推論タスクにおいて顕著な機能を示した。
本稿では,新しいグラフィカルモデルを用いてLLM推論を定式化する統一確率的フレームワークを提案する。
本稿では,Bootstrapping Reinforced Thinking Process (BRiTE)アルゴリズムについて述べる。
論文 参考訳(メタデータ) (2025-01-31T02:39:07Z) - Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm Perspective [98.29190911211053]
CoR(Chain-of-Reasoning)は、複数の推論パラダイムを統合する新しい統合フレームワークである。
CoRは異なる推論パラダイムによって複数の潜在的な答えを生成し、それらをコヒーレントな最終解へと合成する。
実験の結果,CoR-Math-7Bは現在のSOTAモデルより有意に優れていた。
論文 参考訳(メタデータ) (2025-01-19T16:53:26Z) - Cantor: Inspiring Multimodal Chain-of-Thought of MLLM [83.6663322930814]
視覚的コンテキスト獲得と論理的推論の集約は、視覚的推論タスクに取り組む上で重要であると我々は主張する。
我々はCantorと呼ばれる革新的なマルチモーダルCoTフレームワークを提案し、その特徴は知覚決定アーキテクチャである。
提案手法の有効性を実証し,マルチモーダルCoT性能の大幅な向上を示した。
論文 参考訳(メタデータ) (2024-04-24T17:59:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。