論文の概要: UniCAR-RL: Seeing Better before Thinking Deeper in Visual Mathematics
- arxiv url: http://arxiv.org/abs/2609.13849v1
- Date: Sat, 12 Sep 2026 10:07:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.583499
- Title: UniCAR-RL: Seeing Better before Thinking Deeper in Visual Mathematics
- Title(参考訳): UniCAR-RL: ビジュアル数学をもっと深く考える前にもっと良くなる
- Abstract要約: アノテーションのない強化学習フレームワークUniCAR-RLを提案する。
トレーニングプロセス中の知覚と推論の最適化を明示的に分離することにより、両方の機能の分離と最適化を実現する。
実験により、UniCAR-RLは生の短問合せデータのみを用いてMLLMの数学的および視覚的推論を大幅に改善することが示された。
- 参考スコア(独自算出の注目度): 33.01988707981005
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) often struggle with complex mathematical visual reasoning primarily due to a lack of fine-grained perception, causing initial visual hallucinations to directly trigger cascading reasoning failures. In traditional end-to-end reinforcement learning (RL), sparse rewards fail to decouple perceptual hallucinations from logical missteps, hindering targeted perception optimization. Alternatively, fine-tuning with perception-enhanced CoT data incurs high costs and hallucinations. In this paper, we address these challenges by proposing UniCAR-RL, an annotation-free RL framework. By explicitly decoupling the optimization of perception and reasoning during the training process, it achieves isolation and optimization of both capabilities. Specifically, UniCAR-RL consists of three synergistic branches: 1) a Caption-RL branch that optimizes perception capabilities through verifier-guided reasoning validation; 2) a Reasoning-RL branch that performs logical reasoning based on a gold image description to halt cascading errors; 3) a QA-RL branch that retains native end-to-end alignment to ensure robust question-answering performance. Experiments show that UniCAR-RL substantially improves MLLMs' mathematical and visual reasoning using only raw short-answer data. Furthermore, it demonstrates strong generalization across diverse architectures and scales.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、主に微粒な知覚の欠如のために複雑な数学的推論に苦しむことが多く、初期視覚幻覚はカスケード推論の失敗を直接引き起こす。
従来のエンドツーエンド強化学習(RL)では、スパース報酬は知覚の幻覚を論理的な誤りから切り離すことができず、目標の知覚最適化を妨げる。
あるいは、知覚を増強したCoTデータによる微調整は、高いコストと幻覚を引き起こす。
本稿では,アノテーションのないRLフレームワークUniCAR-RLを提案する。
トレーニングプロセス中の知覚と推論の最適化を明示的に分離することにより、両方の機能の分離と最適化を実現する。
具体的には、UniCAR-RLは3つの相乗枝から構成される。
1)検証者誘導推論検証により知覚能力を最適化するCaption-RLブランチ
2 ゴールド画像の記述に基づいて論理的推論を行い、カスケードエラーを停止する推論RL分岐
3)QA-RLブランチは、ネイティブなエンドツーエンドアライメントを保持し、堅牢な質問応答性能を保証する。
実験により、UniCAR-RLは生の短問合せデータのみを用いてMLLMの数学的および視覚的推論を大幅に改善することが示された。
さらに、多様なアーキテクチャやスケールにまたがる強力な一般化を示す。
関連論文リスト
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis [23.904569857346605]
計算報酬による強化学習は、視覚言語モデルにおける視覚的推論を促進するための訓練後の標準的な段階となっている。
エンドツーエンドのベンチマークでは、複数の要因が明確化され、特定のスキルに改善を加えることが難しくなる。
本研究では, (i) 因果探索による関数的局所化, (ii) パラメータ比較による更新特性, (iii) モデルマージによる転送可能性テストを含むフランケンシュタイン型解析フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-12T20:44:27Z) - SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning [48.43989881030515]
本稿では,大規模言語モデル(MLLM)の推論能力を高めるための強化学習フレームワークを提案する。
SAIL-RLは、事実的根拠、論理的一貫性、回答整合性を通じて推論品質を評価するThinking Rewardと、深い推論と直接回答が適切かどうかを適応的に決定するJudging Rewardである。
論文 参考訳(メタデータ) (2025-11-04T05:34:06Z) - Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL [19.659532349434418]
強化学習(Reinforcement Learning, RL)は、近年、大規模言語モデルの推論能力を強化する主要なパラダイムとなっている。
しかし、数学やプログラミングのベンチマークで一般的に使われるルールベースの報酬関数は、応答形式と正しさのみを評価する。
本稿では,報酬と有利な信号の両方を再生するプラグイン・アンド・プレイのRL報酬フレームワークであるDynamic Reasoning Efficiency Reward (DRER)を提案する。
論文 参考訳(メタデータ) (2025-09-07T11:52:18Z) - Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning [93.00629872970364]
強化学習(Reinforcement Learning, RL)は, 複雑な推論タスクにおいて, 言語モデルの性能向上のための主要なパラダイムとなっている。
SPARKLE(SPARKLE)は、3つの重要な次元にわたるRLの効果を詳細に解析するフレームワークである。
我々は、RL信号と混合品質の推論トレースを産出しない難題が、依然としてトレーニングに有効であるかどうかを調査する。
論文 参考訳(メタデータ) (2025-06-05T07:53:59Z) - Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning [95.44766931218896]
MLLM(Multi-modal large language model)は、テキストベースの推論に遅れを取っている。
本稿では,MLLMの推論コンポーネントをモジュール化し,容易に置き換え可能なパーセプション推論デカップリングを提案する。
本稿では,視覚知覚最適化(VPO)と呼ばれる新しい強化学習アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-05T02:28:07Z) - Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models [83.24079543652253]
大規模言語モデル(LLM)は、強化学習(RL)最適化を通じて、推論タスクにおいて著しく進歩している。
しかし、推論指向RL微調整は幻覚の頻度を著しく高めている。
本稿では,明示的事実性検証を取り入れた革新的なRL微調整アルゴリズムであるFSPOを提案する。
論文 参考訳(メタデータ) (2025-05-30T14:23:32Z) - Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1 [53.894789613838654]
ビデオ理解におけるMLLMのポストトレーニング手法を評価するためのベンチマークであるSEED-Bench-R1を紹介する。
複雑な現実世界のビデオや、複数の質問の形式での複雑な日常的な計画タスクも含んでいる。
Qwen2-VL-Instruct-7Bをベースモデルとして、RLと教師付き微調整(SFT)を比較した。
我々の詳細な分析では、RLは視覚知覚を増強するが、しばしばコヒーレント推論連鎖を減少させる。
論文 参考訳(メタデータ) (2025-03-31T17:55:23Z) - Leveraging Reward Consistency for Interpretable Feature Discovery in
Reinforcement Learning [69.19840497497503]
一般的に使われているアクションマッチングの原理は、RLエージェントの解釈よりもディープニューラルネットワーク(DNN)の説明に近いと論じられている。
本稿では,RLエージェントの主目的である報酬を,RLエージェントを解釈する本質的な目的として考察する。
我々は,Atari 2600 ゲームと,挑戦的な自動運転車シミュレータ環境である Duckietown の検証と評価を行った。
論文 参考訳(メタデータ) (2023-09-04T09:09:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。