論文の概要: Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- arxiv url: http://arxiv.org/abs/2607.01191v1
- Date: Wed, 01 Jul 2026 17:24:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:08.00493
- Title: Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- Title(参考訳): 知覚と推論:視覚の微粒化に対する知覚と推論の分離
- Authors: Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen,
- Abstract要約: P2R(Perceive-to-Reason)は、2段階のプロセスとして微細な視覚的推論を定式化する統合フレームワークである。
P2RはPerceiverとして質問関連エビデンスをローカライズし、アノテートされた画像と収穫された領域に基づいて質問をReasonerとして答える。
PRA-GRPOは、認識重視と推論重視の更新を交互に行うロールアウェア強化学習戦略である。
- 参考スコア(独自算出の注目度): 73.40085256022111
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fine-grained visual reasoning remains challenging for vision-language models, especially when small but critical visual cues are buried in high-resolution images. Existing approaches rely on repeated cropping or test-time visual search to introduce local evidence, but they typically do not explicitly distinguish perception from reasoning. In this paper, we propose Perceive-to-Reason (P2R), a unified framework that formulates fine-grained visual reasoning as a two-stage process: the model first localizes question-relevant evidence as a Perceiver, and then answers the question as a Reasoner based on the annotated image and cropped regions. To better align training with this decoupled formulation, we further introduce Perception-Reasoning Alternating GRPO (PRA-GRPO), a role-aware reinforcement learning strategy that alternates between perception-focused and reasoning-focused updates using only final-answer supervision. Built on top of Qwen3-VL-Instruct-2B/4B/8B, P2R consistently improves performance across model scales. In particular, P2R-4B achieves 93.2% on V-Star, 81.9% on HR-Bench-4K, and 80.5% on HR-Bench-8K, substantially outperforming its corresponding backbone. Further experiments show that the benefits of P2R extend beyond high-resolution benchmarks to broader multimodal reasoning tasks. These results suggest that explicitly decoupling perception from reasoning provides an effective framework for fine-grained visual reasoning.
- Abstract(参考訳): 視覚言語モデルでは、特に解像度の高い画像に小さくて重要な視覚的手がかりが埋められている場合、きめ細かい視覚的推論は依然として困難である。
既存のアプローチは、局所的な証拠を導入するために、繰り返しの収穫やテストタイムのビジュアルサーチに依存している。
本稿では,2段階のプロセスとして細粒度の視覚的推論を定式化する統合フレームワークであるPerceive-to-Reason(P2R)を提案する。
この分離された定式化によるトレーニングの整合性向上を目的として, 最終回答のみを用いて, 認識重視と推論重視の更新を交互に行う役割意識強化学習戦略であるPerception-Reasoning Alternating GRPO(PRA-GRPO)を導入する。
Qwen3-VL-Instruct-2B/4B/8B上に構築されたP2Rは、モデルスケール全体のパフォーマンスを一貫して改善する。
特に、P2R-4BはV-Starで93.2%、HR-Bench-4Kで81.9%、HR-Bench-8Kで80.5%、対応するバックボーンではかなり上回っている。
さらなる実験により、P2Rの利点は高解像度のベンチマークからより広範なマルチモーダル推論タスクにまで及んでいることが示されている。
これらの結果は,知覚を推論から明確に切り離すことが,視覚的推論の微粒化に有効な枠組みであることを示唆している。
関連論文リスト
- Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization [31.411469692692766]
Chain-of-Thoughtトレースは、最終的な回答と矛盾することが多く、視覚的証拠が不十分である。
ラグランジアン二重昇華による制約として整合性と接地を強制するFithful GRPOを提案する。
その結果,FGRPOは推論品質を大幅に改善し,不整合率を24.5%から1.7%に下げ,視覚的接点スコアを+13%改善した。
論文 参考訳(メタデータ) (2026-04-09T17:15:47Z) - See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs [24.90876091319589]
視覚的マルチモーダル推論のための反復的,トレーニング不要,プラグアンドプレイフレームワークを提案する。
私たちのキーとなるアイデアは、視覚的なエビデンスでテスト時の各推論ステップを監督することです。
本手法はTreeBenchを16.5%-29.5%改善し,RH-AUCを13.7%向上させる。
論文 参考訳(メタデータ) (2026-02-25T02:13:59Z) - CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation [6.356820150960838]
視覚言語モデルを安定させるために,テスト時間スケーリングにインスパイアされた2つの補完的アプローチを導入する。
CASHEWは推論時のフレームワークで、複数の候補軌道を高品質な推論トレースに反復的に集約することで推論を安定化する。
CASHEW-RL はグループシーケンスポリシー最適化 (GSPO) を用いて訓練されており、最小でも十分な視覚的証拠に根ざした正しい回答を促す複合報酬が提供されている。
論文 参考訳(メタデータ) (2026-01-12T21:24:45Z) - From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning [12.548754243700657]
マルチモーダルな大言語モデル(MLLM)は、視覚情報の統合に欠ける推論を生成する。
このようなタスクにおいて視覚的知覚が重要なボトルネックであることを示し、クロード3.5では26.7%、クロード3.7では23.6%の利得を得た。
我々は,イメージ理解,思考ステップ,回答精度など,異なる推論的側面を対象とする6つの報酬関数を設計・評価する。
Qwen-2.5-VL-7Bの実験では、ベースモデルよりも5.56%改善されており、ドメイン内設定とドメイン外設定の両方で一貫して改善されている。
論文 参考訳(メタデータ) (2026-01-01T05:19:28Z) - See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning [58.7125460363147]
本稿では,質問条件付きマスキングビューを双方向の視線信号に変換する双方向知覚整形(BiPS)を提案する。
BiPSはQwen2.5-VL-7Bを平均8.2%向上させ、目に見えないデータセットやイメージタイプに対して、ドメイン外の強力な一般化を示す。
論文 参考訳(メタデータ) (2025-12-26T18:59:47Z) - BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception [67.89135437537179]
我々は視覚中心の推論ベンチマークであるBLINK-Twiceを紹介した。
外部の知識に頼るのではなく、私たちのタスクは視覚的コンテンツのみから推論するモデルを必要とします。
事前の知覚ベンチマークと比較すると、浅い知覚を超越し、きめ細かい観察と分析的推論を必要とする。
論文 参考訳(メタデータ) (2025-10-10T13:14:13Z) - CoFFT: Chain of Foresight-Focus Thought for Visual Language Models [61.34272727005052]
フォレスト・フォーカス思考の連鎖(英語: Chain of Foresight-Focus Thought, CoFFT)は、人間の視覚的認知をエミュレートすることによって視覚的推論を強化する訓練のないアプローチである。
これらの段階は反復的に機能し、推論が視覚的焦点を導き、視覚的焦点がその後の推論を知らせる相互依存サイクルを生成する。
Qwen2.5-VL、InternVL-2.5、Llava-Nextを使った複数のベンチマークでの実証結果では、3.1-5.8%が一貫したパフォーマンス向上を示し、計算オーバーヘッドは増大した。
論文 参考訳(メタデータ) (2025-09-26T07:46:30Z) - ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models [11.263321053154364]
ERGOは推論駆動の知覚平均化マルチモーダルコンテキストで、どこにフォーカスするかを決定する。
我々は、粗大な知覚のための強化学習フレームワークにおいて、単純で効果的な報酬成分を開発する。
提案手法は,従来のモデルや競合手法よりも精度が高く,効率が向上する。
論文 参考訳(メタデータ) (2025-09-26T07:15:19Z) - VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning [56.99825489208698]
複数の視覚知覚タスクの推論と解決が可能な統合フレームワークであるVisionReasonerを紹介する。
VisionReasonerは、視覚的な入力を分析するための推論機能を強化し、統一モデル内の様々な知覚タスクに対処する。
VisionReasonerは、検出、セグメンテーション、カウントという3つの重要な領域にまたがる10のタスクに対して評価する。
論文 参考訳(メタデータ) (2025-05-17T16:51:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。