論文の概要: Region-Level Policy Optimization for Fine-grained MLLM Perception
- arxiv url: http://arxiv.org/abs/2609.19745v1
- Date: Thu, 17 Sep 2026 06:10:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.120372
- Title: Region-Level Policy Optimization for Fine-grained MLLM Perception
- Title(参考訳): きめ細かいMLLM認識のための領域レベルポリシー最適化
- Abstract要約: MLLMの微細な視覚知覚は、解像度を上げることで一般的に改善されるが、付加された視覚トークンは、視覚エンコーディングと言語モデルプリフィルコストを増大させる。
関心領域(RoI)を局所化し,その内容を認識する2つの操作は,解決要件が異なることを示す。
地域レベルの強化学習による提案ネットワークを最適化し,Vision-RL2と呼ぶ。
- 参考スコア(独自算出の注目度): 43.40677219802473
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Fine-grained visual perception in MLLMs is commonly improved by raising the resolution, but the added visual tokens inflate vision-encoding and language-model prefilling costs. We show that the two operations underlying fine-grained perception, localizing the region of interest (RoI) and recognizing its content, have different resolution requirements. In a controlled diagnostic, localization tolerates roughly 3 to 4 times stronger token compression than recognition, which motivates localizing from a coarse view and concentrating resolution on the selected evidence. Decoding coordinates with the MLLM can be trained end-to-end from answers, but costs a full model pass per query and depends on grounding ability. A lightweight proposal network distilled from the model's attention is fast, but inherits the noise of its attention targets. The RoI from the proposal network reaches the answer through a discrete region choice, so its faithfulness to the answer cannot supervise the network. We therefore optimize the proposal network with region-level reinforcement learning, which we call Vision-RL2. It treats coherent regions as actions, and a frozen MLLM reader scores each one by how its removal changes the answer likelihood. Complementary subtractive and additive objectives suppress distracting proposals and recover missing evidence, updating only the predictor without region annotations, response sampling, or reasoning trajectories. The refined proposal further enables a sparse encoding that magnifies evidence and excludes background tokens. Across six fine-grained benchmarks and four MLLM backbones, Vision-RL2 improves accuracy over the base model at every token budget and surpasses its largest-budget accuracy with about 4 times fewer visual tokens. Code is available at https://github.com/YuHengsss/VisionRL2 .
- Abstract(参考訳): MLLMの微細な視覚知覚は、解像度を上げることで一般的に改善されるが、付加された視覚トークンは、視覚エンコーディングと言語モデルプリフィルコストを増大させる。
関心領域(RoI)を局所化し,その内容を認識する2つの操作は,解決要件が異なることを示す。
制御された診断では、ローカライゼーションは認識の約3倍から4倍のトークン圧縮を許容し、粗い視点からローカライズし、選択された証拠の解決に集中させる。
MLLMとのデコード座標は、答えからエンドツーエンドまで訓練することができるが、クエリ毎に完全なモデルパスがかかり、グラウンド化能力に依存する。
モデルの注意から抽出した軽量な提案ネットワークは高速だが、その注目対象のノイズを継承する。
提案ネットワークからのRoIは、個別の領域選択によって応答に達するので、その応答に対する忠実さはネットワークを監督できない。
そこで我々は,ビジョン-RL2と呼ばれる地域レベルの強化学習を用いて提案ネットワークを最適化する。
コヒーレントな領域をアクションとして扱い、凍結したMLLMリーダーは、その除去が解答可能性を変える方法によってそれぞれをスコアする。
補足的および付加的な目的は、邪魔な提案を抑え、行方不明の証拠を回収し、リージョンアノテーション、応答サンプリング、または推論軌跡のない予測器のみを更新する。
改良された提案により、証拠を拡大し、バックグラウンドトークンを除外するスパースエンコーディングが可能になる。
6つのきめ細かいベンチマークと4つのMLLMバックボーンで、Vision-RL2はトークン予算ごとにベースモデルよりも精度を改善し、最大予算の精度を約4倍のビジュアルトークンで上回る。
コードはhttps://github.com/YuHengsss/VisionRL2で入手できる。
関連論文リスト
- MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models [46.54440573184562]
Reinforcement Learning with Verifiable Rewards (RLVR)は、回答の正当性信号を用いてポリシーを最適化することで、有望なソリューションを提供する。
我々は、生成した記述と視覚入力の相互情報(MI)を安価な事前スクリーニング信号として利用することにより、両方の制約に対処する分離されたフレームワークであるMIRLを紹介する。
6つの視覚言語推論ベンチマークの実験により、MIRLの平均精度は70.22%に達した。
論文 参考訳(メタデータ) (2026-05-02T16:21:31Z) - SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs [34.330422211810685]
我々は,視覚的知覚を推論から切り離すモジュール型フレームワーク(知覚と推論回路の分離)を導入する。
脳のシーケンシャルな知覚から認知への処理にインスパイアされたこのパイプラインは、2段階のパイプラインを実装し、まずモデルが明示的な視覚探索を行い、質問関連領域をローカライズする。
難しいビジュアル推論ベンチマーク全体において、モノリシックなベースラインと強力なビジュアルグラウンドアプローチよりも優れています。
論文 参考訳(メタデータ) (2026-02-06T10:05:25Z) - ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models [11.263321053154364]
ERGOは推論駆動の知覚平均化マルチモーダルコンテキストで、どこにフォーカスするかを決定する。
我々は、粗大な知覚のための強化学習フレームワークにおいて、単純で効果的な報酬成分を開発する。
提案手法は,従来のモデルや競合手法よりも精度が高く,効率が向上する。
論文 参考訳(メタデータ) (2025-09-26T07:15:19Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes [65.88899655866871]
我々は,MLLMの視覚知覚能力を高めるために,DIP-R1(Deep Inspection and Perception with RL)という新しいフレームワークを開発した。
DIP-R1は、3つのシンプルなルールベースの報酬モデリングを通じて、MLLMをビジュアルシーンの詳細な検査を通じてガイドする。
本研究は,RLをMLLMに組み込むことにより,複雑な実世界の知覚タスクにおける能力向上の可能性を明らかにするものである。
論文 参考訳(メタデータ) (2025-05-29T07:16:16Z) - Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models [59.05769810380928]
Rephrase, Augment and Reason (RepARe) は勾配のないフレームワークで、基礎となる視覚言語モデルを用いて画像に関する詳細な情報を抽出する。
その結果、VQAv2では3.85%(絶対)、A-OKVQAでは6.41%、VizWizでは7.94%の増加が見られた。
論文 参考訳(メタデータ) (2023-10-09T16:57:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。