論文の概要: Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning
- arxiv url: http://arxiv.org/abs/2609.36572v2
- Date: Wed, 30 Sep 2026 02:54:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.149519
- Title: Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning
- Title(参考訳): 視覚感度はクレーム抽出性ではない:マルチモーダル強化学習のためのパーシステンス・アウェア・クレジット・アサイン
- Abstract要約: RLトレーニングの前に、4つのマルチモーダル推論ベンチマークにおけるQwen2.5-VL-7Bの正しい応答の27.81%には、イメージがサポートしていないという少なくとも1つの直接的な視覚的主張が含まれている。
Evidence-Function Sensitivity (EFS) を分離するために、インターベンション画像の下で同じ応答を再スコアする固定ロールアウト対応診断を導入する。
DAPO と VPPO の下では、全体としてはより引きずりやすいが、支持された主張はより持続的になり、EFSO はこの劣化を伴わずに EFS を上昇させる。
- 参考スコア(独自算出の注目度): 3.27594822320331
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has been extended to Large Vision-Language Models (LVLMs), and perception-aware methods further encourage policies to rely on visual evidence. Yet relying on the image does not guarantee that visual claims are supported by it. Before RL training, 27.81% of the correctly answered responses of Qwen2.5-VL-7B on four multimodal reasoning benchmarks contain at least one direct visual claim that the image does not support. Since outcome-level RL rewards each response as a whole, these claims inherit the positive credit of the correct answer. We introduce a fixed-rollout counterfactual diagnostic that re-scores the same response under an intervened image to separate Evidence-Function Sensitivity (EFS), how strongly the model's predictions change, from claim persistence, whether the model keeps supporting the same claim rather than retracting it. The diagnostic reveals Sensitivity-Persistence Decoupling (SPD): under DAPO and VPPO, EFS increases and claims become more retractable overall, yet unsupported claims become significantly more persistent, whereas GRPO raises EFS without this deterioration. We therefore propose Persistence-Aware Credit Gating (PACG), which attenuates positive credit for unusually persistent visual claims and leaves all other credit unchanged. It requires no supported/unsupported labels and adds no inference cost. On Qwen2.5-VL-7B, PACG raises the nine-benchmark average over three seeds from 58.1% to 59.9% with DAPO and from 59.8% to 60.9% with VPPO, while making unsupported claims more retractable. The gains extend to a larger model, a newer backbone, and the accuracy of HallusionBench also improves consistently. These results suggest that visual sensitivity and claim retractability are complementary dimensions of multimodal credit assignment.
- Abstract(参考訳): RLVR(Reinforcement Learning with Verifiable Rewards)は、LVLM(Large Vision-Language Models)にまで拡張され、視覚的エビデンスに依存する政策をさらに促進している。
しかし、画像に依存することは、視覚的クレームがそれをサポートすることを保証しない。
RLトレーニングの前に、4つのマルチモーダル推論ベンチマークにおけるQwen2.5-VL-7Bの正しい応答の27.81%には、イメージがサポートしていないという少なくとも1つの直接的な視覚的主張が含まれている。
結果レベルRLは、各レスポンス全体に対して報酬を与えるので、これらのクレームは正の回答の正の信用を継承する。
本稿では, モデルが同一のクレームを抽出するのではなく, モデルが同一のクレームをサポートし続けるかどうか, モデルの予測がどれだけ強く変化するか, を分離するために, インターベンション画像下で同じ応答を再スコアする固定ロールアウト対実診断法を提案する。
DAPO と VPPO の下では EFS は増加し, 全体としては回収性が高くなるが, GRPO はこの劣化を伴わずに EFS を上昇させる。
そこで我々はPACG(Persistence-Aware Credit Gating)を提案する。
サポートされていないラベルは不要で、推論コストは不要である。
Qwen2.5-VL-7Bでは、PACGは、DAPOでは58.1%から59.9%に、VPPOでは59.8%から60.9%に、9ベンチマーク平均を58.1%から59.9%に引き上げている。
ゲインはより大きなモデル、新しいバックボーンにまで拡張され、HalusionBenchの精度も一貫して改善されている。
これらの結果から,視覚的感度とクレームリトラクタビリティはマルチモーダルクレジット代入の相補的な次元であることが示唆された。
関連論文リスト
- Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence [30.96534006962091]
潜時視覚推論(LVR)は、単語のすべての推論ステップを表現するのではなく、連続的潜時トークンでの計算を可能にする。
テキストCoTとは異なり、潜伏推論は直接観察できないため、潜伏トークンが何を学ぶかを監督することは困難である。
本稿では,ReaLVRを提案する。これは,モデル自身の自由走行軌道に対して視覚的エビデンスを監督するものである。
論文 参考訳(メタデータ) (2026-09-28T08:16:14Z) - HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide [18.50218795316691]
本稿では,視覚的劣化,空白画像の置き換え,接地・関係チェックの後に回答を再実行する行動診断法であるHaluPrismを提案する。
これらのターゲットプローブは、視覚的摂動感度、画像除去された信頼性保持、グラウンドディング/リレーショナル-プローブ不安定性に対するシグネチャを与える。
論文 参考訳(メタデータ) (2026-08-29T11:06:37Z) - RECAP: Relation Evidence Calibration for Detecting Spatial Relation Hallucinations in Vision-Language Models [18.4543393295727]
視覚言語モデルは、画像が不整合関係をサポートする場合でも、空間関係の疑問に自信を持って答えることができる。
我々は,その視覚的支援を監査することで,すでに生成したイエス/ノー回答を受け入れ,拒否する関係的選択予測を定式化する。
ReCAPは、クレームのイメージ条件付き可能性、セマンティックな矛盾、オプションの片側サポートを比較し、これらの証人を回答条件付き拒絶リスクに変換する。
論文 参考訳(メタデータ) (2026-08-04T14:03:52Z) - Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning [73.40085256022111]
P2R(Perceive-to-Reason)は、2段階のプロセスとして微細な視覚的推論を定式化する統合フレームワークである。
P2RはPerceiverとして質問関連エビデンスをローカライズし、アノテートされた画像と収穫された領域に基づいて質問をReasonerとして答える。
PRA-GRPOは、認識重視と推論重視の更新を交互に行うロールアウェア強化学習戦略である。
論文 参考訳(メタデータ) (2026-07-01T17:24:26Z) - Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images [52.50752250573993]
MLLM(Multimodal Large Language Models)は、視覚的知覚が強いが、視点の変化による空間の推論には限界がある。
本研究では、この課題を全方位360度画像におけるパースペクティブ・コンディションド・スペース・推論(PCSR)として検討する。
我々は2,600全方位画像から84,373組の質問応答対の診断ベンチマークであるPCSR-Benchを紹介する。
論文 参考訳(メタデータ) (2026-05-12T17:11:17Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Token-Level Inference-Time Alignment for Vision-Language Models [58.41370989069588]
VLM(Vision-Language Models)は、現代のマルチモーダルインテリジェンスの重要なバックボーンとなっている。
本稿では,基本VLMを凍結し,その分布を近似する報酬モデルをトレーニングする軽量フレームワークTITAを提案する。
推測中、暗黙の選好信号は報酬モデルと目標VLMの対数確率比として抽出され、密集した自己回帰フィードバックが得られる。
論文 参考訳(メタデータ) (2025-10-20T09:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。