論文の概要: CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2606.23206v1
- Date: Mon, 22 Jun 2026 11:51:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 23:21:34.493309
- Title: CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- Title(参考訳): CFPO:マルチモーダル推論のための対実的ポリシー最適化
- Authors: Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao,
- Abstract要約: 本稿では,視覚知覚とテキスト推論の因果一貫性を実現するフレームワークであるCFPOを提案する。
CFPOはGRPOやDAPOといった標準的なアルゴリズムと統合されており、外部の報酬モデルや追加の監視を必要としない。
推論の忠実さを大幅に改善し、標準のRLベースラインよりも3.17%-6.25%、最先端の認識認識法(PAPO)よりも1.32%-2.13%、一貫した利得を達成する。
- 参考スコア(独自算出の注目度): 6.719961045766247
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) have demonstrated remarkable capabilities in multimodal reasoning. However, prevailing reinforcement learning (RL) paradigms lack explicit counterfactual enhancement and causal learning mechanisms. This fundamental deficiency results in severe grounding failures, manifesting as a tendency to ignore visual evidence in favor of language priors or exhibiting hallucination drift during long chain-of-thought reasoning. To address this root cause, we propose CounterFactual Policy Optimization (CFPO), a novel framework that enforces causal consistency between visual perception and textual reasoning. CFPO introduces a cross-modal counterfactual enhancement mechanism, which regularizes the policy by maximizing the discrepancy between the model's predictions and those from a counterfactual state where critical visual cues are suppressed. This approach seamlessly integrates with standard algorithms like GRPO and DAPO without requiring external reward models or additional supervision. Extensive experiments demonstrate that CFPO significantly improves reasoning fidelity, achieving consistent gains of 3.17%-6.25% over standard RL baselines and 1.32%-2.13% over the state-of-the-art perception-aware method (PAPO). Code is available at https://github.com/Raven-July/CFPO.
- Abstract(参考訳): LVLM(Large Vision-Language Models)はマルチモーダル推論において顕著な機能を示す。
しかし、一般的な強化学習(RL)パラダイムには、明確な反ファクトの強化と因果学習機構が欠如している。
この根本的な欠陥は、言語先行性を支持する視覚的証拠を無視したり、長いチェーン・オブ・プリーティングの間に幻覚の漂流を示す傾向を示す、深刻な基盤的障害をもたらす。
この根本原因を解決するために,視覚認識とテキスト推論の因果一貫性を実現する新しいフレームワークであるCFPO(CounterFactual Policy Optimization)を提案する。
CFPOは、重要な視覚的手がかりが抑制される対物状態との差を最大化することにより、ポリシーを規則化するクロスモーダルな対物的拡張機構を導入する。
このアプローチは、外部報酬モデルや追加の監視を必要とせずに、GRPOやDAPOといった標準アルゴリズムとシームレスに統合される。
大規模な実験により、CFPOは推論の忠実性を大幅に改善し、標準のRLベースラインよりも3.17%-6.25%、最先端の知覚認識法(PAPO)より1.32%-2.13%向上した。
コードはhttps://github.com/Raven-July/CFPOで入手できる。
関連論文リスト
- Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs [68.58207076756237]
本稿では,結果評価からメカニズム診断へ移行する摂動に基づく評価プロトコルProCauEvalを紹介する。
因果推論において,ビデオコンテンツは体系的に過小評価されている。
教師のネガティブなアライメントに基づく強化学習フレームワークであるADPOを提案する。
論文 参考訳(メタデータ) (2026-05-10T08:48:58Z) - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models [38.47027398567909]
Perception-Grounded Policy Optimization (PGPO)は、トークンレベルでのメリットを動的に再評価する、新しいきめ細かなクレジット割り当てフレームワークである。
PGPOは,言語的先行音からの勾配雑音を抑えつつ,視覚的に依存するトークンの学習信号を積極的に増幅することを示す。
理論的および実証的な分析は、PGPOが勾配の分散を効果的に減少させ、訓練の崩壊を防ぎ、頑健で知覚的なマルチモーダル推論のための強力な正則化剤として機能することを確認する。
論文 参考訳(メタデータ) (2026-04-02T09:53:20Z) - Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization [72.30168853571216]
マルチモーダルな言語モデルは、視覚知覚と象徴的推論を統合するタスクに優れています。
CapPO は,(1) 原画像上の条件付き応答とキャプション上の条件付き応答のばらつきを最小限に抑えるキャプションベース整合性正規化,(2) KL 重み付き優位性推定スキームを適応的に拡張して知覚整合性トラジェクトリを強化するキャプションベース整合性正規化という2つの重要なメカニズムを統合した。
論文 参考訳(メタデータ) (2025-09-26T04:32:26Z) - Perception-Aware Policy Optimization for Multimodal Reasoning [79.56070395437898]
現在のマルチモーダル推論における誤りの主な原因は、視覚入力の知覚にある。
提案するPAPOは,モデルが推論を学習しながら知覚を学習することを奨励する,新しいポリシー勾配アルゴリズムである。
知覚誤りの30.5%が有意に減少し,PAPOによる知覚能力の向上が示唆された。
論文 参考訳(メタデータ) (2025-07-08T23:22:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。