論文の概要: Beyond Entropy: Self-Diagnostic Multi-Role Token Optimization for Video Reasoning
- arxiv url: http://arxiv.org/abs/2610.03400v1
- Date: Fri, 02 Oct 2026 14:48:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.431291
- Title: Beyond Entropy: Self-Diagnostic Multi-Role Token Optimization for Video Reasoning
- Title(参考訳): エントロピーを超えて:ビデオ推論のための自己診断型マルチロールトークン最適化
- Abstract要約: 我々は、信頼性の高いトークン選択と適応的な対実的介入を共同で最適化する、共進化的フレームワークであるDyCPOを紹介する。
複雑なビデオ推論と一般的なビデオ理解ベンチマークの実験は、一貫したパフォーマンス改善を示している。
- 参考スコア(独自算出の注目度): 82.12877400975769
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards has substantially advanced multimodal reasoning, yet it remains fundamentally limited by ambiguous token-level credit assignment. While high-entropy token heuristics encourage possibility exploration, naively extending them to video reasoning tends to induce lengthy reasoning, as the model becomes overly reliant on high-entropy visual activations. Alternative approaches that rely on counterfactual-based visual token localization for credit assignment also tend to over-prioritize visual exploration at the expense of decisive reasoning cues for answer derivation, thereby exacerbating the interference from spurious visual nuances. Moreover, these methods employ static counterfactual strategies that fail to co-evolve with the policy during training. In this paper, we introduce DyCPO, a co-evolutionary framework that jointly optimizes reliable token selection and adaptive counterfactual intervention. It constructs a multi-role dependence metric to balance visual exploration and answer-relevance mining in token-wise contrastive learning, while suppressing exploration-only filler tokens and spurious visual noise. Rather than relying on static counterfactual priors, DyCPO dynamically derives counterfactual signals from the model's own successful and failed rollouts, enabling self-diagnostic analysis and co-evolution of the optimization objective with the policy. Extensive experiments on complex video reasoning and general video understanding benchmarks demonstrate consistent performance improvements, establishing DyCPO as a robust token-level credit assignment paradigm for multimodal reinforcement learning.
- Abstract(参考訳): 検証可能な報酬を伴う強化学習は、かなり先進的なマルチモーダル推論を持つが、あいまいなトークンレベルの信用代入によって基本的に制限されている。
高エントロピーのトークンヒューリスティックスは可能性探索を奨励するが、高エントロピーの視覚的アクティベーションに過度に依存しているため、ビデオ推論にナリスティックに拡張すると長めの推論が引き起こされる傾向がある。
対物に基づく視覚的トークンのローカライゼーションを信用代入に頼っている別のアプローチは、答えの導出のための決定的な推論手段を犠牲にして、視覚的な探索を過度に優先順位付けする傾向があり、それによって刺激的な視覚的ニュアンスからの干渉が悪化する。
さらに、これらの手法は、トレーニング中にポリシーと共進化することができない静的な反ファクト戦略を用いる。
本稿では,信頼性の高いトークン選択と適応的対実的介入を共同で最適化するDyCPOについて紹介する。
それは、探索のみのフィラートークンと刺激的な視覚ノイズを抑えながら、トークン単位の対照的な学習において、視覚的な探索と回答関連性のマイニングのバランスをとるために、マルチロール依存度尺度を構築する。
DyCPOは静的な反ファクトの事前に頼らず、モデル自身の成功と失敗のロールアウトから動的に反ファクトの信号を導き出し、自己診断的分析と最適化目的とポリシーの共進化を可能にする。
複雑なビデオ推論と一般的なビデオ理解ベンチマークに関する大規模な実験は、一貫したパフォーマンス向上を示し、マルチモーダル強化学習のための堅牢なトークンレベルクレジット割り当てパラダイムとしてDyCPOを確立した。
関連論文リスト
- ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning [53.17987412112712]
強化学習(Reinforcement Learning, RL)は、複雑な操作タスクにおけるビジョン・ランゲージ・アクション(VLA)モデルを改善する重要な可能性を示している。
本稿では,現在のVLA-RLフレームワークにおける探索の停滞ボトルネックについて検討する。
本稿では,VLA ポリシーを個別の行動事前に規定する簡易かつ汎用的なフレームワークである RL Exploration Token (ExToken) を紹介する。
論文 参考訳(メタデータ) (2026-07-14T16:04:41Z) - Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization [56.150184676745205]
ビデオ異常理解(VAU)は、スパースでコンテキストに依存した手がかりに依存している。
本稿では,映像理解をアクティブな逐次意思決定プロセスとして再認識するクローズドループフレームワークである$Anomtext-$を提案する。
人間のビデオレビュー行動に触発されたこのフレームワークは、内部の認知的推論と戦略的エビデンスを、インターリーブされたポリシーに統一する。
論文 参考訳(メタデータ) (2026-07-01T08:41:49Z) - Structured Role-Aware Policy Optimization for Multimodal Reasoning [31.08329979854717]
検証可能な報酬(RLVR)からの強化学習は、大規模視覚言語モデル(LVLM)の推論能力を向上させる強力な可能性を示している。
本稿では,ロールアウェアトークンレベルのクレジット割り当ての観点から,マルチモーダルRLVRを再考する。
本稿では,代入関数を変更することなく,シーケンスレベルのGRPOの利点をロールレベルのトークンレベルに改良するSRPO(Structured Role-aware Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-05-08T05:37:08Z) - Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models [38.47027398567909]
Perception-Grounded Policy Optimization (PGPO)は、トークンレベルでのメリットを動的に再評価する、新しいきめ細かなクレジット割り当てフレームワークである。
PGPOは,言語的先行音からの勾配雑音を抑えつつ,視覚的に依存するトークンの学習信号を積極的に増幅することを示す。
理論的および実証的な分析は、PGPOが勾配の分散を効果的に減少させ、訓練の崩壊を防ぎ、頑健で知覚的なマルチモーダル推論のための強力な正則化剤として機能することを確認する。
論文 参考訳(メタデータ) (2026-04-02T09:53:20Z) - Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs [51.60575965819268]
本稿では,この相互依存を明示的にモデル化するToken-Reweighting(ToR)戦略を提案する。
ToRは複数のマルチモーダル推論ベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-26T06:25:27Z) - Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought [73.39221516441624]
マルチモーダル・チェーン・オブ・ソート(CoT)推論は、推論軌道を構築するために大きな視覚言語モデルを必要とする。
既存のReinforcement Learning with Verifiable Rewards (RLVR) 法は、様々な視覚的接地度を区別することなく、CoTを均一に扱う。
本稿では,隠れ状態の類似性に先立って認識を導き,トークンのエントロピーと統合する知覚探索ポリシー最適化(PEPO)を提案する。
論文 参考訳(メタデータ) (2026-03-24T06:38:00Z) - Spotlight on Token Perception for Multimodal Reinforcement Learning [65.97597482517425]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LVLM(Large Vision-Language Models)の推論能力を向上した。
本稿では,トークン認識の新しい視点を通して,マルチモーダルRLVRの先駆的な探索を行う。
本稿では、トークン認識を明示的に活用して学習信号を洗練する新しいポリシー勾配アルゴリズムである視覚知覚政策最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2025-10-10T11:25:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。