論文の概要: Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2606.29812v1
- Date: Mon, 29 Jun 2026 05:45:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.063305
- Title: Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning
- Title(参考訳): 誘導バイアスとしての一貫性:ロバストなマルチモーダル推論のためのクロスビュー不変性学習
- Authors: Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Kening Zheng, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu,
- Abstract要約: 本稿では,RLVRトレーニングにクロスビュー一貫性を注入するConsistRollを提案する。
オリジナルとセマンティックに不変な変換されたビューを同じ世代グループに配置する。
ペアの完了が正確かつ一貫性のある場合にのみ、共同報酬を割り当てる。
- 参考スコア(独自算出の注目度): 40.68014726208686
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Inductive biases steer learning toward generalizable solutions by encoding task structure. In this work, we identify a crucial missing bias in MLLMs: cross-view consistency, \textit{i.e.}, semantically invariant views of the same instance should lead to the same answer. Standard reinforcement learning with verifiable rewards (RLVR) objectives do not impose this constraint, but instead assign pointwise rewards to each visual input. Even with data augmentation (DA), transformed views are typically rewarded independently, providing little signal once within-view rewards saturate. We propose \textbf{ConsistRoll}, a simple but effective method that injects cross-view consistency into RLVR training by reusing the group-sampling mechanism of GRPO. Specifically, ConsistRoll places original and semantically invariant transformed views in the same generation group, and assigns a joint reward only when paired completions are both correct and consistent. In this way, ConsistRoll turns consistency into an online credit-assignment signal, \textbf{without extra generation overhead and annotations}. Theoretically, we show that cross-view consistency is a valid inductive bias, and ConsistRoll introduces a cross-view correction term absent from DA, penalizing view dependence and alleviating advantage collapse. Comprehensive benchmarks across math, general-purpose, hallucination domains confirm that ConsistRoll achieves robust improvements in multimodal reasoning.
- Abstract(参考訳): 帰納バイアスは、タスク構造を符号化することで一般化可能な解へ学習する。
横断的な一貫性、 \textit{i.e.}、同じインスタンスのセマンティック不変ビューは、同じ答えをもたらすべきである。
検証可能な報酬(RLVR)を目標とする標準的な強化学習は、この制約を課すのではなく、視覚入力毎にポイントワイズ報酬を割り当てる。
データ拡張(DA)でさえ、変換されたビューは通常独立して報酬を受け取り、一度ビュー内の報酬が飽和すると、ほとんど信号を提供しない。
本稿では,GRPO のグループサンプリング機構を再利用して,RLVR トレーニングにクロスビュー一貫性を注入する,シンプルだが効果的な方法である \textbf{ConsistRoll} を提案する。
具体的には、ConsistRollはオリジナルとセマンティックに不変な変換されたビューを同じ世代グループに配置し、ペアの完了が正確かつ一貫性のある場合にのみ共同報酬を割り当てる。
このようにして、ConsistRollは一貫性をオンラインクレジット割り当て信号である \textbf{without ex generation overhead and annotations} に変換する。
理論的には、クロスビュー一貫性は効果的な帰納バイアスであり、ConsistRollは、DAから欠落したクロスビュー補正項を導入し、ビュー依存を罰し、有利な崩壊を緩和する。
数学、汎用、幻覚領域の総合的なベンチマークでは、ConsistRollがマルチモーダル推論の堅牢な改善を実現している。
関連論文リスト
- C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders [56.67585330425431]
スパースオートエンコーダ(SAE)は、アクティベーションをスパースで人間の理解可能な機能に分解することで、大きな言語モデルを解釈するために広く使われている。
これらの問題は、サンプル間の一貫性のない潜在的な割り当てに起因している。
我々はC$2$Rを導入し、これは方向的に類似した潜伏剤の共活性化を罰する。
論文 参考訳(メタデータ) (2026-06-29T17:45:31Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement [42.87874090062771]
統一マルチモーダルモデル(UMM)は、理解と生成の両方において優れた性能を示している。
我々は、異なる監視信号によって誘導される誘導バイアスに起因する根本的な課題を特定する。
本研究では,自己改善型ポストトレーニングフレームワークであるDIVAを提案し,表現の発散を内部のシナジーに変換する。
論文 参考訳(メタデータ) (2026-05-25T01:17:32Z) - Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling [19.22335478070254]
MLLM自己進化におけるCSRS(Continuous Softened Retracing ReSampling)を提案する。
具体的には,ロングテール推論経路の探索を拡大するために,アンカーポイントからモデルの再推論を行うRetracing Re-inference Mechanism (RRM)を提案する。
CSRSは,MathVisionなどのベンチマークにおけるQwen2.5-VL-7Bの推論性能を著しく向上することを示した。
論文 参考訳(メタデータ) (2026-04-04T08:52:43Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense [36.71358559780692]
HEROは、検証者信号と報酬モデルスコアを構造化された方法で統合する強化学習フレームワークである。
HEROはRMのみのベースラインと検証者のみのベースラインを一貫して上回り、検証可能なタスクと検証しにくいタスクの両方で大きな利益を上げている。
論文 参考訳(メタデータ) (2025-10-08T17:09:41Z) - Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval [54.90229711181207]
TIPR (Text-to-Image Person Retrieval) は、与えられたテキストクエリに基づいて、最も関連性の高い人物画像を取得することを目的としている。
TIPRの鍵となる課題は、テキストと視覚のモダリティの効果的なアライメントを達成することである。
FMFA, クロスモーダルフルモーデファインファインファインファインアライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-17T07:12:05Z) - Relieving Long-tailed Instance Segmentation via Pairwise Class Balance [85.53585498649252]
長い尾のインスタンスセグメンテーションは、クラス間のトレーニングサンプルの極端な不均衡のために難しいタスクである。
尾のついたものに対して、(大多数のサンプルを含む)ヘッドクラスの深刻なバイアスを引き起こす。
そこで本研究では,学習中の予測嗜好を蓄積するために,学習中に更新される混乱行列上に構築された新しいPairwise Class Balance(PCB)手法を提案する。
論文 参考訳(メタデータ) (2022-01-08T07:48:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。