論文の概要: VIGOR: Zero-Shot Visual Generalization via Latent-Space Consistency in Model-Based Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.02801v1
- Date: Fri, 02 Oct 2026 04:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.210728
- Title: VIGOR: Zero-Shot Visual Generalization via Latent-Space Consistency in Model-Based Reinforcement Learning
- Title(参考訳): VIGOR:モデルベース強化学習における潜在空間一貫性によるゼロショット視覚一般化
- Abstract要約: モデルベースRL(VIGOR)における潜在空間整合性による視覚的一般化を提案する。
VIGORは、3つの相互依存的なコンポーネントを統合している: (i)非対称な弱強弱化(i)弱弱強弱化(i)弱弱強弱化(i)動的レベル整合(ii)動的レベル整合(ii)動的レベル整合(i)動的レベル整合(ii)エンコーダレベルの安定化(iii)エンコーダレベルの安定化(iii)エンコーダレベルの安定化(encoder-level stabilization)。
- 参考スコア(独自算出の注目度): 14.61830335464839
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model-based reinforcement learning (MBRL) achieves strong sample efficiency by planning within learned latent dynamics, yet its performance degrades substantially under unseen visual distractions such as background variations, lighting changes, or camera shifts. Unlike model-free RL, where encoder perturbations affect only single-step predictions, MBRL suffers from a two-level vulnerability: visual distractions first push encoder outputs out of distribution, and these errors then compound through recursive latent rollouts over the planning horizon. We propose visual generalization via latent-space consistency in model-based RL (VIGOR), a framework that enables zero-shot generalization to unseen visual distractions while retaining the sample efficiency of its MBRL backbone. VIGOR integrates three interdependent components: (i) asymmetric weak-to-strong augmentation, which pairs weak-only and weak-to-strong latent views within a single batch; (ii) dynamics-level consistency, which enforces augmentation-invariant transition predictions through direct latent regression; and (iii) encoder-level stabilization, which prevents encoder drift under the cross-augmentation supervision imposed by dynamics-level consistency. Evaluations on the DeepMind Control Suite (DMC) and Robosuite show that VIGOR outperforms state-of-the-art model-free and model-based baselines, surpassing the second-best baseline by 3.4% on DMC and 43.6% on Robosuite. Ablations further show that VIGOR's robustness is augmentation-agnostic: replacing the default augmentation with alternatives from distinct perturbation families preserves strong generalization, confirming that latent-space consistency, not the augmentation choice, drives robustness.
- Abstract(参考訳): モデルベース強化学習(MBRL)は、学習された潜在力学を計画することで、強力なサンプル効率を達成するが、その性能は、背景の変化、照明の変化、カメラシフトといった目に見えない視覚的障害の下で著しく低下する。
モデルフリーのRLとは異なり、エンコーダの摂動が単一ステップの予測にのみ影響を及ぼすが、MBRLは2段階の脆弱性に悩まされる。
モデルベースRL(VIGOR)では,MBRLバックボーンのサンプル効率を保ちながら,ゼロショットの一般化による視覚的障害の発見を可能にするフレームワークとして,潜時空間整合による視覚的一般化を提案する。
VIGORは3つの相互依存コンポーネントを統合する。
(i) 1バッチで弱のみと弱から強の潜在ビューをペア化する非対称な弱から強への増大
(ii) 直接遅延回帰による拡張不変遷移予測を強制するダイナミックスレベルの整合性、及び
三 エンコーダレベルの安定化。ダイナミックスレベルの整合性により課せられるクロス強化監督の下でエンコーダのドリフトを防止する。
DeepMind Control Suite (DMC) と Robosuite の評価によると、VIGOR は最先端のモデルフリーとモデルベースベースラインを上回り、DMC では3.4%、Robosuite では43.6%となっている。
さらに、VIGORの堅牢性は拡張に依存しないことを示している: デフォルトの拡張を異なる摂動族からの代替に置き換えることは強力な一般化を保ち、拡張選択ではなく、潜在空間の一貫性が堅牢性を促進することを確認する。
関連論文リスト
- DUEL: Adversarial Self-Play for Multimodal Reasoning [16.61891948648537]
視覚言語モデル(VLM)の推論能力向上のための効果的なパラダイムとして強化学習(RL)が登場した。
本稿では,同じ事前学習VLMから生じる2つのポリシー間の対立的相互作用から,監督が出現する自己進化的ポストトレーニングフレームワークDUELを提案する。
実験によると、DUELは人間のアノテーション、外部報酬モデル、画像編集ツールを使わずに、視覚的推論と堅牢な識別を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-24T00:38:26Z) - Mitigating Error Amplification in Fast Adversarial Training [58.74042726356826]
FAT(Fast Adversarial Training)は、ネットワークに摂動不変表現の学習を促すことによって、モデルロバスト性の向上に有効であることが証明されている。
FATは、しばしば破滅的なオーバーフィッティング(CO)に悩まされ、モデルがトレーニングアタックに過度に適合し、目に見えないものへの一般化に失敗する。
本稿では、摂動予算と監視信号の両方を動的に調整する分散対応動的ガイダンス(DDG)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-27T11:23:18Z) - GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control [0.0]
GIRL(Generative Imagination Reinforcement Learning)は、この障害モードに2つの重要なコンポーネントで対処する潜在的世界モデルフレームワークである。
GIRLは、DreamerV3に対するタスク間の遅延ロールアウトドリフトを38~61%削減し、リターンを改善し、長距離タスクでの環境相互作用を少なくする。
蒸留前の変種はオーバーヘッドを減らし、フルモデルに対する計算効率を向上させる。
論文 参考訳(メタデータ) (2026-04-08T17:14:21Z) - RaDAR: Relation-aware Diffusion-Asymmetric Graph Contrastive Learning for Recommendation [12.682517297917828]
RaDARは,グローバルな構造を捉えるグラフ生成モデルと,ノイズの多いエッジを洗練するための関係認識型認知モデルを組み合わせた,新しいフレームワークである。
RaDARは、特にノイズやスパース条件下で、最先端の手法を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-17T17:05:23Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding [54.05243949024302]
既存の堅牢なMLLMは、視覚エンコーダの一般化にのみ焦点をあてた暗黙のトレーニング/適応に依存している。
本稿では,構造的推論連鎖による視覚的劣化を明示的にモデル化する新しいフレームワークであるRobust-R1を提案する。
提案手法は, (i) 劣化を考慮した推論基盤の微調整, (ii) 劣化パラメータを正確に知覚するための報酬駆動アライメント, (iii) 劣化強度に適応した動的推論深度スケーリングの2つを統合した。
論文 参考訳(メタデータ) (2025-12-19T12:56:17Z) - ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention [86.93601565563954]
ScaleWeaverは、高度な視覚的自己回帰(VAR)モデルに基づいて、高忠実で制御可能な生成を実現するために設計されたフレームワークである。
提案された参照注意モジュールは image$rightarrow$condition から不要な注意を排除し、計算コストを削減している。
実験によると、ScaleWeaverは、拡散ベースの方法よりも優れた効率を実現しつつ、高品質な生成と正確な制御を提供する。
論文 参考訳(メタデータ) (2025-10-16T17:00:59Z) - Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories [58.988535279557546]
適応推論トラジェクトリを用いたtextbf sycophancy Mitigation を提案する。
SMARTは,分布外の入力に対して強い性能を維持しながら,サイコファンティクスの挙動を著しく低下させることを示した。
論文 参考訳(メタデータ) (2025-09-20T17:09:14Z) - Unified Enhancement of the Generalization and Robustness of Language Models via Bi-Stage Optimization [2.502393972789905]
本稿では,LMの一般化とロバスト性の両方を均一に向上する二段階最適化フレームワークを提案する。
提案手法は,従来の手法と比較して,LMの一般化とロバスト性を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2025-03-19T13:50:36Z) - CL-MVSNet: Unsupervised Multi-view Stereo with Dual-level Contrastive Learning [32.65909515998849]
CL-MVSNetという2段階のコントラスト学習手法を提案する。
具体的には、2つの対照的な分岐を教師なしMVSフレームワークに統合し、追加の監視信号を構築する。
提案手法は,すべてのエンドツーエンドのMVSフレームワークの最先端性能を達成し,微調整を行なわずに教師付きフレームワークをかなりの差で上回っている。
論文 参考訳(メタデータ) (2025-03-11T09:39:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。