論文の概要: Concept-Guided Spatial Regularization for World Models in Atari Pong
- arxiv url: http://arxiv.org/abs/2607.15142v1
- Date: Thu, 16 Jul 2026 15:46:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.163201
- Title: Concept-Guided Spatial Regularization for World Models in Atari Pong
- Title(参考訳): アタリポンにおける世界モデルのための概念誘導型空間正規化
- Authors: Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen,
- Abstract要約: 我々はアタリポンの視覚的世界モデルエージェントを5つ評価した。
新しいポリシーは、凍結した世界モデルの中で完全に訓練され、実際の環境で評価されます。
分割された概念領域に適用した補助画素再構成損失であるCGSReg(Concept-Guided Spatial Regularization)を提案する。
- 参考スコア(独自算出の注目度): 10.294921790652669
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models are usually evaluated as components of model-based reinforcement learning (MBRL) systems, while the world models themselves are rarely studied in isolation. We examine five representative visual world-model agents in Atari Pong: DreamerV3, DIAMOND, TWISTER, Simulus, and STORM. After reproducing their training pipelines and matching the reported agent performance, we freeze the learned world models and evaluate them with a closed-loop rollout diagnostic: a policy trained separately from the corresponding MBRL agent interacts with each frozen model, and the generated video trajectories are inspected for visual and dynamical errors. Across all five models, the rollouts contain clear failures, including ball disappearance, incorrect ball motion, and invalid ball-paddle interactions. Beyond visual trajectories, we further evaluate them with pixel-space zero-shot MBRL, where a new policy is trained entirely inside a frozen world model and then evaluated in the real environment. Across all five models, the resulting policies substantially underperform those produced by the corresponding original MBRL training pipelines. The gap is particularly large for DreamerV3, whose mean return drops from -5.5 to -20.9, near the minimum Pong return of -21. We hypothesize that insufficient modeling of task-critical concepts, such as the ball in Pong, may contribute to these failures. We therefore propose Concept-Guided Spatial Regularization (CGSReg), an auxiliary pixel reconstruction loss applied to segmented concept regions. Experiments show that CGSReg improves both closed-loop rollouts and pixel-space zero-shot MBRL in DreamerV3, DIAMOND, and TWISTER. Its effects vary across the remaining models and evaluation metrics, indicating that CGSReg alone does not address all world-model bottlenecks.
- Abstract(参考訳): 世界モデルは、通常、モデルベース強化学習(MBRL)システムの構成要素として評価されるが、世界モデル自体が独立して研究されることは滅多にない。
本研究では,アタリポンにおける5つの視覚的世界モデルエージェント,DreamerV3,DIAMOND,TWISTER,Simulus,STORMについて検討する。
トレーニングパイプラインを再生し、報告されたエージェントのパフォーマンスと一致させた後、学習した世界モデルを凍結し、クローズドループロールアウト診断により評価する。対応するMBRLエージェントとは独立にトレーニングされたポリシーは、各凍結モデルと相互作用し、生成したビデオトラジェクトリは視覚的および動的エラーに対して検査される。
5つのモデル全体で、ロールアウトには、ボールの消失、不正なボールの動き、無効なボールパドル相互作用など、明確な障害が含まれている。
視覚的トラジェクトリの他に、ピクセル空間ゼロショットMBRLを用いて、新たなポリシーを凍結世界モデル内で完全にトレーニングし、実環境で評価する。
5つのモデル全体で、結果として得られるポリシーは、対応するMBRLトレーニングパイプラインによって生成されたものよりも大幅に劣っている。
この差はドリーマーV3にとって特に大きいが、平均リターンは-21のポンのリターンに近い-5.5から-20.9に低下する。
Pongのボールのようなタスククリティカルな概念の不十分なモデリングは、これらの失敗に寄与するのではないか、という仮説を立てる。
そこで我々は,分割された概念領域に適用された補助画素再構成損失であるCGSReg(Concept-Guided Spatial Regularization)を提案する。
実験の結果、CGSRegはDreamerV3、DIAMOND、TWISTERのクローズドループロールアウトとピクセルスペースゼロショットMBRLの両方を改善していることがわかった。
その効果は、残りのモデルや評価指標によって異なり、CGSRegだけではすべての世界モデルのボトルネックに対処していないことを示している。
関連論文リスト
- Predicting Closed-Loop Performance of Latent World Models: Offline Checkpoint Selection for MPC and Model-Based RL Under Non-Markovian Rewards in LunarLander [0.6581214715240989]
検証時間のみで学習した潜在世界モデルの下流クローズドループ性能を予測する方法について検討する。
最適制御理論から導かれた構造的検証時間診断の組をGymnasiumのLunarLander v3に適用する。
論文 参考訳(メタデータ) (2026-07-02T05:46:03Z) - Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement [52.93267443851685]
VLA(Vision-Language-Action)モデルは様々な操作タスクにまたがって一般化することができる。
シミュレーションで純粋に訓練された強化学習政策は、実世界のVLAのゼロショットの堅牢性を改善することができるか?
本稿では,オブジェクトポーズを用いてVLA動作を洗練するオブジェクト中心残差RLフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-17T11:36:54Z) - What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators [6.400424118459376]
アーキテクチャ的に異なる2つの世界モデル(IRISとDIAMOND)に解釈可能性技術を適用した。
両モデルともゲーム状態変数の線形デオード可能な表現を開発する。
IRISアテンションヘッドの分析は空間的特殊化を明らかにし、特定のヘッドはゲームオブジェクトと重複するトークンに優先的に出席する。
論文 参考訳(メタデータ) (2026-03-23T04:00:53Z) - VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents [130.70999337445468]
言語モデル(LLM)エージェントと比較して、視覚言語モデル(VLM)エージェントを訓練する際の重要な課題は、テキスト状態から複雑な視覚観察に移行することである。
VLMエージェントは、明示的な視覚状態推論によって内部世界モデルを構築することができるか?
我々は、強化学習(RL)を通して、エージェントの推論プロセスを建築的に実施し、報奨する。
エージェントの状態推定と遷移モデリングへの推論が成功に不可欠であることが分かりました。
論文 参考訳(メタデータ) (2025-10-19T16:05:07Z) - Internalizing World Models via Self-Play Finetuning for Agentic RL [65.96875390986655]
エージェントとしての大規模言語モデル(LLM)は、しばしばアウト・オブ・ディストリビューション(OOD)のシナリオで苦労する。
状態表現と遷移モデリングという2つのコンポーネントに分解することで、この世界モデルをエンコードする方法を示す。
SPAは,世界モデルを学習するために,セルフプレイ指導による微調整段階を通じてポリシーを冷やし始める,シンプルな強化学習フレームワークである。
論文 参考訳(メタデータ) (2025-10-16T18:03:39Z) - Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining [49.730897226510095]
我々は,60億のトークンデータを持つアタリゲーム上で事前訓練されたオフラインモデルベースRLエージェントであるJOWA: Jointly-Reinforceed World-Action Modelを紹介する。
われわれの最大のエージェントは、1億5000万のパラメータを持ち、10%のサブサンプルオフラインデータだけで事前トレーニングされたゲーム上での人間レベルのパフォーマンス78.9%で、既存の最先端の大規模なオフラインRLベースラインを31.6%上回っている。
論文 参考訳(メタデータ) (2024-10-01T10:25:03Z) - Sense, Imagine, Act: Multimodal Perception Improves Model-Based
Reinforcement Learning for Head-to-Head Autonomous Racing [10.309579267966361]
モデルベース強化学習(MBRL)技術は、最近、現実の自律レースに有望な結果をもたらした。
本稿では,F1TENTH Gymから収集した自家中心型LiDARとRGBカメラ観測を組み合わせた自己教師型センサ融合手法を提案する。
その結果、ドリーマーのエージェントは衝突を安全に回避し、ゼロショット・ヘッド・ツー・ヘッド・オートレースでテストされた他のベースラインと比較すると、最も多くのレースに勝利した。
論文 参考訳(メタデータ) (2023-05-08T14:49:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。