論文の概要: RIWANav: Recursive World-Action Models with Self-Improvement for Urban Navigation
- arxiv url: http://arxiv.org/abs/2610.08640v1
- Date: Tue, 06 Oct 2026 16:33:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.116731
- Title: RIWANav: Recursive World-Action Models with Self-Improvement for Urban Navigation
- Title(参考訳): RIWANav:都市ナビゲーションのための自己改善型再帰的ワールドアクションモデル
- Abstract要約: 長距離都市航法は、時間とともにエラーが複雑になるような連続した局所的な決定を必要とする。
本稿では,タスク固有の自己改善手法として,世界モデルとアクションモデル(政治)を併用したフレームワークであるRIWANAVを紹介する。
実験の結果,RIWANAVはトレーニングベースラインや先行手法よりも優れていた。
- 参考スコア(独自算出の注目度): 15.267963499726383
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon urban navigation requires sequential local decisions whose errors can compound over time. Imitation learning (IL) rarely learns from failures, while physical trial-and-error reinforcement learning (RL) is costly. Action-conditioned world models can provide imagined feedback by predicting visual consequences for candidate actions. However, a frozen world model may become less reliable as the policy evolves. In this paper, we introduce RIWANAV, a post-training framework that casts the coupled adaptation of a world model and an action model (policy) as task-specific recursive self-improvement (RSI). Each cycle alternates two updates. The world model evaluates policy actions through imagined outcomes, providing comparative feedback for group-relative policy optimization (GRPO). The improved policy then constructs a grounded self-curriculum, selecting expert-consistent action-video pairs by behavioral novelty and prediction error. The refined world model supplies feedback for the next policy update, closing the recursive self-improvement loop. Experiments show that RIWANAV outperforms training baselines and prior methods, validating the proposed recursive self-improvement loop between the policy and world model. Real-world trials further demonstrate its practical applicability.
- Abstract(参考訳): 長距離都市航法は、時間とともにエラーが複雑になるような連続した局所的な決定を必要とする。
イミテーション学習(IL)は失敗から学ぶことはめったにないが、物理的な試行錯誤強化学習(RL)は費用がかかる。
アクション条件付き世界モデルは、候補アクションに対する視覚的結果を予測することによって、想像上のフィードバックを提供することができる。
しかし、この政策が進むにつれて、凍結した世界モデルは信頼性が低下する可能性がある。
本稿では,タスク固有の再帰的自己改善(RSI)として,世界モデルとアクションモデル(政治)を併用したポストトレーニングフレームワークであるRIWANAVを紹介する。
各サイクルは2つの更新を交互に行う。
世界モデルは、想像された結果を通じて政策行動を評価し、グループ相対的政策最適化(GRPO)の比較フィードバックを提供する。
改良されたポリシーは、行動のノベルティと予測エラーによって専門家と一貫性のあるアクションビデオペアを選択する、基礎的な自己カリキュラムを構築する。
洗練された世界モデルは、次のポリシーアップデートに対するフィードバックを提供し、再帰的な自己改善ループを閉じます。
実験の結果、RIWANAVはトレーニングベースラインや事前手法よりも優れており、政策と世界モデルの間の再帰的自己改善ループが検証されている。
現実の試行は、その実用性をさらに実証する。
関連論文リスト
- Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning [53.77164209208635]
本稿では,視覚的整合性と軌跡アライメントを用いて,より広い行動分布を探索するWorldEchoを紹介する。
本稿では,3つの軸に沿った行動(分布カバレッジ,表現的接地,介入効果のアライメント)を強化するWorldSyncを提案する。
RoboTwinベンチマークと実ロボットタスクの実験は、WorldSyncがWorldEchoメトリクスを改善し、反復的なポリシー改善のためのより信頼性の高いシミュレータとして機能していることを示している。
論文 参考訳(メタデータ) (2026-08-25T17:59:49Z) - Predicting Consequences and Reinforcing Navigation Policies with Latent World Models [31.865100130203317]
ロボットナビゲーションのためのLWM(Latent World Model)を提案する。
我々の重要な洞察は、空間的近接は潜在的特徴の類似性と相関し、潜在的空間において行動結果を直接評価できるということである。
提案手法は,予測精度,ポリシー学習,実世界のナビゲーション性能において,前世界モデルと模倣学習法を著しく上回っている。
論文 参考訳(メタデータ) (2026-08-23T11:58:42Z) - Q-Learning With World Models [69.63968749241239]
本稿では,Qラーニング上の実測軌道上でテスト時間探索を行い,高価値な行動を選択するために世界モデルを活用するフレームワークを提案する。
QWMは, 試料効率と性能の両方において, 従来の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2026-08-17T22:00:42Z) - COMAP: Co-Evolving World Models and Agent Policies for LLM Agents [14.918267305899619]
COMAPは、クローズドループインタラクションを通じてテキストワールドモデルとエージェントポリシーを共進化させる新しいフレームワークである。
各決定ステップにおいて、世界モデルは、候補行動に対する将来の状態フィードバックを予測し、エージェントは、このフィードバックの信頼性を推定して、将来の状態リフレクションを行う。
結果として生じるオンライン軌道は、自己蒸留によって世界モデルを更新するために使用され、エージェントの進化する相互作用分布によく一致する。
論文 参考訳(メタデータ) (2026-06-01T15:21:17Z) - Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization [46.32504081845328]
モデルに基づく強化学習は、世界モデルを用いて、大規模に効果的に支援することができる。
我々は、既存の世界モデルアプローチにおける検索と価値学習の間の構造的ミスアライメントであるボトルネックを特定する。
拡散政策表現を通じて探索と政策最適化を統一するフレームワークである世界モデルにおけるモデルベース拡散政策最適化(MBDPO)を提案する。
論文 参考訳(メタデータ) (2026-05-25T19:06:51Z) - Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training [54.896907620476675]
本稿では,学習世界モデルを用いた学習後学習フレームワークを提案する。
Hi-WMは中間状態をキャッシュし、ロールバックとブランチをサポートする。
我々は、剛性と変形性のあるオブジェクト相互作用と2つのポリシーバックボーンにまたがる3つの実世界の操作タスクについて、Hi-WMを評価する。
論文 参考訳(メタデータ) (2026-04-23T14:42:54Z) - AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models [75.214287449744]
我々は,Impartial World Modelを中心に構築されたポストトレーニング政策改善のためのフレームワークを紹介する。
私たちの主な貢献は、このモデルに危険について正直であることを教えることです。
大規模な実験を通じて、我々のモデルは失敗を予測する上で、ベースラインを著しく上回っていることを実証する。
論文 参考訳(メタデータ) (2025-11-25T13:57:24Z) - Bootstrap Off-policy with World Model [59.129118672069644]
ブートストラップループを通じて計画と非政治学習を緊密に統合するフレームワークであるBOOMを提案する。
BOOMは、トレーニングの安定性と最終的なパフォーマンスの両方において、最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-11-01T06:33:04Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - World Models via Policy-Guided Trajectory Diffusion [21.89154719069519]
既存の世界モデルは、次の状態を予測するために、ポリシーから次のアクションをサンプリングする、自己回帰的である。
本稿では, 自己回帰的でない新しい世界モデリング手法を提案する。
論文 参考訳(メタデータ) (2023-12-13T21:46:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。