論文の概要: $\texttt{WEAVER}$, Better, Faster, Longer: An Effective World Model for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2606.13672v1
- Date: Thu, 11 Jun 2026 17:59:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.981451
- Title: $\texttt{WEAVER}$, Better, Faster, Longer: An Effective World Model for Robotic Manipulation
- Title(参考訳): $\texttt{WEAVER}$, Better, Fast, Longer: ロボットマニピュレーションのための効果的な世界モデル
- Abstract要約: $texttWEAVER$は、3つのdeiderataを同時に実行するWMアーキテクチャである。
$texttWEAVER$.texttWEAVER$は、フローマッチング損失を通じて、将来の潜伏者と報奨値を予測するように訓練されている。
我々は、ロボットハードウェアに$texttWEAVER$を適用し、ポリシー評価、ポリシー改善、テストタイムプランニングの有効性を実証する。
- 参考スコア(独自算出の注目度): 26.48387646424999
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The potential impacts of world models (WMs, i.e., learned simulators) on robotics are far-reaching -- policy evaluation, policy improvement, and test-time planning -- all with limited real-world interaction. To unlock these downstream capabilities, a WM needs to jointly satisfy three desiderata: $\textit{(i)}$ fidelity (i.e., producing simulated trajectories that correlate with reality), $\textit{(ii)}$ consistency (i.e., producing simulated trajectories that are coherent over long horizons), and $\textit{(iii)}$ efficiency (i.e., producing simulated trajectories quickly). We propose $\texttt{WEAVER}$ (World Estimation Across Views for Embodied Reasoning): a WM architecture that simultaneously achieves all three desiderata, providing state-of-the-art results on robotic manipulation tasks. $\texttt{WEAVER}$ is a multi-view WM trained to predict future latents and reward values via a flow-matching loss. We distill the key design decisions across model architecture, memory, and prediction objectives required to unlock the kinds of long-horizon dynamic manipulation tasks that have confounded prior world modeling approaches. We apply $\texttt{WEAVER}$ in robotic hardware, demonstrating its effectiveness at policy evaluation ($ρ$=0.870 correlation with real-world success rate), policy improvement (real-world success rate improvement of $38\%$ on top of the $π_{0.5}$ robot foundation model), and test-time planning (real-world success rate improvement of $14\%$ with a $5-10\times$ speedup over prior WMs). $\texttt{WEAVER}$ also demonstrates better performance than prior WMs when evaluated on out-of-distribution scenarios. Code, models, and videos at: https://arnavkj1995.github.io/WEAVER/ .
- Abstract(参考訳): ロボット工学における世界モデル(WM、すなわち学習シミュレータ)の潜在的な影響は、政策評価、政策改善、テストタイム計画など、いずれも現実世界の相互作用に限られている。
これらの下流機能をアンロックするには、WMは3つのdesiderataを共同で満たす必要がある。
(i)}$fidelity(つまり、現実と相関するシミュレートされた軌道を生成する)、$\textit{
(ii)}$ consistency(すなわち、長い地平線上でコヒーレントなシミュレートされた軌道を生成する)と$\textit{
(iii)=効率(即ち、シミュレートされた軌道を素早く生成する)
本稿では,3つのデシラタを同時に実現し,ロボット操作タスクの最先端結果を提供するWMアーキテクチャを提案する。
$\texttt{WEAVER}$は、フローマッチング損失を通じて、将来の潜伏者と報酬値を予測するために訓練されたマルチビューWMである。
我々は,従来のモデリング手法を確立させた長軸動的操作タスクを解き放つために必要な,モデルアーキテクチャ,メモリ,予測目標にまたがる重要な設計決定を精査する。
ロボットハードウェアに$\texttt{WEAVER}$を適用し、その効果を政策評価(ρ$=0.870と実世界の成功率との相関)、政策改善(π_{0.5}$ロボット基礎モデル上での実世界の成功率改善)、テスト時間計画(実世界の成功率改善とWMs以前の5〜10倍のスピードアップ)で示す。
$\texttt{WEAVER}$は、アウト・オブ・ディストリビューションのシナリオで評価した場合、以前のWMよりも優れたパフォーマンスを示す。
コード、モデル、ビデオ https://arnavkj1995.github.io/WEAVER/
関連論文リスト
- WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control [85.21175469425172]
近年,ロボット基盤モデル(RFM)が汎用ロボットシステムの主要なアプローチとして確立されている。
提案する3D-Centric World-Spatial-Action モデリングパラダイムに基づく新しい RFM である WSA$_1$ を提案する。
将来のロボット行動に対する3D世界認識の視覚的思考を学習するだけでなく、行動一般化を促進するために3D世界遷移とロボット行動の相互制約をモデル化する。
論文 参考訳(メタデータ) (2026-07-04T16:26:39Z) - GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation [73.02743604295246]
WMBenchは、実際のロボット遠隔操作データとポリシーのロールアウトから構築されたベンチマークである。
7つのビデオワールドモデル,4つのアクション表現スキーム,および実際のロボット実行と組み合わせた324,000以上のシミュレートされたポリシーロールアウトを分析した。
評価者の品質は、短期的な視覚的リアリズムよりも、長期的な、行動に忠実なロールアウト一貫性に支配されている。
論文 参考訳(メタデータ) (2026-07-02T17:02:43Z) - $τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation [45.040666672458634]
政策学習,映像予測,行動評価を統合した統合ビデオアクション世界モデルを提案する。
このモデルは、実際のロボット遠隔操作で約27,300ドル(約2万2000円)で訓練されている。
論文 参考訳(メタデータ) (2026-05-31T05:35:36Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - VectorWorld: Efficient Streaming World Model via Diffusion Flow on Vector Graphs [10.040683730802266]
本稿では,ego中心のベクターグラフタイルをロールアウト中に段階的に生成するストリーミングワールドモデルであるVectorWorldを提案する。
これは、モーションアウェアのゲートVAEを介してポリシー互換の相互作用状態を生成することで、履歴条件のポリシーと整合する。
solvrfreegated Diconditioned Training MeanFlow JVPを通じて、リアルタイムのアウトステップ補完をサポートする。
論文 参考訳(メタデータ) (2026-03-18T12:13:30Z) - RISE: Self-Improving Robot Policy with Compositional World Model [52.227523057681786]
我々は、想像力によるロボット強化学習のスケーラブルなフレームワークRISEを紹介する。
中心となるのは構成的世界モデルであり、制御可能なダイナミクスモデルを通じて多視点の未来を予測し、(ii)進捗値モデルを用いて想像結果を評価する。
これらのコンポーネントはクローズドループの自己改善パイプラインに統合され、虚構のロールアウトを継続的に生成し、利点を推定し、コストのかかる物理的相互作用なしに虚構空間のポリシーを更新する。
論文 参考訳(メタデータ) (2026-02-11T17:43:36Z) - AnyTask: an Automated Task and Data Generation Framework for Advancing Sim-to-Real Policy Learning [16.837846476054786]
大規模で多様な、高品質なインタラクションデータは、現実の世界で収集するのに費用がかかる。
我々はAnyTaskという,大規模並列GPUシミュレーションと基礎モデルを組み合わせて多様な操作タスクを設計する自動化フレームワークを提示する。
我々は、生成されたデータに基づいて行動クローニングポリシーを訓練し、シミュレーションで検証し、実際のロボットハードウェアに直接デプロイする。
論文 参考訳(メタデータ) (2025-12-19T17:55:48Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning [25.65324419553667]
我々は,視覚的特徴と行動生成の統合を強化するために,階層構造を明示的に組み込んだ新しいビジュモータ学習フレームワークである$textbfTriply-Hierarchical Diffusion Policy(textbfH$mathbf3$DP)を紹介した。
大規模な実験では、H$3$DPは$mathbf+27.5%の平均相対的な改善を$mathbf44$のシミュレーションタスクで達成し、$mathbf4$の挑戦的な実世界の操作タスクで優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-12T17:59:43Z) - Uncovering Untapped Potential in Sample-Efficient World Model Agents [51.65485693709418]
Simulusは高度にモジュール化されたTBWMエージェントで、マルチモーダルトークン化フレームワーク、本質的なモチベーション、優先順位付けされたWMリプレイ、レグレッション・アズ・クラス化を統合している。
Simulusは3つの異なるベンチマークで、計画自由なWMに対して最先端のサンプル効率を達成する。
論文 参考訳(メタデータ) (2025-02-17T08:06:10Z) - STORM: Efficient Stochastic Transformer based World Models for
Reinforcement Learning [82.03481509373037]
近年,モデルに基づく強化学習アルゴリズムは視覚入力環境において顕著な有効性を示している。
本稿では,強力なモデリングと生成機能を組み合わせた効率的な世界モデルアーキテクチャであるTransformer-based wORld Model (STORM)を紹介する。
Stormは、Atari 100$kベンチマークで平均126.7%の人的パフォーマンスを達成し、最先端のメソッドの中で新しい記録を樹立した。
論文 参考訳(メタデータ) (2023-10-14T16:42:02Z) - Reactive Long Horizon Task Execution via Visual Skill and Precondition
Models [59.76233967614774]
シミュレーションで学習したモデルを用いて、単純なタスクプランナの構成要素をグラウンド化することで、見知らぬロボットタスクを達成できるシミュレート・トゥ・リアル・トレーニングのアプローチについて述べる。
シミュレーションでは91.6%から98%,実世界の成功率は10%から80%に増加した。
論文 参考訳(メタデータ) (2020-11-17T15:24:01Z) - Nearly Minimax Optimal Reward-free Reinforcement Learning [88.75843804630772]
本稿では、特にバッチ強化学習に適した報酬不要強化学習フレームワークと、複数の報酬関数に対するポリシーを必要とするシナリオについて検討する。
textbfStaged textbfSampling + textbfTruncated textbfPlanning (algoname) という新しい効率的なアルゴリズムを提供しています。
論文 参考訳(メタデータ) (2020-10-12T17:51:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。