論文の概要: DriftWorld: Fast World Modeling through Drifting
- arxiv url: http://arxiv.org/abs/2607.15065v1
- Date: Thu, 16 Jul 2026 14:37:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.138752
- Title: DriftWorld: Fast World Modeling through Drifting
- Title(参考訳): DriftWorld: ドリフトによる高速な世界モデリング
- Authors: Susie Lu, Haonan Chen, Weirui Ye, Yilun Du,
- Abstract要約: 本稿では,ドリフト生成モデルに基づく行動条件付き世界モデルDriftWorldを紹介する。
DriftWorldは、推論時に反復的に飾るのではなく、トレーニング中にアクション条件付きドリフトを学ぶ。
DriftWorldは、正確かつ高速にロールアウトすることで、最先端の意思決定パフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 49.014235003131596
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predictive world models enable robots to plan by imagining the outcomes of their actions, but their value for control hinges on generating many rollouts quickly. This creates a bottleneck for diffusion-based world models: multistep sampling makes each rollout expensive, limiting large-scale action search at inference time. We introduce DriftWorld, an action-conditioned world model based on drifting generative models. Rather than denoising iteratively at inference, DriftWorld learns an action-conditioned drift during training, allowing it to generate future frames from the current observation and a candidate action sequence in a single forward pass at 30+ fps, which is 17x faster on average than diffusion based baselines. We evaluate DriftWorld on standard vision-based robotic manipulation benchmarks, including Bridge-V2, RT-1, Language Table, Push-T, and Robomimic. By producing rollouts that are both accurate and fast, DriftWorld achieves state-of-the-art decision-making performance with far less inference time than diffusion-based world model baselines. Beyond online control, DriftWorld can also serve as an offline simulator for ranking real-world robot policies, with rollout-based scores correlating with ground truth at up to 0.99. These results show that drifting models are a strong fit for robot world modeling, where fast, high-quality imagination directly supports planning and policy evaluation.
- Abstract(参考訳): 予測的世界モデルは、ロボットが行動の結果を想像することで計画できるが、制御ヒンジに対するその価値は多くのロールアウトを素早く生成する。
マルチステップサンプリングは、各ロールアウトを高価にし、推論時に大規模なアクションサーチを制限します。
本稿では,ドリフト生成モデルに基づく行動条件付き世界モデルDriftWorldを紹介する。
DriftWorldは、推論時に反復的にノイズを発生させるのではなく、トレーニング中にアクション条件ドリフトを学習し、現在の観測から将来のフレームと、拡散ベースラインよりも平均17倍速い1回のフォワードパスで候補アクションシーケンスを生成する。
DriftWorldは、Bridge-V2、RT-1、Language Table、Push-T、Roomimicなど、標準的な視覚に基づくロボット操作ベンチマークで評価する。
DriftWorldは、正確かつ高速なロールアウトを生産することによって、拡散ベースの世界モデルベースラインよりもはるかに少ない推論時間で最先端の意思決定パフォーマンスを達成する。
オンラインコントロール以外にも、DriftWorldは現実世界のロボットポリシーをランク付けするためのオフラインシミュレーターとしても機能する。
これらの結果は,ドリフトモデルがロボットの世界モデリングに強く適合していることを示し,高速で高品質な想像力は計画と政策評価を直接支援している。
関連論文リスト
- RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation [52.855830378221775]
一般的なロボットポリシーを評価するためのスケーラブルな代替手段として、ビデオワールドモデルが登場しつつある。
タスクプログレス対応の視覚言語モデルスコアリングと,高速なビデオワールドモデルを組み合わせた自動評価パイプラインであるRoboWorldを紹介する。
論文 参考訳(メタデータ) (2026-07-01T15:22:41Z) - CausalDrive: Real-time Causal World Models for Autonomous Driving [60.66609721457312]
制御可能でリアルタイムなファンデーション駆動の世界であるCausalDriveを紹介します。
CaulDriveは、最初のフロントビューフレーム、エゴ車両の軌道、マクロテキストプロンプトのみで動作する。
本稿では,(1)衝突アーティファクトを著しく緩和した生成的クローズループ評価,(2)ビデオ2Rewardモジュールによる大規模強化学習(RL)後トレーニング,(3)リアルタイムの人間-イン-ザ・ループシミュレーション,の3つのダウンストリームアプリケーションにおける汎用性を実証する。
論文 参考訳(メタデータ) (2026-06-13T15:04:44Z) - Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation [53.750389076941396]
拡散に基づくビジュモータポリシーは反復的認知を通じて多モーダルな動作分布をキャプチャするが、その高い推論遅延はリアルタイムロボット制御を制限する。
Ada3Driftは,専門家のデモモードに対して予測された行動を引き付ける訓練時間ドリフト場を学習する。
Ada3Driftは、拡散ベースの代替よりも10倍の関数評価を必要としながら、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-12T14:36:53Z) - WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL [30.884160045861616]
我々は、VLAポリシーの訓練後、信頼性の高い世界モデルに基づく強化学習フレームワークであるWoVRを提案する。
制御可能なアクション条件付きビデオワールドモデルによってロールアウト安定性を向上させる。
また、Keyframe-evolutiond Rolloutsによる効果的なエラー深度を低減するために、想像上のインタラクションを再確認する。
論文 参考訳(メタデータ) (2026-02-15T03:48:20Z) - Walk through Paintings: Egocentric World Models from Internet Priors [65.30611174953958]
本稿では,エゴセントリック・ワールド・モデル(EgoWM)について述べる。
我々は、スクラッチからトレーニングするよりも、インターネット規模のビデオモデルのリッチワールドを再利用し、軽量なコンディショニング層を通じてモーターコマンドを注入する。
当社のアプローチは,3-DoF移動ロボットから25-DoFヒューマノイドまで,エボディメントやアクションスペースを自然に拡張する。
論文 参考訳(メタデータ) (2026-01-21T18:59:32Z) - Epona: Autoregressive Diffusion World Model for Autonomous Driving [39.389981627403316]
既存のビデオ拡散モデルは、柔軟で長い水平予測と軌道計画の統合に苦慮している。
これは、従来のビデオ拡散モデルは固定長フレーム列のグローバルな共同分布モデルに依存しているためである。
本研究では,局所分布モデリングが可能な自己回帰的世界モデルであるEponaを提案する。
論文 参考訳(メタデータ) (2025-06-30T17:56:35Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - Transformers are Sample Efficient World Models [1.9444242128493845]
我々は、離散自己エンコーダと自己回帰変換器からなる世界モデルで学習するデータ効率のエージェントIRISを紹介する。
Atari 100kベンチマークの2時間のゲームプレイに相当するIRISは、平均的な人間正規化スコア1.046を達成し、26ゲーム中10ゲームで人間を上回っている。
論文 参考訳(メタデータ) (2022-09-01T17:03:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。