論文の概要: WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression
- arxiv url: http://arxiv.org/abs/2608.26239v1
- Date: Wed, 26 Aug 2026 17:57:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.135125
- Title: WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression
- Title(参考訳): WALL-SS: 次世代自動回帰による長距離世界モデルのスケーリング
- Abstract要約: 生成的世界モデルは、相互作用の下で世界がどのように進化するかの予測モデルを提供する。
WALL-SSは,スケールワイドの自己回帰スケーリングによって視覚的未来を生成する世界モデルである。
We show that WALL-SS improves action following and trajectory accuracy, support coherent minute-long streaming rollout under bounded memory, and consistent benefit of on-policy alignment。
- 参考スコア(独自算出の注目度): 24.010807495676605
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generative world models provide robots with predictive models of how the world evolves under interaction, with growing potential for simulation, planning, policy evaluation, and robot learning. Beyond clip-level future prediction, a unified generative formulation should relate actions to consequences, support flexible horizons and continuous interaction, and enable reward-driven optimization. We introduce WALL-SS, a world model that generates visual futures through Scale-wise autoregressive Scaling, enabling action-controllable and long-horizon robotic simulation. WALL-SS represents embodied trajectories as causal sequences of temporally interleaved observations and actions, making action-dependent state transitions explicit while naturally supporting variable-length generation, streaming extension through reusable causal states, and direct optimization through sequence probabilities. To make this formulation effective over long horizons, we generate each future observation in a coarse-to-fine manner and develop three complementary components within the same hierarchy. Action-conditioned next-scale prediction injects scale-aligned action representations to improve action-future coupling and model both successful and failed behaviors. Scale-compressed long-horizon memory retains recent interactions at fine resolution while compressing distant observations and actions, with scale-wise dream forcing enhancing robustness to self-generated context. Finally, on-policy alignment optimizes autoregressive visual dynamics with action-following and long-term consistency rewards while preserving the pretrained visual distribution. Experiments show that WALL-SS improves action following and trajectory accuracy, supports coherent minute-long streaming rollout under bounded memory, and consistently benefits from on-policy alignment in reducing action drift and long-horizon inconsistency.
- Abstract(参考訳): 生成的世界モデルは、ロボットに、相互作用の下で世界がどのように進化するかを予測するモデルを提供し、シミュレーション、計画、政策評価、ロボット学習の可能性を増大させる。
クリップレベルの将来の予測以外にも、統合された生成的定式化はアクションを結果に関連付け、フレキシブルな水平線と継続的な相互作用をサポートし、報酬駆動の最適化を可能にするべきである。
WALL-SSは、スケールワイドの自己回帰スケーリングによって視覚的未来を生成する世界モデルであり、アクション制御可能で長期のロボットシミュレーションを可能にする。
WALL-SSは、時間的にインターリーブされた観察と行動の因果配列としてエンボディされた軌跡を表現し、変動長生成を自然にサポートしながら行動依存状態遷移を明示し、再利用可能な因果状態を通じてストリーミング拡張し、シーケンス確率を直接最適化する。
この定式化を長い地平線上で有効にするために、各将来の観測を粗い方法で生成し、同じ階層内で3つの相補的成分を開発する。
アクション条件付き次のスケール予測は、アクション-フューチャー結合を改善するためにスケール整列されたアクション表現を注入し、成功と失敗の両方の振る舞いをモデル化する。
スケール圧縮ロングホライゾンメモリは、遠隔観察とアクションを圧縮しながら、最近の相互作用を微細な解像度で保持し、スケールワイドドリームは自己生成のコンテキストに堅牢性を強制する。
最後に、オンラインアライメントは、事前訓練された視覚分布を保ちながら、アクションフォローと長期一貫性の報酬を伴って自己回帰視覚力学を最適化する。
実験により、WALL-SSは動作追従と軌道精度を改善し、境界メモリ下でのコヒーレントな分長ストリーミングロールアウトをサポートし、アクションドリフトの低減とロングホライゾン不整合性の持続的メリットを示す。
関連論文リスト
- Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving [78.83165764484562]
Drive-HWMは階層的なスローファーストな世界モデリングフレームワークで、将来の表現予測とアクション生成を補完的な時間スケールで構成する。
次のフレーム予測では、高速モデルが差し迫ったシーンの進化を捉え、一方1ステップのアクション生成は、新しい観察が到着すると、決定を継続的に更新することを可能にする。
論文 参考訳(メタデータ) (2026-09-03T09:21:19Z) - SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation [35.54319311306262]
SLIM はコンパクトな潜在相互作用ポリシーである。
自己教師付きマスク付き軌道予測を通じて表現を学習する。
SLIMは、より少ないパラメータで、大規模なVLAとワールドアクションモデルベースラインとを一致または超える。
論文 参考訳(メタデータ) (2026-08-10T15:58:39Z) - ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games [6.8149466180197]
本稿では, 遷移分離原理に基づく行動感応的潜在世界モデルである ActSWM を提案する。
ActSWMは、ステップドリフト分析、クローズループマインクラフト計画、ゲーム間のローカルアクションリカバリなどを通じて、既存のベースラインよりも大きなアクション依存ロールアウトギャップを維持している。
論文 参考訳(メタデータ) (2026-07-29T09:55:54Z) - ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving [12.68658021226119]
本稿では,ビジュアルアクション・クロスコンディショニングを備えた自動回帰拡散フレームワークForgeDriveを紹介する。
ForgeDriveは、運転シミュレーション、計画、視覚計測を単一のモデルに統合するだけでなく、訓練後の戦略を使わずに既存の強力なプランナーよりも優れています。
論文 参考訳(メタデータ) (2026-06-30T07:05:48Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - SPIRAL: A Closed-Loop Framework for Self-Improving Action World Models via Reflective Planning Agents [135.00390535239129]
本稿では,自己改善型計画および反復的行動世界モデリングフレームワークであるSPIRALを紹介する。
SPIRALはActWMをクローズドループシンク-アクト-リフレクションプロセスとして定式化し、そこで生成は明示的な計画とフィードバックの下で段階的に進行する。
複数のTI2Vバックボーンに対する実験は、ActWM-Benchとメインストリームのビデオ生成ベンチマークで一貫した利得を示している。
論文 参考訳(メタデータ) (2026-03-09T14:00:36Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Astra: General Interactive World Model with Autoregressive Denoising [73.6594791733982]
Astraはインタラクティブな汎用世界モデルであり、多様なシナリオのために現実世界の未来を生成する。
本稿では,自己回帰型認知型アーキテクチャを提案し,時間的因果的注意を用いて過去の観測を集約する。
Astraはインタラクティブで一貫性があり、一般的な長期的なビデオ予測を実現し、様々な形式のインタラクションをサポートする。
論文 参考訳(メタデータ) (2025-12-09T18:59:57Z) - SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models [42.814012901180774]
textbfSAMPOは、フレーム内生成のための視覚的自己回帰モデリングと、次のフレーム生成のための因果モデリングを組み合わせたハイブリッドフレームワークである。
動作条件付きビデオ予測とモデルベース制御において,SAMPOが競合性能を発揮することを示す。
また、SAMPOのゼロショット一般化とスケーリング挙動を評価し、未知のタスクに一般化する能力を示す。
論文 参考訳(メタデータ) (2025-09-19T02:41:37Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。