論文の概要: CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
- arxiv url: http://arxiv.org/abs/2610.00859v1
- Date: Thu, 01 Oct 2026 00:23:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.816518
- Title: CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
- Title(参考訳): CtrlWAM: 制御可能な世界行動モデル
- Abstract要約: 世界行動モデル(WAM)は、行動(意図)と視覚的未来(展望)を共同で予測する
本稿では,シミュレータで摂動動作を実行するCtrlWAMについて述べる。
運転実験では、より正確なアクション予測、生成されたビデオとアクションの緊密な一致、提供されたコマンドのより良い追従が示される。
- 参考スコア(独自算出の注目度): 68.8215501687831
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World action models (WAMs) jointly predict actions (intent) and visual future (foresight). Standard training adds noise to recorded actions and video simultaneously, but such training paradigms introduce a mismatch: perturbed actions imply counterfactual future visual, while the noised video remains tied to the GT recording. In low-noise regime, the scene geometry and even the dynamic behavior remain clearly visible from the noisy future frames despite the added noise. We present CtrlWAM, which executes perturbed actions in a simulator and pairs them with their noised visual consequences for joint WAM learning. To accommodate the different denoising requirements of video and actions, we introduce warped video--action noise schedules that aim to keep visual layout responsive as action predictions evolve. We further extend the action interface from ego-only control to a variable number of agent streams, allowing a unified model to represent predicted or commanded futures for multiple agents. Driving experiments show more accurate action forecasts, closer agreement between generated video and actions, and better following of supplied commands; robotics experiments show stronger motion fidelity and controllability. Matched controls support the benefit of off-path renders for command following and manipulation fidelity. Together, these findings contribute to a more controllable world action model. Project page: https://ctrl-wam.github.io/
- Abstract(参考訳): 世界行動モデル(WAM)は、行動(意図)と視覚的未来(展望)を共同で予測する。
標準的なトレーニングは、記録されたアクションとビデオに同時にノイズを加えるが、そのような訓練パラダイムはミスマッチをもたらす。
低雑音環境下では, シーン形状や動的挙動さえも, 付加ノイズにもかかわらず, ノイズのある将来のフレームからはっきりと見えるままである。
本稿では,シミュレータで摂動動作を実行するCtrlWAMについて述べる。
映像とアクションの異なる記述要件を満たすため,動作予測の進展に伴う視覚的レイアウトの応答性を維持するために,ワープされたビデオアクションノイズスケジュールを導入する。
我々はさらに、アクションインターフェースをエゴのみの制御からエージェントストリームの可変数に拡張し、複数のエージェントの予測や命令された未来を統一モデルで表現できるようにします。
運転実験は、より正確な行動予測、生成されたビデオとアクションの緊密な一致、供給されたコマンドのより良い追従を示す。
マッチしたコントロールは、コマンド追従と操作の忠実さに対するオフパスレンダリングの利点をサポートする。
これらの発見は、より制御可能な世界行動モデルに寄与する。
プロジェクトページ: https://ctrl-wam.github.io/
関連論文リスト
- GameWAM: A World Action Model for Video Games [36.43342575951464]
我々は,ネイティブなクローズドループゲームプレイとGUI制御のための WAM について,我々の知る限り,GameWAM を紹介した。
協調した世界行動学習を支援するために,ゲームプレイとGUIトラジェクトリを構築した。
実験では、比較されたエージェントよりも実行されたネイティブアクションが少なく、競争力のあるタスク成功を示す。
論文 参考訳(メタデータ) (2026-08-25T17:21:15Z) - World Action Models: A Survey [100.95337034529263]
ワールドアクションモデル(World Action Models, WAM)は、将来を予測できる予測モデルである。
近年のWAMは大規模なビデオ生成モデルを再利用しており、並列線はビデオ生成コアを持たない言語や視覚言語によるバックボーンに依存している。
この調査は、フィールドに共通の説明を与えます。まず、これらの境界を明確にし、2つの補完的な視点で既存の作業を整理します。
論文 参考訳(メタデータ) (2026-06-18T17:05:19Z) - $τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation [45.040666672458634]
政策学習,映像予測,行動評価を統合した統合ビデオアクション世界モデルを提案する。
このモデルは、実際のロボット遠隔操作で約27,300ドル(約2万2000円)で訓練されている。
論文 参考訳(メタデータ) (2026-05-31T05:35:36Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - Astra: General Interactive World Model with Autoregressive Denoising [73.6594791733982]
Astraはインタラクティブな汎用世界モデルであり、多様なシナリオのために現実世界の未来を生成する。
本稿では,自己回帰型認知型アーキテクチャを提案し,時間的因果的注意を用いて過去の観測を集約する。
Astraはインタラクティブで一貫性があり、一般的な長期的なビデオ予測を実現し、様々な形式のインタラクションをサポートする。
論文 参考訳(メタデータ) (2025-12-09T18:59:57Z) - Unified Video Action Model [47.88377984526902]
統合されたビデオとアクションモデルは、アクション予測のためのリッチなシーン情報を提供するロボット工学にとって重要な約束である。
我々は,映像とアクションの予測を協調的に最適化し,高精度かつ効率的なアクション推論を実現するUnified Video Action Model (UVA)を提案する。
広範な実験により、UVAは幅広いロボティクスタスクの汎用的なソリューションとして機能できることが実証された。
論文 参考訳(メタデータ) (2025-02-28T21:38:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。