論文の概要: Latent Action as Intention Enables Efficient Future Imagination for World Action Models
- arxiv url: http://arxiv.org/abs/2608.24882v2
- Date: Tue, 01 Sep 2026 06:44:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.45751
- Title: Latent Action as Intention Enables Efficient Future Imagination for World Action Models
- Title(参考訳): インテンションとしての潜在行動は、世界行動モデルに有効な未来のイマジネーションを可能にする
- Authors: Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Yuhang Zheng, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding,
- Abstract要約: 提案するアーキテクチャ**LAWA**は,コンパクトな潜伏動作を将来の意図の操作的表現として利用するWAMアーキテクチャである。
RoboCasaでは、LAWAは数ショットと全データ設定で65.6%と80.8%という最先端の平均的な成功率を達成した。
また、一致したJoint-WAMモデルの性能レベルも保持し、42.9%の遅延時間を必要とする。
- 参考スコア(独自算出の注目度): 20.031922437200524
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World action models (WAMs) improve robot control by modeling how observations evolve, but generating future observations at test time incurs substantial latency. Fast-WAM removes this process for efficiency; however, our matched implementations show lower generalization for Fast-WAM than for future-aware alternatives, especially with scarce robot demonstrations and in out-of-distribution scenarios. To bridge this gap, we introduce **LAWA**, a WAM architecture that uses compact latent actions as an operational representation of future intentions, enabling efficient test-time future imagination without generating future observations. Specifically, a discrete tokenizer enhanced by action-free pre-training produces manipulation-centric codebook targets. LAWA jointly denoises a continuous latent state anchored to these targets with executable action chunks while omitting the future-video branch at inference. On RoboCasa, LAWA achieves state-of-the-art average success rates of 65.6% and 80.8% in the few-shot and full data settings, improving over the matched Fast-WAM baseline by 9.6 and 4.5 points, respectively. It also preserves the performance level of the matched Joint-WAM variant while requiring 42.9% lower inference latency. LAWA also demonstrates competitive zero-shot robustness on LIBERO-Plus and superior performance on real-world tasks. These results show that future imagination need not be discarded: retaining it with compact latent actions yields an effective trade-off among performance, generalization, and latency. Code and models will be released.
- Abstract(参考訳): 世界行動モデル(WAM)は、観察がどのように進化するかをモデル化することでロボット制御を改善するが、テスト時に将来の観察を生成することは、かなりの遅延を引き起こす。
Fast-WAMは、このプロセスの効率性を排除するが、Fast-WAMの実装は、特にロボットのデモやアウト・オブ・ディストリビューションのシナリオにおいて、将来の選択肢よりも、より低い一般化を示している。
このギャップを埋めるために、我々は**LAWA**を導入する。このアーキテクチャは、コンパクトな潜伏動作を将来の意図の操作的表現として使用し、将来の観測を発生させることなく、効率的なテスト時将来の想像を可能にする。
具体的には、アクションフリープレトレーニングによって強化された離散トークン化器は、操作中心のコードブックターゲットを生成する。
LAWAは、将来のビデオブランチを推論で省略しながら、これらのターゲットに固定された連続潜時状態を実行可能なアクションチャンクで共同で認知する。
RoboCasaでは、LAWAは数ショットと全データ設定で65.6%と80.8%の最先端の平均成功率を獲得し、マッチしたFast-WAMベースラインを9.6ポイント、4.5ポイント改善した。
また、一致したJoint-WAMモデルの性能レベルも保持し、42.9%の遅延時間を必要とする。
LAWAはまた、LIBERO-Plus上での競合ゼロショットの堅牢性と、現実世界のタスクにおける優れたパフォーマンスを実証している。
これらの結果は、将来の想像力を捨てる必要はないことを示している: コンパクトな潜伏動作で維持することは、性能、一般化、遅延の間に効果的なトレードオフをもたらす。
コードとモデルはリリースされる。
関連論文リスト
- Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models [40.0682886050991]
世界行動モデル(WAM)は、現在の観察を超えて環境がどのように進化するかを学ぶことで、ロボット操作を改善する。
ジョイントWAMは、推論中に将来の認識表現を保持するが、計算コストは不当である。
分布シフト下での一般化には,予測時将来の条件付けが不可欠であることを示す。
論文 参考訳(メタデータ) (2026-08-05T03:18:58Z) - ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts [24.959404195743744]
トレーニング・ディストリビューション・ハロシン化(英語: Training-Distribution Hallucination)とは、現在のシーンに忠実に留まらず、視覚的に変化した観察で条件付けられた未来がトレーニング領域の内容に幻覚を与える現象である。
本稿では,DINOv3 を将来予測と履歴検索のための共有意味表現として用き,詳細なVAE のダイナミクスを維持しつつ,アクションロバスト性を向上させるセマンティック・テンポラル WAM (ST-WAM) を提案する。
論文 参考訳(メタデータ) (2026-07-31T03:44:56Z) - Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination [45.6948544726412]
World-Action Models (WAM) は未来の視覚予測とアクション生成を結合する。
ほとんどの既存のWAMは将来の予測に依存しており、高い推論遅延を引き起こし、リアルタイムロボットのデプロイを困難にしている。
本稿では,その制御利益を保ちつつ,将来の想像力のコストを低減させるワールド・アクション・モデルであるEfficient-WAMを紹介する。
論文 参考訳(メタデータ) (2026-06-08T18:14:08Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - When to Trust Imagination: Adaptive Action Execution for World Action Models [42.51856318901667]
世界行動モデル(WAM)は、近ごろ、将来の視覚的観察と将来の行動を共同で予測することによって、ロボット操作のための有望なパラダイムとして登場した。
現在のWAMは、各モデル推論の後、一定の数の予測アクションを実行し、ロボットは、想像された未来が実際の物理的なロールアウトと一致しているかどうかを無視する。
我々は,将来性検証問題として適応型WAM実行を定式化し,WAM予測された未来が信頼性を保ちながらロボットはより長く実行すべきであり,現実が想像力から逸脱した場合にはより早く再計画する。
論文 参考訳(メタデータ) (2026-05-07T13:18:28Z) - OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation [55.56490813640669]
VLAモデルは典型的には現在のフレームにのみ作用するが、将来の予測とオブジェクト認識推論は別々の潜在空間でしばしば学習される。
本稿では,時間的フォアシークエンスとオブジェクト認識推論を共通化することで,制約に対処するフレームワークOFlowを提案する。
提案手法は, 時間的フローマッチングを用いて将来の潜伏者を予測し, 物理的に関係のある手がかりを強調するオブジェクト認識表現に分解する。
論文 参考訳(メタデータ) (2026-04-20T06:38:01Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation [100.25567121604382]
VLA(Vision-Language-Action)モデルは、言語誘導されたタスクの実行と、目に見えないシナリオへの一般化の観点から、ロボット操作を改善した。
VLM(Vision-Language-Models)に基づく新しい高度なVLAアーキテクチャを提案する。
我々のモデルはタスクパフォーマンスにおいて既存のVLAをはるかに上回るだけでなく、新しいロボットへの顕著な適応と、見えないオブジェクトや背景への一般化も示している。
論文 参考訳(メタデータ) (2024-11-29T12:06:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。