論文の概要: Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model
- arxiv url: http://arxiv.org/abs/2606.27325v1
- Date: Thu, 25 Jun 2026 17:36:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.382387
- Title: Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model
- Title(参考訳): あらゆる行動が平等であるとは限らない:デクサラス世界モデルの条件付けを再考する
- Authors: Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li, Zecui Zeng, Renjing Xu,
- Abstract要約: アクション・コンディショニングは、アクション・コンディショナード・ワールド・モデルでは未発見のままである。
本稿では,グローバル圧縮ではなく構造化プロセスとして動作条件を扱うDexACを提案する。
セマンティックブランチとDexACを組み合わせることで、FID、FVD、PCKが大幅に向上し、視覚的時間的リアリズムと行動追従一貫性が向上することを示す。
- 参考スコア(独自算出の注目度): 15.646017114869169
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in action-conditioned world models show promising progress in modeling complex interactions and forecasting future states under diverse action sequences. While these models are often driven by stronger visual representations and model capacity, action conditioning itself remains underexplored. Most existing approaches compress the entire action sequence into a single representation, which works well for low-DoF control but becomes less reliable in high-DoF scenarios. We observe that high-DoF dexterous actions are inherently heterogeneous, spanning multiple orders of magnitude, where large-scale motions coexist with subtle but important signals. When uniformly aggregated, optimization exhibits an imbalance across action components, which hinders the modeling of fine-grained effects and affects action fidelity. We therefore propose DexAC-WM, which treats action conditioning as a structured process rather than global compression. DexAC preserves dimension-level semantics via action tokenization and aligns action signals with visual dynamics through local refinement and global modulation. To address the limited high-level semantic grounding in existing world models, we further introduce a semantic branch that provides rich object-scene priors, which enables world model to capture dynamic visual details while supporting high-DoF action-conditioned video prediction. Experiments on EgoDex and EgoVerse show that combining the semantic branch with DexAC significantly improves FID, FVD, and PCK, demonstrating gains in visual-temporal realism and action-following consistency. We further verify that DexAC extends to other backbones, showing the scalability of our structured action-conditioning design. These results suggest that scaling world models to high-DoF control requires both structured action modeling and semantic grounding.
- Abstract(参考訳): 行動条件付き世界モデルの最近の進歩は、複雑な相互作用をモデル化し、多様な行動シーケンスの下で将来の状態を予測する上で有望な進歩を示している。
これらのモデルは、しばしばより強力な視覚表現とモデルキャパシティによって駆動されるが、アクションコンディショニングそれ自体は未探索のままである。
既存のほとんどのアプローチでは、アクションシーケンス全体を単一の表現に圧縮し、低DoF制御ではうまく機能するが、高DoFシナリオでは信頼性が低下する。
我々は,大規模動きが微妙に重要な信号と共存する,高DoFデキスタラス動作が本質的に不均一であることを観察した。
均一に集約された場合、最適化はアクションコンポーネント間の不均衡を示し、きめ細かい効果のモデリングを妨げ、アクションの忠実性に影響を与える。
そこで本稿では,グローバル圧縮ではなく構造化プロセスとして動作条件を扱うDexAC-WMを提案する。
DexACはアクショントークン化を通じて次元レベルのセマンティクスを保持し、局所的な精細化とグローバルな変調を通じてアクション信号を視覚力学と整合させる。
既存の世界モデルにおける限られたハイレベルなセマンティックグラウンドに対処するため、我々はさらに、リッチなオブジェクトシーンの事前情報を提供するセマンティックブランチを導入し、ハイDoFアクション条件付きビデオ予測をサポートしながら、ダイナミックなビジュアルディテールをキャプチャすることを可能にする。
EgoDexとEgoVerseの実験では、セマンティックブランチとDexACを組み合わせることで、FID、FVD、PCKが大幅に改善され、視覚的時間的リアリズムとアクションフォロー一貫性が向上することが示されている。
さらに、DexACが他のバックボーンにも拡張可能であることを確認し、構造化されたアクションコンディショニング設計のスケーラビリティを示す。
これらの結果は,世界モデルをハイDoF制御に拡張するには,構造化アクションモデリングとセマンティックグラウンドディングの両方が必要であることを示唆している。
関連論文リスト
- Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - Making Foresight Actionable: Repurposing Representation Alignment in World Action Models [57.23863557252883]
World Action Models (WAMs)は、ビデオ生成モデルを使用して将来のシーンの進化をモデル化することで、ロボット操作のための有望なルートを提供する。
目に見える未来を生み出すことは 必ずしも正確な行動の抽出を 保証するとは限らない
本稿では,Action-Grounded Representation Alignmentの目的であるAGRAを提案する。
論文 参考訳(メタデータ) (2026-06-10T15:31:25Z) - iMaC: Translating Actions into Motion and Contact Images for Embodied World Models [77.395425755122]
身体的世界モデルは、視覚ロボットによる意思決定と対話型環境シミュレーションのための重要なパラダイムとして登場した。
本稿では,実画像を実世界モデルのためのネイティブアクション表現として扱う,新しい統一制御パラダイムである「イメージ・アズ・アクション・コントロール」を提案する。
論文 参考訳(メタデータ) (2026-06-08T17:55:41Z) - DisCo: World Models with Discrete Camera Motion Control [79.86256515640231]
本研究では、離散アクションプリミティブのコンパクトなセットで生成し、アクション分離性を改善する制御可能なビデオワールドモデルであるDisCoを提案する。
DisCoは、視覚的品質を維持しながら、はるかに信頼性の高いアクションを達成する。
論文 参考訳(メタデータ) (2026-06-06T03:50:45Z) - SCAR: Self-Supervised Continuous Action Representation Learning [36.917304453471864]
視覚的遷移から具現化された動作表現を学習するための共同逆フォワード動的フレームワークであるSCARを提案する。
事前訓練された生成バックボーン上に構築されたSCARは、逆ダイナミクスモデル(IDM)を使用して、潜時観測ペアから潜時動作を推論し、フォワードダイナミクスモデル(FDM)を用いて、それらに条件付けられた将来のダイナミクスを予測する。
Procgen と Robotwin のデータセットの実験により、学習された統合潜在行動表現は、具体化固有の生の行動よりも、世界モデリングのためのより強い条件付けインターフェースとして機能することが示された。
論文 参考訳(メタデータ) (2026-05-13T16:23:11Z) - ACWM-Phys: Investigating Generalized Physical Interaction in Action-Conditioned Video World Models [30.527810700174488]
行動条件付き世界モデル(ACWM)は,映像の予測と意思決定に強く期待されている。
本稿では,多様な物理力学下での行動条件予測のための新しいベンチマークであるACWM-Physを紹介する。
論文 参考訳(メタデータ) (2026-05-09T00:00:47Z) - Olaf-World: Orienting Latent Actions for Video World Modeling [100.96069208914957]
アクションコントロール可能な世界モデルのスケーリングは、アクションラベルの不足によって制限される。
大規模受動的ビデオから行動条件付きビデオワールドモデルを事前訓練するパイプラインであるOraf-Worldを紹介する。
論文 参考訳(メタデータ) (2026-02-10T18:58:41Z) - Walk through Paintings: Egocentric World Models from Internet Priors [65.30611174953958]
本稿では,エゴセントリック・ワールド・モデル(EgoWM)について述べる。
我々は、スクラッチからトレーニングするよりも、インターネット規模のビデオモデルのリッチワールドを再利用し、軽量なコンディショニング層を通じてモーターコマンドを注入する。
当社のアプローチは,3-DoF移動ロボットから25-DoFヒューマノイドまで,エボディメントやアクションスペースを自然に拡張する。
論文 参考訳(メタデータ) (2026-01-21T18:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。