論文の概要: WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
- arxiv url: http://arxiv.org/abs/2607.23909v2
- Date: Fri, 31 Jul 2026 13:02:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.208346
- Title: WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
- Title(参考訳): WorldDiT: 世界と行動モデリングのための統一拡散アーキテクチャ
- Authors: Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra,
- Abstract要約: WorldDiTは、アクション生成とビジュアルワールドモデリングを結合した統合拡散トランスフォーマーアーキテクチャである。
トレーニング中、単一の拡散トランスフォーマーが連続的なアクションチャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。
- 参考スコア(独自算出の注目度): 8.370690859866412
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many recent robot policies pursue stronger control by using large pretrained vision-language models (VLMs) as the action backbone. We introduce WorldDiT, a unified diffusion transformer architecture that couples action generation with visual world modeling and achieves strong performance without a large pretrained VLM action backbone. During training, a single diffusion transformer generates continuous action chunks and predicts normalized RGB patch targets from future camera frames. Across four LIBERO simulation suites, WorldDiT lies on the reported Pareto frontier for total model parameters and mean success among methods reporting all four suites. These results provide a strong sub-billion-parameter baseline for future scaling studies.
- Abstract(参考訳): 近年のロボット政策の多くは、大きな事前訓練された視覚言語モデル(VLM)をアクションバックボーンとして使用することで、より強力な制御を追求している。
本稿では,視覚世界モデリングとアクション生成を結合した統合拡散トランスフォーマーアーキテクチャであるWorldDiTを紹介する。
トレーニング中、単一の拡散トランスフォーマーが連続的なアクションチャンクを生成し、将来のカメラフレームから正規化されたRGBパッチターゲットを予測する。
4つのLIBEROシミュレーションスイート全体で、WorldDiTは4つのスイート全てを報告するメソッドの中で、合計モデルのパラメータと平均的な成功について報告されたParetoフロンティア上にある。
これらの結果は将来のスケーリング研究に強力なサブビリオンパラメータベースラインを提供する。
関連論文リスト
- Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation [72.52773248997929]
ビデオワールドモデルは、1つの命令から現実的な未来を生成できるが、時間とともに一貫したポイントレベルの動きを維持できないことが多い。
GEM-4Dは、トレーニング中にビデオ生成バックボーンに高密度な4D対応制御を注入する幾何学的地上ビデオワールドモデルである。
Inverse dynamicsモジュールは、対応性のあるビデオロールアウトを実行可能なロボットトラジェクトリに変換し、現実世界とシミュレーション操作の両方で直接デプロイできる。
論文 参考訳(メタデータ) (2026-05-20T21:36:44Z) - MotuBrain: An Advanced World Action Model for Robot Control [23.733029557644354]
We present MotuBrain, a unified World Action Model that jointly model video and action under a UniDiffuser formulation。
単一のモデルは、ポリシー学習、世界モデリング、ビデオ生成、逆ダイナミクス、共同ビデオアクション予測をサポートする。
Motus上に構築されているMotuBrainは、言語と相互作用の結合を強くするための独立したテキストストリームである、統一されたマルチビューモデリングも導入している。
我々の推論スタックは、ステップの削減、コンパイル、FP8量子化、DiTキャッシュ、V2Aスタイルのアクション専用推論、リアルタイムチャンククループ実行を組み合わせたものです。
論文 参考訳(メタデータ) (2026-04-30T12:34:44Z) - Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining [28.30092786035367]
DeFIはビジュアルフォワードと逆ダイナミクスを分離し、各データソースを利用するための新しいフレームワークである。
今後の予測のために,多種多様な人・ロボットビデオで事前訓練された一般フォワード・ダイナミクス・モデル(GFDM)と,ラベルなしビデオ遷移から潜伏行動を予測するための自己教師付き学習によって訓練された一般逆ダイナミクス・モデル(GIDM)を紹介する。
CALVIN ABC-D と SimplerEnv の実験では、DeFI は CALVIN の平均タスク長 4.51 に達し、SimplerEnv-Frac は 51.2% 成功した。
論文 参考訳(メタデータ) (2026-03-27T17:20:10Z) - DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control [16.562259973551786]
本稿では,ビデオ拡散変換器とアクション拡散変換器を結合したエンドツーエンドのビデオ・アクション・モデルであるDiT4DiTを紹介する。
DiT4DiTは、再構成後のフレームに頼る代わりに、ビデオ生成プロセスから中間的なデノイング機能を抽出する。
これは最先端の結果を達成し、LIBEROでは98.6%、RoboCasa GR1では50.8%という平均的な成功率に達した。
論文 参考訳(メタデータ) (2026-03-11T06:03:53Z) - Pre-Trained Video Generative Models as World Simulators [59.546627730477454]
本研究では,事前学習した映像生成モデルを制御可能な世界シミュレータに変換するための動的世界シミュレーション(DWS)を提案する。
条件付き動作と生成した視覚的変化の正確なアライメントを実現するために,軽量で普遍的な動作条件付きモジュールを導入する。
実験により、DWSは拡散モデルと自己回帰変換モデルの両方に汎用的に適用可能であることが示された。
論文 参考訳(メタデータ) (2025-02-10T14:49:09Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - IRASim: A Fine-Grained World Model for Robot Manipulation [24.591694756757278]
本稿では,ロボットとオブジェクトのインタラクションの詳細を詳細に表現したビデオを生成する新しい世界モデルIRASimを提案する。
拡散変圧器を訓練し、各変圧器ブロック内に新しいフレームレベル動作条件モジュールを導入し、アクションフレームアライメントを明示的にモデル化し強化する。
論文 参考訳(メタデータ) (2024-06-20T17:50:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。