論文の概要: GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
- arxiv url: http://arxiv.org/abs/2607.13960v2
- Date: Thu, 16 Jul 2026 13:06:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.226126
- Title: GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
- Title(参考訳): GigaWorld-Policy-0.5:AutoResearchによるより高速で強力なWAM
- Abstract要約: 本稿では,より効率的なロボット制御を目的としたアクション中心型WAMであるGigaWorld-Policy-0.5を紹介する。
効率的な推論のために、GigaWorld-Policy-0.5はMixture-of-Transformersアーキテクチャを導入している。
GigaWorld-Policy-0.5は,ロボット制御の推論効率を向上しつつ,将来の視覚力学のトレーニング効果を保っている。
- 参考スコア(独自算出の注目度): 66.7936140772745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) improve robot policy learning by jointly modeling actions and future visual observations, using future scene evolution as dense supervision for physically grounded action generation. However, a common design in existing WAMs is to explicitly generate future videos at inference time, incurring substantial computational overhead and hindering real-time closed-loop deployment. GigaWorld-Policy addresses this issue with an action-centered formulation, where future visual dynamics are used during training while action-only decoding is used at inference time. Building upon this framework, we present GigaWorld-Policy-0.5, an enhanced action-centered WAM designed for more efficient robot control. During pretraining, GigaWorld-Policy-0.5 adopts a mixed Action-Conditioned World Modeling (AC-WM) and WAM training strategy. This strengthens the coupling between visual dynamics and robot actions and improves the transferability of action representations for downstream policy learning. For efficient inference, GigaWorld-Policy-0.5 introduces a Mixture-of-Transformers architecture that separates visual dynamics modeling and action generation into specialized experts, reducing active computation during action-only inference and achieving 85 ms inference latency on a local RTX 4090 setup. In addition, we employ an agent-based AutoResearch pipeline to systematically search training configurations, enabling more efficient identification of optimal experimental setups while reducing the time and manual intervention required for hyperparameter tuning. Experiments and ablations show that GigaWorld-Policy-0.5 preserves the training benefits of future visual dynamics while improving inference efficiency for robot control.
- Abstract(参考訳): World Action Models (WAM)は、アクションと将来の視覚的観察を共同でモデル化することで、ロボットのポリシー学習を改善する。
しかし、既存のWAMの一般的な設計は、推論時に将来のビデオを明示的に生成し、かなりの計算オーバーヘッドを発生させ、リアルタイムのクローズドループ展開を妨げることである。
GigaWorld-Policyは、アクション中心の定式化によってこの問題に対処する。
この枠組みに基づいて,より効率的なロボット制御を目的とした行動中心型WAMであるGigaWorld-Policy-0.5を提案する。
プレトレーニング中、GigaWorld-Policy-0.5はAC-WM(Action-Conditioned World Modeling)とWAMトレーニング戦略を採用した。
これにより、視覚力学とロボット行動の結合が強化され、下流政策学習のための行動表現の伝達可能性が改善される。
効率的な推論のために、GigaWorld-Policy-0.5はMixture-of-Transformersアーキテクチャを導入し、視覚力学モデリングとアクション生成を専門の専門家に分離し、アクションのみの推論時のアクティブな計算を削減し、ローカルRTX 4090セットアップで85msの推論レイテンシを実現する。
さらに、エージェントベースのAutoResearchパイプラインを使用して、トレーニング構成を体系的に検索し、最適な実験装置の同定をより効率的にし、ハイパーパラメータチューニングに必要な時間と手動の介入を減らす。
GigaWorld-Policy-0.5は,ロボット制御の推論効率を向上しつつ,将来の視覚力学のトレーニング効果を保っている。
関連論文リスト
- LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models [14.629670168049984]
本稿では,映像のブリッジ前処理と低レベル動作の具体的表現として,動作整列潜時ダイナミクスを提案する。
意味再構成と実動作アライメントを訓練した潜在ダイナミクスモデルと、変換器の混合として構築されたワールドダイナミクスアクションモデル(MoT)を組み合わせたLD4WAMを提案する。
LD4WAMは、5000時間以上の人間とロボットのデータの統合データセットに基づいて、RoboTwinシミュレーションや、グリッパーと器用な両手を備えた本物のロボット上で、強力に動作します。
論文 参考訳(メタデータ) (2026-08-23T13:09:30Z) - Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - ABot-M0.5: Unified Mobility-and-Manipulation World Action Model [27.262271208923995]
ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-01T09:21:20Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - Light-WAM: Efficient World Action Models with State-Fusion Action Decoding [15.384126562001027]
Light-WAMは、効率的なロボット操作のための軽量なワールドアクションモデルである。
コンパクトなビデオバックボーンで構築され、ダウンサンプリングされた潜在空間で将来のビデオ監視を行う。
実験により、Light-WAMはLIBERO上で強力な性能を維持し、RoboTwin 2.0上で使用可能なマルチタスク性能を実現している。
論文 参考訳(メタデータ) (2026-06-06T15:58:12Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation [63.04810454548667]
我々は、ロボット操作タスクを解決するために、スケーラブルで連続的かつシーケンシャルな世界インタラクションフレームワークであるPhysGenを紹介した。
トレーニング済みのビデオモデルを物理シミュレーターのプロキシとして扱うことで、PhysGenは外部環境とロボット動作の間の動的相互作用をモデル化する。
本稿では,映像とアクションを共有物理トークンに統合し,離散映像生成と連続ロボット制御のギャップを埋めるマルチモーダル連続表現を提案する。
論文 参考訳(メタデータ) (2026-02-18T14:58:18Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。