論文の概要: Grounded Action Model: 3D Grounding as a Foundation for Robotics
- arxiv url: http://arxiv.org/abs/2609.23863v2
- Date: Fri, 25 Sep 2026 05:22:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.026043
- Title: Grounded Action Model: 3D Grounding as a Foundation for Robotics
- Title(参考訳): グラウンドドアクションモデル:ロボティクスの基礎としての3Dグラウンド
- Abstract要約: Grounded Action Models (GAMs) は、3Dグラウンドで構築されたロボット基盤モデルの新たなパラダイムである。
RoboTwin 2.0では、50タスクの平均成功率は55.3%である(空間強制では52.0%)。
LIBERO-PROでは、16の摂動設定で61%(vs.53% for $_0.5$)の最先端の平均成功率を達成する。
- 参考スコア(独自算出の注目度): 29.02274437902474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Manipulation policies must know which objects matter and where they are, yet the pretrained backbones that current robot foundation models build on, from language in vision-language-action models (VLAs) to video generation in world-action models (WAMs), do not directly require this metric grounding, leaving it to be learned implicitly from robot demonstrations. We propose Grounded Action Models (GAMs), a new paradigm of robot foundation models built with 3D grounding. GAM can be conditioned using language, points, or box prompts, which are first transformed into a shared object-centric representation of the selected objects. This representation captures target-focused visual features and metric object geometry, which is mixed with robot state history through a multi-stream transformer to predict action chunks. Although GAMs can be run autonomously, they can also serve as a low-level controller that a high-level planner controls using its various input modalities, allowing for long-horizon and memory-dependent manipulation. On RoboTwin 2.0, GAM achieves an average success rate of 55.3% across 50 tasks (vs. 52.0% for Spatial Forcing), including 47.6% under scene randomization (vs. 30.4% for Abot-M0), with its action policy trained only on clean-scene demonstrations. On LIBERO-PRO, it achieves a state-of-the-art average success rate of 61% (vs. 53% for $π_{0.5}$) across 16 perturbation settings, with the largest gains when targets are relocated or newly designated. On two real robots, GAM retains 17/20 successes under visual shift on a bimanual YAM versus 4/20 for $π_{0.5}$, while its composition with a Molmo2 planner on a Franka achieves 64.7% ID and 49.8% OOD step completion on long-horizon and memory-dependent tasks.
- Abstract(参考訳): 操作ポリシーは、どのオブジェクトがどこにあるかを知る必要があるが、現在のロボット基盤モデルが構築する事前訓練されたバックボーンは、視覚言語アクションモデル(VLA)の言語から世界アクションモデル(WAM)の動画生成まで、ロボットのデモから暗黙的に学習される。
本研究では,3次元グラウンドティングを用いたロボット基礎モデルの新たなパラダイムであるグラウンドド・アクション・モデル(GAM)を提案する。
GAMは言語、ポイント、ボックスプロンプトを使用して条件付けが可能で、最初に選択されたオブジェクトの共有オブジェクト中心表現に変換される。
この表現は、アクションチャンクを予測するためにマルチストリームトランスフォーマーを通じて、ロボットの状態履歴と混ざったターゲット中心の視覚特徴とメートル法オブジェクト形状をキャプチャする。
GAMは自律的に実行できるが、様々な入力モードを使って高レベルプランナーが制御する低レベルコントローラとしても機能し、長い水平とメモリ依存の操作を可能にする。
RoboTwin 2.0では、GAMは50のタスク(空間強制では52.0%)で平均55.3%の成功率に達し、47.6%がシーンランダム化(Abot-M0では30.4%)で、アクションポリシーはクリーンシーンのデモのみに基づいて訓練されている。
LIBERO-PROでは、16の摂動設定で61%(vs.53% for $π_{0.5}$)の最先端の平均成功率を達成する。
実際の2つのロボットでは、GAMは2次元YAMと4/20のπ_{0.5}$の視覚シフトで17/20の成功を維持し、一方、FrankaのMomo2プランナーは64.7%のIDと49.8%のOODステップ完了を達成した。
関連論文リスト
- Transferring the Intelligence of VLMs to Robotic Control [49.39888205530348]
人間は物理的世界とデジタル世界の両方にシームレスに適応でき、人間の知性自体がこのギャップを越えて移動する可能性があることを示唆している。
本稿では,ロボット制御をエージェントVLMに公開するヒューマン直感インタフェースであるRoboDawnを用いて,この問題を考察する。
RoboTwin 2.0 C2RとRoboDojoの実験では、RoboDawnはタスク固有のロボットトレーニングなしで高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-09-19T11:34:13Z) - WLA$^3$: World Latent Action Modeling for Semantics, Dynamics, and Kinematics [33.75014442121971]
WLA$3$ (World Latent Action Modeling for Semantics, Dynamics, and Kinematics)は、統一的なジェネラリストポリシーモデルフレームワークである。
WLA$3$は、世界潜在アクションモデル(WLAM)が、セマンティクス、ダイナミクス、キネマティクスで学んだ表現を再利用する。
LaryBenchでは、最後の32D遅延アクションは67.89%の平均的な分類精度に達する。
論文 参考訳(メタデータ) (2026-09-14T16:59:00Z) - DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation [11.665741844323984]
我々は、ビデオ生成がワールドアクションモデリングの不要な目的であると主張している。
ロボット操作においては、世界モデルの目的は、中間の瞬間に世界がどのように見えるかを再現するのではなく、アクションの実行後に世界が到達する状態を予測することである。
本稿では,映像生成に頼らずに将来予測状態からロボット動作を推定するDELE-w0.5を提案する。
論文 参考訳(メタデータ) (2026-08-22T18:17:36Z) - G0.5: One Autoregressive Stream for Robot Reasoning and Action [43.43377463558725]
本稿では,1つの変圧器デコーダが1つの目的の下で推論とアクショントークンを出力する,事前訓練された自己回帰VLAであるG0.5を紹介する。
推論とアクションは1組の重みを共有しているため、事前訓練されたVLMの能力は物理的な振る舞いへと引き継がれる。
G0.5は7つの独立した体制で最先端のモデルを上回っている。
論文 参考訳(メタデータ) (2026-08-12T07:26:47Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation [54.03004125910057]
階層型視覚-言語-アクションモデルは、標準的なモノリシックVLAモデルよりも、ドメイン外のデータを利用するのに効果的であることを示す。
階層設計により、高レベルなVLMは、オフドメイン微調整データと実ロボットテストシナリオの間の重要なドメインギャップをまたいで転送可能であることを示す。
論文 参考訳(メタデータ) (2025-02-08T07:50:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。