論文の概要: GeoProp: Grounding Robot State in Vision for Generalist Manipulation
- arxiv url: http://arxiv.org/abs/2607.07101v1
- Date: Wed, 08 Jul 2026 07:37:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.316354
- Title: GeoProp: Grounding Robot State in Vision for Generalist Manipulation
- Title(参考訳): GeoProp:ジェネラリスト操作のための視界の接地ロボット
- Authors: Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu,
- Abstract要約: プロプリオセプションはロボット操作の基本であるが、標準的な融合法では、視覚トークンとの明確なアライメントが欠如している孤立ベクターとして扱う。
そこで,GeoPropは,空間的特徴サンプリングと幾何的グラウンドリングにより,プロプレプセプションを視覚と整合させる軽量アダプタである。
- 参考スコア(独自算出の注目度): 36.72479079997517
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Proprioception is fundamental to robotic manipulation, yet standard fusion methods often treat it as an isolated vector lacking explicit alignment with visual tokens. Without a direct correspondence between 3D kinematics and 2D feature maps, manipulation policies struggle to ground the robot's state within the scene, frequently underperforming even vision-only baselines. To address this, we introduce GeoProp, a lightweight, plug-and-play adapter that aligns proprioception with vision through explicit geometric grounding and spatial feature sampling. GeoProp projects the robot state onto the image plane to sample localized visual features, constructing a grounded state token. It then injects state-derived spatial priors into the corresponding visual features via FiLM modulation. To capture motion intent, GeoProp further samples features at a short-horizon predicted coordinate derived from recent kinematics, providing look-ahead visual context. Across 67 tasks, GeoProp improves Diffusion Policy by 8.7% on 63 simulation tasks and pi_0 by 4.0% on the RoboTwin subset, and yields a 10.6% average gain across both policy families in the real world, while adding only 2-3% to the parameter count. These results demonstrate that GeoProp is a simple yet high-impact inductive bias for generalist embodied policies. Project page: https://alibaba-damo-academy.github.io/GeoProp/.
- Abstract(参考訳): プロプリオセプションはロボット操作の基本であるが、標準的な融合法では、視覚トークンとの明確なアライメントが欠如している孤立ベクターとして扱うことが多い。
3Dキネマティクスと2D特徴マップの直接的な対応がなければ、操作ポリシーはシーン内のロボットの状態を把握するのに苦労する。
そこで我々はGeoPropを紹介した。GeoPropはモジュール・アンド・プレイの軽量なアダプタで、空間的特徴サンプリングと幾何的グラウンドリングによってプロプリセプションを視覚と整合させる。
GeoPropは、画像平面上にロボットの状態を投影し、局所化された視覚的特徴をサンプリングし、接地された状態トークンを構築する。
その後、状態由来の空間的先行をFiLM変調により対応する視覚特徴に注入する。
動きの意図を捉えるために、GeoPropは、最近のキネマティクスから導かれた近水平予測座標の機能をさらにサンプリングし、ルックアヘッドの視覚的コンテキストを提供する。
67のタスクで、GeoPropは63のシミュレーションタスクで8.7%、RoboTwinサブセットで4.0%の拡散ポリシーを改善し、両方のポリシーファミリで平均利得を10.6%、パラメータカウントに2-3%加える。
これらの結果は、GeoPropは一般の具体的政策に対する単純かつ高影響の帰納バイアスであることを示している。
プロジェクトページ:https://alibaba-damo-academy.github.io/GeoProp/。
関連論文リスト
- Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos [43.32573764638152]
生成した視覚から低レベル制御を導出することは、ミスマッチした抽象化である、と我々は主張する。
我々は、将来の2次元エンドエフェクタ・ウェイポイントとして幾何学的コンテンツを抽出するtextbfGRAを提案する。
実際のロボットタスクでは、GRAは一致したデータ予算の下で擬似アクションベースラインを上回ります。
論文 参考訳(メタデータ) (2026-06-23T11:35:13Z) - Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation [52.00134393320209]
Sparse2Actは、スパースポイントクラウドエンコーダの事前学習のための観測・動作アライメントフレームワークである。
マスク付きスパース3Dトークンは、観察と組み合わせたワークスペース運動の周囲のシーン特徴を整理するために訓練される。
LIBERO-10ベンチマークでは,500ステップの微調整を行い,平均86.9%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-10T23:56:01Z) - Revisiting Articulated Parts Perception in Robot Manipulation [53.043391395657835]
幾何一次構造(GPS)は、スケーラビリティと品質のバランスをとるために部分幾何学構造の抽象化である。
GPSはポータブルなVirtual Reality(VR)デバイスと統合されており、1つのオブジェクトシーケンスをアノテートするのに1分しかかからない。
この効率的なVR-GPSシステムにより、6つのクラスにわたる234個のオブジェクトに対して41Kフレームを収集し、単一のRGB-Dオブジェクトイメージを入力として一般化可能なGPSモデルを訓練する。
論文 参考訳(メタデータ) (2026-06-06T11:07:29Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models [40.52757787197674]
VLA政策学習のための状態誘導型空間アライメントアーキテクチャであるGeoAlignを紹介する。
GeoAlignは、ロボットドメインのRGB-D監視を備えたRGBジオグラフィックブランチをポストトレーニングし、ポリシーロールアウトのためにRGB由来のGeometry-Enhanced Post-Trained機能を生成する。
GeoAlignは、LIBEROの99.0%、SimplerEnv-Fractalの3つのタスクで85.3%、幾何学的にクリティカルな8つの現実世界のALOHAタスクで78.8%を達成している。
論文 参考訳(メタデータ) (2026-06-02T07:01:18Z) - OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation [41.754765514902736]
本稿では,中間表現と作用空間を$SE(3)$ trajectory predictionで整列するビジュモータポリシーを提案する。
OASISは、3D対応の機能エンコーダを結合し、視覚言語とメートル法深度機能を$SE(3)$ trajectory predictorで融合する。
OASISは、VLAとWAMのベースラインを成功率とアウト・オブ・ディストリビューションの一般化で上回っている。
論文 参考訳(メタデータ) (2026-05-25T13:28:33Z) - Vision-Based Hand Shadowing for Robotic Manipulation via Inverse Kinematics [0.0]
3Dプリンティングガラスに装着した1台の自家中心型RGB-Dカメラから、オフラインのハンドシャドイングとマッピングパイプラインを提示する。
パイプラインはMediaPipe Handsを使用して、手当たり21のランドマークを検出する。
グリップコントローラは、親指の指形状を4段階のフォールバック階層で把握するようにマッピングする。
論文 参考訳(メタデータ) (2026-03-11T23:53:28Z) - Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation [53.09168514034483]
バイマン操作は3次元幾何学を推論し、動作中にどのように進化するかを予測し、滑らかで協調された動きを生成するポリシーを必要とする。
本稿では,事前学習した3次元幾何学的基礎モデルに基づいて,バイマン操作を直接構築するフレームワークを提案する。
我々の政策は、幾何学的認識の潜伏子、2次元意味的特徴、およびプロプレセプションを統一状態表現に融合させ、拡散モデルを用いて将来のアクションチャンクと、密度の高いポイントマップにデコードする未来の3次元潜伏子を共同で予測する。
論文 参考訳(メタデータ) (2026-02-27T08:54:20Z) - Local Policies Enable Zero-shot Long-horizon Manipulation [80.1161776000682]
ManipGenを紹介します。これはsim2real転送のための新しいポリシーのクラスであるローカルポリシーを活用します。
ManipGenは、SayCan、OpenVLA、LLMTrajGen、VoxPoserといったSOTAアプローチを、50の現実世界操作タスクで36%、76%、62%、60%で上回っている。
論文 参考訳(メタデータ) (2024-10-29T17:59:55Z) - Learning Any-View 6DoF Robotic Grasping in Cluttered Scenes via Neural Surface Rendering [6.185645393091031]
この研究は、グリップをレンダリングとして再解釈し、6DoFグリップ検出の新しい方法であるNeuGraspNetを導入する。
NeuGraspNetは、モバイル操作のシナリオに共通するランダムな視点で動作し、既存の暗黙的および半単純的把握方法より優れている。
論文 参考訳(メタデータ) (2023-06-12T19:42:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。