論文の概要: SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2606.26800v2
- Date: Mon, 29 Jun 2026 08:18:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.05609
- Title: SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation
- Title(参考訳): SSI-Policy:視覚言語ロボットマニピュレーションのための構造化シーンインタフェースの学習
- Authors: Kaijun Wang, Zikai Ouyang, Xuping Wu, Jinyi Hong, Wei Pan, Haibo Lu, Jia Pan, Wei Zhang, Linfang Zheng,
- Abstract要約: SSI-Policyは統一されたRGBのみの中間表現で、単分子深度特徴、言語基底のオブジェクトレイアウト、命令条件の2Dモーショントラジェクトリを共同でエンコードする。
SSI-Policyは、タスク毎に10のデモしか行わないLIBEROベンチマークにおいて、最強の事前メソッドよりも15%近く改善されている。
さらに,空間的推論,クロス・エボディメント・トランスファー,コンタクトリッチな操作にまたがる13の現実世界タスクについて検証を行った。
- 参考スコア(独自算出の注目度): 14.951719484171063
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Real-world robotic manipulation demands spatial grounding, task-aware reasoning, and precise control. Learning such capabilities becomes particularly challenging in the low-data regime. Prior methods often trade off scalable task-level reasoning and explicit physical structure: video-based approaches can drift geometrically over long horizons, 3D approaches often require depth sensing, and many flow/trajectory interfaces emphasize motion without an explicit RGB-only geometric representation. We introduce SSI-Policy, a modular framework built around a Structured Scene Interface (SSI) -- a unified, RGB-only intermediate representation that jointly encodes monocular depth features, language-grounded object layouts, and instruction-conditioned 2D motion trajectories. Critically, SSI is robot-agnostic and trainable from action-free video, decoupling perception from control so that the downstream policy can learn from few demonstrations. On the LIBERO benchmark with only 10 demonstrations per task, SSI-Policy improves over the strongest prior method by nearly 15\% and remains competitive with 50-demo methods that leverage large-scale external pretraining. Ablations show that geometric and motion cues provide complementary benefits within the shared interface. We further validate on 13 real-world tasks spanning spatial reasoning, cross-embodiment transfer, and contact-rich manipulation.
- Abstract(参考訳): 現実世界のロボット操作は、空間的接地、タスク認識推論、正確な制御を必要とする。
このような能力を学ぶことは、低データ体制において特に困難になる。
ビデオベースのアプローチは、長い地平線を幾何学的に漂うことができ、3Dアプローチは、しばしば深度検知を必要とし、多くのフロー/軌道インターフェースは、明示的なRGBのみの幾何学的表現なしで動きを強調する。
SSI-Policyは構造化シーンインタフェース(Structured Scene Interface, SSI)を中心に構築されたモジュラー・フレームワークで, 単眼深度特徴, 言語基底オブジェクトレイアウト, 命令条件付き2次元モーショントラジェクトリを結合的に符号化した,RGBのみの中間表現である。
批判的に言えば、SSIはロボットに依存しず、アクションフリーのビデオからトレーニング可能であり、制御から認識を分離することで、下流のポリシーが少数のデモから学べるようにしている。
SSI-Policyは、タスク毎に10のデモしか行わないLIBEROベンチマークにおいて、最強の事前メソッドを15倍近く改善し、大規模な外部事前トレーニングを利用する50-demoメソッドと競合し続けている。
アブレーションは、幾何学的および運動的手がかりが共有インタフェース内で相補的な利点をもたらすことを示している。
さらに,空間的推論,クロス・エボディメント・トランスファー,コンタクトリッチな操作にまたがる13の現実世界タスクについて検証を行った。
関連論文リスト
- GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation [54.305781492241785]
本稿では,トレーニング分布を超えて一般化したビジュモータ操作ポリシーを学習するための枠組みを提案する。
GHOSTは、(i)多視点RGB-D観測から、3Dエンドエフェクタ上の分布として次のサブゴールを予測する高レベルポリシーに制御を分解する。
一連のタスクの中で、この階層的な分解は、フラットな拡散ポリシーと比較して、パフォーマンスと堅牢性を一貫して改善します。
論文 参考訳(メタデータ) (2026-06-08T18:08:01Z) - Unified 3D Scene Understanding Through Physical World Modeling [10.45277075153122]
本稿では,RGB,光フロー,カメラポーズなどのマルチモーダルシーン要素をノードが表現する確率的グラフィカルモデルとして定式化された,統合された3次元理解とインタラクションのための物理世界モデルを提案する。
3WMは、精密な制御性、強力な幾何整合性、実世界のシナリオでの堅牢性を提供することにより、微調整を必要とせずに、特別なベースラインを上回ります。
このことは、統合モデルが、汎用的な視覚世界モデルに向けて一歩前進して、断片化されたタスク固有システムの実用的な代替として機能できることを実証している。
論文 参考訳(メタデータ) (2026-05-23T01:01:35Z) - OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer [84.22494391514066]
OCRAはビデオベースのヒューマン・ロボット・アクション転送のためのフレームワークである。
人間のデモビデオから直接学習し、堅牢な操作を可能にする。
論文 参考訳(メタデータ) (2026-03-15T14:31:03Z) - UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models [23.387376978512567]
我々は、深度対応の潜伏事前学習を通して幾何学構造を組み込んだ変圧器ベースのVLAモデルUniLACTを紹介する。
我々は、RGBと深さの共有埋め込み空間を学習する統合潜在行動学習フレームワークUniLARNを提案する。
シミュレーションと実世界の両方の環境での実験は、深度認識された潜在行動表現の有効性を示した。
論文 参考訳(メタデータ) (2026-02-23T18:41:41Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer [59.02729900344616]
GPUを加速したフォトリアリスティックなシミュレーションは、ロボット学習のためのスケーラブルなデータ生成パスを開いた。
視覚に基づくヒューマノイドロコ操作のための教師-学生-ブートストラップ学習フレームワークを開発した。
これは、純粋なRGB知覚を用いた多様な調音ロコ操作が可能な初めてのヒューマノイド・シム・トゥ・リアル政策である。
論文 参考訳(メタデータ) (2025-11-30T20:07:13Z) - Video Spatial Reasoning with Object-Centric 3D Rollout [58.12446467377404]
我々は,ロバストなビデオ空間推論を実現するために,OCR(Object-Centric 3D Rollout)を提案する。
OCRは、トレーニング中に選択した物体の3次元形状に構造的摂動を導入する。
OCRはモデルを補完し、全体にわたって論理的にソートする。
論文 参考訳(メタデータ) (2025-11-17T09:53:41Z) - Learning Generalizable 3D Manipulation With 10 Demonstrations [16.502781729164973]
10個のデモから操作スキルを学習する新しいフレームワークを提案する。
シミュレーションベンチマークと実世界のロボットシステムの両方に関する広範な実験を通じて、我々のフレームワークを検証する。
この研究は、現実世界のアプリケーションにおいて、効率的で一般化可能な操作スキル学習を前進させる大きな可能性を示している。
論文 参考訳(メタデータ) (2024-11-15T14:01:02Z) - Neural Dynamic Policies for End-to-End Sensorimotor Learning [51.24542903398335]
感覚運動制御における現在の主流パラダイムは、模倣であれ強化学習であれ、生の行動空間で政策を直接訓練することである。
軌道分布空間の予測を行うニューラル・ダイナミック・ポリシー(NDP)を提案する。
NDPは、いくつかのロボット制御タスクにおいて、効率と性能の両面で、これまでの最先端よりも優れている。
論文 参考訳(メタデータ) (2020-12-04T18:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。