論文の概要: ExStereo: Lifting 2D Vision-Language-Action Models to 3D with Explicit Stereo Representations
- arxiv url: http://arxiv.org/abs/2610.04805v1
- Date: Sat, 03 Oct 2026 23:21:18 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:31:41.756132
- Title: ExStereo: Lifting 2D Vision-Language-Action Models to 3D with Explicit Stereo Representations
- Title(参考訳): ExStereo: 明示的ステレオ表現による2次元視覚・言語・行動モデルから3次元へのリフティング
- Abstract要約: ExStereoは、事前訓練された2Dビジョン・ランゲージ・アクションモデルと3D知覚を付加するステレオモジュールである。
本研究では,大規模ステレオデータを用いた自己教師型学習目標を用いて,課題特定後学習の中間段階を導入する。
本稿では,2つの公開VLA,$_0.5$およびSmolVLAを微調整し,シミュレーションおよび実世界のPPERプラットフォーム上で評価する。
- 参考スコア(独自算出の注目度): 15.116936319059318
- License:
- Abstract: Three-dimensional perception is critical for robotic manipulation, particularly for high-precision tasks, as recovering metric depth and precise 3D object positions from monocular RGB observations is inherently ill-posed. However, many Vision-Language-Action (VLA) models rely solely on RGB observations for perception. Leveraging recent advances in foundation models for stereo matching, we introduce ExStereo, a stereo module that augments pre-trained 2D VLAs with 3D perception. ExStereo reconstructs scene geometry from stereo image pairs and renders multi-view observations as an explicit stereo representation for stereo feature extraction. The action tokens from the action expert selectively attend to the resulting stereo tokens through our proposed action-stereo cross-attention mechanism, enabling the policy to generate robot actions conditioned on 3D scene information. To learn robust 3D representations, we introduce a mid-training stage before task-specific post-training, using a self-supervised learning objective on large-scale stereo data. We validate our approach by fine-tuning two publicly available VLAs, $π_{0.5}$ and SmolVLA, and evaluate them in simulation and on a real-world bimanual PiPER platform. Across both settings, VLAs fine-tuned with ExStereo consistently outperform baselines, demonstrating the effectiveness of stereo perception for robotic manipulation. Our project website is at: https://exstereo-vla.github.io/ExStereo/.
- Abstract(参考訳): 3次元の知覚はロボット操作、特に高精度な作業において重要であり、単眼のRGB観測からメートル法深度と正確な3次元物体の位置を復元することは本質的に不適切である。
しかしながら、多くのVision-Language-Action(VLA)モデルは、知覚のためのRGB観測のみに依存している。
ステレオマッチングのための基礎モデルの最近の進歩を生かして,事前学習された2次元VLAを3次元知覚で拡張するステレオモジュールExStereoを導入する。
ExStereoはステレオ画像対からシーン幾何学を再構築し、ステレオ特徴抽出のための明示的なステレオ表現として多視点観察をレンダリングする。
アクションエキスパートのアクショントークンは,提案したアクションステレオ・クロスアテンション機構を通じて,ステレオトークンを選択的に参加させ,3Dシーン情報に基づいてロボットアクションを生成する。
頑健な3D表現を学習するために,大規模ステレオデータを用いた自己教師型学習目標を用いて,タスク固有の後学習の中間段階を導入する。
本稿では,2つの公開VLA,$π_{0.5}$およびSmolVLAを微調整し,シミュレーションおよび実世界のPPERプラットフォーム上で評価する。
両方の設定で、ExStereoで微調整されたVLAは、ロボット操作におけるステレオ認識の有効性を実証し、一貫してベースラインを上回った。
プロジェクトのWebサイトは以下の通り。
関連論文リスト
- SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models [3.2119871428711875]
本研究では,目標対象の3D事前情報を提供するために,オブジェクト中心の3Dアライメントアライメントフレームワークを提案する。
具体的には、タスク関連オブジェクトをオブジェクト認識モデルでローカライズし、対応するオブジェクトマスクを生成し、SAM3Dを用いて高密度オブジェクトレベルの3D表現を抽出する。
実験は一貫して改善され、LIBEROでは99.1%、CALVINでは平均4.11が達成された。
論文 参考訳(メタデータ) (2026-07-28T16:05:32Z) - PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction [57.63073414949329]
我々は,階層的な3Dポイントクラウド表現をアクションデコーディングプロセスに直接統合する,デュアルシステム3D対応VLAポリシーであるPointACTを提案する。
PointACTは、効率的なボトルネックウィンドウ自己アテンションを備えたマルチスケールのポイントアクションインタラクション機構を採用し、進化するアクショントークンが局所的な幾何学的詳細とグローバルなシーン構造の両方に密に関与できるようにする。
論文 参考訳(メタデータ) (2026-05-20T17:10:31Z) - StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception [30.791524912385924]
StereoPolicyは、幾何学的推論を強化するために、同期ステレオ画像ペアを直接活用する、ビジュモータポリシー学習フレームワークである。
本結果は,ロボット操作のための3次元幾何学的理解と2次元事前学習表現を橋渡しする,スケーラブルでロバストなモダリティとしてステレオビジョンを裏付けるものである。
論文 参考訳(メタデータ) (2026-05-11T05:06:12Z) - 3D Audio-Visual Segmentation [52.34970001474347]
ロボット工学やAR/VR/MRに様々な応用がある。
本稿では,事前学習した2次元オーディオ視覚基盤モデルから,使用可能な知識を統合することで特徴付ける新しいアプローチであるEchoSegnetを提案する。
実験により、EchoSegnetは、私たちの新しいベンチマークで、3D空間の音声オブジェクトを効果的にセグメント化できることが実証された。
論文 参考訳(メタデータ) (2024-11-04T16:30:14Z) - SUGAR: Pre-training 3D Visual Representations for Robotics [85.55534363501131]
ロボット工学のための新しい3D事前学習フレームワークSUGARを紹介した。
SUGARは3次元の点雲を通してオブジェクトの意味的、幾何学的、および余分な特性をキャプチャする。
SuGARの3D表現は最先端の2Dおよび3D表現よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-04-01T21:23:03Z) - Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion [45.171150395915056]
3Dセマンティックシーン補完(SSC)は、限られた観測から密集した3Dシーンを推定する必要がある不適切な認識課題である。
従来のカメラベースの手法は、固有の幾何学的曖昧さと不完全な観察のため、正確なセマンティックシーンを予測するのに苦労した。
我々は,SSCにおけるステレオマッチング技術と鳥眼ビュー(BEV)表現学習を利用して,そのような問題に対処する。
論文 参考訳(メタデータ) (2023-03-24T12:33:44Z) - DSGN++: Exploiting Visual-Spatial Relation forStereo-based 3D Detectors [60.88824519770208]
カメラベースの3Dオブジェクト検出器は、LiDARセンサーよりも広い展開と低価格のため歓迎されている。
我々は3次元幾何学と意味論の両方を表現するステレオボリューム構造について、以前のステレオモデリングDSGNを再考する。
本稿では,2次元から3次元のパイプラインを通しての情報フローを改善することを目的としたDSGN++を提案する。
論文 参考訳(メタデータ) (2022-04-06T18:43:54Z) - YOLOStereo3D: A Step Back to 2D for Efficient Stereo 3D Detection [6.5702792909006735]
YOLOStereo3Dは1つのGPUでトレーニングされ、10fps以上で動作する。
LiDARデータを使わずに、最先端のステレオ3D検出フレームワークに匹敵するパフォーマンスを示す。
論文 参考訳(メタデータ) (2021-03-17T03:43:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。