論文の概要: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.25912v1
- Date: Tue, 28 Jul 2026 16:05:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.912614
- Title: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models
- Title(参考訳): SAM3D-Guided Object-Centric Representation Asignment for Vision-Language-Action Models
- Authors: Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen,
- Abstract要約: 本研究では,目標対象の3D事前情報を提供するために,オブジェクト中心の3Dアライメントアライメントフレームワークを提案する。
具体的には、タスク関連オブジェクトをオブジェクト認識モデルでローカライズし、対応するオブジェクトマスクを生成し、SAM3Dを用いて高密度オブジェクトレベルの3D表現を抽出する。
実験は一貫して改善され、LIBEROでは99.1%、CALVINでは平均4.11が達成された。
- 参考スコア(独自算出の注目度): 3.2119871428711875
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have shown strong potential for general robot manipulation, but most existing models rely on 2D visual-language backbones and lack fine-grained 3D understanding of target objects, especially under occlusion, pose variation, scale changes, and precise spatial interaction. We propose an object-centric 3D representation alignment framework built upon $π_0$, using SAM3D as a frozen 3D teacher to provide target-object 3D priors during training. Specifically, we localize task-relevant objects with object recognition models, generate corresponding object masks, and use SAM3D to extract dense object-level 3D representations, which are aligned with intermediate visual features of $π_0$. This enables the policy to internalize target-object 3D information while preserving the original RGB-language-to-action inference pipeline without requiring depth, point clouds, masks, SAM3D, or additional 3D modules at test time. Simulation experiments show consistent improvements, achieving 99.1\% on LIBERO and an average length of 4.11 on CALVIN. Real-world experiments further demonstrate that our method is particularly effective in long-horizon manipulation scenarios where the robot must focus on different target objects across multiple subtasks.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、一般的なロボット操作の強力な可能性を示しているが、既存のモデルの多くは2次元視覚言語バックボーンに依存しており、特にオクルージョン、ポーズのバリエーション、スケールの変化、空間的相互作用の精密な3D理解が欠如している。
本稿では, SAM3D を凍結した 3D 教師として用いて, π_0$ 上に構築したオブジェクト中心の 3D 表現アライメントフレームワークを提案する。
具体的には、タスク関連オブジェクトをオブジェクト認識モデルでローカライズし、対応するオブジェクトマスクを生成し、SAM3Dを用いて高密度なオブジェクトレベルの3D表現を抽出する。
これにより、ポリシーは、深さ、点雲、マスク、SAM3D、またはテスト時に追加の3Dモジュールを必要とせずに、元のRGB言語からアクションへの推論パイプラインを保持しながら、ターゲットオブジェクトの情報を内部化することができる。
シミュレーション実験では、LIBEROでは99.1\%、CALVINでは平均4.11%という一貫した改善がなされた。
実世界の実験では、ロボットが複数のサブタスクにまたがる異なる対象物に焦点を合わせなければならない長期操作シナリオにおいて、本手法が特に有効であることを実証している。
関連論文リスト
- N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models [45.008146973701855]
N3D-VLMは、ネイティブな3Dオブジェクト認識と3D認識の視覚的推論をシームレスに統合する新しい統合フレームワークである。
RGB/RGB-D入力からの回答を直接予測する従来のエンドツーエンドモデルとは異なり、本手法はネイティブな3Dオブジェクト認識機能を備えたモデルである。
論文 参考訳(メタデータ) (2025-12-18T14:03:44Z) - Common3D: Self-Supervised Learning of 3D Morphable Models for Common Objects in Neural Feature Space [58.623106094568776]
3Dモデル(3DMM)は、オブジェクトカテゴリの形状や外観を表現する強力なツールである。
我々は,オブジェクト中心ビデオのコレクションから,オブジェクトの3DMMを自己管理的に学習する新しい手法であるCommon3Dを導入する。
Common3Dは、様々な視覚タスクをゼロショットで解くことができる最初の完全に自己教師された方法である。
論文 参考訳(メタデータ) (2025-04-30T15:42:23Z) - NVSMask3D: Hard Visual Prompting with Camera Pose Interpolation for 3D Open Vocabulary Instance Segmentation [14.046423852723615]
本稿では,3次元ガウシアン・スプレイティングに基づくハードビジュアル・プロンプト手法を導入し,対象物に関する多様な視点を創出する。
提案手法は現実的な3次元視点をシミュレートし,既存のハード・ビジュアル・プロンプトを効果的に増強する。
このトレーニングフリー戦略は、事前のハード・ビジュアル・プロンプトとシームレスに統合され、オブジェクト記述的特徴が強化される。
論文 参考訳(メタデータ) (2025-04-20T14:39:27Z) - MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation [91.94869042117621]
推論セグメンテーション(Reasoning segmentation)は、人間の意図と空間的推論に基づく複雑なシーンにおける対象オブジェクトのセグメンテーションを目的としている。
最近のマルチモーダル大言語モデル(MLLM)は印象的な2次元画像推論セグメンテーションを実証している。
本稿では,2次元MLLMから3次元シーン理解へ知識を伝達するフレームワークであるMLLM-For3Dを紹介する。
論文 参考訳(メタデータ) (2025-03-23T16:40:20Z) - SUGAR: Pre-training 3D Visual Representations for Robotics [85.55534363501131]
ロボット工学のための新しい3D事前学習フレームワークSUGARを紹介した。
SUGARは3次元の点雲を通してオブジェクトの意味的、幾何学的、および余分な特性をキャプチャする。
SuGARの3D表現は最先端の2Dおよび3D表現よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-04-01T21:23:03Z) - Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers [65.51132104404051]
オブジェクトレベルのシーンと対話するために、オブジェクト識別子とオブジェクト中心表現を導入する。
我々のモデルは、ScanRefer、Multi3DRefer、Scan2Cap、ScanQA、SQA3Dなど、既存のベンチマーク手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2023-12-13T14:27:45Z) - LanguageRefer: Spatial-Language Model for 3D Visual Grounding [72.7618059299306]
3次元視覚的グラウンドリング問題に対する空間言語モデルを構築した。
本稿では,ReferIt3Dが提案する視覚言語データセットに対して,本モデルが競合的に動作することを示す。
論文 参考訳(メタデータ) (2021-07-07T18:55:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。