論文の概要: 3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
- arxiv url: http://arxiv.org/abs/2605.29416v1
- Date: Thu, 28 May 2026 06:07:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 00:00:30.945606
- Title: 3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
- Title(参考訳): 3DVLA:3次元空間と事例理解によるビジョン・ランゲージ・アクションモデルの実現
- Authors: Zhongyu Xia, Yousen Tang, Bingqing Wei, Yongtao Wang,
- Abstract要約: 3DVLAは、事前訓練されたビジョン・ランゲージ・アクションモデルに堅牢な3D推論を注入するプラグイン・アンド・プレイフレームワークである。
提案手法の有効性とプラグ・アンド・プレイの両互換性を検証し,操作性能の一貫性と顕著な向上を示す。
- 参考スコア(独自算出の注目度): 11.30785902722196
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-Language-Action models have achieved remarkable progress in robotic manipulation, yet they suffer from a critical limitation: a lack of 3D scene understanding. This deficiency manifests as three intertwined challenges: weak extraction of 3D spatial positions without enforcing multi-view consistency, inadequate 3D instance understanding, and fragile reasoning under occlusion. Although mature 3D perception methods exist, their direct integration into VLA pipelines is hindered by architectural incompatibility and by heavy reliance on costly instance-level annotations. To address the above challenges, we propose 3DVLA, a plug-and-play framework that injects robust 3D reasoning into pretrained VLAs without requiring extra manual labels or discarding VLM priors. Specifically, 3DVLA tackles the three challenges through: (1) pervasive 3D feature encoding with explicit multi-view consistency constraints across all modalities and a Spatially-Conditioned Geometry Aggregation method, (2) an instance estimation module with high-level instance tokens for 3D instance awareness, and (3) a masked self-supervised 3D encoding branch that retains its predictor for visual token completion to handle occlusions. We integrate 3DVLA with multiple VLA baselines and evaluate on LIBERO-Plus and RoboTwin 2.0. Results show consistent and significant gains in manipulation performance, validating both the effectiveness and plug-and-play compatibility of our approach.
- Abstract(参考訳): Vision-Language-Actionモデルはロボット操作において顕著な進歩を遂げているが、3Dシーン理解の欠如という致命的な限界に悩まされている。
この欠損は、多視点整合性を持たずに3次元空間位置の弱い抽出、不適切な3次元インスタンス理解、そして閉塞下での脆弱な推論の3つの課題として現れている。
成熟した3D認識手法は存在するが、VLAパイプラインへの直接統合は、アーキテクチャ上の非互換性と、コストのかかるインスタンスレベルのアノテーションへの依存によって妨げられる。
上記の課題に対処するため、3DVLAを提案する。この3DVLAは、予め訓練されたVLAに頑健な3D推論を注入する。
具体的には、3DVLAは、(1)全モードにわたる明示的な多視点整合性制約を持つ広汎な3D特徴符号化と、(2)3Dインスタンス認識のための高レベルなインスタンストークンを持つインスタンス推定モジュール、(3)オクルージョンを処理するための視覚トークン補完のための予測器を保持するマスク付き自己監督型3D符号化ブランチの3つの課題に取り組む。
我々は3DVLAを複数のVLAベースラインと統合し、LIBERO-PlusとRoboTwin 2.0で評価する。
その結果,本手法の有効性とプラグ・アンド・プレイ互換性の両面を検証し,操作性能が一貫した有意な向上を示した。
関連論文リスト
- PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction [57.63073414949329]
我々は,階層的な3Dポイントクラウド表現をアクションデコーディングプロセスに直接統合する,デュアルシステム3D対応VLAポリシーであるPointACTを提案する。
PointACTは、効率的なボトルネックウィンドウ自己アテンションを備えたマルチスケールのポイントアクションインタラクション機構を採用し、進化するアクショントークンが局所的な幾何学的詳細とグローバルなシーン構造の両方に密に関与できるようにする。
論文 参考訳(メタデータ) (2026-05-20T17:10:31Z) - PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models [33.89873575295867]
我々はPokeGymを紹介した。Pokemon Legends: Z-Aは視覚的に複雑な3DオープンワールドであるRole-Playing Gameである。
PokeGymは厳格なコードレベルの分離を強制する:エージェントは生のRGB観測のみで動作するが、独立した評価器はメモリスキャンによって成功を検証する。
このベンチマークは、ナビゲーション、インタラクション、混合シナリオにまたがる30のタスク(30-220ステップ)と、3つの命令の粒度(Visual-Guided、Step-Guided、Goal-Only)で構成され、視覚的な接地、セマンティック推論、自律的な探索機能を体系的に分解する。
論文 参考訳(メタデータ) (2026-04-09T15:12:36Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation [66.7166217399105]
エージェントは、エンドツーエンドモデルには解釈可能性や明示的な3D推論が欠けているという、重要なジレンマに直面します。
1) 計画,グラウンド,ナビゲーション,質問応答を単一の3D-VLMパイプラインとCoTパイプラインで統一する動的3Dチェーン(3D CoT) ; 2) フラグメンテッド・スーパービジョン(SLFS)戦略からのシナジスティック学習 マスク付き自己回帰損失を用いて,大規模かつ部分的に注釈付けされたハイブリッドデータから学習する。
論文 参考訳(メタデータ) (2025-12-14T09:53:15Z) - Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision [31.929268076595122]
OccVLAは、3D占有率表現を統一されたマルチモーダル推論プロセスに統合する新しいフレームワークである。
OccVLAは、軌跡計画のためのnuScenesベンチマークの最先端結果を達成し、3次元視覚的質問応答タスクにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2025-09-06T03:47:21Z) - Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding [24.964149224068027]
我々は,3D MLLM のためのプラグ&プレイ型ビジュアルトークン解析フレームワークである Fast3D を提案する。
グローバルアテンション予測(GAP)は,目標モデルのグローバルアテンション分布を予測し,トークンの効果的な重要度推定を可能にする。
SAPは、注意に基づく複雑性評価を通じて動的トークン予算を導入し、レイヤーワイドプルーニング比率を自動的に調整する。
論文 参考訳(メタデータ) (2025-07-12T16:29:02Z) - Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance [72.6809373191638]
本稿では,3次元ラベルを必要とせずに2次元ドメインと3次元ドメイン間の制約を活用できるフレームワークを提案する。
具体的には、LiDARと画像特徴をオブジェクト認識領域に基づいて整列する特徴レベルの制約を設計する。
第二に、出力レベルの制約は、2Dと投影された3Dボックスの推定の重なりを強制するために開発される。
第3に、トレーニングレベルの制約は、視覚データと整合した正確で一貫した3D擬似ラベルを生成することによって利用される。
論文 参考訳(メタデータ) (2023-12-12T18:57:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。