論文の概要: VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.12356v2
- Date: Thu, 16 Jul 2026 05:52:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.214751
- Title: VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation
- Title(参考訳): VistaVLA:ロボットマニピュレーションのための幾何学的・意味論的3次元ガウス型VLA
- Authors: Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang,
- Abstract要約: VLA(Vision-Language-Action)モデルは、言語命令と2次元視覚入力を直接アクションにマッピングすることで、ロボット操作のための強力なエンドツーエンドパラダイムとして登場した。
これらのモデルには明確なシーンレベルの3D表現がなく、空間的レイアウトや幾何学的制約について推論する能力に制限がある。
本稿では3次元ガウスプリミティブから幾何学的・意味論的3次元認知表現を構築する新しいフレームワークVistaVLAを提案する。
- 参考スコア(独自算出の注目度): 7.753769810587787
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Vision-Language-Action (VLA) models have emerged as a powerful end-to-end paradigm for robotic manipulation by mapping language instructions and 2D visual inputs directly to actions. However, these models lack an explicit, scene-level 3D representation, limiting their ability to reason over spatial layouts and geometric constraints. While recent efforts incorporate explicit 3D cues, such as depth maps or point clouds, to improve geometric awareness, they primarily capture low-level structures and lack high-level semantic grounding in 3D space. In human cognition, interaction with the physical world relies on a 3D semantic cognitive map - an internal mental model that integrates spatial layouts with semantic context to enable persistent, viewpoint-invariant reasoning. In light of this, we present VistaVLA, a novel two-stage framework that constructs a geometry- and semantics-aware 3D cognitive representation from 3D Gaussian primitives and grounds it as compact context tokens for VLA policy learning. Specifically, VistaVLA lifts multi-view vision-language features into 3D Gaussian primitives, forming geometry-anchored semantic tokens that align view-consistent spatial grounding with 2D visual feature spaces. To make this 3D representation computationally tractable for effective VLA control, we introduce Merge-then-Query (MtQ), a token summarization mechanism. MtQ compresses dense Gaussian primitives into a highly compact set of spatially informative tokens, achieving a 99% token reduction while preserving action-relevant 3D layouts and semantic context. Extensive evaluations in both simulated and real-world environments demonstrate the effectiveness of VistaVLA. Notably, in real-world scenarios, VistaVLA improves success rates by 22.8% across seven real-world tasks and by 30.0% over the VLA-Adapter baseline on challenging out-of-distribution tasks.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、言語命令と2次元視覚入力を直接アクションにマッピングすることで、ロボット操作のための強力なエンドツーエンドパラダイムとして登場した。
しかし、これらのモデルには明示的でシーンレベルの3D表現がなく、空間的レイアウトや幾何学的制約について推論する能力が制限されている。
近年の取り組みは、深度マップや点雲のような明示的な3Dの手がかりを取り入れて幾何学的認識を改善する一方で、主に低レベルの構造を捉え、3D空間における高レベルのセマンティックグラウンドを欠いている。
人間の認知では、物理的世界との相互作用は3D意味認知マップ(空間的レイアウトと意味的コンテキストを統合する内部精神モデル)に依存し、永続的で視点不変な推論を可能にする。
そこで我々は,3次元ガウスプリミティブから幾何学的および意味論的3次元認知表現を構築し,VLAポリシー学習のためのコンパクトなコンテキストトークンとして位置づける新しい2段階フレームワークVistaVLAを提案する。
具体的には、VistaVLAは3次元ガウスプリミティブに多視点視覚言語機能を持ち上げ、2次元視覚的特徴空間でビュー一貫性のある空間接地を整列する幾何学的意味トークンを形成する。
本稿では,この3次元表現を有効なVLA制御に利用するために,トークン要約機構であるMerge-then-Query(MtQ)を導入する。
MtQは、高密度のガウス原始体を非常にコンパクトな空間情報トークンセットに圧縮し、アクション関連3Dレイアウトとセマンティックコンテキストを維持しながら、99%のトークン削減を達成する。
シミュレーション環境と実環境環境の両方における広範囲な評価はVistaVLAの有効性を示している。
特に、現実世界のシナリオでは、VistaVLAは7つの現実のタスクで22.8%、VLA-Adapterベースラインで30.0%、アウト・オブ・ディストリビューションタスクで成功率を改善する。
関連論文リスト
- Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation [76.16065370700488]
We introduced Lift3D-VLA, a unified VLA framework that equips models with explicit 3D point cloud reasoning and possible temporally coherent action generation。
我々は,Lift3D-VLAがMetaWorldとRLBenchの平均成功率を10.8%,11.1%向上したことを示す。
論文 参考訳(メタデータ) (2026-07-07T17:59:47Z) - Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding [31.76161781831759]
提案するOcc-VLMは3次元シーン理解のための新しいフレームワークで,提案するRGB画像に対して純粋に動作し,単一の2次元視覚エンコーダを用いる。
Occ-VLMは、正確な幾何学的知覚と堅牢な視覚言語推論の両方を達成する。
論文 参考訳(メタデータ) (2026-06-18T04:24:28Z) - PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction [57.63073414949329]
我々は,階層的な3Dポイントクラウド表現をアクションデコーディングプロセスに直接統合する,デュアルシステム3D対応VLAポリシーであるPointACTを提案する。
PointACTは、効率的なボトルネックウィンドウ自己アテンションを備えたマルチスケールのポイントアクションインタラクション機構を採用し、進化するアクショントークンが局所的な幾何学的詳細とグローバルなシーン構造の両方に密に関与できるようにする。
論文 参考訳(メタデータ) (2026-05-20T17:10:31Z) - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。
既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。
DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:44:26Z) - Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models [47.045362895601556]
Loc3R-VLMは、モノクロビデオ入力から高度な3D理解機能を備えた2Dビジョンランゲージモデルを備えたフレームワークである。
人間の空間認識にインスパイアされたLoc3R-VLMは、グローバルなレイアウト再構築と明示的な状況モデリングという2つの共同目的に依存している。
幾何学的整合性と計量スケールの整合性を確保するために,事前学習した3次元基礎モデルから抽出した軽量カメラポーズの先行情報を活用する。
論文 参考訳(メタデータ) (2026-03-18T17:59:10Z) - ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation [33.92613503473177]
本稿では,3D-4Dの統一表現を用いた3D-4D表現を提案する。
STHumanは,14,300kエピソード,注釈付き2D,3D,4Dコンテキストを備えた大規模ヒューマン操作データセットである。
RLBenchと実世界の操作タスクの実験は、手法が最先端のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-03-14T06:36:48Z) - Abstract 3D Perception for Spatial Intelligence in Vision-Language Models [100.13033631690114]
視覚言語モデル(VLM)は、空間認識や物理的理解といった3D関連課題に苦しむ。
我々は,VLMの幾何学的構造と物理力学を符号化するために,抽象的境界ボックスを利用するフレームワークであるSandboxVLMを紹介した。
提案手法は空間知能を常に向上させ,SAT Realの8.3%のゲインをベースライン法と比較して達成する。
論文 参考訳(メタデータ) (2025-11-14T04:16:09Z) - Agentic 3D Scene Generation with Spatially Contextualized VLMs [67.31920821192323]
本稿では,複雑な3D環境の生成,理解,編集を可能にする新しいパラダイムを提案する。
我々は,VLMが空間コンテキストから反復的に読み取って更新するエージェント型3Dシーン生成パイプラインを開発した。
その結果,我々のフレームワークは多様かつ困難な入力を処理でき,事前の作業では観測できないような一般化のレベルを達成することができることがわかった。
論文 参考訳(メタデータ) (2025-05-26T15:28:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。