論文の概要: Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning
- arxiv url: http://arxiv.org/abs/2606.25360v1
- Date: Wed, 24 Jun 2026 03:45:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.208054
- Title: Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning
- Title(参考訳): 意味論と幾何学的グラウンドリングのデカップリング:言語による模倣学習のための空間的視覚的プロンプト
- Abstract要約: 本稿では,アクション生成ループから空間的グラウンドを明示的に抽出する分離アーキテクチャであるSVP-ILを提案する。
実験では、SVP-ILは最先端のVLAや純粋なビジュモータベースラインよりも著しく優れている。
- 参考スコア(独自算出の注目度): 21.67233368353003
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While end-to-end Vision-Language-Action (VLA) models show promise in robotic manipulation, their monolithic paradigm inherently couples semantic reasoning and spatial control. This creates a severe alignment bottleneck, limiting precise target disambiguation in data-constrained imitation learning. To overcome this, we propose SVP-IL, a decoupled architecture that explicitly extracts spatial visual grounding from the action generation loop. By leveraging vision-language foundation models, we parse instructions into zero-shot geometric masks, translating language into explicit Spatial Visual Prompts (SVP). These priors are injected into a continuous action generator via a lightweight direct feature-level fusion mechanism. This integration provides explicit and uncorrupted spatial gradient guidance while ensuring highly stable optimization under low-data regimes. Extensive experiments demonstrate that SVP-IL significantly outperforms state-of-the-art VLAs and pure visuomotor baselines. Trained on as few as 50 to 100 demonstrations, SVP-IL improves average success rates on highly ambiguous language-conditioned tasks from 24.0% to 39.5%, achieving 67.8% on standard benchmarks. Real-world robotic experiments further validate its robustness and data efficiency in unstructured physical environments.
- Abstract(参考訳): エンドツーエンドのVision-Language-Action(VLA)モデルはロボット操作において有望であるが、そのモノリシックなパラダイムは本質的に意味論的推論と空間的制御を結合している。
これにより、データ制約付き模倣学習における正確なターゲットの曖昧さを制限する、アライメントのボトルネックが深刻になる。
そこで本稿では,アクション生成ループから空間的視界を明示的に抽出する分離アーキテクチャであるSVP-ILを提案する。
視覚言語基礎モデルを活用することで、命令をゼロショットの幾何マスクに解析し、言語を明示的な空間的視覚プロンプト(SVP)に変換する。
これらの前者は、軽量の直接的特徴レベル融合機構を介して連続的な作用発生器に注入される。
この統合は、低データ状態下で高度に安定な最適化を確保しながら、明示的かつ非破壊的な空間勾配ガイダンスを提供する。
広範囲な実験により、SVP-ILは最先端のVLAや純粋なビズモトールベースラインよりも著しく優れていることが示された。
50から100のデモで訓練されたSVP-ILは、高度にあいまいな言語条件のタスクにおける平均成功率を24.0%から39.5%に改善し、標準ベンチマークで67.8%を達成した。
実世界のロボット実験は、非構造的な物理的環境におけるロバスト性とデータ効率をさらに検証する。
関連論文リスト
- GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation [55.47130289185285]
VLA(Vision-Language-Action)ポリシーは、高度な言語条件のロボット操作である。
我々は textbfWorld State Tokens と textbfWorld Prediction Tokens を VLA バックボーンに直接挿入する,コンパクトでポリシーネイティブな拡張である textbfMethodname を提示する。
論文 参考訳(メタデータ) (2026-08-26T11:41:55Z) - Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models [20.8047896631941]
VLA(Vision-Language-Action)モデルは、ロボット操作において優れているが、標準的な指示が言い換えられると破滅的な性能低下を被る。
現状のVLAでは,タスクの正当性を内部的に保持することに成功した。
不安定な関節経路をバイパスするエレガントな介入であるグラウンドド・セマンティック・リバインド(GSR)を提案する。
論文 参考訳(メタデータ) (2026-08-03T17:02:04Z) - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。
既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。
DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:44:26Z) - MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation [47.2088748094605]
Vision-Language-Action(VLA)モデルは、視覚的な観察や自然言語の指示からロボットを操作することを目的としている。
MMaDA-VLAは,マルチモーダル理解と生成をひとつのフレームワークで統一する,完全ネイティブな大規模拡散VLAモデルである。
論文 参考訳(メタデータ) (2026-03-26T12:55:51Z) - TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation [70.23578202012048]
Vision-Language Navigation (VLN) は、アーキテクチャ上のミスマッチのため、大きなビジョン-Language Models (VLM) に固有の課題を提示している。
我々は,VLMのバックボーンにトポロジ構造を明示的に注入するエンドツーエンドフレームワークであるTagaVLM(トポロジ・アウェア・グローバルアクション推論)を提案する。
トポロジ的ノード情報を強化するため、Interleaved Navigation Promptはノードレベルのビジュアルテキストアライメントを強化する。
埋め込みトポロジグラフでは、このモデルはグローバルな行動推論が可能であり、堅牢な経路補正を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:28:07Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Universal Pose Pretraining for Generalizable Vision-Language-Action Policies [83.39008378156647]
既存のVision-Language-Action(VLA)モデルは、しばしば機能崩壊と訓練効率の低下に悩まされる。
本稿では,VLAトレーニングを3次元空間前駆体抽出のための事前学習フェーズに分離する,分離されたパラダイムであるPose-VLAを提案する。
我々のフレームワークは2段階の事前学習パイプラインに従い、ポーズと動きのアライメントによる基本的な空間接地を確立する。
論文 参考訳(メタデータ) (2026-02-23T11:00:08Z) - DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning [35.44151923549777]
VLA(Vision-Language-Action)モデルは最近、印象的な一般化と言語誘導操作機能を示している。
視覚言語モデル(VLM)から受け継いだ空間的推論の制限による空間的推論の精度の低下
本稿では,プレトレーニングした深度予測モジュールを通じて空間認識を明示的に組み込んだ,シンプルで効果的なVLAアーキテクチャであるDepthVLAを提案する。
論文 参考訳(メタデータ) (2025-10-15T10:09:00Z) - DexVLG: Dexterous Vision-Language-Grasp Model at Scale [59.5613919093295]
ヒトのような器用な手のための大型モデルを用いた機能的握りの研究はほとんどない。
DexVLGは、言語命令に整合したDexterousグリップポーズ予測のための大型ビジョン言語-Graspモデルである。
シミュレーションでは、174,000個のオブジェクトのセマンティックな部分にマッピングされた1億1千万個のデキスタスなグリップポーズを、詳細な部分レベルのキャプションと組み合わせて生成する。
論文 参考訳(メタデータ) (2025-07-03T16:05:25Z) - From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation [35.79160868966466]
FSD(From Seeing to Doing)は空間関係推論により中間表現を生成する新しい視覚言語モデルである。
提案手法は,空間座標を視覚信号と整列する自己整合性機構と,階層的なデータパイプラインを併用する。
我々は、FSDがSimplerEnvで40.6%の成功率、実世界の8つのタスクで72%の成功率を達成したことを示し、最強のベースラインを30%上回った。
論文 参考訳(メタデータ) (2025-05-13T13:20:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。