論文の概要: AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2603.12730v1
- Date: Fri, 13 Mar 2026 07:21:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-21 18:33:56.749092
- Title: AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
- Title(参考訳): アンカーVLA4D:ロボットマニピュレーションのためのアンカー型空間時間視-言語-行動モデル
- Authors: Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong,
- Abstract要約: VLA(Vision-Language-Action)システムは、空間的知覚が限られ、操作を通して記憶が欠如している。
AnchorVLA4Dは、視覚入力をアンカー画像で拡張し、初期シーンコンテキストを保存するシンプルな空間時空間VLAである。
- 参考スコア(独自算出の注目度): 11.15252844796209
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Since current Vision-Language-Action (VLA) systems suffer from limited spatial perception and the absence of memory throughout manipulation, we investigate visual anchors as a means to enhance spatial and temporal reasoning within VLA policies for robotic manipulation. Conventional VLAs generate actions by conditioning on a single current frame together with a language instruction. However, since the frame is encoded as a 2D image, it does not contain detailed spatial information, and the VLA similarly lacks any means to incorporate past context. As a result, it frequently forgets objects under occlusion and becomes spatially disoriented during the manipulation process. Thus, we propose AnchorVLA4D, a simple spatial-temporal VLA that augments the visual input with an anchor image to preserve the initial scene context throughout execution, and adds a lightweight spatial encoder that jointly processes the anchor and current frames to expose geometric relationships within an episode. Built on a Qwen2.5-VL backbone with a diffusion-based action head, AnchorVLA4D requires no additional sensing modalities (e.g., depth or point clouds) and introduces negligible inference overhead. Combining anchoring with a frozen pretrained spatial encoder yields further gains, realizing a 13.6% improvement on the Simpler WidowX benchmark and confirming the approach on real-world tasks, where it achieved an average success rate of 80%.
- Abstract(参考訳): ロボット操作のためのVLAポリシ内での空間的・時間的推論を強化する手段として,現在のビジョン・ランゲージ・アクション(VLA)システムでは空間的知覚が限られており,記憶の欠如があるため,視覚的アンカーについて検討する。
従来のVLAは、言語命令と共に単一の電流フレームに条件付けすることでアクションを生成する。
しかし、フレームは2D画像として符号化されているため、詳細な空間情報が含まれておらず、VLAも同様に過去の文脈を組み込む手段が欠けている。
結果として、隠蔽対象をしばしば忘れ、操作プロセス中に空間的に不向きになる。
そこで,AnchorVLA4Dを提案する。AnchorVLA4Dは,視覚入力をアンカーイメージで拡張し,実行中のシーンコンテキストを保存し,アンカーフレームと現在のフレームを共同処理してエピソード内の幾何学的関係を明らかにする軽量な空間エンコーダである。
拡散に基づくアクションヘッドを備えたQwen2.5-VLバックボーン上に構築されたAnchorVLA4Dは、追加のセンシングモード(例えば、深さや点雲)を必要とせず、無視可能な推論オーバーヘッドを導入する。
冷凍保存された空間エンコーダとアンカーのアンカーと組み合わせることで、Simpler WidowXベンチマークの13.6%の改善を実現し、実際のタスクに対するアプローチを確認し、平均80%の成功率を達成した。
関連論文リスト
- ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation [33.92613503473177]
本稿では,3D-4Dの統一表現を用いた3D-4D表現を提案する。
STHumanは,14,300kエピソード,注釈付き2D,3D,4Dコンテキストを備えた大規模ヒューマン操作データセットである。
RLBenchと実世界の操作タスクの実験は、手法が最先端のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-03-14T06:36:48Z) - TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation [70.23578202012048]
Vision-Language Navigation (VLN) は、アーキテクチャ上のミスマッチのため、大きなビジョン-Language Models (VLM) に固有の課題を提示している。
我々は,VLMのバックボーンにトポロジ構造を明示的に注入するエンドツーエンドフレームワークであるTagaVLM(トポロジ・アウェア・グローバルアクション推論)を提案する。
トポロジ的ノード情報を強化するため、Interleaved Navigation Promptはノードレベルのビジュアルテキストアライメントを強化する。
埋め込みトポロジグラフでは、このモデルはグローバルな行動推論が可能であり、堅牢な経路補正を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:28:07Z) - V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs [66.81402538540458]
本稿では,局所的セマンティックアタックの新しい手法であるV-Attackを提案する。
V-Attackは、最先端の手法よりも平均して36%の攻撃成功率を改善する。
論文 参考訳(メタデータ) (2025-11-25T11:51:17Z) - VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation [54.81449795163812]
時間的コヒーレントなロボット操作のための4次元認識型汎用VLAモデルを開発した。
視覚的特徴を抽出し, 4次元埋め込みのための3次元位置への1次元時間埋め込みを行い, クロスアテンション機構による統一視覚表現に融合する。
この枠組みの中で、デザインされた視覚アクションは、空間的に滑らかで時間的に一貫したロボット操作を共同で行う。
論文 参考訳(メタデータ) (2025-11-21T12:26:30Z) - From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors [54.84863164684646]
既存の視覚言語アクション(VLA)モデルは3Dの現実世界で機能するが、通常は2Dエンコーダ上に構築される。
本研究では,アクションヘッドにリッチな3次元空間トークンを注入する新しいパラダイムであるFALCONを紹介する。
論文 参考訳(メタデータ) (2025-10-20T11:26:45Z) - STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding [31.38893861328115]
映像生成は近年目覚ましい進歩を遂げているが、コヒーレントな物体の動きと相互作用を維持することは依然として困難である。
両問題に2つの簡単なコンポーネントで対処する画像とビデオのフレームワークであるSTANCEを提示する。
論文 参考訳(メタデータ) (2025-10-16T11:50:38Z) - Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos [70.07088203106443]
既存の手法は運動を学ぶための明示的な知識に依存しており、結果として準最適表現をもたらす。
Masked Autoentangler (MAE)フレームワークは、4Dデータにおける低レベルの幾何学と高レベルのダイナミックスの間のギャップを埋めるのに苦労している。
本稿では,表現的,識別的,移動可能な4次元表現を学習するための,新しい自己異方性MAEを提案する。
論文 参考訳(メタデータ) (2025-04-07T08:47:36Z) - Language-Bridged Spatial-Temporal Interaction for Referring Video Object
Segmentation [28.472006665544033]
ビデオオブジェクトセグメンテーションの参照は、ビデオ内の自然言語表現によって参照されるオブジェクトのフォアグラウンドラベルを予測することを目的としている。
従来の手法は3D ConvNetsに依存するか、さらに2D ConvNetsをエンコーダとして組み込んで、複雑な時空間の特徴を抽出する。
本稿では,言語を中間ブリッジとして利用するLBDT(Language-Bridged Duplex Transfer)モジュールを提案する。
論文 参考訳(メタデータ) (2022-06-08T10:12:53Z) - Exploring Intra- and Inter-Video Relation for Surgical Semantic Scene
Segmentation [58.74791043631219]
セグメンテーション性能を高めるために,映像内および映像間関係を補完する新しいフレームワークSTswinCLを提案する。
本研究では,EndoVis18 ChallengeとCaDISデータセットを含む2つの公開手術ビデオベンチマークに対するアプローチを広く検証する。
実験により,従来の最先端手法を一貫して超越した提案手法の有望な性能を示す。
論文 参考訳(メタデータ) (2022-03-29T05:52:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。