論文の概要: S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation
- arxiv url: http://arxiv.org/abs/2606.27872v1
- Date: Fri, 26 Jun 2026 09:13:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.440104
- Title: S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation
- Title(参考訳): S$^2$-VLA: 長距離マニピュレーションのための状態空間誘導型ビジョンランゲージ・アクションモデル
- Abstract要約: VLA(Vision-Language-Action)モデルは、ロボット操作において強力な能力を示しているが、その性能は長距離作業では著しく低下している。
本稿では,SSGAA(State-Space Guided Adaptive Attention)機構を導入するフレームワークであるS$2$-VLAを提案する。
S$2$-VLAは、より大きな7Bスケールモデルより一貫して優れており、ロングホライゾンのベンチマークで最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 34.73337776403718
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have demonstrated strong capabilities in robotic manipulation, but their performance degrades significantly in long-horizon tasks due to cumulative error propagation. This limitation largely arises from static feature fusion mechanisms that rely on fixed weights to combine visual, language, and action representations, preventing the model from adapting to different phases of task execution. To address this limitation, we propose S$^2$-VLA, a framework that introduces a State-Space Guided Adaptive Attention (SSGAA) mechanism. SSGAA maintains a belief state that tracks task progression and generates dynamic gating weights to adaptively fuse information from three complementary sources visual features for spatial perception, task intents for high-level task planning, and temporal action sequences for execution consistency. This adaptive fusion allows the model to shift its focus throughout task execution, aligning with the evolving requirements of different task stages. Despite its compact 2B parameter size, S$^2$-VLA consistently outperforms larger 7B-scale models and achieves state-of-the-art performance on long-horizon manipulation benchmarks, including LIBERO and SimplerEnv. highlighting the importance of adaptive feature fusion for long-horizon robotic manipulation.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、ロボット操作において強力な能力を示しているが、その性能は累積誤差伝播による長期タスクにおいて著しく低下している。
この制限は、視覚、言語、行動表現を組み合わせるために固定重みに依存する静的な特徴融合機構に大きく影響し、モデルがタスク実行の異なるフェーズに適応するのを防ぐ。
この制限に対処するため,SSGAA(State-Space Guided Adaptive Attention)機構を導入するフレームワークであるS$^2$-VLAを提案する。
SSGAAは、タスク進行を追跡し、動的ゲーティング重みを生成し、空間知覚のための3つの相補的な視覚的特徴、高レベルのタスク計画のためのタスク意図、実行一貫性のための時間的アクションシーケンスから情報を適応的に融合する信念状態を維持している。
この適応的な融合により、異なるタスクステージの進化する要求に合わせて、モデルがタスク実行全体に集中をシフトすることができる。
コンパクトな2Bパラメータサイズにもかかわらず、S$^2$-VLAはより大型の7Bスケールモデルより一貫して優れており、LIBEROやSimplerEnvといった長距離操作ベンチマークで最先端のパフォーマンスを実現している。
長距離ロボット操作における適応的特徴融合の重要性を強調する。
関連論文リスト
- NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation [16.57017306622846]
低レベルのアクション制御から高レベルのセマンティック推論を分離する非同期デュアル周波数アーキテクチャであるNebulaVLAを提案する。
ヘテロジニアスロボット間のセマンティックギャップをブリッジするために,統一言語に基づく行動表現であるGESTURE-7を導入する。
論文 参考訳(メタデータ) (2026-08-17T12:40:23Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation [21.418782746588263]
DAM-VLAは動的アクションモデルに基づくVision-Language-Actionフレームワークである。
VLM推論と拡散に基づくアームとグリップ制御のためのアクションモデルを統合する。
DAM-VLAは、シミュレーションおよび実世界の設定において最先端のVLA手法よりも優れた成功率を達成する。
論文 参考訳(メタデータ) (2026-03-01T05:16:04Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention [92.85371254435074]
PosA-VLAフレームワークは、ポーズ条件付き監視を通じて視覚的注意を保ち、タスク関連領域に対するモデルの認識を一貫して導く。
本手法は,多様なロボット操作ベンチマークにおいて,正確かつ時間効率のよい動作を実施できることを示す。
論文 参考訳(メタデータ) (2025-12-03T12:14:29Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - vGamba: Attentive State Space Bottleneck for efficient Long-range Dependencies in Visual Recognition [0.0]
状態空間モデル(SSM)は代替手段を提供するが、視界での応用は未定である。
この研究は、効率性と表現性を高めるために、SSMと注意機構を統合するハイブリッドビジョンバックボーンであるvGambaを導入している。
分類、検出、セグメンテーションタスクのテストでは、vGambaは精度と計算効率のトレードオフが優れており、既存のモデルよりも優れていることが示されている。
論文 参考訳(メタデータ) (2025-03-27T08:39:58Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。