論文の概要: D$^2$-VLA: Dual-Memory Dual-Frequency Vision-Language-Action Model For Long Dynamic Manipulation
- arxiv url: http://arxiv.org/abs/2609.34792v1
- Date: Mon, 28 Sep 2026 10:00:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.034287
- Title: D$^2$-VLA: Dual-Memory Dual-Frequency Vision-Language-Action Model For Long Dynamic Manipulation
- Title(参考訳): D$^2$-VLA:長い動力学的マニピュレーションのためのデュアルメモリデュアル周波数ビジョンランゲージ・アクションモデル
- Abstract要約: ロングホライズン操作では、移動物体に反応しながら、もはや見えなくなったキューをロボットに思い出させる必要がある。
本稿では,プリトレーニング済みVLMのKV-cacheインタフェースにおいて,デュアルメモリとデュアル周波数制御を組み合わせたD$2$-VLAを提案する。
D$2$-VLAは、DOMINOで29.3%、PUMAで9.6%、PUMAで17.2%、DOMINO-Longで60.0%、DOMINO-Longで35.4%、20.6%である。
- 参考スコア(独自算出の注目度): 21.363874202366205
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon manipulation requires robots to remember cues that are no longer in view while responding to moving objects. Yet vision-language-action (VLA) policies often rely on the latest observation, and refreshing their visual context typically requires another costly vision-language model (VLM) pass. We present D$^2$-VLA, which combines dual memory and dual-frequency control at the KV-cache interface of a pretrained VLA. D$^2$-VLA uses block-wise causal KV caching to encode observations incrementally and, guided by distinct temporal attention patterns, constructs separate historical KV read views for the VLM and action expert. Between periodic VLM updates, a gated adapter incorporates fresh visual features into the latest history-conditioned KV block, while a short fast-memory queue supports action replanning. We introduce DOMINO-Long, a ten-task benchmark requiring robots to use earlier visual cues when manipulating moving objects. D$^2$-VLA achieves complete-task success rates of 29.3\% on DOMINO, compared with 9.6\% for $π_{0.5}$ and 17.2\% for PUMA, and 60.0\% on DOMINO-Long, compared with 35.4\% and 20.6\%, respectively. It improves success rates on eight real-robot tasks and reaches 97.5\% on LIBERO-Long and 74.3\% on RoboTwin 2.0.
- Abstract(参考訳): ロングホライズン操作では、移動物体に反応しながら、もはや見えなくなったキューをロボットに思い出させる必要がある。
しかし、視覚言語アクション(VLA)ポリシーは、しばしば最新の観察に依存し、視覚的コンテキストを更新するには、通常、別のコストのかかる視覚言語モデル(VLM)パスが必要となる。
本稿では,事前学習したVLAのKV-cacheインタフェースにおいて,デュアルメモリとデュアル周波数制御を組み合わせたD$^2$-VLAを提案する。
D$^2$-VLAは、ブロックワイズ因果KVキャッシングを使用して、観察を段階的にエンコードし、異なる時間的注意パターンによってガイドされ、VLMとアクションエキスパートのための別々の歴史的KV読み込みビューを構築する。
周期的なVLM更新の間、ゲートアダプタは最新の履歴条件付きKVブロックに新しい視覚的特徴を組み込む。
我々は、移動物体を操作する際に、ロボットがより早い視覚的手がかりを使用する必要がある10タスクのベンチマークであるDOMINO-Longを紹介した。
D$^2$-VLAは、DOMINOでは29.3\%、PUMAでは9.6\%、PUMAでは17.2\%、DOMINO-Longでは60.0\%、DOMINO-Longでは35.4\%、20.6\%である。
8つの実ロボットタスクの成功率を改善し、LIBERO-Longでは97.5\%、RoboTwin 2.0では74.3\%に達する。
関連論文リスト
- Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models [15.623091131522528]
Gated VLA-Cacheは、ニューラルイントロスペクションによる視覚的類似性キャッシングを強化する。
OpenVLAとOpenVLA-OFTで4つのLIBEROベンチマークスイートを評価した。
論文 参考訳(メタデータ) (2026-08-11T11:53:10Z) - TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM [48.08028534478592]
視覚言語アクション(VLA)モデルは一般的にLLM中心の$VをLからA$経路に採用する。
我々は,従来の$V から L への変換を,直接$V + L から A$ への写像として行う新しい VLA パラダイムである TurboVLA を導入する。
LIBEROでは、TurboVLAは平均97.7%成功し、0.2Bパラメータと31.2msの推論遅延、0.9GBの推論VRAMしか得られなかった。
論文 参考訳(メタデータ) (2026-07-29T17:59:58Z) - MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation [68.89913903899101]
リアルタイム推論効率(14 FPS)で最先端性能を実現する新しいVLNフレームワークを提案する。
MemVLNは、視覚エンコーダを使用して連続観察を処理し、LLM(Large Language Model)を使用して命令を解釈し、アクションを生成する。
VLN-CEの実験では、MemVLN-4BはベースラインのQwen3-VL-4Bアーキテクチャを5.8%のSRでR2R、9.7%のSRで上回り、推論遅延の7$times$スピードアップを達成した。
論文 参考訳(メタデータ) (2026-07-26T07:08:30Z) - EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies [68.812675280427]
EventVLAは、疎視的エビデンスメモリの概念に基づいて開発されたエンドツーエンドフレームワークである。
KEMは、VLAの潜伏した埋め込みから将来の確率を直接予測し、スパースでタスククリティカルな視覚イベントを自律的にキャプチャして保存する。
対話型視覚的エビデンスで非マルコフ操作タスクを評価するための診断ベンチマークであるRoboTwin-MeMを提案する。
論文 参考訳(メタデータ) (2026-06-18T11:11:37Z) - OxyGen: Unified KV Cache Management for Vision-Language-Action Models under Multi-Task Parallelism [15.325398725305774]
我々は,KVキャッシュをタスクや時間とともに共有する第1級のリソースとして扱う推論パラダイムであるKVキャッシュ管理を統一的に提案する。
OxyGenは、孤立実行よりも最大3.7$timesのスピードアップを実現し、200トークン/秒の言語スループットと70Hzのアクション周波数をアクション品質の劣化なしに同時に提供する。
論文 参考訳(メタデータ) (2026-03-15T13:23:56Z) - Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement [27.517125673741486]
VLA(Vision-Language-Action)モデルは、汎用的なロボット制御のための有望なパラダイムとして登場した。
マルチレベル静的および動的トークンに視覚入力をアンタングルするフレームワークであるSD-VLAを提案する。
本稿では,VLAの長期時間依存性モデリング機能をより効果的に評価する新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-03T20:17:47Z) - InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models [49.08289742711585]
我々は、Gated DeltaNetとSWA(Slide window attention)を相乗化する線形複雑VLMアーキテクチャであるInfiniteVLを提案する。
InfiniteVLは、一定のレイテンシとメモリフットプリントを維持しながら、3.6時間以上の推論高速化を実現する。
ストリーミングビデオ理解のシナリオでは、長期メモリキャッシュを保持しながら、24FPSのリアルタイムプリフィル速度を安定的に維持する。
論文 参考訳(メタデータ) (2025-12-09T17:18:32Z) - MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation [22.063033063941788]
MAP-VLA(Memory-Augmented Prompting for Vision-Language-Action Model)は、実証型メモリプロンプトによって訓練済みのVLAモデルを強化し、長距離ロボット操作タスクのためのアクション生成を可能にする新しいフレームワークである。
その結果、MAP-VLAは、シミュレーションベンチマークで7.0%の絶対的なパフォーマンス向上を達成でき、また、現在の最先端手法を超越した、長距離タスクにおける実際のロボット評価の25.0%を達成できることがわかった。
論文 参考訳(メタデータ) (2025-11-12T17:56:13Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z) - MiniVLM: A Smaller and Faster Vision-Language Model [76.35880443015493]
MiniVLMは視覚特徴抽出器と視覚言語融合モジュールの2つのモジュールで構成されている。
MiniVLMはモデルサイズを73%$、推論時間コストを94%$に削減する。
論文 参考訳(メタデータ) (2020-12-13T03:02:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。