論文の概要: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
- arxiv url: http://arxiv.org/abs/2607.06370v1
- Date: Tue, 07 Jul 2026 15:10:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.562152
- Title: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
- Title(参考訳): アクションキャッシング・リファインメントを用いたビジョンランゲージ・アクションモデルの学習自由加速
- Authors: Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki,
- Abstract要約: VLA(Vision-Language-Action)モデルは、汎用可能なロボット操作のための有望なアプローチとして登場した。
我々はActionCacheを提案する。ActionCacheはプラグイン・アンド・プレイの外部キャッシュで、過去の中間アクションをウォームスタート世代に再利用する。
シミュレーションおよび実環境における実験結果から、ActionCacheは低レイテンシのシステムにおいて高いタスク成功率を維持していることが示された。
- 参考スコア(独自算出の注目度): 1.0279917564173053
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have emerged as a promising approach for generalizable robotic manipulations. In particular, flow matching-based VLA models have shown remarkable success due to their capability to generate precise and smooth action sequences and capture multimodal distributions. However, the iterative denoising process in the action head acts as a major computational bottleneck, posing a critical challenge for real-time deployment. To address this challenge, we propose ActionCache, a plug-and-play external cache that opportunistically reuses past intermediate actions to warm-start generations from the vicinity of target actions, thereby drastically reducing the inference latency. Specifically, ActionCache stores the intermediate actions with compact multimodal keys, which enables retrieval from similar past contexts across different episodes or even different tasks. Experimental results in simulation and real-world environments demonstrate that ActionCache maintains high task success rates in a low-latency regime, achieving inference acceleration of up to $11.75\times$ and $34.43\times$ for representative flow-based VLA models, $π_{0.5}$ and GR00T-N1.6, respectively.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、汎用可能なロボット操作のための有望なアプローチとして登場した。
特に、フローマッチングに基づくVLAモデルは、正確にスムーズな動作シーケンスを生成し、マルチモーダル分布をキャプチャする能力により、顕著な成功を収めている。
しかし、アクションヘッドの反復的デノベーションプロセスは大きな計算ボトルネックとして機能し、リアルタイムデプロイメントにおいて重要な課題となっている。
この課題に対処するために、我々はActionCacheというプラグイン・アンド・プレイの外部キャッシュを提案し、このキャッシュは、過去の中間アクションを最適に再利用し、ターゲットアクションの近傍から世代をウォームスタートさせ、推論遅延を大幅に削減する。
具体的には、ActionCacheは、中間アクションをコンパクトなマルチモーダルキーで保存する。
シミュレーションおよび実世界の環境での実験結果から、ActionCacheは低レイテンシ環境で高いタスク成功率を維持しており、それぞれ11.75\times$と34.43\times$、π_{0.5}$、GR00T-N1.6の予測加速を実現している。
関連論文リスト
- A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation [30.881585159777714]
視覚言語アクション(VLA)モデルは、自然言語による知覚と制御において例外的な性能を示した。
VLAモデルの高い計算コストは、大きな効率上の課題をもたらす。
本稿では,VLAステージ間で非同期並列化が可能なVLAを実現することを提案する。
論文 参考訳(メタデータ) (2026-03-30T15:23:27Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching [23.52474883720957]
VLA(Vision-Language-Action)モデルは、視覚知覚と言語命令から直接のアクション生成を可能にする強力なマルチモーダル推論能力を示している。
本稿では,フレーム間の静的な視覚トークンを適応的にキャッシュ・再利用することにより,計算オーバーヘッドを低減する訓練不要な推論高速化手法であるVLA-Cacheを紹介する。
論文 参考訳(メタデータ) (2025-02-04T09:48:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。