論文の概要: RAVEL: Asynchronous Rolling Inference for Flow-Based Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.34170v1
- Date: Mon, 28 Sep 2026 02:45:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 06:14:06.815157
- Title: RAVEL: Asynchronous Rolling Inference for Flow-Based Vision-Language-Action Models
- Title(参考訳): RAVEL:フローベースビジュアルランゲージ・アクションモデルのための非同期圧延推論
- Abstract要約: フローベース視覚言語アクション(VLA)モデルは、汎用ロボット操作に非常に効果的である。
計算コストのかかるVLMエンコーディングとマルチステップ反復アクション生成に依存しているため、大きな遅延ボトルネックが生じる。
本稿では、VLMバックボーンとアクションエキスパートの両方の計算ボトルネックに対処する非同期推論フレームワークであるRAVELを用いて、この制限に対処する。
- 参考スコア(独自算出の注目度): 65.30288525352879
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Flow-based vision-language-action (VLA) models are highly effective for generalist robot manipulation, yet their reliance on computationally expensive VLM encoding and multi-step iterative action generation imposes a significant latency bottleneck. The resulting inference latency makes it difficult for robots to respond quickly, especially in dynamic environments. We address this limitation with RAVEL (Rolling Asynchronous VLA Enabling Low-Latency Control), an asynchronous inference framework that addresses the computational bottlenecks of both the VLM backbone and the action expert. To reduce the delay from multi-step action denoising, RAVEL allows near-term actions to be executed after a single denoising step by carrying partially denoised future actions forward in a rolling buffer. To avoid blocking on slow VLM encoding, RAVEL decouples VLM encoding from rolling action generation, allowing the action expert to operate continuously using the latest available VLM context, while a lightweight Fast Observation Pathway (FOP) directly conditions the action expert on current observations. Across simulated and real-world manipulation tasks, RAVEL consistently achieves substantially lower response latency while maintaining the task capability of the underlying VLA, enabling high-frequency and responsive closed-loop control.
- Abstract(参考訳): フローベース視覚言語行動モデル(VLA)は汎用ロボット操作において非常に効果的であるが、計算コストのかかるVLMエンコーディングと多段階反復行動生成に依存しているため、大きな遅延ボトルネックが生じる。
結果として生じる推論レイテンシは、特に動的環境において、ロボットの迅速な応答を困難にしている。
本稿では、VLMバックボーンとアクションエキスパートの両方の計算ボトルネックに対処する非同期推論フレームワークであるRAVEL(Rolling Asynchronous VLA Enabling Low-Latency Control)を用いて、この制限に対処する。
マルチステップ動作復調の遅れを軽減するため、RAVELはローリングバッファに部分的に復調された将来の動作を前方に移動させることで、単一復調ステップ後の短期動作の実行を可能にする。
遅いVLMエンコーディングのブロックを避けるため、RAVELはVLMエンコーディングをローリングアクション生成から切り離し、アクションエキスパートが最新のVLMコンテキストを使用して継続的に動作できるようにする。
シミュレーションおよび実世界の操作タスク全体にわたって、RAVELは基盤となるVLAのタスク能力を維持しながら、応答遅延を大幅に低減し、高周波かつ応答性の高いクローズループ制御を可能にする。
関連論文リスト
- FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference [13.128933240091419]
FlashVLAはVision-Language-Action(VLA)モデルのストリーミングアクションデコーディングフレームワークである。
強いタスク性能を維持しながら、推論速度を大幅に改善する。
現実世界のデプロイメントにおいて、スムーズな非同期推論を備えた単一のGPU上で、$geq$30,Hzの制御周波数を達成することができる。
論文 参考訳(メタデータ) (2026-08-27T17:19:29Z) - Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models [26.864668803085888]
VLA(Vision-Language-Action Model)は、ロボット操作において強力なタスク理解と一般化を実証している。
本稿では,意味的理解と行動生成を分離する非同期なセマンティック・アクション・デカップリング・フレームワークを提案する。
提案手法は,最大35.6Hzのサーバ側動作モジュール推論スループットを実現し,高周波クローズドループ制御への低侵襲パスを提供する。
論文 参考訳(メタデータ) (2026-06-13T12:49:42Z) - StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation [30.881585159777714]
視覚言語アクション(VLA)モデルは、自然言語による知覚と制御において例外的な性能を示した。
VLAモデルの高い計算コストは、大きな効率上の課題をもたらす。
本稿では,VLAステージ間で非同期並列化が可能なVLAを実現することを提案する。
論文 参考訳(メタデータ) (2026-03-30T15:23:27Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - Mean-Flow based One-Step Vision-Language-Action [15.497933767026568]
FlowMatchingベースのVision-Language-Action(VLA)フレームワークは、高周波アクションチャンクを生成する上で、顕著なアドバンテージを示している。
それらは、本質的に反復的なサンプリング要件とアーキテクチャ上の制限から生じる、世代遅延の延長によって制約される。
本稿では,アクション生成プロセスにおけるノイズによる問題を解消する,平均フローに基づくワンステップVLA手法を提案する。
論文 参考訳(メタデータ) (2026-03-02T05:30:30Z) - AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge [49.66156306240961]
高レイテンシは制御ループを壊し、リアルタイムデプロイメントでは安全でない強力なモデルをレンダリングする。
リアクティブ実行からセマンティック推論を分離する非同期制御フレームワークであるAsyncVLAを提案する。
AsyncVLAは、最先端のベースラインよりも40%高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-13T21:31:19Z) - VLA-RAIL: A Real-Time Asynchronous Inference Linker for VLA Models and Robots [5.308743386891208]
VLA(Vision-Language-Action)モデルは、ロボット工学において画期的な進歩を遂げた。
連続したアクションチャンクのキューを融合する戦略は、VLAモデル全体のパフォーマンスに大きな影響を与える。
既存の方法は、ロボットアクションの実行時にジッタ、ストール、あるいは停止に悩まされる。
本稿では,モデル推論とロボット動作制御を非同期に行うように設計された新しいフレームワークであるVLA-RAILを紹介する。
論文 参考訳(メタデータ) (2025-12-31T06:59:42Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。