論文の概要: VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference
- arxiv url: http://arxiv.org/abs/2512.01031v1
- Date: Sun, 30 Nov 2025 18:59:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-02 19:46:34.546873
- Title: VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference
- Title(参考訳): VLASH: 将来対応型非同期推論によるリアルタイムVLA
- Abstract要約: 非同期推論は、連続および低レイテンシ制御を実現するための有望なソリューションを提供する。
本稿では,ビジョン・ランゲージ・アクションモデルのための一般的な非同期推論フレームワークであるVLASHを提案する。
追加のオーバーヘッドやアーキテクチャの変更なしに、スムーズで、正確で、高速な反応制御を提供する。
- 参考スコア(独自算出の注目度): 24.248289541718275
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action models (VLAs) are becoming increasingly capable across diverse robotic tasks. However, their real-world deployment remains slow and inefficient: demonstration videos are often sped up by 5-10x to appear smooth, with noticeable action stalls and delayed reactions to environmental changes. Asynchronous inference offers a promising solution to achieve continuous and low-latency control by enabling robots to execute actions and perform inference simultaneously. However, because the robot and environment continue to evolve during inference, a temporal misalignment arises between the prediction and execution intervals. This leads to significant action instability, while existing methods either degrade accuracy or introduce runtime overhead to mitigate it. We propose VLASH, a general asynchronous inference framework for VLAs that delivers smooth, accurate, and fast reaction control without additional overhead or architectural changes. VLASH estimates the future execution-time state by rolling the robot state forward with the previously generated action chunk, thereby bridging the gap between prediction and execution. Experiments show that VLASH achieves up to 2.03x speedup and reduces reaction latency by up to 17.4x compared to synchronous inference while fully preserving the original accuracy. Moreover, it empowers VLAs to handle fast-reaction, high-precision tasks such as playing ping-pong and playing whack-a-mole, where traditional synchronous inference fails. Code is available at https://github.com/mit-han-lab/vlash
- Abstract(参考訳): VLA(Vision-Language-Action Model)は、多様なロボットタスクにまたがる能力が高まっている。
しかし、実世界の展開は遅く、非効率であり、デモビデオはスムーズに見え、顕著な動作停止と環境変化に対する遅延反応を伴う5~10倍の速度で再生されることが多い。
非同期推論は、ロボットが動作を実行し、同時に推論を実行することによって、連続かつ低レイテンシ制御を実現するための有望なソリューションを提供する。
しかし、ロボットと環境は推論中に進化し続けるため、予測と実行間隔の間に時間的ミスアライメントが発生する。
既存のメソッドは精度を低下させるか、ランタイムオーバーヘッドを導入してそれを緩和する。
オーバヘッドやアーキテクチャの変更を伴わずにスムーズで正確で高速な反応制御を実現するVLASHという,VLAのための一般的な非同期推論フレームワークを提案する。
VLASHは、ロボット状態を予め生成したアクションチャンクで前方に回転させることで、将来の実行時刻を推定し、予測と実行のギャップを埋める。
実験によると、VLASHは最大2.03倍のスピードアップを実現し、元の精度を保ちながら同期推論と比較して最大17.4倍の遅延を減少させる。
さらに、VLAは、従来の同期推論が失敗するping-pongやwack-a-moleなどの高速で高精度なタスクを処理することができる。
コードはhttps://github.com/mit-han-lab/vlashで入手できる。
関連論文リスト
- FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference [13.128933240091419]
FlashVLAはVision-Language-Action(VLA)モデルのストリーミングアクションデコーディングフレームワークである。
強いタスク性能を維持しながら、推論速度を大幅に改善する。
現実世界のデプロイメントにおいて、スムーズな非同期推論を備えた単一のGPU上で、$geq$30,Hzの制御周波数を達成することができる。
論文 参考訳(メタデータ) (2026-08-27T17:19:29Z) - StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution [50.18922379062543]
フィードバックフローマッチング(Feedback Flow Matching, FBFM)は、アクティブに生成されたチャンク内で再接地を行うトレーニング不要な推論機構である。
トレーニング不要であるため、このメカニズムは予期せぬ事象に対する応答性を改善し、長時間の作業におけるドリフトを抑制する。
我々は,FBFMを第2世代WAMと第2世代WAMの両方で評価した。
論文 参考訳(メタデータ) (2026-07-31T10:11:09Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference [23.424767173051404]
VLA(Vision-Language-Action)モデルは、様々な実施タスクにおいて印象的なパフォーマンスを実現している。
Jetson Orinのような低消費電力オンボードデバイスにVLAモデルをデプロイすることは、高い計算複雑性のため、依然として困難である。
非同期推論は、アクション実行とその後の推論を並列化することで、このレイテンシを部分的に隠蔽することができるが、認識実行ミスアライメントと長時間のリアクションタイムという、2つの重要な問題が発生する。
我々は、Foresight-Aligned Asynchronous Correctionを介して、オンボードデバイス上でのVLAの効率的なデプロイ方法であるJetson-PIを提案する。
論文 参考訳(メタデータ) (2026-07-14T11:38:36Z) - DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model [6.247270890079242]
ビジョン言語アクション(VLA)モデルは、視覚言語事前学習から共有同期クロックを継承し、全ての入力を1レートで処理する。
同期VLAは遅いモダリティをオーバーサンプリングし、高速なモダリティをアンサンプし、最低有効周波数でアクション生成をカプセル化する。
DAM-VLAは,センサレートでリフレッシュされたモードごとの潜伏バッファを保持し,アクションヘッドで連続して読み取る。
論文 参考訳(メタデータ) (2026-06-10T13:59:07Z) - OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation [55.56490813640669]
VLAモデルは典型的には現在のフレームにのみ作用するが、将来の予測とオブジェクト認識推論は別々の潜在空間でしばしば学習される。
本稿では,時間的フォアシークエンスとオブジェクト認識推論を共通化することで,制約に対処するフレームワークOFlowを提案する。
提案手法は, 時間的フローマッチングを用いて将来の潜伏者を予測し, 物理的に関係のある手がかりを強調するオブジェクト認識表現に分解する。
論文 参考訳(メタデータ) (2026-04-20T06:38:01Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge [49.66156306240961]
高レイテンシは制御ループを壊し、リアルタイムデプロイメントでは安全でない強力なモデルをレンダリングする。
リアクティブ実行からセマンティック推論を分離する非同期制御フレームワークであるAsyncVLAを提案する。
AsyncVLAは、最先端のベースラインよりも40%高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-13T21:31:19Z) - Real-Time Robot Execution with Masked Action Chunking [38.37108371991901]
ロボットのようなサイバー物理システムにはリアルタイム実行が不可欠である。
近年,リアルタイムロボット操作のためのシステムレベルのパラダイムとして,非同期推論が登場している。
本稿では,マスクされたアクションチャンキングによって事前訓練されたポリシーの修正を学習するREMACを提案する。
論文 参考訳(メタデータ) (2026-01-27T23:48:32Z) - TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control [15.534182843429043]
大規模なVision-Language-Action(VLA)モデルはセマンティックな一般化を提供するが、高い推論遅延に悩まされる。
本稿では,高頻度動作から意味論的推論を分離する階層型フレームワークであるTIDALを提案する。
TIDALは、二重周波数アーキテクチャを用いて拡散ベースのVLAのためのバックボーンに依存しないモジュールとして動作する。
論文 参考訳(メタデータ) (2026-01-21T12:43:11Z) - VLA-RAIL: A Real-Time Asynchronous Inference Linker for VLA Models and Robots [5.308743386891208]
VLA(Vision-Language-Action)モデルは、ロボット工学において画期的な進歩を遂げた。
連続したアクションチャンクのキューを融合する戦略は、VLAモデル全体のパフォーマンスに大きな影響を与える。
既存の方法は、ロボットアクションの実行時にジッタ、ストール、あるいは停止に悩まされる。
本稿では,モデル推論とロボット動作制御を非同期に行うように設計された新しいフレームワークであるVLA-RAILを紹介する。
論文 参考訳(メタデータ) (2025-12-31T06:59:42Z) - Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation [10.09057399213028]
Vision-Language-Action(VLA)システムは、意味論的推論のためのVision-Language Model(VLM)と、連続的なアクション信号を生成するアクションエキスパートを統合する。
本稿では,非同期なFast-Slow VLAフレームワーク(DuoCore-FS)を導入し,アクション生成のための高速経路とリッチなVLM推論のための遅い経路にシステムを編成する。
論文 参考訳(メタデータ) (2025-12-23T09:28:20Z) - Stable Video Infinity: Infinite-Length Video Generation with Error Recycling [76.91310169118408]
本研究では、高時間一貫性、可視的シーン遷移、制御可能なストリーミングストーリーラインを有する無限長ビデオを生成することができる安定ビデオインフィニティ(SVI)を提案する。
SVIにはError-Recycling Fine-Tuningが組み込まれており、これはDiffusion Transformerの自己生成エラーをスーパーバイザのプロンプトにリサイクルする、新しいタイプの効率的なトレーニングである。
我々は、一貫性、創造性、条件設定を含む3つのベンチマークでSVIを評価し、その汎用性と最先端の役割を徹底的に検証した。
論文 参考訳(メタデータ) (2025-10-10T09:45:46Z) - dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought [66.78110237549087]
VLA(Vision-Language-Action)モデルは、ロボット工学の次世代パラダイムとして登場しつつある。
単一システムにおける視覚認識,言語推論,ロボット制御を統一する拡散型VLAであるdVLAを紹介する。
論文 参考訳(メタデータ) (2025-09-30T02:36:11Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - Real-Time Execution of Action Chunking Flow Policies [49.1574468325115]
本稿では,アクションインタラクションシステムの非同期実行を可能にする新しい推論時アルゴリズムを提案する。
これは、再トレーニングなしでボックスから実行する拡散またはVLAベースのシステムに適用できる。
その結果、RTCは高速で、性能が高く、推論操作に対して一意に堅牢であることがわかった。
論文 参考訳(メタデータ) (2025-06-09T01:01:59Z) - Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction [81.34648970317383]
本稿では,知覚,決定,反応を両立させるシステムであるDispiderを紹介する。
実験により、Dispiderは従来のビデオQAタスクにおいて高いパフォーマンスを維持しているだけでなく、ストリーミングシナリオ応答における従来のオンラインモデルを大幅に上回っていることがわかった。
論文 参考訳(メタデータ) (2025-01-06T18:55:10Z) - One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation [80.71541671907426]
OneStep Diffusion Policy (OneDP)は、事前訓練された拡散政策から知識を単一ステップのアクションジェネレータに蒸留する新しいアプローチである。
OneDPはロボット制御タスクの応答時間を著しく短縮する。
論文 参考訳(メタデータ) (2024-10-28T17:54:31Z) - HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers [12.373320641721344]
大型ビジョンランゲージ・アクション(VLA)モデルは、その印象的な一般化能力のためにロボット制御において有望であることが示されている。
数十億のパラメータを持つVLMバックエンドへの依存は、高い計算コストと遅延推定につながる。
本稿では,柔軟な周波数・性能トレードオフを実現する階層型ロボットトランスフォーマフレームワークであるHiRTを提案する。
論文 参考訳(メタデータ) (2024-09-12T09:18:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。