論文の概要: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference
- arxiv url: http://arxiv.org/abs/2607.12659v2
- Date: Fri, 17 Jul 2026 02:24:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.235457
- Title: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference
- Title(参考訳): Jetson-PI:Foresight-Aligned Asynchronous Inferenceによる実時間ロボット制御を目指して
- Authors: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li,
- Abstract要約: VLA(Vision-Language-Action)モデルは、様々な実施タスクにおいて印象的なパフォーマンスを実現している。
Jetson Orinのような低消費電力オンボードデバイスにVLAモデルをデプロイすることは、高い計算複雑性のため、依然として困難である。
非同期推論は、アクション実行とその後の推論を並列化することで、このレイテンシを部分的に隠蔽することができるが、認識実行ミスアライメントと長時間のリアクションタイムという、2つの重要な問題が発生する。
我々は、Foresight-Aligned Asynchronous Correctionを介して、オンボードデバイス上でのVLAの効率的なデプロイ方法であるJetson-PIを提案する。
- 参考スコア(独自算出の注目度): 23.424767173051404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have achieved impressive performance on diverse embodied tasks. However, deploying VLA models on low-power onboard devices, such as the Jetson Orin, remains challenging due to their high computational complexity, which leads to substantial inference latency and low control frequency. Asynchronous inference can partially mask this latency by parallelizing action execution and subsequent inference, but it introduces two critical issues: perception-execution misalignment and long reaction time. In this paper, we propose Jetson-PI, a method for efficient VLA deployment on onboard devices via Foresight-Aligned Asynchronous Correction. To address misalignment, we train a lightweight future correction module that predicts future environment representation conditioned on committed actions, enabling the action expert to directly predict actions from the future time step. To reduce reaction time, we introduce confidence-based scheduling optimization that adaptively balances VLM and action expert invocations, complemented by system-level accelerations including CUDA graph reuse, GPU-resident intermediate buffering, and flow unrolling. Extensive experiments demonstrate that Jetson-PI achieves 8.66x and 5.41x improvements in control frequency compared with naive PyTorch and vla.cpp on NVIDIA Jetson Orin, while outperforming VLASH by 14.8\% in average success rate on the LIBERO benchmark. The code of our asynchronous algorithm is available on https://github.com/PKU-SEC-Lab/Jetson-PI, and our efficient llama.cpp-based inference engine is available on https://github.com/PKU-SEC-Lab/Jetson-PI-Edge.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、様々な実施タスクにおいて印象的なパフォーマンスを実現している。
しかしながら、Jetson Orinのような低消費電力のオンボードデバイスにVLAモデルをデプロイすることは、高い計算複雑性のために依然として難しい。
非同期推論は、アクション実行とその後の推論を並列化することで、このレイテンシを部分的に隠蔽することができるが、認識実行ミスアライメントと長時間のリアクションタイムという、2つの重要な問題が発生する。
本稿では,Foresight-Aligned Asynchronous Correctionによるデバイス上でのVLAの効率的なデプロイ手法であるJetson-PIを提案する。
そこで我々は,行動専門家が今後の行動から行動を直接予測できるようにするために,行動行動に規定された将来の環境表現を予測する軽量な将来の修正モジュールを訓練する。
反応時間を削減するために, CUDAグラフの再利用, GPU-resident 中間バッファリング, フローアンローリングなど, システムレベルのアクセラレーションを補完する, VLM とアクションエキスパートの呼び出しを適応的にバランスさせる信頼性ベースのスケジューリングアルゴリズムを導入する。
大規模な実験により、Jetson-PIはNVIDIA Jetson OrinのPyTorchやvla.cppに比べて制御周波数が8.66倍および5.41倍改善され、LIBEROベンチマークでは平均成功率の14.8%を上回った。
非同期アルゴリズムのコードはhttps://github.com/PKU-SEC-Lab/Jetson-PIで、効率的なllama.cppベースの推論エンジンはhttps://github.com/PKU-SEC-Lab/Jetson-PI-Edgeで利用可能です。
関連論文リスト
- Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference [19.683948028719808]
VLA(Vision-Language-Action)モデルは、ロボット操作の強力な一般化を示すが、その高い推論遅延はリアルタイムデプロイメントを制限する。
本稿では,知覚と行動生成の両面での計算量を削減するシステムレベル加速戦略を提案する。
Libero、RobotWin、Real Robot Platformsの実験では、ハイパフォーマンスを維持しながら、2倍以上のスピードアップを実証している。
論文 参考訳(メタデータ) (2026-07-14T02:48:31Z) - Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators [1.9955035892352748]
大規模言語モデル(LLM)は、レイテンシとコストに敏感な設定にますますデプロイされている。
最近の推論システムは、実行をプリフィルとデコードフェーズに分解し、異なる計算特性を示す。
本稿では、一般的なモデルであるLlama2-7Bを用いて、GPUおよび新興AIアクセラレータ間でのLLM推論性能の位相認識評価を行う。
論文 参考訳(メタデータ) (2026-06-14T12:23:29Z) - DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? [57.585275546688116]
VLM(Vision-Language Models)は、エンボディエージェントの高レベルプランナーとしてますます普及している。
テストタイムの計算をいつ、どこで使うかを選択することは、実際の世界にフロンティアパフォーマンスをもたらす中心である、と私たちは主張する。
我々はマルチモーダルシーンコンテキストを用いてプロンプト毎に計算を割り当てるルーティングフレームワークであるDIRECTを紹介した。
論文 参考訳(メタデータ) (2026-06-10T17:58:49Z) - Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment [8.758783768535805]
VLA(Vision-Language-Action)モデルは、一般的なロボット制御に期待できるが、ロボット上での展開は、コストとエネルギー予算の厳しいリアルタイム推論によってボトルネックとなる。
本稿では,モデル・ハードウエアのコキャラクタリゼーションによる低コストVLAデプロイメントの系統的解析を行う。
論文 参考訳(メタデータ) (2026-04-27T13:12:16Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - VLA-RAIL: A Real-Time Asynchronous Inference Linker for VLA Models and Robots [5.308743386891208]
VLA(Vision-Language-Action)モデルは、ロボット工学において画期的な進歩を遂げた。
連続したアクションチャンクのキューを融合する戦略は、VLAモデル全体のパフォーマンスに大きな影響を与える。
既存の方法は、ロボットアクションの実行時にジッタ、ストール、あるいは停止に悩まされる。
本稿では,モデル推論とロボット動作制御を非同期に行うように設計された新しいフレームワークであるVLA-RAILを紹介する。
論文 参考訳(メタデータ) (2025-12-31T06:59:42Z) - VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference [24.248289541718275]
非同期推論は、連続および低レイテンシ制御を実現するための有望なソリューションを提供する。
本稿では,ビジョン・ランゲージ・アクションモデルのための一般的な非同期推論フレームワークであるVLASHを提案する。
追加のオーバーヘッドやアーキテクチャの変更なしに、スムーズで、正確で、高速な反応制御を提供する。
論文 参考訳(メタデータ) (2025-11-30T18:59:24Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - Real-Time Execution of Action Chunking Flow Policies [49.1574468325115]
本稿では,アクションインタラクションシステムの非同期実行を可能にする新しい推論時アルゴリズムを提案する。
これは、再トレーニングなしでボックスから実行する拡散またはVLAベースのシステムに適用できる。
その結果、RTCは高速で、性能が高く、推論操作に対して一意に堅牢であることがわかった。
論文 参考訳(メタデータ) (2025-06-09T01:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。