論文の概要: Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization
- arxiv url: http://arxiv.org/abs/2608.00569v1
- Date: Sat, 01 Aug 2026 10:11:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.781956
- Title: Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization
- Title(参考訳): 創発的表現スペシャライゼーションによる遅延耐性クラウドエッジ協調ビジョン・ランゲージ・アクションモデル
- Authors: Daojie Peng, Fulong Ma, Bingtao Wang, Sheng Wang, Jun Ma,
- Abstract要約: CloudEdgeVLAは、時間的ミスアライメントを表現学習問題として扱うクラウドエッジポリシーである。
軽量エッジヘッドは、最新のクラウド機能と現在のローカルビジョンを組み合わせたものだ。
CloudEdgeVLAは63.8--78.0%の成功を維持し、40ステップの均一遅延ウィンドウを持つ。
- 参考スコア(独自算出の注目度): 6.831202558046453
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying billion-parameter Vision-Language-Action (VLA) policies on mobile robots creates a systems conflict: semantic reasoning benefits from cloud GPUs, whereas closed-loop control must respond locally despite network delay and jitter. Existing hierarchical and asynchronous policies improve throughput, but their slow-path representations can still arrive stale or require explicit scheduling and delay cues. We introduce CloudEdgeVLA, a cloud-edge policy that treats temporal misalignment as a representation-learning problem. A cloud VLA encodes delayed observations into slowly varying task features, while a lightweight edge head combines the latest available cloud feature with current local vision. During training, current and randomly delayed frames are paired with the same current action target in fresh and stale paths. This objective encourages the cloud representation to preserve task-level information while the edge path supplies state-sensitive corrections. Across four LIBERO suites, CloudEdgeVLA retains 63.8--78.0% success with a 40-step uniform-delay window, whereas VLASH reaches at most 6.4% and the evaluated single-path baselines at most 3.0%. By removing blocking synchronization from the control loop, the design offers a practical route to scalable VLA deployment in which cloud models can grow while edge computation remains lightweight and responsive.
- Abstract(参考訳): 数十億パラメータのVision-Language-Action(VLA)ポリシをモバイルロボットにデプロイすると、システム競合が発生する。クラウドGPUによるセマンティック推論のメリットに対して、クローズドループコントロールはネットワーク遅延やジッタにもかかわらず、ローカルで応答する必要がある。
既存の階層的および非同期なポリシによってスループットが向上するが、遅いパス表現は依然として安定しているか、明示的なスケジューリングと遅延の方法を必要とする可能性がある。
CloudEdgeVLAは、時間的ミスアライメントを表現学習問題として扱うクラウドエッジポリシーである。
クラウドVLAは遅延観測をゆっくりと変化するタスク機能にエンコードし、軽量エッジヘッドは最新のクラウド機能と現在のローカルビジョンを組み合わせたものだ。
トレーニング中、電流とランダムに遅延したフレームは、新しいパスと古いパスで同じ現在のアクションターゲットとペアリングされる。
この目的は、エッジパスが状態に敏感な修正を提供する間、クラウド表現がタスクレベルの情報を保存することを奨励する。
4つのLIBEROスイートの中で、CloudEdgeVLAは、40ステップの均一遅延ウィンドウで63.8--78.0%の成功を維持し、VLASHは6.4%、評価シングルパスベースラインは3.0%である。
制御ループからブロッキング同期を取り除くことで、エッジ計算が軽量で応答性を維持しながらクラウドモデルを成長させる、スケーラブルなVLAデプロイメントへの実践的な経路を提供する。
関連論文リスト
- LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference [0.8633013637160062]
マルチモーダル推論のための軽量エッジクラウドルーティングシステム INAR-VL を2層配置で提案する。
INAR-VLはエッジ上で36%のリクエストを実行し、レイテンシを24%削減し、エネルギーを26%削減し、クラウドレベルの精度を97%維持することを示した。
論文 参考訳(メタデータ) (2026-05-13T12:44:10Z) - Progressive Semantic Communication for Efficient Edge-Cloud Vision-Language Models [0.3004066195320147]
VLM(Vision-Language Models)は、リソース制約のある組み込みプラットフォームへのデプロイが困難である。
クラウドへの完全なオフロード推論は、帯域幅に制限のある環境では現実的ではないことが多い。
エッジクラウドVLM推論のためのプログレッシブセマンティック通信フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T10:16:06Z) - AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation [21.033021862213825]
AsyncShieldは非同期ナビゲーションのためのプラグイン・アンド・プレイコントロールフレームワークである。
システムは拘束されたマルコフ決定プロセスを使用して、意図回復の忠実性と物理的安全性のバランスをとる。
AsyncShieldは軽量なプラグイン・アンド・プレイモジュールとして動作する。
論文 参考訳(メタデータ) (2026-04-27T06:20:15Z) - Speculative Policy Orchestration: A Latency-Resilient Framework for Cloud-Robotic Manipulation [6.709418204725671]
クラウドロボティクスは、ロボットが高次元のモーションプランニングと推論をリモートサーバーにオフロードすることを可能にする。
高周波制御を必要とする継続的な操作のために、ネットワーク遅延とジッタはシステムを不安定にすることができる。
我々は,遅延耐性のクラウドエッジフレームワークである投機的ポリシーオーケストレーション(SPO)を提案する。
論文 参考訳(メタデータ) (2026-03-19T19:24:14Z) - AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge [49.66156306240961]
高レイテンシは制御ループを壊し、リアルタイムデプロイメントでは安全でない強力なモデルをレンダリングする。
リアクティブ実行からセマンティック推論を分離する非同期制御フレームワークであるAsyncVLAを提案する。
AsyncVLAは、最先端のベースラインよりも40%高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-13T21:31:19Z) - InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models [49.08289742711585]
我々は、Gated DeltaNetとSWA(Slide window attention)を相乗化する線形複雑VLMアーキテクチャであるInfiniteVLを提案する。
InfiniteVLは、一定のレイテンシとメモリフットプリントを維持しながら、3.6時間以上の推論高速化を実現する。
ストリーミングビデオ理解のシナリオでは、長期メモリキャッシュを保持しながら、24FPSのリアルタイムプリフィル速度を安定的に維持する。
論文 参考訳(メタデータ) (2025-12-09T17:18:32Z) - Fast and Cost-effective Speculative Edge-Cloud Decoding with Early Exits [11.398891065175686]
大型言語モデル(LLM)は、スマートフォン、ウェアラブル、エンボディロボットなどのエッジデバイス上の様々なアプリケーションを可能にする。
LLMはデバイス上でデプロイ可能で、レイテンシを低減し、プライバシを改善したコスト効率の高いソリューションを提供する。
本稿では,サーバ上での大きなターゲットモデルとデバイス上での小さなドラフトモデルを備えた,高速で費用対効果の高いエッジクラウドデコーディングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-27T14:55:16Z) - Mitigating Prior Shape Bias in Point Clouds via Differentiable Center Learning [15.132585178169423]
微分可能中心サンプリングネットワーク(DCS-Net)と呼ばれる新しいソリューションを導入する。
グローバルな特徴再構成とローカルな特徴再構成の両方を非自明なプロキシタスクとして組み込むことで,情報漏洩問題に対処する。
実験により,本手法は既存の点雲モデルの表現能力を向上することを示した。
論文 参考訳(メタデータ) (2024-02-03T08:58:23Z) - Tailored Learning-Based Scheduling for Kubernetes-Oriented Edge-Cloud
System [54.588242387136376]
エッジクラウドシステムのための学習ベースのスケジューリングフレームワークkaisを紹介する。
まず,分散した要求ディスパッチに対応するために,協調型マルチエージェントアクタ-クリティックアルゴリズムを設計する。
次に,多種多様なシステムスケールと構造について,グラフニューラルネットワークを用いてシステム状態情報を埋め込む。
第3に、リクエストディスパッチとサービスオーケストレーションを調和させる2段階のスケジューリングメカニズムを採用します。
論文 参考訳(メタデータ) (2021-01-17T03:45:25Z) - Pseudo-LiDAR Point Cloud Interpolation Based on 3D Motion Representation
and Spatial Supervision [68.35777836993212]
我々はPseudo-LiDAR点雲ネットワークを提案し、時間的および空間的に高品質な点雲列を生成する。
点雲間のシーンフローを活用することにより,提案ネットワークは3次元空間運動関係のより正確な表現を学習することができる。
論文 参考訳(メタデータ) (2020-06-20T03:11:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。