論文の概要: Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2606.25985v1
- Date: Wed, 24 Jun 2026 15:53:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.390148
- Title: Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models
- Title(参考訳): Action ControlNet:視覚・言語・アクションモデルにおける平滑な非同期制御のための軽量遅延認識アダプタ
- Authors: Tiecheng Guo, Meng Guo,
- Abstract要約: Action ControlNet (ACNet) は、視覚言語-アクションモデルのための軽量遅延対応アダプタである。
ACNetは推論遅延下で堅牢性を改善し、直接チャンクストレよりもスムーズな非同期軌道を得る。
- 参考スコア(独自算出の注目度): 2.1822977353368778
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models have shown strong potential for general-purpose robot manipulation, but their inference latency remains a major obstacle to stable high-frequency control. Asynchronous execution mitigates this bottleneck by overlapping policy inference with action execution, yet the next action chunk is still predicted from stale observations while the robot continues to move. Direct chunk stitching therefore introduces handoff discontinuities, action jitter, and failures in contact-rich manipulation. Existing remedies typically require either full-policy retraining or architecture-specific runtime logic. This work proposes Action ControlNet (ACNet), a lightweight delay-aware adapter that uses the executed motion suffix as a residual condition for a mostly frozen action head. ACNet leaves the pretrained backbone unchanged, introduces few trainable parameters, and remains compatible with generative action heads such as diffusion and flow matching. On Kinetix, Meta-World MT50, and a real-world SO-ARM101 platform, ACNet improves robustness under inference delay and yields smoother asynchronous trajectories than direct chunk stitching, while remaining more lightweight than full delay-conditioned retraining.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは汎用ロボット操作の強い可能性を示しているが、その推論遅延は安定した高周波制御の主要な障害である。
非同期実行は、ポリシー推論とアクション実行を重複させることで、このボトルネックを軽減するが、ロボットが動き続ける間、次のアクションチャンクは古い観察から予測される。
したがって、直接縫合は、ハンドオフの不連続、アクションジッタ、コンタクトリッチな操作の失敗をもたらす。
既存のリメディエーションは、一般的にフルポリティリトレーニングかアーキテクチャ固有のランタイムロジックのいずれかを必要とする。
本研究は,動作サフィックスを大部分が凍結した動作ヘッドの残条件として使用する軽量遅延認識アダプタであるAction ControlNet(ACNet)を提案する。
ACNetはトレーニング済みのバックボーンをそのまま残し、トレーニング可能なパラメータをほとんど導入せず、拡散やフローマッチングといった生成アクションヘッドと互換性がある。
Kinetix、Meta-World MT50、および現実世界のSO-ARM101プラットフォームでは、ACNetは推論遅延時の堅牢性を改善し、直接チャンクストレッチよりもスムーズな非同期トラジェクトリを提供する。
関連論文リスト
- Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models [26.864668803085888]
VLA(Vision-Language-Action Model)は、ロボット操作において強力なタスク理解と一般化を実証している。
本稿では,意味的理解と行動生成を分離する非同期なセマンティック・アクション・デカップリング・フレームワークを提案する。
提案手法は,最大35.6Hzのサーバ側動作モジュール推論スループットを実現し,高周波クローズドループ制御への低侵襲パスを提供する。
論文 参考訳(メタデータ) (2026-06-13T12:49:42Z) - DEFLECT: Delay-Robust Execution via Flow-matching Likelihood-Estimated Counterfactual Tuning for VLA Policies [12.248643831532663]
DEFLECTは、非同期VLA制御の使用可能な遅延エンベロープを大幅に拡張し、高遅延状態(5-7制御ステップ)で+6.4の成功率を、最も長い遅延時間で実スケールVLAに移行すると+4.6とした。
論文 参考訳(メタデータ) (2026-05-19T03:14:11Z) - DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors [57.944744187489185]
外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
論文 参考訳(メタデータ) (2026-04-27T23:04:03Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy [52.106797722292896]
我々は,チャンクベースのアクション生成とリアルタイム修正を統合した動的クローズドループ拡散ポリシーフレームワークDCDPを提案する。
動的PushTシミュレーションでは、DCDPは5%の計算しか必要とせず、再トレーニングなしに適応性を19%改善する。
論文 参考訳(メタデータ) (2026-03-02T15:04:18Z) - AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge [49.66156306240961]
高レイテンシは制御ループを壊し、リアルタイムデプロイメントでは安全でない強力なモデルをレンダリングする。
リアクティブ実行からセマンティック推論を分離する非同期制御フレームワークであるAsyncVLAを提案する。
AsyncVLAは、最先端のベースラインよりも40%高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-13T21:31:19Z) - VLA-RAIL: A Real-Time Asynchronous Inference Linker for VLA Models and Robots [5.308743386891208]
VLA(Vision-Language-Action)モデルは、ロボット工学において画期的な進歩を遂げた。
連続したアクションチャンクのキューを融合する戦略は、VLAモデル全体のパフォーマンスに大きな影響を与える。
既存の方法は、ロボットアクションの実行時にジッタ、ストール、あるいは停止に悩まされる。
本稿では,モデル推論とロボット動作制御を非同期に行うように設計された新しいフレームワークであるVLA-RAILを紹介する。
論文 参考訳(メタデータ) (2025-12-31T06:59:42Z) - Controllable Long-term Motion Generation with Extended Joint Targets [5.580967710862411]
COMETはリアルタイムに動作する自動回帰フレームワークであり、汎用的な文字制御と堅牢な長距離合成を可能にする。
我々のTransformerベースの条件付きVAEは、任意のユーザ特定関節を正確にインタラクティブに制御できる。
この機構はプラグイン・アンド・プレイのスタイリングモジュールとしても機能し、リアルタイムのスタイル転送を可能にする。
論文 参考訳(メタデータ) (2025-12-04T05:44:15Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - Real-Time Execution of Action Chunking Flow Policies [49.1574468325115]
本稿では,アクションインタラクションシステムの非同期実行を可能にする新しい推論時アルゴリズムを提案する。
これは、再トレーニングなしでボックスから実行する拡散またはVLAベースのシステムに適用できる。
その結果、RTCは高速で、性能が高く、推論操作に対して一意に堅牢であることがわかった。
論文 参考訳(メタデータ) (2025-06-09T01:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。