論文の概要: FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking
- arxiv url: http://arxiv.org/abs/2607.24008v1
- Date: Mon, 27 Jul 2026 05:10:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.317604
- Title: FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking
- Title(参考訳): FutureRTC:予測型アクションチャンクによるリアルタイムロボット実行
- Authors: Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu,
- Abstract要約: FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
- 参考スコア(独自算出の注目度): 51.97839311685636
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time deployment of Vision-Language-Action (VLA) policies necessitates asynchronous execution, wherein subsequent action chunks are computed concurrently with the execution of the current chunk, leading to prediction-execution misalignment and manifesting as inter-chunk discontinuities. Existing methods either superficially smooth chunk boundaries, require costly policy optimization, or exclusively forward-predict proprioceptive states yet neglect critical visual observations. In this paper, we propose \textbf{FutureRTC}, a plug-and-play adaptation framework that predicts execution-time observations and states for asynchronous VLA control without modifying the underlying policy. Specifically, FutureRTC features a state correction module to compensate for the discrepancy between rolled-forward and actual execution-time proprioceptive states and an observation prediction module that forecasts execution-time visual representations by leveraging robot motion as an explicit physical prior through motion-aware feature transport and reconstruction. Furthermore, we introduce a policy consistency loss to align the action chunks generated from predicted contexts with those produced under the expected execution-time inputs of the VLA policy. Extensive experiments across simulated and real-world environments demonstrate that FutureRTC achieves superior robustness to inference delays, resulting in smoother trajectories, faster execution, and consistently higher task success rates.
- Abstract(参考訳): リアルタイムなVision-Language-Action(VLA)ポリシーのデプロイは非同期実行を必要とし、その後のアクションチャンクと現在のチャンクの実行が同時に計算され、予測と実行のミスアライメントが発生し、チャンク間の不連続が表される。
既存の手法は、表面的に滑らかなチャンク境界、コストのかかる政策最適化、あるいは排他的に予測される受容状態のいずれかを必要とするが、重要な視覚的観察を無視する。
本稿では,実行時の観測や非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである \textbf{FutureRTC} を提案する。
具体的には、FutureRTCは、ロールフォワードと実際の実行時受入状態の相違を補う状態補正モジュールと、動作認識特徴の伝達と再構成を通じて、ロボットの動きを明示的な物理的事前として活用することにより、実行時視覚表現を予測する観察予測モジュールとを備えている。
さらに、予測コンテキストから生成されたアクションチャンクと、VLAポリシーの期待される実行時入力に基づいて生成されたアクションチャンクを整合させるポリシー整合性損失を導入する。
シミュレーションおよび実世界の環境にわたる大規模な実験により、FutureRTCは推論遅延に対して優れた堅牢性を達成し、よりスムーズな軌道、より高速な実行、一貫したタスク成功率をもたらすことが示されている。
関連論文リスト
- SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation [1.6711881128691604]
本稿では,インスタンス中心のシーンコンテキストとマルチモーダルな提案を前提とした拡散型シナリオ生成フレームワークを提案する。
Open Motionデータセットの実験では、さまざまなインタラクティブなシナリオにおけるリアリズム、安全性、コントロール可能性のバランスが好まれている。
論文 参考訳(メタデータ) (2026-06-25T15:01:31Z) - LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation [13.705916129860071]
拡散に基づくビジュモータポリシーは、しばしばチャンク間不連続を示し、障害物認識実行の明確なメカニズムを欠いている。
本稿では,軌道最適化と拡散ポリシを統合した非同期動作生成フレームワークであるLAGO Policyを提案する。
論文 参考訳(メタデータ) (2026-06-16T14:33:51Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors [57.944744187489185]
外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
論文 参考訳(メタデータ) (2026-04-27T23:04:03Z) - F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation [62.06267255986041]
非同期推論はロボット操作における主要なパラダイムとして現れている。
本稿では,予測対象の流れを利用して将来の観測を合成する新しい枠組みを提案する。
本手法は複雑な動的操作タスクにおける応答性と成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-02T17:57:15Z) - StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation [30.881585159777714]
視覚言語アクション(VLA)モデルは、自然言語による知覚と制御において例外的な性能を示した。
VLAモデルの高い計算コストは、大きな効率上の課題をもたらす。
本稿では,VLAステージ間で非同期並列化が可能なVLAを実現することを提案する。
論文 参考訳(メタデータ) (2026-03-30T15:23:27Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Real-Time Robot Execution with Masked Action Chunking [38.37108371991901]
ロボットのようなサイバー物理システムにはリアルタイム実行が不可欠である。
近年,リアルタイムロボット操作のためのシステムレベルのパラダイムとして,非同期推論が登場している。
本稿では,マスクされたアクションチャンキングによって事前訓練されたポリシーの修正を学習するREMACを提案する。
論文 参考訳(メタデータ) (2026-01-27T23:48:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。