論文の概要: DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors
- arxiv url: http://arxiv.org/abs/2604.25050v1
- Date: Mon, 27 Apr 2026 23:04:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.627207
- Title: DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors
- Title(参考訳): DiscreteRTC:離散拡散ポリシは自然な非同期実行子である
- Authors: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang,
- Abstract要約: 外部修正をネイティブなアンマスクに置き換えるDiscreteRTCを提案する。
DiscreteRTCは、非同期のインペインティングのために0行のコードを実装するのが簡単で、スクラッチから生成したアクションに比べてわずか0.7倍の計算速度で推論が高速で、フローベースのRTCに比べて実世界の動的ピックタスクの成功率が50%向上した。
- 参考スコア(独自算出の注目度): 57.944744187489185
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unlike chatbots, physical AI must act while the world keeps evolving. Therefore, the inter-chunk pause of synchronous executors are fatal for dynamic tasks regardless of how fast the inference is. Asynchronous execution -- thinking while acting -- is therefore a structural requirement, and real-time chunking (RTC) makes it viable by recasting chunk transitions as inpainting: freezing committed actions and consistently generating the remainder. However, RTC with flow-matching policy is structurally suboptimal: its inpainting comes from inference-time corrections rather than the base policy, yielding little pre-training benefit, specific fine-tuning, heuristic guidance, and extra computation that inflates the latency. In this work, we observe that discrete diffusion policies, which generate actions by iteratively unmasking, are natural asynchronous executors that resolve all limitations at once: they are fine-tuning free since inpainting is their native operation, while early stopping further provides adaptive guidance and reduces inference cost. We propose DiscreteRTC, which replaces external corrections with native unmasking, and show on dynamic simulated benchmarks and real-world dynamic manipulation tasks that it achieves higher success rates than continuous RTC and other baselines. In summary, DiscreteRTC is simpler to implement with 0 lines of code for async inpainting, faster at inference with only 0.7x computation compared with generating actions from scratch, and better at execution with 50% higher success rate in real-world dynamic pick task compared with flow-matching-based RTC. More visualizations are on https://outsider86.github.io/DiscreteRTCSite/.
- Abstract(参考訳): チャットボットとは異なり、物理的なAIは世界が進化し続ける間に行動しなくてはならない。
したがって、同期エグゼキュータのチャンク間停止は、推論の速度に関係なく、動的タスクでは致命的である。
非同期実行 -- 行動しながら考える -- は構造的な要件であり、リアルタイムチャンキング(RTC)は、チャンク遷移をインペインティングとして再キャストすることで、コミットしたアクションを凍結し、残りのアクションを一貫して生成する。
しかし、フローマッチングポリシを備えたRTCは構造的に準最適であり、その影響はベースポリシーよりも推論時間補正によるもので、トレーニング前のメリットはほとんどなく、特定の微調整、ヒューリスティックガイダンス、遅延を膨らませる余分な計算をもたらす。
本研究では,反復的アンマッシングによる動作を生成する離散拡散ポリシが,すべての制限を一度に解決する自然な非同期実行子であることを観察する。
本研究では,外部修正をネイティブなアンマキングに置き換えたDiscreteRTCを提案し,動的シミュレーションベンチマークと実世界の動的操作タスクについて,連続RTCや他のベースラインよりも高い成功率を達成することを示す。
要約すると、DiscreteRTCは非同期のインペインティングのために0行のコードで実装しやすく、スクラッチから生成したアクションと比べてわずか0.7倍の計算速度で推論を高速化し、フローマッチングベースのRTCよりも実世界の動的ピックタスクにおいて50%高い成功率で実行を高速化する。
さらなる視覚化はhttps://outsider86.github.io/DiscreteRTCSite/にある。
関連論文リスト
- Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy [52.106797722292896]
我々は,チャンクベースのアクション生成とリアルタイム修正を統合した動的クローズドループ拡散ポリシーフレームワークDCDPを提案する。
動的PushTシミュレーションでは、DCDPは5%の計算しか必要とせず、再トレーニングなしに適応性を19%改善する。
論文 参考訳(メタデータ) (2026-03-02T15:04:18Z) - Unbiased Gradient Estimation for Event Binning via Functional Backpropagation [64.88399635309918]
バックプロパゲーション中に弱微分を合成することにより任意の双対関数の非バイアス勾配推定のための新しいフレームワークを提案する。
自己監督型光流ではECEが9.4%,SLAMでは5.1%低下し,事象に基づく視覚知覚において大きなメリットが示された。
論文 参考訳(メタデータ) (2026-02-13T04:05:03Z) - Real-Time Robot Execution with Masked Action Chunking [38.37108371991901]
ロボットのようなサイバー物理システムにはリアルタイム実行が不可欠である。
近年,リアルタイムロボット操作のためのシステムレベルのパラダイムとして,非同期推論が登場している。
本稿では,マスクされたアクションチャンキングによって事前訓練されたポリシーの修正を学習するREMACを提案する。
論文 参考訳(メタデータ) (2026-01-27T23:48:32Z) - Training-Time Action Conditioning for Efficient Real-Time Chunking [45.91723746443767]
トレーニング時の推論遅延をシミュレーションし,アクションプレフィックスを直接条件付けすることで,推論時のオーバーヘッドを解消する。
シミュレーション実験では、トレーニング時間RTCは推論時間RTCよりも高い推論遅延で優れることがわかった。
実時間ロボット制御において,トレーニング時動作条件付けは推論時インペインティングの代替となることが示唆された。
論文 参考訳(メタデータ) (2025-12-05T18:57:28Z) - AsyncHZP: Hierarchical ZeRO Parallelism with Asynchronous Scheduling for Scalable LLM Training [4.643969942380424]
単純さとメモリ効率を維持しつつ,優れた性能を実現するために,ZeROの新しい非同期版を提案する。
非効率な通信につながるような細粒度のシャーディングを使用する従来のZeROとは異なり、AsyncHZPはパラメータ、勾配、および異なるレプリカグループ間の状態を適応的に再シャーディングする。
AsyncHZPは古典的なND並列性より一貫して優れており、複雑な戦略的チューニングなしに最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-23T01:29:35Z) - Real-Time Execution of Action Chunking Flow Policies [49.1574468325115]
本稿では,アクションインタラクションシステムの非同期実行を可能にする新しい推論時アルゴリズムを提案する。
これは、再トレーニングなしでボックスから実行する拡散またはVLAベースのシステムに適用できる。
その結果、RTCは高速で、性能が高く、推論操作に対して一意に堅牢であることがわかった。
論文 参考訳(メタデータ) (2025-06-09T01:01:59Z) - COrAL: Order-Agnostic Language Modeling for Efficient Iterative Refinement [80.18490952057125]
反復改良は、複雑なタスクにおける大規模言語モデル(LLM)の能力を高める効果的なパラダイムとして登場した。
我々はこれらの課題を克服するために、コンテキストワイズ順序非依存言語モデリング(COrAL)を提案する。
当社のアプローチでは、管理可能なコンテキストウィンドウ内で複数のトークン依存関係をモデル化しています。
論文 参考訳(メタデータ) (2024-10-12T23:56:19Z) - AEGNN: Asynchronous Event-based Graph Neural Networks [54.528926463775946]
イベントベースのグラフニューラルネットワークは、標準のGNNを一般化して、イベントを"進化的"時間グラフとして処理する。
AEGNNは同期入力で容易に訓練でき、テスト時に効率的な「非同期」ネットワークに変換できる。
論文 参考訳(メタデータ) (2022-03-31T16:21:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。