論文の概要: Evolving Cache Schedules for Fast Diffusion Policy Inference
- arxiv url: http://arxiv.org/abs/2607.20293v1
- Date: Wed, 22 Jul 2026 15:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.136339
- Title: Evolving Cache Schedules for Fast Diffusion Policy Inference
- Title(参考訳): 高速拡散ポリシー推論のためのキャッシュスケジューリングの進化
- Abstract要約: 拡散ポリシは、アクションチャンクを反復的にデノナイズすることで、強力なビジュモータ制御を実現するが、繰り返しデノナイズすることで、リアルタイムなデプロイメントを計算的に要求する。
Evolving Cache Schedules (EVO)は,進化的検索によるキャッシュリフレッシュをグローバルにスケジュールする,トレーニング不要のアクセラレーションフレームワークである。
EVOは計算量を大幅に削減し、最大8.05倍の動作生成速度を実現し、FLOPを15.77Gから1.96Gに削減する。
- 参考スコア(独自算出の注目度): 6.879031540914794
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion policies achieve strong visuomotor control by iteratively denoising action chunks, but repeated denoising makes real-time deployment computationally demanding. Cache-based methods reduce inference cost by reusing intermediate activations, but existing training-free schedules typically allocate computation uniformly across blocks, ignoring heterogeneous redundancy across blocks and leading to a suboptimal performance-efficiency trade-off. To bridge this gap, we introduce Evolving Cache Schedules (EVO), a training-free acceleration framework that globally schedules cache refreshes via evolutionary search. EVO represents each candidate as a complete schedule over the block-timestep lattice. Thus, redundant transformer computations during iterative denoising can be skipped through cache reuse while preserving closed-loop rollout performance. To make the search practical, EVO introduces redundancy-aware initialization, which seeds the population with promising schedules, and target-conditioned early stopping, which verifies and terminates once a desired performance target is reached. The offline-optimized schedule can be directly plugged into pretrained diffusion policies without retraining. Extensive manipulation benchmarks show that EVO preserves near-full performance while substantially reducing computation, achieving up to 8.05x action-generation speedup and reducing FLOPs from 15.77G to as low as 1.96G. Source code is available at https://github.com/pillom/EVO.
- Abstract(参考訳): 拡散ポリシは、アクションチャンクを反復的にデノナイズすることで、強力なビジュモータ制御を実現するが、繰り返しデノナイズすることで、リアルタイムなデプロイメントを計算的に要求する。
キャッシュベースの手法は、中間アクティベーションを再利用することで推論コストを削減するが、既存のトレーニング不要スケジュールでは、ブロック間での計算を均一に割り当て、ブロック間の不均一な冗長性を無視し、最適性能と効率のトレードオフをもたらす。
このギャップを埋めるために、進化的検索を通じてキャッシュリフレッシュをグローバルにスケジュールするトレーニング不要のアクセラレーションフレームワークであるEvolving Cache Schedules (EVO)を紹介します。
EVOは各候補をブロックタイムステップ格子上の完全なスケジュールとして表現する。
これにより、クローズドループロールアウト性能を維持しつつ、キャッシュ再利用により反復復調時の冗長なトランスフォーマー計算をスキップすることができる。
探索を実用的なものにするために、EVOは、期待されたスケジュールで個体群をシードする冗長性認識初期化と、目標条件付き早期停止を導入し、所望のパフォーマンス目標に到達すると検証と終了を行う。
オフラインで最適化されたスケジュールは、再トレーニングすることなく、事前訓練された拡散ポリシーに直接接続することができる。
大規模なベンチマークでは、EVOは計算処理を著しく削減し、最大8.05倍の動作生成速度を実現し、FLOPを15.77Gから1.96Gに削減している。
ソースコードはhttps://github.com/pillom/EVO.comで入手できる。
関連論文リスト
- BAG: Budget-Aware Gating for Diffusion Caching [13.854727125627107]
BAG(Budget-Aware Gating)は、動的でインスタンス適応的な機能再利用とグローバル予算のペアリングを統一する、新しいキャッシュポリシーである。
我々は、オフラインからオンラインまでのスケジュール蒸留を通じてこのポリシーを訓練し、オフライン検索スケジュールの決定をコンパクトなオンラインゲートに転送する。
論文 参考訳(メタデータ) (2026-08-10T07:54:28Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Reflex: Real-Time VLA Control through Streaming Inference [12.85847066934547]
textbfReflexは,フローマッチングポリシに対して,テキストリアルタイムストリーミング推論を可能にするフレームワークである。
LIBEROとKinetixのベンチマークでは、Reflexは2.58$times$推論スピードアップと50Hzの安定したストリーミングを実現し、反応遅延を最大54%削減した。
論文 参考訳(メタデータ) (2026-07-16T07:56:43Z) - PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models [61.39458217121294]
拡散大言語モデル(dLLM)の推論は計算コストが高い。
最近のdLLMのスパースアテンション手法はブロックスパース計算によってこのコストを軽減している。
我々は定期的に更新されたカラムスパースアテンション手法であるPulseColを紹介する。
論文 参考訳(メタデータ) (2026-05-20T07:06:54Z) - BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning [41.5997751218601]
BlockVLAは、事前訓練されたARバックボーンを効率的な離散拡散ポリシーに適合させるフレームワークである。
LIBERO と SimplerEnv のベンチマークを広範囲に評価する。
本モデルでは, トレーニング効率が向上し, 成功率がベースラインよりもかなり高速に収束する。
論文 参考訳(メタデータ) (2026-05-13T11:37:51Z) - Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation [8.70067126225172]
オートレグレッシブ(AR)ビデオ拡散モデルは、長めのビデオ生成を可能にするが、複数ステップの復調を繰り返して高価である。
我々は,効率的なARビデオ拡散のためのトレーニングフリーフレームワークSCOPEを提案する。
MAGI-1とSkyReels-V2では、SCOPEは元の出力に匹敵する品質を維持しながら最大4.73倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2026-04-03T11:34:47Z) - Timestep-Aware Block Masking for Efficient Diffusion Model Inference [48.764748095994996]
拡散確率モデル(DPM)は画像生成において大きな成功を収めたが、高い推論遅延に悩まされている。
本稿では,事前学習したDPMの計算グラフを時間単位に最適化する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-20T13:35:03Z) - Causal Autoregressive Diffusion Language Model [70.7353007255797]
CARDは厳密な因果注意マスク内の拡散過程を再構成し、単一の前方通過で密集した1対1の監視を可能にする。
我々の結果は,CARDが並列生成のレイテンシの利点を解放しつつ,ARMレベルのデータ効率を実現することを示す。
論文 参考訳(メタデータ) (2026-01-29T17:38:29Z) - PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference [16.54910591046794]
大規模言語モデル(LLM)は、様々なタスクにまたがる例外的な能力を示すが、その展開は高い計算とメモリコストに制約される。
より正確で効率的なブロックとKVキャッシュのプルーニングを可能にするPD分散推論のための新しいプルーニング法を提案する。
論文 参考訳(メタデータ) (2025-08-29T02:29:52Z) - CSGO: Generalized Optimization for Cold Start in Wireless Collaborative Edge LLM Systems [62.24576366776727]
本稿では,全体の推論遅延を最小限に抑えるために,遅延を考慮したスケジューリングフレームワークを提案する。
提案手法は,ベースライン戦略と比較して,コールドスタート遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-08-15T07:49:22Z) - Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction [72.27673320976933]
Diffusion Large Language Models (dLLMs) は推論と並列デコードにおけるブレークスルーを可能にする。
現在のキャッシュ技術は、フルレイヤ状態を保存することでデコーディングを加速するが、メモリ使用量を大幅に増加させる。
Sparse-dLLMは、動的キャッシュ消去とスパースアテンションを統合した最初のトレーニングフリーフレームワークである。
論文 参考訳(メタデータ) (2025-08-04T16:14:03Z) - Block-wise Adaptive Caching for Accelerating Diffusion Policy [10.641633189595302]
Block-wise Adaptive Caching(BAC)は、中間動作特徴をキャッシュすることで拡散ポリシーを高速化する手法である。
BACは、ロボットベンチマークで無償で最大3倍の推論スピードアップを達成する。
論文 参考訳(メタデータ) (2025-06-16T13:14:58Z) - HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration [31.982294870690925]
我々はHarmoniCaと呼ばれる新しい学習ベースのキャッシュフレームワークを開発した。
SDT(Step-Wise Denoising Training)を取り入れて、Denoisingプロセスの継続性を保証する。
私たちのフレームワークは40%以上のレイテンシ削減(理論的スピードアップ)とPixArt-$alpha$のパフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2024-10-02T16:34:29Z) - GDP: Stabilized Neural Network Pruning via Gates with Differentiable
Polarization [84.57695474130273]
ゲートベースまたは重要度に基づくプルーニング手法は、重要度が最小のチャネルを削除することを目的としている。
GDPは、各チャネルのオン・アンド・オフを制御するために、ベルやホイッスルのない畳み込み層の前に接続することができる。
CIFAR-10とImageNetデータセットを用いて行った実験は、提案したGDPが最先端のパフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2021-09-06T03:17:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。