論文の概要: Test-time Sparsity for Extreme Fast Action Diffusion
- arxiv url: http://arxiv.org/abs/2605.13316v1
- Date: Wed, 13 May 2026 10:28:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.983686
- Title: Test-time Sparsity for Extreme Fast Action Diffusion
- Title(参考訳): 極端に高速な動作拡散のためのテスト時間間隔
- Authors: Kangye Ji, Yuan Meng, Jianbo Zhou, Ye Li, Chen Tang, Zhi Wang,
- Abstract要約: アクション拡散は、高忠実なアクション生成において優れるが、反復的なデノイングの性質のため、計算コストが重い。
この課題に対処するために,テスト時間間隔を提案する。これは,各モデルに対する動的に予測可能な残差計算をテスト時に前方に進めることで,動作拡散を加速することを目的としている。
- 参考スコア(独自算出の注目度): 15.679362579177267
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Action diffusion excels at high-fidelity action generation but incurs heavy computational costs owing to its iterative denoising nature. Despite current technologies showing promise in accelerating diffusion transformers by reusing the cached features, they struggle to adapt to policy dynamics arising from diverse perceptions and multi-round rollout iterations in open environments. We propose test-time sparsity to tackle this challenge, which aims to accelerate action diffusion by dynamically predicting prunable residual computations for each model forward at test time. However, two bottlenecks remain in this paradigm: 1) repetitive conditional encoding and pruning offset most potential speed gains, and 2) the features cached from previous denoising timesteps cannot constrain large pruning errors under aggressive sparsity. To address the first bottleneck, we design a highly parallelized inference pipeline that minimizes the non-decoder delay to milliseconds. Specifically, we first design a lightweight pruner that shares the encoder with the diffusion transformer. Then, we decouple the encoding and pruning from the autoregressive denoising loop by processing all denoising timesteps in parallel, and overlap the pruner with the decoder forward inference through asynchronism. To overcome the second bottleneck, we introduce an omnidirectional reusing strategy, which achieves 95% sparsity by selectively reusing features cached from the current forward, previous denoising timesteps, and earlier rollout iterations. To learn the rollout-level reusing strategies, we sample a few action trajectories to supervise the sparsified diffusion step by step. Extensive experiments demonstrate that our method reduces FLOPs by 92% and accelerates action generation by 5x, achieving lossless performance with an inference frequency of 47.5 Hz. Our code is available at https://github.com/ky-ji/Test-time-Sparsity.
- Abstract(参考訳): アクション拡散は、高忠実なアクション生成において優れるが、反復的なデノイングの性質のため、計算コストが重い。
キャッシュされた特徴を再利用することで拡散トランスフォーマーを加速させる現在の技術にもかかわらず、オープン環境における多様な認識や複数ラウンドのロールアウトイテレーションから生じるポリシーのダイナミクスに適応するのに苦労している。
この課題に対処するために,テスト時間間隔を提案する。これは,各モデルに対する動的に予測可能な残差計算をテスト時に前方に進めることで,動作拡散を加速することを目的としている。
しかし、このパラダイムには2つのボトルネックが残っている。
1 繰り返し条件付き符号化及び打ち切りオフセットの最大速度ゲイン
2) 従来のデノナイジング時間ステップからキャッシュした特徴は, 攻撃的な間隔で大きなプルーニングエラーを抑えることはできない。
最初のボトルネックに対処するため、並列化された推論パイプラインを設計し、非デコーダの遅延をミリ秒に抑える。
具体的には、まず、エンコーダと拡散変換器を共有する軽量プルーナーを設計する。
そして,全復調時間ステップを並列に処理することで,自己回帰的復調ループから復号と復号を分離し,復号器と復号器の前方推論を非同期性により重畳する。
第2のボトルネックを克服するために、現在のフォワードからキャッシュされた機能を選択的に再利用し、以前のデノナイジングタイムステップと初期のロールアウトイテレーションを選択的に再利用することで、95%の間隔を実現する全方位再利用戦略を導入する。
ロールアウトレベルの再利用戦略を学習するために,いくつかのアクショントラジェクトリをサンプリングし,拡散過程を段階的に監視する。
広汎な実験により,FLOPsを92%削減し,アクション生成を5倍高速化し,推論周波数47.5Hzの損失のない性能を実現した。
私たちのコードはhttps://github.com/ky-ji/Test-time-Sparsity.comで利用可能です。
関連論文リスト
- Muninn: Your Trajectory Diffusion Model But Faster [4.221836692945716]
拡散に基づく軌道プランナーは、リッチでマルチモーダルなロボットの動きを合成できるが、反復的なデノベーションは、オンラインの計画と制御を違法に遅くする。
本研究では,モデルの再学習や軌道品質の犠牲を伴わずに,ロボットのリアルタイム使用に十分な速度で拡散型軌道プランナを構築するという課題に対処する。
Muninnは、タスクのパフォーマンスと安全性の指標を保ちながら、デノイザの評価を減らし、複数の軌道拡散モデルで最大4.6倍のウォールタイムのスピードアップを提供する。
論文 参考訳(メタデータ) (2026-05-11T05:21:52Z) - Streaming Autoregressive Video Generation via Diagonal Distillation [50.13573884115673]
自己回帰モデルは、シーケンシャルフレーム合成のための自然なフレームワークを提供するが、高い忠実性を達成するためには重い計算を必要とする。
ビデオチャンクとデノイングステップの時間的情報を活用するために,ダイアゴナル蒸留を提案する。
本手法は,2.61秒(最大31FPS)で5秒ビデオを生成し,未蒸留モデル上で277.3倍のスピードアップを実現する。
論文 参考訳(メタデータ) (2026-03-10T10:45:24Z) - Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration [58.19554276924402]
スペクトル拡散特徴予測器(Spectrum)を提案する。
我々はFLUX.1で4.79$times$スピードアップ、Wan2.1-14Bで4.67$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-03-02T08:59:11Z) - TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control [15.534182843429043]
大規模なVision-Language-Action(VLA)モデルはセマンティックな一般化を提供するが、高い推論遅延に悩まされる。
本稿では,高頻度動作から意味論的推論を分離する階層型フレームワークであるTIDALを提案する。
TIDALは、二重周波数アーキテクチャを用いて拡散ベースのVLAのためのバックボーンに依存しないモジュールとして動作する。
論文 参考訳(メタデータ) (2026-01-21T12:43:11Z) - FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers [12.17745708847535]
FREEは、並列検証で機能レベルの自動回帰を実行するために軽量なドラフトラを使用する、新しいフレームワークである。
ImageNet-$5122$の実験では、FREEは最大1.86倍の加速を実現し、FREE(relax)はさらに2.25倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2025-11-25T15:12:10Z) - Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation [50.04968365065964]
拡散に基づく音声ヘッドモデルは高品質でフォトリアリスティックなビデオを生成するが、推論が遅い。
我々はLightning-fast Caching-based Parallel Denoising Prediction (LightningCP)を紹介する。
また,より高速な注意計算を実現するために,DFA(Decoupled Foreground Attention)を提案する。
論文 参考訳(メタデータ) (2025-08-25T02:58:39Z) - StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation [52.56469577812338]
本稿では,インタラクティブな画像生成のためのリアルタイム拡散パイプラインStreamDiffusionを紹介する。
既存の拡散モデルは、テキストや画像プロンプトから画像を作成するのに適しているが、リアルタイムのインタラクションでは不足することが多い。
本稿では,従来のシーケンシャル・デノナイジングをデノナイジング・プロセスに変換する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-19T18:18:33Z) - Towards More Accurate Diffusion Model Acceleration with A Timestep Tuner [112.99126045081046]
数千のデノナイジングステップを用いて画像を生成するために定式化された拡散モデルは通常、遅い推論速度に悩まされる。
最小コストで特定の区間に対してより正確な積分方向を求めるのに役立つtextbftimestep tunerを提案する。
実験により,我々のプラグイン設計を効率的に訓練し,様々な最先端加速度法の推論性能を向上できることが示された。
論文 参考訳(メタデータ) (2023-10-14T02:19:07Z) - Single and Few-step Diffusion for Generative Speech Enhancement [18.487296462927034]
拡散モデルは音声強調において有望な結果を示した。
本稿では,2段階の学習手法を用いて,これらの制約に対処する。
提案手法は定常的な性能を保ち,従って拡散ベースラインよりも大きく向上することを示す。
論文 参考訳(メタデータ) (2023-09-18T11:30:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。