論文の概要: BAG: Budget-Aware Gating for Diffusion Caching
- arxiv url: http://arxiv.org/abs/2608.09231v1
- Date: Mon, 10 Aug 2026 07:54:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.13448
- Title: BAG: Budget-Aware Gating for Diffusion Caching
- Title(参考訳): BAG:拡散キャッシングのための予算対応ゲーティング
- Abstract要約: BAG(Budget-Aware Gating)は、動的でインスタンス適応的な機能再利用とグローバル予算のペアリングを統一する、新しいキャッシュポリシーである。
我々は、オフラインからオンラインまでのスケジュール蒸留を通じてこのポリシーを訓練し、オフライン検索スケジュールの決定をコンパクトなオンラインゲートに転送する。
- 参考スコア(独自算出の注目度): 13.854727125627107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion caching is a lightweight strategy that accelerates Diffusion Transformers (DiTs) by reusing intermediate features across denoising steps, but existing paradigms face a fundamental trade-off: online heuristics lack global budget awareness, whereas static schedules lack instance adaptivity and fail to flexibly adapt to varying runtime budget constraints. To bridge this gap, we present BAG (Budget-Aware Gating), a novel caching policy that unifies global budget pacing with dynamic, instance-adaptive feature reuse. Rather than relying on hand-crafted rules, BAG employs a lightweight gating network that dynamically decides whether to execute a full computation or reuse cached features at each step by jointly conditioning on the budget state and local trajectory feedback. We train this policy via offline-to-online schedule distillation, transferring the decision-making of offline-searched schedules into a compact online gate. Extensive experiments on FLUX.1-dev and Wan2.1 demonstrate that BAG consistently outperforms state-of-the-art caching methods across various speedup tiers while remaining robust across different resolutions, seeds, and guidance scales. Code will be released.
- Abstract(参考訳): 拡散キャッシング(Diffusion cache)はディフュージョントランスフォーマー(DiT)を加速する軽量な戦略だが、既存のパラダイムは基本的なトレードオフに直面している。
このギャップを埋めるために、我々は、動的でインスタンス適応的な機能再利用とグローバル予算のペアリングを統一する新しいキャッシュポリシーであるBAG(Budget-Aware Gating)を提示する。
手作りのルールに頼るのではなく、BAGは軽量なゲーティングネットワークを使用して、予算状態と局所軌道フィードバックを共同で条件付けすることで、各ステップで完全な計算を実行するか、キャッシュされた機能を再利用するかを動的に決定する。
我々は、オフラインからオンラインまでのスケジュール蒸留を通じてこのポリシーを訓練し、オフライン検索スケジュールの決定をコンパクトなオンラインゲートに転送する。
FLUX.1-dev と Wan2.1 の広範な実験により、BAG は様々なスピードアップ層で常に最先端のキャッシュ手法より優れており、様々な解像度、シード、ガイダンススケールで堅牢であることが示された。
コードはリリースされる。
関連論文リスト
- Evolving Cache Schedules for Fast Diffusion Policy Inference [6.879031540914794]
拡散ポリシは、アクションチャンクを反復的にデノナイズすることで、強力なビジュモータ制御を実現するが、繰り返しデノナイズすることで、リアルタイムなデプロイメントを計算的に要求する。
Evolving Cache Schedules (EVO)は,進化的検索によるキャッシュリフレッシュをグローバルにスケジュールする,トレーニング不要のアクセラレーションフレームワークである。
EVOは計算量を大幅に削減し、最大8.05倍の動作生成速度を実現し、FLOPを15.77Gから1.96Gに削減する。
論文 参考訳(メタデータ) (2026-07-22T15:40:11Z) - AdaptiveSD A Stability-Aware, Runtime-Adaptive Speculative Decoding Framework with Multi-Policy Orchestration for CPU-Constrained LLM Inference [0.0]
固定深度投機的復号化は有望な手法の1つとして現れてきたが、実際には、帯域幅の飽和、不安定性、あるいは破滅的なリソースの枯渇による性能低下がシステム障害の原因となることが多い。
当社のソリューションは、4つの密結合したコンポーネントが連続的なフィードバックループで連携する。Adaptive Draft Controller、Dynamic Policy Engine、KVキャッシュ調整レイヤ、モニタリングエンジンである。
従来の手法はスループットを最大化することのみに重点を置いているが,提案手法の有効性は,投機的効率の標準的な測定基準と並行して,無駄な計算処理やトークン間遅延分散など,いくつかの重要な指標に基づいて評価する。
論文 参考訳(メタデータ) (2026-07-04T13:39:40Z) - Budget-Constrained Step-Level Diffusion Caching [9.784100090561045]
既存の方法は、最終的な出力品質を直接最適化することなく、閾値ベースのステップごとのキャッシュ決定を行う。
計算予算を事前に修正し,最終出力を最もよく保存するキャッシュポリシを検索するBudCacheを提案する。
BudCacheは同じ推論予算の下で決定論的キャッシュベースラインよりも優れた生成品質を実現する。
論文 参考訳(メタデータ) (2026-06-11T15:45:05Z) - BUDDY: BUdget-Driven DYnamic Depth Routing for Adaptive Large Language Model Inference [8.041559188948003]
Buddyは、大規模言語モデルのための予算駆動の動的深度ルーティングフレームワークである。
厳格な予算管理、デコードタイムの再ルーティング、トレーニングされた1つのモデルで複数の予算をサポートする。
論文 参考訳(メタデータ) (2026-06-08T14:06:35Z) - Aligning Flow Map Policies with Optimal Q-Guidance [50.514994916864275]
フローマップポリシは、任意のサイズのジャンプを学習することで、高速なアクション生成のために設計されている。
FLOW MAP Q-GUIDANCE (FMQ) は, 批判誘導型信頼領域制約の下でオフラインフローマップポリシーを適用するのに最適な, 原則付きクローズドフォーム学習ターゲットである。
FMQは、オフラインからオフラインまでのRLにおける最先端のパフォーマンスを達成し、平均成功率に対して21.3%の相対的な改善により、以前のワンステップポリシーMVPを上回っている。
論文 参考訳(メタデータ) (2026-05-12T17:12:29Z) - WorldCache: Content-Aware Caching for Accelerated Video World Models [50.7543797435026]
我々はPerception-Constrained Dynamic CaCacheフレームワークであるtextbfWorldCacheを紹介する。
WorldCacheは、機能をいつ、どのように再利用するかを改善します。
PAI-Benchで評価されたCosmos-2.5-2Bでは、WorldCacheはtextbf$2.3times$推論スピードアップを実現し、textbf99.4%のベースライン品質を維持している。
論文 参考訳(メタデータ) (2026-03-23T17:59:54Z) - Adaptive Linear Path Model-Based Diffusion [52.84663832658799]
リニアパスモデルベース拡散(LP-MBD)を導入し、分散保存スケジュールをフローマッチング線形確率パスに置き換える。
また,適応型LP-MBD(ALP-MBD)を提案し,タスクの複雑さや環境条件に応じて拡散ステップやノイズレベルを調整する。
論文 参考訳(メタデータ) (2026-02-02T21:33:03Z) - SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models [56.45983529954998]
DLMキャッシュにおける更新識別と予算配分を共同で最適化するSPAキャッシュを提案する。
まず、低次元部分空間における更新臨界トークンの識別を可能にする低次元特異プロキシを導出する。
第2に、生成品質を劣化させることなく、安定したレイヤへの更新を少なくするアダプティブ戦略を導入する。
論文 参考訳(メタデータ) (2026-01-30T05:22:44Z) - Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning [9.92274274871221]
拡散政策は、マルチモーダルな行動分布をモデル化する強力な能力のために、アクション生成を支配してきた。
我々は、非常にスパースなアクション生成のために$underlinetextbfS$parse $underlinetextbfA$ction$underlinetextbfG$enを提案する。
論文 参考訳(メタデータ) (2026-01-19T09:50:36Z) - TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration [64.32072516882947]
拡散ポリシーは、具体的制御が優れているが、高い推論遅延と計算コストに悩まされている。
時間認識強化に基づく投機的拡散政策(TS-DP)を提案する。
TS-DPは94%以上のドラフトで最大4.17倍高速な推論を実現し、推論周波数は25Hzに達した。
論文 参考訳(メタデータ) (2025-12-13T07:53:14Z) - Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning [56.47948583452555]
固定ステップのEulerスキームによるフローマッチング推論プロセスの離散化は,最適輸送から変化するJordan-Kinderlehrer-Otto原理と整合する,というキーインサイトに基づいて,SWFP(Stepwise Flow Policy)フレームワークを紹介した。
SWFPは、大域的な流れを、プロキシメート分布間の小さな漸進的な変換の列に分解する。
この分解は、小さな流れブロックのカスケードを介して事前訓練された流れを微調整する効率的なアルゴリズムを導き、大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-10-17T07:43:51Z) - Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation [54.61034867177997]
キャッシング推論応答は、大きな言語モデルに他の前方を通さずに、それらを検索することができる。
従来の正確なキャッシュは、クエリ間のセマンティックな類似性を見落とし、不要な再計算をもたらす。
本稿では,未知のクエリおよびコスト分布下でのセマンティックキャッシュ消去のための,原則的,学習ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-11T06:53:27Z) - Block-wise Adaptive Caching for Accelerating Diffusion Policy [10.641633189595302]
Block-wise Adaptive Caching(BAC)は、中間動作特徴をキャッシュすることで拡散ポリシーを高速化する手法である。
BACは、ロボットベンチマークで無償で最大3倍の推論スピードアップを達成する。
論文 参考訳(メタデータ) (2025-06-16T13:14:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。