論文の概要: Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models
- arxiv url: http://arxiv.org/abs/2608.18484v1
- Date: Wed, 19 Aug 2026 03:16:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.266048
- Title: Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models
- Title(参考訳): サポートの分割, 残余の再構築: 映像生成と世界モデルのためのトレーニング不要なスパースアテンション
- Abstract要約: 本稿では,Response-Coupled PartitioningとProbe-Fitted Residual Reconstructionを組み合わせたSparsePRを提案する。
分割幾何学はスパース出力からの残余のプール支持と予測可能性の両方に影響を及ぼすことを示す。
SparsePRは22.0-26.4%で生成品質を保ち、1.48x-2.61xのエンドツーエンドのスピードアップを実現した。
- 参考スコア(独自算出の注目度): 5.001952589124473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training-free block-sparse attention can accelerate video transformers, but row-wise attention concentration does not by itself specify an executable sparse operator. Queries sharing a block route may have poorly overlapping supports, while retained attention mass alone does not determine the post-softmax error from skipped interactions. We show that partition geometry affects both pooled support and the predictability of the remaining residual from the sparse output. We introduce SparsePR, which combines Response-Coupled Partitioning with Probe-Fitted Residual Reconstruction. Sampled-query key responses form paired K/V groups, whose centroids induce query-response coordinates for shared routing. A small set of exact query rows then calibrates a call-specific affine correction from the sparse output within the output subspace observed in the probe residuals. Across four heterogeneous video generation and world models, SparsePR consistently reduces attention-reconstruction error. Ablations show that probe fitting accounts for most of this reduction, while response-coupled partitioning lowers hard-drop error and improves reconstruction under a finite probe budget. SparsePR preserves generation quality at 22.0-26.0% realized executed-pair density while achieving 1.48x-2.61x end-to-end speedups. Project page: https://pardistaghavi.github.io/SparsePR-website/
- Abstract(参考訳): トレーニング不要なブロックスパースアテンションはビデオトランスを加速させるが、行単位のアテンション集中はそれ自体が実行可能なスパース演算子を指定しない。
ブロックルートを共有するクエリはオーバーラップが不十分な場合があるが、注意質量だけはスキップされたインタラクションからソフトマックス後のエラーを判断しない。
分割幾何学はスパース出力からの残余のプール支持と予測可能性の両方に影響を及ぼすことを示す。
本稿では,Response-Coupled PartitioningとProbe-Fitted Residual Reconstructionを組み合わせたSparsePRを提案する。
サンプリングされたキー応答はペア化されたK/Vグループを形成し、セントロイドは共有ルーティングのためのクエリ応答座標を誘導する。
正確なクエリ行の小さなセットは、プローブ残差で観測された出力部分空間内のスパース出力から呼び出し固有のアフィン補正を校正する。
4つの異種ビデオ生成と世界モデルにおいて、SparsePRは、常に注意再構築誤差を減少させる。
アブレーションは、プローブフィッティングがほとんどの削減を担っていることを示しているが、応答結合分割はハードドロップ誤差を低減し、有限のプローブ予算下での再構築を改善する。
SparsePRは、実行ペア密度が1.48x-2.61xのエンドツーエンドのスピードアップを達成しながら、22.0-26.0%で生成品質を維持する。
プロジェクトページ: https://pardistaghavi.github.io/SparsePR-website/
関連論文リスト
- Graph-Aware Exact Branch-and-Bound with Device Profiles for Static Qubit Allocation [1.5229257192293195]
静的量子ビット割り当ては、回路の論理量子ビットをスパース物理デバイスにマッピングする。
我々は、グラフ対応の正確な削減を、軽量な割り当てバウンドパスのためのエンジニアリングバンドルに統合する。
その結果、グラフ対応ノード処理とエンジニアリングにより、正確な割り当てに必要なリソースを大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2026-08-04T12:36:54Z) - Decoder-Preserving Sparse Autoencoders: Which Readouts Survive Sparse Compression? [0.0]
我々は,この曖昧さを最適リッジ予測演算子と列車復号器保存SAE間の行列値歪みとして定式化する。
制御されたスパース実験は、宣言された事前がタスクサブスペースから保持された組み合わせを保護していることを示している。
これらの結果から,どのリフィットされたリニアリードアウトがスパース圧縮に耐えるかは,再構成品質が決定できないことが示唆された。
論文 参考訳(メタデータ) (2026-07-19T22:19:17Z) - STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation [60.597357847359255]
ビデオセグメンテーションでは、複雑な自然言語クエリの下で数百フレームにわたるピクセル精度の高いオブジェクトトラッキングが要求される。
既存のメソッドはトークン圧縮を通じてこの問題に対処するが、典型的には時間的コンテキストを持たない機能で動作する。
状態空間モデルは、この制約を解決し、その線形反復性は、各トークンを時間的文脈で選択的に$mathcalO(T)$コスト圧縮して減少させる。
論文 参考訳(メタデータ) (2026-07-03T03:28:25Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding [88.17174909130188]
LVLM(Large Vision-Language Models)は、視覚的な入力を高密度なトークンシーケンスにマッピングし、推論に二次的な計算ボトルネックを与える。
特徴抽出の労力を動的に分配する視覚トークン化アーキテクチャであるPARCELを紹介する。
PARCELは、既存のマトリシカベースラインを「一度にトレーニングし、どこにでもデプロイする」パラダイムを保ちながら、視覚障害者の予算で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-28T15:57:31Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - One-Shot Federated Ridge Regression: Exact Recovery via Sufficient Statistic Aggregation [0.7106986689736825]
フェデレート・リッジ回帰(Federated ridge regression)は、各クライアントが局所的な十分な統計を計算し、一度送信する分散平衡問題である。
我々は、クライアント1回に1回ノイズが注入された場合の差分プライバシー保証を確立し、マルチラウンドプロトコルのプライバシを低下させる構成ペナルティを排除した。
合成ヘテロジニアス回帰の実験では、単発核融合はFedAvgの精度と一致し、通信コストは最大38時間以下であることが示されている。
論文 参考訳(メタデータ) (2026-01-13T04:47:22Z) - SparseCoop: Cooperative Perception with Kinematic-Grounded Queries [24.54324085409114]
SparseCoopは3次元検出と追跡のための完全にスパースな協調認識フレームワークである。
2X-SeqとGriffinのデータセットの実験は、SparseCoopが最先端のパフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2025-12-07T13:22:06Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - Generalized Parallel Scaling with Interdependent Generations [58.43994876504917]
本稿では,相互依存応答を並列に生成するブリッジを提案する。
少数の新しいパラメータしか持たず、ブリッジは強化学習による相対平均精度の向上を図っている。
論文 参考訳(メタデータ) (2025-10-01T17:33:35Z) - QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification [67.15451442018258]
拡散変換器は素晴らしいビデオ生成能力を示すが、その計算とメモリの禁止コストは実際の展開を妨げる。
モデル量子化とアテンションスパシフィケーションは圧縮に有望な2つの方向であるが、それぞれがアグレッシブ圧縮の下で深刻な性能劣化を被っている。
モデル量子化と注意散布を統合した統合フレームワークである textbfQuantSparse を提案する。
論文 参考訳(メタデータ) (2025-09-28T06:49:44Z) - Attention Map Guided Transformer Pruning for Edge Device [98.42178656762114]
視覚トランスフォーマー (ViT) は, 全体的かつ隠蔽された人物再識別 (Re-ID) タスクにおいて, 有望な成功を収めた。
本稿では、冗長なトークンとヘッドの両方を除去する新しいアテンションマップガイド(AMG)トランスフォーマープルーニング法を提案する。
Occluded DukeMTMC と Market-1501 に関する総合的な実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-04-04T01:51:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。