論文の概要: RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation
- arxiv url: http://arxiv.org/abs/2607.02584v1
- Date: Wed, 01 Jul 2026 02:44:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.337197
- Title: RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation
- Title(参考訳): Rotateアテンション:ビデオ生成におけるINT4量子アテンションのためのRoPE対応回転とレンジレクリエーション
- Abstract要約: 3D RoPEを用いた textbfDiT ベースのビデオ生成モデルに適した,効率的な textbfmixed-precision INT4 FlashAttention フレームワークを提案する。
textbfRotateAttentionは、最大1.68$times$エンドツーエンドのスピードアップと2.2$times$カーネルレベルのアクセラレーションを達成しながら、フル精度のベースラインとほぼ同じ品質の映像を生成する。
- 参考スコア(独自算出の注目度): 15.82658615412336
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In \textbf{DiT-based video generation models equipped with 3D Rotary Position Embeddings (3D RoPE)}, the attention mechanism remains a primary computational bottleneck due to its quadratic complexity with respect to sequence length. While quantized \textbf{FlashAttention} offers a promising path toward hardware acceleration, existing low-bit quantization methods overlook two critical challenges in this setting: \textbf{1)} applying online rotation matrices -- a widely used technique for mitigating outliers in Queries ($Q$) and Keys ($K$) -- is difficult to reconcile with \textbf{RoPE}; and \textbf{2)} the non-negative attention matrix $P = \exp(QK - \max(QK))$ makes symmetric quantization waste half of the 4-bit dynamic range. In this work, we observe that the outlier distributions of $Q$ and $K$ are strongly affected by the dimensional partitioning of \textbf{3D RoPE}. Based on this finding, we propose \textbf{RotateAttention}, an efficient \textbf{mixed-precision INT4 FlashAttention} framework tailored for \textbf{DiT-based video generation models with 3D RoPE}, using selective \textbf{FP16 fallback} for accuracy-sensitive attention blocks and denoising steps. RotateAttention introduces two core techniques: \textbf{1) RoPE-aware Rotation}, which employs either mergeable rotation matrices that can be fused into RoPE or negligible-overhead matrices to mitigate RoPE-induced outliers in $Q$ and $K$; and \textbf{2) Range-optimized $P$ Quantization}, which uses fixed scales and zero-points to fully exploit the \textbf{INT4 numerical range} with minimal computational overhead. Experiments show that \textbf{RotateAttention} preserves video generation quality nearly identical to full-precision baselines while achieving up to 1.68$\times$ end-to-end speedup and 2.2$\times$ kernel-level acceleration.
- Abstract(参考訳): 3Dロータリー位置埋め込み(3D RoPE)を備えたtextbf{DiT-based video generation modelでは、アテンション機構は、シーケンス長に関して二次的な複雑さのため、主要な計算ボトルネックのままである。
量子化 \textbf{FlashAttention} はハードウェアアクセラレーションへの有望な道を提供するが、既存の低ビット量子化手法はこの設定において2つの重要な課題を概観する: \textbf{1} オンライン回転行列 - クエリ(Q$) とキー(K$) の外部化を緩和するための広く使われているテクニック -- は、 \textbf{RoPE} と整合することが困難であり、非負の注意行列 $P = \exp(QK - \max(QK))$ は、4ビットダイナミックレンジの半分の対称量子化廃棄物を作る。
本研究では、$Q$ および $K$ の外部分布が \textbf{3D RoPE} の次元分割の影響を強く受けていることを観察する。
本発見に基づき, 3D RoPE} を用いた textbf{DiT ベースのビデオ生成モデルに適した, 効率的な \textbf{RotateAttention} フレームワークである \textbf{RotateAttention} を提案する。
RotateAttentionは2つのコア技術を導入している: \textbf{1 RoPE-aware Rotation} は、RoPEに融合できるマージ可能な回転行列または無視可能なオーバーヘッド行列を用いて、RoPEが引き起こしたアウトリーを$Q$と$K$で緩和する。
実験の結果、‘textbf{RotateAttention’は、最大1.68$\times$エンドツーエンドのスピードアップと2.2$\times$カーネルレベルのアクセラレーションを達成しながら、フル精度のベースラインとほぼ同じ品質の映像を生成する。
関連論文リスト
- Fingerprint, Not Blueprint: How Positional Schemes Set the Default Spectral Algebra of Attention [1.7042264000899534]
最強の先行頭頂部は、RoPEの下でスペクトル回転していることを示す。
また、公開ピティアチェックポイントでは、すべてのヘッドがランダム行列(ジニブレ) null に起源を持つことを示す。
検討された設定の中で、位置スキームはアテンションヘッドの解のデフォルトスペクトル代数を設定する。
論文 参考訳(メタデータ) (2026-07-07T10:17:30Z) - Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling [71.62893745623526]
ビデオフレーム選択は準ガウスサンプリングの問題である。
我々はAdaQと呼ばれる適応的でトレーニングなしのアプローチを提案する。
論文 参考訳(メタデータ) (2026-06-23T06:13:30Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers [15.551959210208862]
Diffusion Transformers (DiTs) は高忠実度ビデオ生成に革命をもたらしたが、その$mathcalO(L2)$ attention complexity は長周期合成の重大なボトルネックとなっている。
3D RoPE誘導Sparse-LowRankアテンションフレームワークである textbfRoPe SLR を提案する。
RoPe SLRはWan2.1-1.3BでのFLOPを最大10ドル、エンドツーエンドの推論スピードアップで2.26ドルである。
論文 参考訳(メタデータ) (2026-05-20T03:24:50Z) - DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization [47.19478866645546]
そこで我々は,DuQuantをMXFP4フォーマットに適応させるDuQuant++を提案する。
MXFP4 W4A4量子化の下でのLLaMA-3ファミリーの実験は、DuQuant++が一貫して最先端のパフォーマンスを実現していることを示している。
論文 参考訳(メタデータ) (2026-04-20T04:27:28Z) - Efficient Matrix Implementation for Rotary Position Embedding [50.45885099010382]
RoPE(Rotary Position Embedding)は、言語、視覚、および3Dドメインにわたるモダントランスフォーマーアーキテクチャのコアコンポーネントとなっている。
ベクトル演算を統一行列変換に置き換える,数学的に等価だが計算効率のよいRoPEの再構成法であるRoMEを提案する。
実験により、RoMEはオペレーターレベルとフルモデルレベルの両方で相当な加速を提供することが示された。
論文 参考訳(メタデータ) (2026-04-10T00:17:47Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - Rank-Aware Spectral Bounds on Attention Logits for Stable Low-Precision Training [0.0]
変圧器における注意スコアは、低精度トレーニングにおけるオーバーフローリスクを最大で支配する2次形式である$S_ij = x_itop M x_j / sqrtd_h$である。
相互作用行列 $M = WQ WKtop$ が階数 $r ll d$ を持つとき、$max_i,j|S_ij|$ は $exp(-d22/) となる。
論文 参考訳(メタデータ) (2026-02-21T14:29:22Z) - E2Former-V2: On-the-Fly Equivariant Attention with Linear Activation Memory [13.451231889715542]
Equivariant Graph Neural Networks (EGNN) は3次元原子論システムのモデリングに広く利用されている。
textbfE2Former-V2は,代数的空間性とハードウェア対応の実行を統合するスケーラブルなアーキテクチャである。
E2Former-V2は、推論を加速しながら、同等の予測性能を維持している。
論文 参考訳(メタデータ) (2026-01-23T10:20:08Z) - Selective Rotary Position Embedding [84.22998043041198]
テキストインプットに依存した回転型埋め込み機構であるtextitSelective RoPE を導入する。
我々は,問合せキー対上で,これらの回転の隠れ形式を,ソフトマックスアテンションがすでに実行していることを示す。
入力依存回転が言語モデルの性能を向上させることを実証し, ゲートトランスフォーマーにtextitSelective RoPE を組み込むことにより, 本手法の有効性を検証した。
論文 参考訳(メタデータ) (2025-11-21T16:50:00Z) - DoPE: Denoising Rotary Position Embedding [60.779039511252584]
トランスフォーマーモデルにおける回転位置埋め込み(RoPE)は、長さを弱める固有の限界を持つ。
ノイズのある特徴写像として位置符号化を用いたアテンションマップを再解釈し、位置補間ページ(DoPE)を提案する。
DoPEは、トランカテッド行列エントロピーに基づくトレーニング不要な手法であり、特徴写像における外乱周波数帯域を検出する。
論文 参考訳(メタデータ) (2025-11-12T09:32:35Z) - A3 : an Analytical Low-Rank Approximation Framework for Attention [14.649496050074735]
トレーニング後の低ランク近似フレームワークである$tt Attt 3$を提案する。
tt Attt 3$ は SoTA よりも優れたパフォーマンスを維持していることを示す。
また、KVキャッシュ圧縮、量子化、性能向上のための混合ランク代入など、$tt Att 3$の汎用性も示す。
論文 参考訳(メタデータ) (2025-05-19T10:29:32Z) - Gravity-aligned Rotation Averaging with Circular Regression [53.81374943525774]
我々は,重力方向をグローバルパイプラインの回転平均位相に統合する原理的アプローチを導入する。
4つの大規模データセットで最先端の精度を実現する。
論文 参考訳(メタデータ) (2024-10-16T17:37:43Z) - Vision Transformer with Sparse Scan Prior [24.78780746169092]
textbfSparse textbfScan textbfSelf-textbfAttention mechanism(rmS3rmA$)を提案する。
このメカニズムはトークンごとに一連のAnchor of Interestをプリ定義し、局所的な注意を使ってこれらのアンカー周辺の空間情報を効率的にモデル化する。
rmS3rmA$で構築すると、 textbfSparse textbfScan textbfVisionを導入します。
論文 参考訳(メタデータ) (2024-05-22T04:34:36Z) - Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object
Detection [89.66162518035144]
点雲から2段階の3Dオブジェクトを検出するための柔軟で高性能なフレームワークであるPraamid R-CNNを提案する。
興味の疎い点から特徴を適応的に学習するために,ピラミッドRoIヘッドという新しい第2段モジュールを提案する。
我々のピラミッドRoIヘッドはスパースかつ不均衡な状況に対して堅牢であり、検出性能を継続的に向上するために様々な3Dバックボーンに適用することができる。
論文 参考訳(メタデータ) (2021-09-06T14:17:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。