論文の概要: Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection
- arxiv url: http://arxiv.org/abs/2607.21752v1
- Date: Thu, 23 Jul 2026 19:05:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.972728
- Title: Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection
- Title(参考訳): 圧縮型コンテンツ選択によるパラメータフリー適応スパースアテンション
- Authors: Debarshi Kundu, Swaroop Ghosh, Vasant Honavar,
- Abstract要約: データ適応的なスパース・アテンション・マスクは固定パターン(例えばBigBirdやLongformer)を著しく上回り、長いシーケンスに対する集中的な注意を超えることもある。
我々は、古典的なデータ圧縮がtextbfno の追加パラメータを持つ効果的なマスキング信号を提供することを示した。
PG-19 byte-level language modeling at 92M parameters with 8K context, our method achieves 1.71 bits-byte (BPB)。
アドバンテージはシーケンス長とともに増大し、BigBird は 4K コンテキストで 0.05 BPB から 8K で 0.63 BPB に拡大し、収束時間は 3.3$time となる。
- 参考スコア(独自算出の注目度): 0.5352699766206807
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Data-adaptive sparse attention masks substantially outperform fixed patterns (e.g., BigBird and Longformer) and can even exceed dense attention on long sequences. Existing adaptive approaches---including SBM-Transformer, Dynamic Mask Attention, and NSA---typically require additional learnable parameters, custom gradient estimators, or specialized CUDA kernels. We show that classical data compression provides an effective masking signal with \textbf{no additional parameters}. By computing per-block gzip compression ratios, we identify non-redundant content blocks and route long-range attention selectively through them. Intuitively, blocks that gzip cannot compress contain information not predictable from local repetition, making them natural long-range attention targets. Because the compression profile is input-dependent, the resulting sparse mask adapts dynamically to content without learned parameters, auxiliary losses, or custom kernels. On PG-19 byte-level language modeling at 92M parameters with 8K context, our method achieves 1.71 bits-per-byte (BPB), outperforming dense attention (2.89), BigBird (2.34), Longformer (3.21), and a reimplemented SBM-Transformer (3.38)---the only learned-mask baseline---by up to 1.67 BPB while adding no parameters. The advantage grows with sequence length, with the gap over BigBird widening from 0.05 BPB at 4K context to 0.63 BPB at 8K, while convergence is 3.3$\times$ faster.
- Abstract(参考訳): データ適応的なスパース・アテンション・マスクは固定パターン(例えばBigBirdやLongformerなど)を大幅に上回り、長いシーケンスに対する集中的な注意を超えることもある。
SBM-Transformer、Dynamic Mask Attention、NSAを含む既存の適応型アプローチは、通常、学習可能なパラメータ、カスタム勾配推定器、または特殊なCUDAカーネルを必要とする。
古典的なデータ圧縮は, <textbf{no additional parameters} を用いた効果的なマスキング信号を提供することを示す。
ブロックごとのgzip圧縮比を計算することで、非冗長なコンテンツブロックを特定し、長距離の注意を選択的にルーティングする。
直感的には、gzipが圧縮できないブロックには、局所的な繰り返しから予測できない情報が含まれており、それらが自然な長距離の注意対象となっている。
圧縮プロファイルは入力依存であるため、結果のスパースマスクは学習パラメータや補助損失、カスタムカーネルを使わずに動的にコンテンツに適応する。
8Kのコンテキストを持つ92MパラメータでのPG-19バイトレベルの言語モデリングでは,1.71ビット/バイト(BPB)を達成し,高い注目(2.89),BigBird(2.34),Longformer(3.21),再実装されたSBM-Transformer(3.38)を実現した。
アドバンテージはシーケンス長とともに増大し、BigBirdは4Kコンテキストで0.05BPBから8Kで0.63BPBに拡大し、収束は3.3$\times$速くなった。
関連論文リスト
- Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models [0.0]
可変ビット幅量子化(VBQ)を導入する。
64重みの連続した群が1,2,4,8ビットから独自の分解能を学習する訓練時間法である。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
論文 参考訳(メタデータ) (2026-07-03T02:42:04Z) - Compute Optimal Tokenization [79.3815358070537]
圧縮速度によって制御されるトークンの情報粒度がスケーリングの傾向にどのように影響するかを検討する。
所望の圧縮速度の設定を可能にする50Mから7Bパラメータまで,988の潜在トークン化モデル(BLT)を訓練する。
実験の結果, モデルパラメータは, 一般に認識されるトークンではなく, バイト単位のデータサイズに比例してスケールすることがわかった。
論文 参考訳(メタデータ) (2026-05-02T01:53:22Z) - Breaking the KV Cache Bottleneck: Fan Duality Model Achieves O(1) Decode Memory with Superior Associative Recall [0.0]
Fan Duality Modelは、シーケンスモデリングにおけるメモリ効率と連想リコールの間の緊張を解消する。
FDMはシーケンス処理を、長距離パターンを隠蔽状態に圧縮する波動成分と、特定のトークンを取得する粒子成分の2つのコンポーネントに分割する。
本稿では,再帰的なスキャンを凍結し,キャッシュを埋め込みと共に最適化する2段階のトレーニング戦略であるFreeze-Scanを提案する。
論文 参考訳(メタデータ) (2026-04-09T02:00:30Z) - StateSMix: Online Lossless Compression via Mamba State Space Models and Sparse N-gram Context Mixing [0.0]
StateSMixはオンライントレーニングされたMambaスタイルのステートスペースモデル(SSM)で、スパース n-gram コンテキストの混合と算術符号を持つ。
SSMはBPEトークンに対して連続的に更新された確率推定を提供し、9つのスパースn-gramハッシュテーブルは正確な局所および長距離パターン記憶を付加する。
標準のenwik8ベンチマークでは、StateSMixは1MBで2.123bpb、3MBで2.149bpb、10MBで2.162bp、xz-9e(LZMA2)を8.7%、5.4%、そして2.162bpbを達成した。
論文 参考訳(メタデータ) (2026-04-05T19:28:11Z) - Nacrith: Neural Lossless Compression via Ensemble Context Modeling and High-Precision CDF Coding [0.0]
本研究では,自然言語テキストにおいて評価されたシステム間で最高の圧縮結果を得る圧縮システムであるNacrithについて述べる。
このシステムは500MBのGGUF重量と1ワーカーあたり1.2GBのVRAMしか必要としない。
Alice29 (Canterbury Corpus, 152 KB) では、Nacrith は 0th-, 1st-, 2nd-order Shannon entropy 境界以下で 0.918bits per byte (bpb) を達成する。
論文 参考訳(メタデータ) (2026-02-23T09:14:05Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight
Compression [76.73007709690306]
Sparse-Quantized Representation (SpQR) は,新しい圧縮フォーマットと量子化技術である。
SpQRは、高精度なLLaMAとFalcon LLMのパープレキシティにおいて、1%未満の相対的精度の損失を達成している。
これにより、1台の24GBのコンシューマGPU上で33BパラメータのLSMを実行でき、15%のスピードアップでパフォーマンスの劣化は発生しない。
論文 参考訳(メタデータ) (2023-06-05T17:53:28Z) - FlashAttention: Fast and Memory-Efficient Exact Attention with
IO-Awareness [80.3586155104237]
FlashAttentionは、トランスフォーマーのためのIO対応の正確な注意アルゴリズムである。
これにより、GPU高帯域メモリ(HBM)とGPUオンチップ間のメモリ読み込み/書き込み数を削減できる。
FlashAttentionとブロックスパース FlashAttentionは、トランスフォーマーのコンテキストを長くすることを可能にする。
論文 参考訳(メタデータ) (2022-05-27T17:53:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。