論文の概要: Training-Free Hashing-Based Attention via Binary Principal Components
- arxiv url: http://arxiv.org/abs/2608.04405v1
- Date: Wed, 05 Aug 2026 03:19:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.701394
- Title: Training-Free Hashing-Based Attention via Binary Principal Components
- Title(参考訳): 二元主成分による学習自由ハッシングに基づく注意
- Authors: Daohai Yu, Zhanpeng Zeng, Keyu Chen, Wenhao Li, Zhifeng Shen, Luxi Lin, Ruizhi Qiao, Xing Sun, Rongrong Ji,
- Abstract要約: Long-context Large Language Model (LLM) は、現実世界のアプリケーションにますます多くデプロイされている。
既存のスパースアテンションはKVペアを減らすことで計算を減少させるが、しばしばかなりの精度の劣化に悩まされる。
我々は、長期LLMのためのトレーニング不要でデータ認識型ハッシュに基づくスパースアテンションであるBinaryPCを提案する。
- 参考スコア(独自算出の注目度): 62.88957443238231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context large language models (LLMs) are increasingly deployed in real-world applications, yet self-attention remains a major efficiency bottleneck -- especially during decoding -- due to the necessity of repeatedly processing ever-growing key-value (KV) caches. Existing sparse attention reduce computation by attending to fewer KV pairs, but often suffer from substantial accuracy degradation, require additional training, or rely on expensive hashing. In this work, we present BinaryPC, a training-free, data-aware hashing-based sparse attention for long-context LLMs. BinaryPC constructs compact binary hash codes and corresponding hash function by computing binary principal components of data. Unlike Locality-Sensitive Hashing (LSH) with data-independent random projections or learned non-linear hashing methods, BinaryPC constructs binary codes that explicitly preserve the structural information of data without requiring gradient-based training. Comprehensive experiments across multiple model families and long-context benchmarks show that BinaryPC preserves accuracy relative to full attention while achieving superior performance among sparse and hashing-based baselines. On modern GPUs, BinaryPC improves end-to-end decoding throughput by 3.56$\times$ over the FlashAttention kernel. Our code is available at https://github.com/yudaohai666/BPC.
- Abstract(参考訳): 長期コンテキストの大規模言語モデル(LLM)は、現実世界のアプリケーションにますますデプロイされているが、キーバリュー(KV)キャッシュを繰り返し処理する必要があるため、自己注意は、特にデコーディングにおいて、大きな効率のボトルネックとなっている。
既存のスパースアテンションはKVペアを減らすことで計算を減少させるが、しばしば相当な精度の劣化に悩まされ、追加のトレーニングを必要としたり、高価なハッシュに依存する。
本研究では,長期LLMのためのトレーニングフリーでデータ認識型ハッシュに基づくスパースアテンションであるBinaryPCを提案する。
BinaryPCは、データのバイナリ主成分を計算することで、コンパクトなバイナリハッシュコードとそれに対応するハッシュ関数を構築する。
データの非依存的なランダムプロジェクションや学習された非線形ハッシュメソッドを持つLocality-Sensitive Hashing(LSH)とは異なり、BinaryPCは勾配ベースのトレーニングを必要とせずにデータの構造情報を明示的に保存するバイナリコードを構築している。
複数のモデルファミリと長期コンテキストベンチマークの総合的な実験により、BinaryPCはスパースベースラインとハッシュベースラインで優れた性能を保ちながら、フルアテンションに対する精度を保っていることが示された。
現代のGPUでは、BinaryPCはFlashAttentionカーネル上でのエンドツーエンドのデコードスループットを3.56$\times$で改善している。
私たちのコードはhttps://github.com/yudaohai666/BPCで利用可能です。
関連論文リスト
- Spotlight Attention: Towards Efficient LLM Generation via Non-linear Hashing-based KV Cache Retrieval [67.21678698740267]
本研究では,クエリやキーの埋め込み分布を最適化するために,非線形ハッシュ関数を利用する新しい手法であるSpotlight Attentionを紹介する。
また、Bradley-Terryランキングに基づく損失を利用して、軽量で安定したトレーニングフレームワークを開発する。
論文 参考訳(メタデータ) (2025-08-27T10:11:27Z) - Voronoi Diagram Encoded Hashing [9.339307138969193]
ボロノイ図形はその3つの性質のために適切な候補である。
本稿では,Voronoi Diagram Encoded Hashing (VDeH) と呼ばれる,単純で効率的なノンラーニングバイナリハッシュ法を提案する。
論文 参考訳(メタデータ) (2025-08-04T10:16:48Z) - Auto-Encoding Twin-Bottleneck Hashing [141.5378966676885]
本稿では,効率よく適応的なコード駆動グラフを提案する。
自動エンコーダのコンテキストでデコードすることで更新される。
ベンチマークデータセットの実験は、最先端のハッシュ手法よりもフレームワークの方が優れていることを明らかに示しています。
論文 参考訳(メタデータ) (2020-02-27T05:58:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。