論文の概要: Training-Free Hashing-Based Attention via Binary Principal Components
- arxiv url: http://arxiv.org/abs/2608.04405v1
- Date: Wed, 05 Aug 2026 03:19:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.701394
- Title: Training-Free Hashing-Based Attention via Binary Principal Components
- Title(参考訳): 二元主成分による学習自由ハッシングに基づく注意
- Abstract要約: Long-context Large Language Model (LLM) は、現実世界のアプリケーションにますます多くデプロイされている。
既存のスパースアテンションはKVペアを減らすことで計算を減少させるが、しばしばかなりの精度の劣化に悩まされる。
我々は、長期LLMのためのトレーニング不要でデータ認識型ハッシュに基づくスパースアテンションであるBinaryPCを提案する。
- 参考スコア(独自算出の注目度): 62.88957443238231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context large language models (LLMs) are increasingly deployed in real-world applications, yet self-attention remains a major efficiency bottleneck -- especially during decoding -- due to the necessity of repeatedly processing ever-growing key-value (KV) caches. Existing sparse attention reduce computation by attending to fewer KV pairs, but often suffer from substantial accuracy degradation, require additional training, or rely on expensive hashing. In this work, we present BinaryPC, a training-free, data-aware hashing-based sparse attention for long-context LLMs. BinaryPC constructs compact binary hash codes and corresponding hash function by computing binary principal components of data. Unlike Locality-Sensitive Hashing (LSH) with data-independent random projections or learned non-linear hashing methods, BinaryPC constructs binary codes that explicitly preserve the structural information of data without requiring gradient-based training. Comprehensive experiments across multiple model families and long-context benchmarks show that BinaryPC preserves accuracy relative to full attention while achieving superior performance among sparse and hashing-based baselines. On modern GPUs, BinaryPC improves end-to-end decoding throughput by 3.56$\times$ over the FlashAttention kernel. Our code is available at https://github.com/yudaohai666/BPC.
- Abstract(参考訳): 長期コンテキストの大規模言語モデル(LLM)は、現実世界のアプリケーションにますますデプロイされているが、キーバリュー(KV)キャッシュを繰り返し処理する必要があるため、自己注意は、特にデコーディングにおいて、大きな効率のボトルネックとなっている。
既存のスパースアテンションはKVペアを減らすことで計算を減少させるが、しばしば相当な精度の劣化に悩まされ、追加のトレーニングを必要としたり、高価なハッシュに依存する。
本研究では,長期LLMのためのトレーニングフリーでデータ認識型ハッシュに基づくスパースアテンションであるBinaryPCを提案する。
BinaryPCは、データのバイナリ主成分を計算することで、コンパクトなバイナリハッシュコードとそれに対応するハッシュ関数を構築する。
データの非依存的なランダムプロジェクションや学習された非線形ハッシュメソッドを持つLocality-Sensitive Hashing(LSH)とは異なり、BinaryPCは勾配ベースのトレーニングを必要とせずにデータの構造情報を明示的に保存するバイナリコードを構築している。
複数のモデルファミリと長期コンテキストベンチマークの総合的な実験により、BinaryPCはスパースベースラインとハッシュベースラインで優れた性能を保ちながら、フルアテンションに対する精度を保っていることが示された。
現代のGPUでは、BinaryPCはFlashAttentionカーネル上でのエンドツーエンドのデコードスループットを3.56$\times$で改善している。
私たちのコードはhttps://github.com/yudaohai666/BPCで利用可能です。
関連論文リスト
- Image Hashing via Cross-View Code Alignment in the Age of Foundation Models [3.33876524834826]
COCOVCA(Cross-View Code Alignment)は、バイナリコードを学ぶためのシンプルで統一された原則である。
HashCoderは、バランスの取れたコードを実行するための最終バッチ正規化レイヤを備えた軽量なハッシュネットワークである。
CroVCAは5つのトレーニングエポックで最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-10-31T16:08:46Z) - Spotlight Attention: Towards Efficient LLM Generation via Non-linear Hashing-based KV Cache Retrieval [67.21678698740267]
本研究では,クエリやキーの埋め込み分布を最適化するために,非線形ハッシュ関数を利用する新しい手法であるSpotlight Attentionを紹介する。
また、Bradley-Terryランキングに基づく損失を利用して、軽量で安定したトレーニングフレームワークを開発する。
論文 参考訳(メタデータ) (2025-08-27T10:11:27Z) - Voronoi Diagram Encoded Hashing [9.339307138969193]
ボロノイ図形はその3つの性質のために適切な候補である。
本稿では,Voronoi Diagram Encoded Hashing (VDeH) と呼ばれる,単純で効率的なノンラーニングバイナリハッシュ法を提案する。
論文 参考訳(メタデータ) (2025-08-04T10:16:48Z) - Deep Asymmetric Hashing with Dual Semantic Regression and Class
Structure Quantization [9.539842235137376]
本稿では,三重制約の下で識別ハッシュを生成する二項意味非対称ハッシュ(DSAH)法を提案する。
これら3つの主要コンポーネントにより、ネットワークを介して高品質なハッシュコードを生成することができる。
論文 参考訳(メタデータ) (2021-10-24T16:14:36Z) - Fast Class-wise Updating for Online Hashing [196.14748396106955]
本稿では,FCOH(Fast Class-wise Updating for Online Hashing)と呼ばれる新しいオンラインハッシュ方式を提案する。
クラスワイズ更新法は、バイナリコード学習を分解し、代わりにクラスワイズ方式でハッシュ関数を更新する。
オンラインの効率をより高めるために,異なるバイナリ制約を独立に扱うことで,オンライントレーニングを高速化する半緩和最適化を提案する。
論文 参考訳(メタデータ) (2020-12-01T07:41:54Z) - Making Online Sketching Hashing Even Faster [63.16042585506435]
本稿では,FROSH(FasteR Online Sketching Hashing)アルゴリズムを提案する。
提案したFROSHがより少ない時間を消費し、同等のスケッチ精度を実現することを保証するための理論的正当性を提供する。
また、FROSHの分散実装であるDFROSHを拡張して、FROSHのトレーニング時間コストをさらに削減する。
論文 参考訳(メタデータ) (2020-10-10T08:50:53Z) - Learning to Hash with Graph Neural Networks for Recommender Systems [103.82479899868191]
グラフ表現学習は、大規模に高品質な候補探索をサポートすることに多くの注目を集めている。
ユーザ・イテム相互作用ネットワークにおけるオブジェクトの埋め込みベクトルの学習の有効性にもかかわらず、連続的な埋め込み空間におけるユーザの好みを推測する計算コストは膨大である。
連続的かつ離散的なコードとを協調的に学習するための,単純かつ効果的な離散表現学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-03-04T06:59:56Z) - Auto-Encoding Twin-Bottleneck Hashing [141.5378966676885]
本稿では,効率よく適応的なコード駆動グラフを提案する。
自動エンコーダのコンテキストでデコードすることで更新される。
ベンチマークデータセットの実験は、最先端のハッシュ手法よりもフレームワークの方が優れていることを明らかに示しています。
論文 参考訳(メタデータ) (2020-02-27T05:58:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。