論文の概要: Spectral-LSH: Sub-Quadratic Prompt Compression via Krylov-Projected Locality-Sensitive Hashing
- arxiv url: http://arxiv.org/abs/2607.19368v1
- Date: Fri, 12 Jun 2026 01:11:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.137465
- Title: Spectral-LSH: Sub-Quadratic Prompt Compression via Krylov-Projected Locality-Sensitive Hashing
- Title(参考訳): Spectral-LSH: Krylov-Projected Locality-Sensitive Hashingによるサブクアドラティック・プロンプト圧縮
- Abstract要約: プリフィルアテンションはシークエンスの長さで2倍にスケールするため、ロングプロンプト推論は依然として高価である。
本稿では,プロンプトが言語モデルに入る前に動作させる訓練不要なプロンプト圧縮手法であるSpectral-LSHを提案する。
- 参考スコア(独自算出の注目度): 1.6816043938020273
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-prompt inference remains expensive because prefill attention scales quadratically with sequence length. We propose Spectral-LSH, a training-free prompt compression method that operates before the prompt enters the language model. Spectral-LSH approximates the dominant components of an implicit attention-kernel operator using a Krylov subspace method together with random features, avoiding explicit $O(N^2)$ attention-kernel materialization. It then applies SimHash in the resulting attention eigenspace to group similar tokens and aggregate them into macro-tokens with causal positional assignments. We evaluate Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct, and Qwen2.5-14B-Instruct on C4. Our experiments reveal a compression-ratio phase transition. Below $ρ= 4 \times$, local token redundancy is low enough that lightweight chunking typically provides the best latency--quality trade-off. Above $ρ= 8 \times$, the spectral path preserves quality that chunking loses. At $ρ= 16 \times$, Qwen2.5-7B (adaptive) reduces the PPL ratio from 353.409 to 196.963, while Qwen2.5-14B (adaptive) reduces it from 9.533 to 3.427. On a small long-context structured stress test containing JSON-like, code-like, and table-like inputs, local LSH also improves every metric over chunking at $8 \times$. The adaptive backend captures both regimes by using the chunk path at low compression and spectral clustering at high compression, although chunking remains the fastest backend in total latency.
- Abstract(参考訳): プリフィルアテンションはシークエンスの長さで2倍にスケールするため、ロングプロンプト推論は依然として高価である。
本稿では,プロンプトが言語モデルに入る前に動作させる訓練不要なプロンプト圧縮手法であるSpectral-LSHを提案する。
スペクトル-LSHは、Krylov部分空間法とランダムな特徴を持つ暗黙の注意カーネル作用素の主成分を近似し、明示的な$O(N^2)$注意カーネルの物質化を避ける。
次に、SimHashを結果として生じる注目固有空間に適用して、類似したトークンをグループ化し、因果的な位置割り当てを持つマクロトークンに集約する。
C4ではMistral-7B-Instruct-v0.3,Qwen2.5-7B-Instruct,Qwen2.5-14B-Instructを評価した。
実験により圧縮比相転移が明らかになった。
以下は$ρ= 4 \times$で、ローカルトークンの冗長性は十分低く、軽量なチャンキングは通常、最高のレイテンシ品質のトレードオフを提供します。
以上の$ρ= 8 \times$では、スペクトルパスはチャンキングが失う品質を保存する。
Qwen2.5-7B (adaptive) は PPL 比を 353.409 から 196.963 に下げ、Qwen2.5-14B (adaptive) は 9.533 から 3.427 に下げる。
JSONライク、コードライク、テーブルライクな入力を含む、小さな長いコンテキストで構造化されたストレステストでは、ローカルなLSHは、チャンキングよりも、すべてのメトリックを8 \times$で改善する。
アダプティブバックエンドは、チャンクパスを低圧縮で、スペクトルクラスタリングを高圧縮で、両方のレシブをキャプチャする。
関連論文リスト
- Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM [0.0]
ミニマ: NVFP4 W4A4は、GDNを含む496のリニア層である。
NVFP4の16要素ブロックのスケーリングが残ストリームの極端な外れ値の局所化の原因を説明する4つのメカニズムの研究がある。
ハイブリッド LLM の繰り返し半分が量子化し易い理由に関する力学的な説明。
論文 参考訳(メタデータ) (2026-09-03T17:04:26Z) - RoPE-Aware Bit Allocation for KV-Cache Quantization [52.099459337231345]
Block-GTQはTurboQuant-MSE上に構築されたキーキャッシュ量子化のためのビットアロケータである。
これは、RoPEクエリキーのロジットを10モデル診断パネルに保存する。
128Kコンテキストでfp16 FlashAttention2より1.34倍高速で動作する。
論文 参考訳(メタデータ) (2026-06-23T00:17:48Z) - When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon [0.0]
KVキャッシュ量子化は、品質-レイテンシトレードオフとしてフレーム化される。
Apple Siliconの統一メモリにインセンティブを与えています。
論文 参考訳(メタデータ) (2026-05-07T05:44:39Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - ParallelComp: Parallel Long-Context Compressor for Length Extrapolation [51.68913021512016]
超長い文脈(テキスト長 >128K)の補間は、大きな言語モデル(LLM)にとって大きな課題である。
本研究では,メモリボトルネックを効果的に克服する並列長コンテキスト圧縮手法であるParallelCompを提案する。
チャンクスループットが1.76倍向上し、プリフィル段階では23.50倍の高速化を実現し、性能損失を無視できる。
論文 参考訳(メタデータ) (2025-02-20T07:10:43Z) - Squeezed Attention: Accelerating Long Context Length LLM Inference [61.787865959140994]
本稿では,入力コンテキストの大部分を固定したアプリケーションを高速化するために,Squeezed Attentionを提案する。
推論中、ユーザ入力からのクエリトークンとセントロイドを比較し、固定されたコンテキストからどのキーが意味論的に関連しているかを予測する。
また,線形から対数的への注意の複雑さを,固定した文脈長に対して低減できる階層型アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-11-14T18:54:19Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - Debiased Distribution Compression [30.600795754425775]
本稿では, バイアス入力シーケンスによる圧縮に適した新しい圧縮手法を提案する。
バーンイン,近似マルコフ連鎖モンテカルロ,テンパリングによるバイアスを克服しつつ,簡潔かつ正確な後続サマリーを提供する。
論文 参考訳(メタデータ) (2024-04-18T16:11:16Z) - A lower bound on the space overhead of fault-tolerant quantum computation [51.723084600243716]
しきい値定理は、フォールトトレラント量子計算の理論における基本的な結果である。
振幅雑音を伴う耐故障性量子計算の最大長に対する指数的上限を証明した。
論文 参考訳(メタデータ) (2022-01-31T22:19:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。