論文の概要: FastE: Readout-Triggered Token Compression for LLM Embedding Inference
- arxiv url: http://arxiv.org/abs/2609.08407v2
- Date: Thu, 10 Sep 2026 09:25:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.282099
- Title: FastE: Readout-Triggered Token Compression for LLM Embedding Inference
- Title(参考訳): FastE: LLM埋め込み推論のための読み出しトリガートケン圧縮
- Authors: Jinsong Shu, Jinyong Wen, Baokun Wang, Zhongle Xie, Lidan Shou, Weiqiang Wang, Gang Chen,
- Abstract要約: 最終読出埋め込みモデルにおける深さ依存プレフィックスの冗長性を同定する。
トレーニング不要なプラグアンドプレイ方式であるFastEを紹介する。
- 参考スコア(独自算出の注目度): 24.546359057068997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this study, we identify depth-dependent prefix redundancy in final-readout LLM embedding models, notably across representative backbones including Qwen3-Embedding and Qwen3-VL-Embedding. We find that removing prefix states is substantially more damaging in shallow layers than at greater depth, showing that prefix states become increasingly compressible as the prefix and readout states propagate through the network. To this end, we introduce FastE, a training-free, plug-and-play method. FastE uses a shared fixed threshold on batch-mean readout-prefix alignment as a lightweight online heuristic for selecting when compression occurs, and ranks prefix states by the attention scores they receive from the readout position to determine which states are retained in subsequent layers. Our evaluations demonstrate FastE's ability to substantially reduce computational costs: on NarrativeQA with Qwen3-Embedding-0.6B, it reduces decoder-backbone FLOPs by 40.11% while retaining 99.53% of Full Forward nDCG@10. Across five text embedding benchmarks, two backbone scales, and three cross-modal retrieval tasks, the quality-efficiency trade-off is directly customizable through the maximum removal ratio without retraining. We believe FastE offers practical value for scalable embedding generation in retrieval, indexing, clustering, and multimodal representation systems.
- Abstract(参考訳): 本研究では,最終読出LDM埋め込みモデル,特にQwen3-EmbeddingやQwen3-VL-Embeddingなどの代表的バックボーンにおける深さ依存性プレフィックスの冗長性を同定する。
その結果,プレフィックス状態がネットワークを介して伝播するにつれて,プレフィックス状態が圧縮しやすくなっていることがわかった。
この目的のために,FastEはトレーニング不要のプラグイン・アンド・プレイ方式である。
FastEはバッチ平均リードアウト-プリフィックスアライメントの共有固定閾値を、圧縮が発生した時に選択するための軽量なオンラインヒューリスティックとして使用し、リードアウト位置から受信したアテンションスコアによってプレフィックス状態のランク付けを行い、後続のレイヤでどの状態が保持されているかを決定する。
評価の結果,NarrativeQA with Qwen3-Embedding-0.6Bでは,デコーダバックボーンFLOPを40.11%削減し,フルフォワードnDCG@10の99.53%を維持した。
5つのテキスト埋め込みベンチマーク、2つのバックボーンスケール、3つのクロスモーダル検索タスクにまたがって、品質効率のトレードオフは、再トレーニングなしで最大削除比率で直接カスタマイズできる。
我々はFastEが、検索、インデックス、クラスタリング、マルチモーダル表現システムにおけるスケーラブルな埋め込み生成に実用的な価値を提供すると考えている。
関連論文リスト
- BitNet Text Embeddings [104.29781473344813]
BITEMBEDは,符号化効率とベクトル記憶を両立させるLLMベースのテキスト埋め込みのための極低ビットフレームワークである。
BITEMBEDは、トレーニング済みのLLMバックボーンを3次重み、量子化アクティベーション、軽量な正規化改善を備えたBitNetスタイルの埋め込みエンコーダに変換する。
Qwen3-0.6B と Gemma703-2M を用いた MMTEB (eng) の実験では、BITEMBED は完全精度の教師埋め込み器とほぼ同等であることが示された。
論文 参考訳(メタデータ) (2026-06-24T10:37:01Z) - Closing the Indexing-Decoding Gap in Multimodal Generative Retrieval via Prefix Retention Optimization [68.48718919047127]
マルチモーダル生成検索式は、複数のモーダル検索を離散識別子生成として定義し、外部埋め込みよりも明示的な類似性探索を不要とする。
既存の手法では、残差量子化によって識別子を構築し、トリエ制約ビームサーチでデコードする。
この組み合わせは、インデックス化とデコーディングのギャップを導入している: 識別子学習の目的は、再構成や対照的な損失を含むが、デコーディング中にプレフィックスの識別性を明示的に強制しない。
1)プレフィックスの格付け蒸留は、リストワイドロスを用いた事前量子化埋め込みによって誘導されるプレフィックスと整合する; (ii)語彙スケジューリングは、コードブックを増大させる。
論文 参考訳(メタデータ) (2026-06-08T09:15:47Z) - UNIQUE: Universal Top-k Sparse Attention for Training-free Inference and Sparsity-aware Training [25.273337266205413]
大規模言語モデル(LLM)における長文推論は、自己注意キー値(KV)キャッシュの線形成長によってボトルネックとなる。
Top-kキャッシュはKVキャッシュのごく一部で注意を緩和するが、トレーニングと補助トレーニングの両方において、正確に重要性を推定する。
論文 参考訳(メタデータ) (2026-05-26T22:32:43Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs [12.949322198287417]
凍結LDMの潜在表現力を活性化するフレームワークであるKV-Embeddingを提案する。
提案手法では, 各層における最終トークンのキー値(KV)状態が, シーケンスの圧縮されたビューを符号化する。
KV-Embeddingは,最大4,096個のトークンに対して堅牢な性能を維持しつつ,トレーニング不要のベースラインを最大10%向上させることを示す。
論文 参考訳(メタデータ) (2026-01-03T02:55:43Z) - Memory-Efficient FastText: A Comprehensive Approach Using Double-Array Trie Structures and Mark-Compact Memory Management [0.0]
FastTextは、単語表現を学習するための基本的なアルゴリズムとして自らを確立した。
しかし、ハッシュベースのバケット機構は、大規模産業展開に重大な制限をもたらす。
本稿では,FastTextのメモリ管理を再定義するメモリ最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-02T02:11:22Z) - A Universal Framework for Compressing Embeddings in CTR Prediction [68.27582084015044]
本稿では,事前学習した埋め込みを定量化することにより,埋め込みテーブルを圧縮するモデル非依存型埋め込み圧縮(MEC)フレームワークを提案する。
まず、高頻度特徴と低周波特徴のバランスをとるために、人気重み付け正規化を適用します。
3つのデータセットの実験により,提案手法はメモリ使用量を50倍以上削減し,レコメンデーション性能を維持・改善する。
論文 参考訳(メタデータ) (2025-02-21T10:12:34Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。