論文の概要: Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors
- arxiv url: http://arxiv.org/abs/2607.25335v2
- Date: Wed, 29 Jul 2026 12:56:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.722623
- Title: Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors
- Title(参考訳): 私が言語学者を雇うたびに、推論コストは低下する:効果的なプロンプト圧縮機としての言語規則について
- Authors: Jianfei Ma, Zhaoxin Feng, Emmanuele Chersoni, Si Chen,
- Abstract要約: 我々は, 語彙, 構文, 意味, 言説の種を進化的に探索し, 競争ルールの組み合わせを見つける。
結果、言語圧縮機はデプロイメント時にLMフォワードパスを必要とせず、CPU側でのみ圧縮を行う。
圧縮品質と復元精度のバランスをとるために,デュアルパスプロトコルを用いて評価を行った。
- 参考スコア(独自算出の注目度): 13.49190771932777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt compression shortens LLM input to reduce inference cost, yet existing methods score token importance through LM forward passes. It remains questionable whether such nuanced, costly token selection is necessary. Compression requires identifying informative content, a problem that linguistic research has long addressed through cues that can be operationalized as deterministic rules. We therefore ask: can \textbf{linguistic rules alone} serve as effective prompt compressors, without LM-based scoring at compression time? To address this, we conduct offline evolutionary search over lexical, syntactic, semantic, and discourse seeds to find competitive rule combinations. The resulting linguistic compressor requires no LM forward pass at deployment and uses only CPU-side processing for compression. We evaluate it with a dual-path protocol to balance compression quality and reconstruction fidelity. Across short passages, multi-document reasoning, and dialogue-memory QA datasets, evolved compressors achieve performance similar to that of recent advanced prompt-compression strategies. Performance is strongest under light-to-moderate compression and degrades as compression becomes more aggressive, while the Direct and Reconstruction paths exhibit distinct patterns. Evolutionary analysis reveals that effective compression fuses signals across linguistic levels and, as the compression ratio increases, rules shift from token pruning to sentence extraction.
- Abstract(参考訳): プロンプト圧縮はLPM入力を短縮して推論コストを削減するが、既存の手法ではLMフォワードパスを通じてトークンの重要性を評価する。
このようなニュアンスでコストのかかるトークンの選択が必要かどうかはまだ疑問である。
圧縮には情報的内容の特定が必要であるが、これは言語研究が決定論的ルールとして運用できる手がかりを通じて長年にわたって取り組んできた問題である。
したがって、次のように問う: \textbf{linguistic rules} だけでは、LMベースのスコアリングなしで、効率的なプロンプト圧縮機として機能できるだろうか?
これを解決するために、語彙、構文、意味、言論の種についてオフラインで進化的探索を行い、競合するルールの組み合わせを見つける。
結果、言語圧縮機はデプロイメント時にLMフォワードパスを必要とせず、CPU側でのみ圧縮を行う。
圧縮品質と復元精度のバランスをとるために,デュアルパスプロトコルを用いて評価を行った。
ショートパス、マルチドキュメント推論、対話記憶型QAデータセットは、最近の先進的なプロンプト圧縮戦略と同様のパフォーマンスを達成する。
圧縮がよりアグレッシブになり、ダイレクトパスとレコンストラクションパスは異なるパターンを示す。
進化的分析により、効果的な圧縮は言語レベルにわたる信号を融合させ、圧縮比が増加するにつれて、規則はトークンプルーニングから文抽出へと移行することが明らかになった。
関連論文リスト
- Lossless Prompt Compression via Dictionary-Encoding and In-Context Learning: Enabling Cost-Effective LLM Analysis of Repetitive Data [0.19780197369405136]
本稿では,大規模言語モデルを用いて,テキスト中のキーのエンコーディングを学習し,符号化された表現の分析を行うことができることを示す。
本稿では,複数長さの繰り返しパターンを識別する圧縮アルゴリズムを提案する。
このトレーニング不要のアプローチは、APIベースのLLMで動作し、基本的なデプロイメント制約に直接対処する。
論文 参考訳(メタデータ) (2026-03-19T21:05:53Z) - Cognitive Chunking for Soft Prompts: Accelerating Compressor Learning via Block-wise Causal Masking [28.492055407384495]
長期のコンテキストは、自己注意の計算コストがシークエンスの長さと2次的に増加するにつれて、推論遅延を増大させる。
既存のメソッドは通常、コンテキスト全体を無差別にメモリトークンの集合に圧縮する。
本稿では,メモリトークンの受容領域を逐次局所チャンクに制限する並列反復圧縮(PIC)を提案する。
論文 参考訳(メタデータ) (2026-02-15T03:58:13Z) - Detecting Overflow in Compressed Token Representations for Retrieval-Augmented Generation [49.48204107529758]
我々はトークンオーバーフローを、圧縮された表現が与えられたクエリに応答する十分な情報を含んでいない状態として定義する。
本稿では,非圧縮トークン表現から,クエリ非依存の飽和統計を確実に分離することを見出した。
クエリとコンテキストの両方のxRAG表現上の軽量なプローブ分類器は平均0.72 AUC-ROCでオーバーフローを検出する。
これらの結果は、クエリ非依存の診断からクエリ対応検出まで進歩し、低コストのプレLLMゲーティングにより、圧縮によるエラーを軽減できる。
論文 参考訳(メタデータ) (2026-02-12T18:15:08Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - Autoencoding-Free Context Compression for LLMs via Contextual Semantic Anchors [43.02557489472655]
現在の文脈圧縮法は、文脈に依存しない圧縮トークンを訓練し、文脈意味論を圧縮する自動符号化タスクに依存している。
本稿では,自動符号化タスクベース圧縮から,この圧縮機能を備えたアーキテクチャへ移行する新しい手法であるSemantic-Anchor Compression (SAC)を提案する。
SACは、様々な圧縮比で既存の文脈圧縮手法より一貫して優れている。
論文 参考訳(メタデータ) (2025-10-10T01:42:14Z) - UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression [86.33995240043936]
UniGistは、大規模言語モデルのためのシーケンスレベルのロングコンテキスト圧縮フレームワークである。
生のトークンを特別な圧縮トークン(gist)に微粒な方法で置き換えることで、コンテキスト情報を効率的に保存する。
提案手法は,圧縮トークンの実際の除去を可能にすることで,フレキシブルな推論もサポートしている。
論文 参考訳(メタデータ) (2025-09-19T08:47:37Z) - UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective [85.08718140718707]
UNCompは不確実性を認識したフレームワークで、適応圧縮に使用できる空間パターンを明らかにする。
スパーシティパターンを詳細に分析する不確実性に注目して、UNCompはKVキャッシュサイズを4.74%に削減し、6%のプリフィルスピードアップを実現し、スループットを6.4倍改善した。
論文 参考訳(メタデータ) (2024-10-04T02:32:36Z) - In-Context Former: Lightning-fast Compressing Context for Large Language Model [48.831304302467004]
本稿では,Transformer-based large language model (LLM) の長期入力コンテキストを圧縮する手法を提案する。
我々は,単語の埋め込みから情報を集めるために,クロスアテンション機構と少数の学習可能なダイジェストトークンを使用する。
実験の結果, 圧縮時のベースライン浮動小数点演算の1/32しか必要とせず, 処理速度を68倍から112倍に向上することがわかった。
論文 参考訳(メタデータ) (2024-06-19T15:14:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。