論文の概要: Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors
- arxiv url: http://arxiv.org/abs/2608.26175v1
- Date: Mon, 27 Jul 2026 08:54:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 05:49:59.253553
- Title: Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors
- Title(参考訳): 圧縮における損失:抽出型プロンプト圧縮機の言語横断監査
- Authors: Mantas Lukauskas,
- Abstract要約: 抽出プロンプト圧縮は、低情報トークンを削除することでLCM推論コストを削減することを約束する。
他のほとんどの言語は、既にトークンプレミアムを支払っている。同じコンテンツは、英語よりも1.3-1.8倍高いトークンである。
圧縮がこのギャップを閉じるか、広げるかを問う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Extractive prompt compression promises to cut LLM inference costs by removing low-information tokens, and learned compressors such as LLMLingua-2 report strong results on English benchmarks. Most other languages already pay a token premium: the same content costs 1.3-1.8x more tokens than in English. We ask whether compression closes or widens this gap. Using fully parallel data in ten languages spanning five scripts, with controls budget-matched in the target model's tokenizer, we audit four learned compressors against four deterministic baselines, on eleven target models from ten vendors (over 250,000 evaluation calls). Three of the compressors are trained with English supervision (LLMLingua-2 XLM-R/mBERT; Kompress-v2 from the production Headroom stack); the fourth, XProvence, is trained multilingually. First, the transfer gap is real, replicates across target models and compressor backbones, and is strongly rate-dependent: at a 0.33 keep-rate English retains 57-62% of normalized context utilization while Lithuanian retains 10-24% and Chinese essentially none, despite Chinese having the smallest token premium. Second, the gap tracks compression supervision data, not architecture. All three English-trained compressors show it, deterministic methods show no comparable gap, and the multilingually trained XProvence v1 shows none. Its v2 release, retrained on translated data, empties 92% of Chinese contexts at its aggressive threshold without any warning. Third, in a harder long-context setting, aggressive learned compression drives compressed contexts to or below no-context utility in three of five non-English languages. A translate-then-compress pipeline matches or beats native compression at roughly half the token cost in three of five tested languages. We release all code, compressions, and model outputs. Safe compression budgets are much smaller outside English.
- Abstract(参考訳): 抽出プロンプト圧縮は低情報トークンを除去することでLCM推論コストを削減することを約束し、LLMLingua-2のような学習圧縮機はイングランドのベンチマークで強い結果を報告した。
他のほとんどの言語は、既にトークンプレミアムを支払っている。同じコンテンツは、英語よりも1.3-1.8倍高いトークンである。
圧縮がこのギャップを閉じるか、広げるかを問う。
5つのスクリプトにまたがる10の言語で完全な並列データを使用し、ターゲットモデルのトークン化ツールに予算が整った制御を行い、学習した4つの圧縮機を10のベンダーから11のターゲットモデル(25万以上の評価コール)に対して4つの決定論的ベースラインに対して監査する。
3つの圧縮機はイングランドの監督(LLMLingua-2 XLM-R/mBERT、プロダクションヘッドルームスタックのKompress-v2)で訓練され、第4のXProvenceは多言語で訓練されている。
まず、転送ギャップは本物であり、ターゲットモデルとコンプレッサーのバックボーンをまたいで複製され、強くレート依存している:0.33の保留率の英語は正規化された文脈利用の57-62%を保ち、リトアニアは10-24%を保ち、中国は最小のトークンプレミアムを持っているにもかかわらず、本質的には存在しない。
第2に、このギャップはアーキテクチャではなく、圧縮監視データを追跡する。
英語で訓練された3つの圧縮機がこれを示し、決定論的手法は同等のギャップを示さず、多言語で訓練されたXProvence v1は存在しない。
翻訳データに基づいて再トレーニングされたv2リリースは、アグレッシブしきい値における中国のコンテキストの92%を警告なしで空にする。
第三に、より厳しいロングコンテキスト環境では、アグレッシブな学習圧縮は、5つの非英語言語のうち3つの非コンテキストユーティリティに圧縮されたコンテキストを駆動する。
Translate-then-compressパイプラインは、5つのテスト言語のうち3つのトークンコストの約半分でネイティブ圧縮と一致または打ち勝つ。
すべてのコード、圧縮、モデル出力をリリースします。
安全な圧縮予算は英語以外ではずっと小さい。
関連論文リスト
- Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors [13.49190771932777]
我々は, 語彙, 構文, 意味, 言説の種を進化的に探索し, 競争ルールの組み合わせを見つける。
結果、言語圧縮機はデプロイメント時にLMフォワードパスを必要とせず、CPU側でのみ圧縮を行う。
圧縮品質と復元精度のバランスをとるために,デュアルパスプロトコルを用いて評価を行った。
論文 参考訳(メタデータ) (2026-07-28T06:33:27Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - An Information Theoretic Perspective on Agentic System Design [40.402567029445045]
小さな「圧縮器」LMは生のコンテキストをコンパクトテキストに蒸留し、より大きな「予測器」LMによって消費される。
その人気にもかかわらず、圧縮機・予測装置の設計はいまだ大半がアドホックである。
我々は、特定のタスクによらず、相互情報が下流のパフォーマンスを強く予測することを示す。
論文 参考訳(メタデータ) (2025-12-25T15:45:31Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z) - L3TC: Leveraging RWKV for Learned Lossless Low-Complexity Text Compression [23.179381396167084]
我々はLearned Lossless Low-complexity Text Compression Method (L3TC)を紹介する。
RWKVモデルは、適度な圧縮比で高速な復号速度を達成する。
本稿では,頻繁なトークンをカバーするために,限定語彙を用いた外部認識トークン化手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T14:24:32Z) - 500xCompressor: Generalized Prompt Compression for Large Language Models [32.4489985319054]
500xCompressorは、自然言語のコンテキストを最小1つの特別なトークンに圧縮する手法である。
あらゆるテキストを圧縮し、様々な種類の質問に答えるように設計されており、微調整を必要とせずにオリジナルの大言語モデル(LLM)によって利用することができる。
論文 参考訳(メタデータ) (2024-08-06T10:51:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。