論文の概要: TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories
- arxiv url: http://arxiv.org/abs/2608.30811v2
- Date: Tue, 01 Sep 2026 15:42:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.681051
- Title: TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories
- Title(参考訳): TopoCompress: Graph-Wired Semantic TrajectoriesによるLong Context Compression
- Authors: Daniel Agyei Asante, Yang Li,
- Abstract要約: TopoCompressは,コヒーレントなセマンティックスパンを選択することで,長いコンテキストを圧縮するフレームワークである。
TopoCompressはまず、セマンティックアクセラレーションとともに、密度と語彙のクエリ関連を使って各スパンをスコアする。
次に、セマンティックな類似性とシーケンシャルな隣接性に基づいてスパンを結合するハイブリッドグラフを構築し、グラフ上のクエリ誘導関連スコアを伝搬する。
- 参考スコア(独自算出の注目度): 2.3951444869691594
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context compression is essential for reducing the cost and latency of large language model inference. However, existing methods can fragment important evidence, require additional training or alignment, and often depend on the target model for effective compression. We introduce TopoCompress, a training-free and model-agnostic framework that compresses long contexts by selecting coherent semantic spans. TopoCompress first scores each span using dense and lexical query relevance together with semantic acceleration. It then constructs a hybrid graph that connects spans based on semantic similarity and sequential adjacency, and propagates the query-guided relevance scores over the graph. Across five long-context tasks-HotpotQA, 2WikiMQA, MuSiQue, Qasper, and MultiFieldQA-en-TopoCompress consistently outperforms strong compression baselines. Notably, TopoCompress achieves performance comparable to the strongest baseline while using a 4x smaller compression budget, and provides a 1.41x smaller compression time over the fastest baseline.
- Abstract(参考訳): 長文圧縮は、大規模言語モデル推論のコストとレイテンシを低減するために不可欠である。
しかし、既存の手法は重要な証拠を断片化し、追加のトレーニングやアライメントを必要とし、しばしば効果的な圧縮のためにターゲットモデルに依存する。
TopoCompressは、コヒーレントなセマンティックスパンを選択することで、長いコンテキストを圧縮する、トレーニング不要でモデルに依存しないフレームワークである。
TopoCompressはまず、セマンティックアクセラレーションとともに、密度と語彙のクエリ関連を使って各スパンをスコアする。
次に、セマンティックな類似性とシーケンシャルな隣接性に基づいてスパンを結合するハイブリッドグラフを構築し、グラフ上のクエリ誘導関連スコアを伝搬する。
HotpotQA, 2WikiMQA, MuSiQue, Qasper, MultiFieldQA-en-TopoCompressの5つの長文タスクは、強い圧縮ベースラインを一貫して上回る。
特にTopoCompressは、4倍の圧縮予算を使いながら最強のベースラインに匹敵するパフォーマンスを実現し、最速のベースラインよりも1.41倍の圧縮時間を提供する。
関連論文リスト
- End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors [25.32575172623139]
長いコンテキストの大規模言語モデルは実行するのに計算コストがかかるままであり、しばしば非常に長い入力を確実に処理することができない。
本稿では,構造グラフに導かれるコンパクトな文群を選択する,学習不要でモデルに依存しない圧縮フレームワークを提案する。
本手法は,k-NNセマンティックエッジと短距離シーケンシャルエッジを組み合わせたスパースハイブリッド文グラフを構築する。
論文 参考訳(メタデータ) (2026-04-25T12:40:54Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - Simple Context Compression: Mean-Pooling and Multi-Ratio Training [12.049015994907629]
我々は、広く使われている圧縮トークンアーキテクチャを一貫して上回る軽量でシンプルな平均プール手法を開発した。
ドメイン内およびドメイン外QAデータセット、モデルファミリ、スケール、圧縮比にわたって、広範な実験を行います。
全体としては,複数の圧縮比のトレーニングを行う場合,比較的少ない低下率で,本手法は最強性能を達成する。
論文 参考訳(メタデータ) (2025-10-23T17:57:23Z) - UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression [86.33995240043936]
UniGistは、大規模言語モデルのためのシーケンスレベルのロングコンテキスト圧縮フレームワークである。
生のトークンを特別な圧縮トークン(gist)に微粒な方法で置き換えることで、コンテキスト情報を効率的に保存する。
提案手法は,圧縮トークンの実際の除去を可能にすることで,フレキシブルな推論もサポートしている。
論文 参考訳(メタデータ) (2025-09-19T08:47:37Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - Style-Compress: An LLM-Based Prompt Compression Framework Considering Task-Specific Styles [49.65811277223873]
Style-Compressは、より小さな言語モデルを適用して、新たなタスクでより大きなモデルのプロンプトを、追加のトレーニングなしで圧縮する軽量フレームワークである。
提案手法は,実効圧縮プロンプトを,スタイルのバリエーションやコンテキスト内学習を通じて,タスク固有の実演として反復的に生成し,選択する。
Style-Compressは、オリジナルのプロンプト再構成、テキスト要約、マルチホップQA、CoT推論の4つのタスクで2つのベースライン圧縮モデルを上回っている。
論文 参考訳(メタデータ) (2024-10-17T21:35:49Z) - Concise and Precise Context Compression for Tool-Using Language Models [60.606281074373136]
ツールを用いた言語モデルにおいて,ツール文書を簡潔かつ高精度な要約シーケンスに圧縮する2つの手法を提案する。
API-BankとAPIBenchの結果,最大16倍の圧縮率で上行ベースラインに匹敵する性能を示した。
論文 参考訳(メタデータ) (2024-07-02T08:17:00Z) - Compressing Lengthy Context With UltraGist [22.054232261437186]
長大な文脈の高品質な圧縮を特徴とするUltraGistという手法を提案する。
UltraGistは、幅広いコンテキスト長と圧縮比をサポートするために効果的に学習できるため、圧縮の柔軟性に寄与する。
これにより、トレーニングプロセスのサンプル効率が向上し、トレーニングデータの使用が最大になる。
論文 参考訳(メタデータ) (2024-05-26T17:23:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。