論文の概要: FOCUS: Training-Free Decision-Preserving Context Compression for LLM Agents
- arxiv url: http://arxiv.org/abs/2609.37590v1
- Date: Tue, 29 Sep 2026 13:45:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.578374
- Title: FOCUS: Training-Free Decision-Preserving Context Compression for LLM Agents
- Title(参考訳): FOCUS:LLMエージェントの学習自由決定保存コンテキスト圧縮
- Abstract要約: 既存のコンテキスト圧縮メソッドはオフラインで何を破棄するかを学ぶ。
テスト時に完全に動作するトレーニングフリーのコンテキスト圧縮フレームワークであるFOCUSを紹介する。
- 参考スコア(独自算出の注目度): 25.63193538183006
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents accumulate interaction histories that grow linearly with task length, causing quadratic inference cost scaling and performance degradation from attention dilution. Existing context-compression methods learn what to discard offline: by contrastively optimizing guidelines, distilling compressors, or training compression policies. This incurs a substantial cost. Further, the compression policy is learned a priori and is not dynamically conditioned on the evolving test-time trajectories. In this paper we ask a complementary question: Which past interactions causally shape the agent's future decisions? We recast context compression as a causal decision preservation problem over discrete interaction units and introduce FOCUS, a training-free context compression framework that operates entirely at test time. Our method requires no offline data collection or fine-tuning, and is architecture-agnostic, attaching to any closed-API frontier model as a modular compression layer. We evaluate FOCUS on diverse agentic benchmarks including API and tool-calling, QA, web domain and multi-turn dialogue. Our method establishes new state of the art performance, cutting peak context by up to 48% and dependency by 73% while improving task success by up to 8.9 percentage points over uncompressed execution.
- Abstract(参考訳): LLMエージェントはタスク長と線形に成長する相互作用履歴を蓄積し、注意希釈による2次推論コストのスケーリングと性能劣化を引き起こす。
既存のコンテクスト圧縮手法はオフラインを捨てる方法を学ぶ: 対照的にガイドラインを最適化し、圧縮機を蒸留し、圧縮ポリシーを訓練する。
これによりかなりのコストがかかる。
さらに、圧縮ポリシを事前学習し、進化するテスト時間軌跡に動的に条件付けされない。
本稿では,エージェントの今後の決定を因果的に形成する過去のインタラクションについて,補完的な質問を行う。
我々は,コンテキスト圧縮を個別の相互作用単位に対する因果決定保存問題として再考し,テスト時に完全に動作するトレーニングフリーなコンテキスト圧縮フレームワークであるFOCUSを紹介した。
本手法では, オフラインデータ収集や微調整は不要であり, アーキテクチャに依存せず, モジュラー圧縮層として任意のクローズドAPIフロンティアモデルにアタッチする。
FOCUSはAPIやツールコール,QA,Webドメイン,マルチターン対話など,さまざまなエージェントベンチマークで評価される。
提案手法は,新しい最先端性能を確立し,ピークコンテキストを最大48%,依存性を最大73%削減し,非圧縮実行よりも最大8.9ポイント向上する。
関連論文リスト
- ACE: Pluggable Adaptive Context Elasticizer across Agents [65.45147906718154]
Adaptive Context Elasticizer (ACE)は、各決定ステップでエージェントのコンテキストに履歴ステップ情報をオーケストレーションする。
ACEは、トランケーションと要約ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-30T12:20:45Z) - Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - CORE-RAG: Lossless Compression for Retrieval-Augmented LLMs via Reinforcement Learning [22.93037884068796]
Retrieval-Augmented Generation (RAG) は、知識更新のタイムラインと大規模言語モデルにおける応答の事実的正確性を高めるための有望なアプローチとして登場した。
RAG用に調整された文書圧縮への既存のアプローチは、しばしばタスクパフォーマンスを低下させる。
我々は、RAGにおけるロスレスコンテキスト圧縮の新しい手法であるCOREを提案する。
論文 参考訳(メタデータ) (2025-08-24T12:21:50Z) - Understanding and Improving Information Preservation in Prompt Compression for LLMs [15.797246416590339]
情報集約的なタスクでは、プロンプト長は急速に増加し、計算要求の増大、性能劣化、無関係または冗長な情報からのバイアスが引き起こされる。
本稿では,プロンプト圧縮手法の詳細な解析を可能にする総合評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-24T20:06:11Z) - Choose Your Model Size: Any Compression of Large Language Models Without Re-Computation [10.376875638696504]
本研究は, 圧縮性能トレードオフを決定するアルゴリズム手法であるACIP (Any Compression via Iterative Pruning) を提案する。
線形層をSVDで再パラメータ化し,その特異値をスペーサ性誘導ペナルティで反復的にプルーする。
本稿では,ACIPが共通量子化に基づく圧縮手法をシームレスに補完することを示す。
論文 参考訳(メタデータ) (2025-02-03T18:40:58Z) - Selection-p: Self-Supervised Task-Agnostic Prompt Compression for Faithfulness and Transferability [67.77534983324229]
本稿では,非形式的トークンを識別する統一圧縮法を開発するために,大規模言語モデルの能力について検討する。
実験により、Selection-pは様々な分類タスクで最先端のパフォーマンスを達成することが示された。
以前の作業と比べて、異なるモデルに対して優れた転送性を示す。
論文 参考訳(メタデータ) (2024-10-15T17:05:25Z) - In-Context Former: Lightning-fast Compressing Context for Large Language Model [48.831304302467004]
本稿では,Transformer-based large language model (LLM) の長期入力コンテキストを圧縮する手法を提案する。
我々は,単語の埋め込みから情報を集めるために,クロスアテンション機構と少数の学習可能なダイジェストトークンを使用する。
実験の結果, 圧縮時のベースライン浮動小数点演算の1/32しか必要とせず, 処理速度を68倍から112倍に向上することがわかった。
論文 参考訳(メタデータ) (2024-06-19T15:14:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。