論文の概要: Self-GC: Self-Governing Context for Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2607.00692v1
- Date: Wed, 01 Jul 2026 09:41:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.833201
- Title: Self-GC: Self-Governing Context for Long-Horizon LLM Agents
- Title(参考訳): セルフGC:長期LDMエージェントの自己管理コンテキスト
- Authors: Xubin Hao, Hongjin Meng, Xin Yin, Jiawei Zhu, Chenpeng Cao,
- Abstract要約: 長期出力のLLMエージェントはツールの結果、ファイル、計画、ユーザ制約を蓄積し、使い捨てのテキスト接尾辞として扱うには構造化しすぎる。
本稿では,ガベージコレクションを意図的に反響しながら,GCが自己管理コンテキストを表すセルフGCを提案する。
Self-GCはユーザターン、ツールスパン、スキルステートをインデックスオブジェクトに変換し、サイドチャネルプランナーにフォールド、マスク、プルーアクションを提案する。
- 参考スコア(独自算出の注目度): 6.2467823330183725
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon LLM agents accumulate tool results, files, plans, and user constraints that are too structured to be treated as a disposable text suffix. Current systems mostly rely on in-run heuristics such as chronological pruning and tool-output masking, or on final self-summary near a context limit. Heuristics are cheap but blind to future dependencies; summaries preserve narrative state but often hide exact evidence, locators, and editable artifacts. We present Self-GC, where GC denotes self-governing context while deliberately echoing garbage collection: the system does not merely reclaim unused tokens, but governs the lifecycle of agent context objects. Self-GC turns user turns, tool spans, and skill state into indexed objects; asks a side-channel planner to propose fold, mask, and prune actions; and lets the harness enforce recoverable sidecars, safe commit boundaries, and cache-aware commit. On a 33-session Hard Set, Self-GC prunes 43.95% of prefix tokens while leaving 84.85% of future continuations unaffected, compared with no-impact rates of 54.55% to 69.70% for heuristic baselines. On a 332-session production-derived suite, three planner backbones reach no-impact rates of 91.27% to 94.58%, while baselines remain at 77.71% to 87.46%. In production, an online account-level split reduces daytime average input tokens by 10% to 15%, with peak reductions near 20%. These results point to context management as runtime lifecycle control over indexed, recoverable objects rather than post hoc text cleanup.
- Abstract(参考訳): Long-Horizon LLMエージェントはツールの結果、ファイル、計画、ユーザの制約を蓄積し、使い捨てのテキストサフィックスとして扱うには構造化しすぎる。
現在のシステムは、主に、時間的プルーニングやツールアウトプットマスキングのような実行中のヒューリスティックや、文脈制限に近い最終的なセルフサマリーに依存している。
要約は物語の状態を保存するが、しばしば正確な証拠、発見者、編集可能なアーティファクトを隠蔽する。
ガベージコレクションを意図的に反映しながら,GCが自己管理コンテキストを表すSelf-GCを提示する。
Self-GCはユーザターン、ツールスパン、スキルステートをインデックスオブジェクトに変換し、サイドチャネルプランナにフォールド、マスク、プルーアクションを提案し、ハーネスが回復可能なサイドカー、安全なコミットバウンダリ、キャッシュ対応コミットを強制できるようにする。
33セッションのハードセットでは、Self-GCは43.95%のプレフィックストークンを使用し、84.85%は影響を受けない。
332セッションのプロダクションベーススイートでは、3つのプランナーバックボーンが91.27%から94.58%に到達し、ベースラインは77.71%から87.46%に留まっている。
生産では、オンラインアカウントレベルの分割により、日平均入力トークンの10%から15%が減少し、ピーク時には20%近く減少する。
これらの結果は、コンテキスト管理を、ポストホックテキストのクリーンアップではなく、インデックス付き、リカバリ可能なオブジェクトに対するランタイムライフサイクル制御として指している。
関連論文リスト
- LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management [0.0]
本稿では,大規模言語モデルのセッションを型付き知識グラフとしてモデル化するオープンソースのプロキシシステムであるTokenMizerを紹介する。
平均78トークン(範囲:42-124) - 評価ベースラインよりも2倍小さい再開ブロックを生成する。
全セッションで、TokenMizerはタスクリコールを51.0%、決定リコールを46.6%、ファイルリコールを58.7%としている。
論文 参考訳(メタデータ) (2026-06-04T16:12:28Z) - Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay [14.181844060152367]
99%の成功率と99%のトークン削減を実現するシステムである LOOP SKILL ENGINE を提案する。
決定論的実行計画は、時間依存変数と結果依存変数をパラメータ化しながら、タスクの機能的意図をキャプチャする。
周期的エージェントタスクのベンチマークが5分から24時間に及ぶ間、Loop Skill Engineは毎月のトークン消費を93.3%--99.98%削減し、実行遅延を8.7倍削減し、出力非決定性を排除している。
論文 参考訳(メタデータ) (2026-05-14T01:05:35Z) - LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents [63.75550089045995]
ロングホライズン検索エージェントは、理由として急速に成長する作業状況を管理し、ツールを呼び、情報を観察しなければならない。
エージェントの軌道の一部は、タスクに対する現在の関連性に応じて、異なるレベルで細部まで維持される。
我々は10kの合成軌道上にQwen3-30B-A3Bを微調整した長距離探索エージェントであるLongSeekerを開発した。
論文 参考訳(メタデータ) (2026-05-06T17:54:16Z) - Beyond Compaction: Structured Context Eviction for Long-Horizon Agents [0.0]
本研究では,長期LLMエージェントに効果的に非有界な作業地平線を与えるコンテキスト管理方式であるContext Window Lifecycle (CWL)を提案する。
セッションが履歴を蓄積するにつれて、CWLは、完了した意味論的に認識された定義を通じて、コンテキストを予算内に保持する。
本稿では, アノテーションプロトコル, エピソードグラフ, 消去ポリシー, トークンカウントループについて記述し, 長期エージェントベンチマークによるCWLの評価を行う。
論文 参考訳(メタデータ) (2026-05-01T18:39:02Z) - GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0) [56.81743709880371]
Long-Horizon Large Language Model (LLM) エージェントは、コンテキストによって根本的に制限される。
長い水平性能は、文脈長ではなく、有限の文脈予算内で意思決定関連情報がどれだけ維持されているかによって決定される。
我々は、情報密度とコンテキストの1つの原理に基づいて構築された汎用的自己進化型LLMエージェントシステムであるGenericAgent(GA)を提案する。
論文 参考訳(メタデータ) (2026-04-18T17:59:15Z) - Contextual Memory Virtualisation: DAG-Based State Management and Structurally Lossless Trimming for LLM Agents [0.0]
我々は,蓄積したLLM理解をバージョン管理状態として扱うシステムであるコンテキスト記憶仮想化(CMV)を提案する。
CMVはセッション履歴を、正式に定義されたスナップショット、ブランチ、トリムプリミティブを備えたDAG(Directed Acyclic Graph)としてモデル化する。
シングルユーザによるケーススタディ評価では、トリミングが迅速なキャッシュの下で経済的に有効であることが示されている。
論文 参考訳(メタデータ) (2026-02-25T20:52:52Z) - Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents [18.383906296536185]
Traversal-as-Policy: サンドボックス化されたOpenHandsの実行ログを単一の実行可能なGated Behavior Tree (GBT)に蒸留する
各ノードは状態条件のアクションマクロを符号化し、成功した軌道からマージチェックを行う。
実行時に、軽量なトラバーサは、子マクロに対するベースモデルの意図と一致します。
論文 参考訳(メタデータ) (2026-01-30T16:25:08Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - NoLiMa: Long-Context Evaluation Beyond Literal Matching [100.00398424275501]
NoLiMaは、NIAHテストを拡張したベンチマークである。
干し草の山の中に針を見つけるためには、潜伏関係を推測するモデルが必要である。
我々は、少なくとも128Kトークンのコンテキストをサポートすると主張する13の人気のある大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-02-07T18:49:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。