論文の概要: When Agent Context Goes Stale: Incoherence in Volatile Agent Context
- arxiv url: http://arxiv.org/abs/2610.05281v1
- Date: Sun, 04 Oct 2026 15:01:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.364606
- Title: When Agent Context Goes Stale: Incoherence in Volatile Agent Context
- Title(参考訳): エージェントコンテキストが安定する時:揮発性エージェントコンテキストの不整合
- Abstract要約: 既存のエージェントランタイムは、以前観測された事実が陳腐化したことをモデルに通知するためのほとんどサポートを提供していない。
エージェントコンテキストにおけるツール観察と,それらが派生した変更可能なソースとの整合性を維持するコンテキストコヒーレンスフレームワークであるConcordを提案する。
- 参考スコア(独自算出の注目度): 5.5784598924005655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern agents increasingly ground their reasoning in observations returned by tools, such as file contents read from a workspace. However, the data sources underlying these observations may later be modified by users, other agents, or external tools, while the model retains only the stale content in its context window. Existing agent runtimes provide little support for notifying the model that a previously observed fact has become stale, causing agents to reuse outdated observations and make incorrect claims about the current workspace state. We propose Concord, a context coherence framework that maintains the consistency between tool observation in agent context and the mutable sources from which they were derived. Concord links each observation to its source, detects source changes, and uses configurable handling policies to update, annotate, or suppress stale context before reuse. Concord is applicable across different agent runtimes and external resources, and can be easily extended to new runtime-resource settings. We implement Concord as a general framework, and instantiate a concrete use case to assess its effectiveness. We construct ConcordBench, where previously observed file contents become stale after subsequent edits. Across three evaluated frontier models, Concord produces answers consistent with the restored workspace state in all evaluated cases under these constructed conditions, matching the oracle on recover count for this benchmark, while using 46.4% fewer tokens than the strongest non-oracle baseline.
- Abstract(参考訳): 現代のエージェントは、ワークスペースから読み取ったファイルの内容など、ツールによって返される観察において、彼らの推論を根拠にしている。
しかしながら、これらの観測の基盤となるデータソースは、後にユーザや他のエージェント、あるいは外部ツールによって修正される可能性がある。
既存のエージェントランタイムは、以前観測された事実が不安定になったことをモデルに通知するためのほとんどサポートを提供していないため、エージェントは時代遅れの観察を再利用し、現在のワークスペース状態に関する誤ったクレームを発生させる。
エージェントコンテキストにおけるツール観察と,それらが派生した変更可能なソースとの整合性を維持するコンテキストコヒーレンスフレームワークであるConcordを提案する。
Concordは各観測結果をソースにリンクし、ソースの変更を検出し、設定可能なハンドリングポリシを使用して、再利用前に古いコンテキストを更新、注釈付け、あるいは抑圧する。
Concordはさまざまなエージェントランタイムと外部リソースに適用でき、新しいランタイムリソース設定に簡単に拡張できる。
一般的なフレームワークとしてConcordを実装し、その有効性を評価するために具体的なユースケースをインスタンス化する。
我々はConcordBenchを構築し、これまで観察されていたファイル内容が後続の編集後に陳腐化する。
3つの評価されたフロンティアモデル全体で、Concordはこれらの構築された条件下でのすべての評価ケースで復元されたワークスペース状態に整合した回答を生成し、このベンチマークの回収回数のオラクルと一致し、最も強力な非オラクルベースラインよりも46.4%少ないトークンを使用する。
関連論文リスト
- AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents [24.087563671845672]
AutoCompactはコーディングエージェントをトレーニングして、いつ圧縮するか、どの動作状態を保存するか、どのように継続するかを判断する。
我々はこれらの軌跡を教師付き微調整に利用し、強化学習による符号化とコンパクト化を共同で最適化する。
SWE-bench VerifiedとSWE-PolyBench Verifiedの実験では、AutoCompactはベースモデルのパスレートをそれぞれ9.2%と5.0%改善している。
論文 参考訳(メタデータ) (2026-10-01T17:54:34Z) - StateComp: Learning When to Compress History in Long Horizon Agents [55.84813053778976]
本研究では,現在エージェントの状態に応じて過去のインタラクションを安全に圧縮できるフレームワークであるState Conditioned Compression(StateComp)を提案する。
WorkBenchBuddyの実験では、StateCompはタスク性能を維持しながら総エージェントと要約トークンを52.27%削減し、表現抽出において12.67倍の高速化を実現している。
論文 参考訳(メタデータ) (2026-09-23T03:34:08Z) - Memory Control Signals Emerge Before Action in Long Horizon Agents [55.84813053778976]
各エージェントアクションの直前に隠された状態を調べ、圧縮とリコールの要求がモデルの内部表現にすでにエンコードされていることを確認する。
本研究では,状態誘導圧縮と外部エビデンス検索を組み合わせたPreaction Memory with Evidence Retrieval (PaMER)を提案する。
論文 参考訳(メタデータ) (2026-09-23T03:23:34Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Context Recycling for Long-Horizon LLM Inference [0.3655021726150367]
大規模言語モデル(LLM)は、短文推論において強力な能力を示すが、長い会話の地平線上での性能は低下する。
タスク関連情報をターン毎に保持するコンテキストリサイクルシステムであるContextForgeを紹介する。
システムは、完全なコンテキスト再生に頼ることなく、事前計算の効率的な再利用を可能にする。
論文 参考訳(メタデータ) (2026-05-01T04:45:08Z) - Code Broker: A Multi-Agent System for Automated Code Quality Assessment [0.0]
我々はGoogle Agent Development Kit ADKで構築されたマルチエージェントシステムであるCode Brokerを紹介する。
ファイル、ローカルディレクトリ、GitHubリポジトリからPythonコードを解析し、実行可能な品質評価レポートを生成する。
論文 参考訳(メタデータ) (2026-04-25T00:53:59Z) - FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents [53.03492387564392]
我々はFS-Researcherを紹介した。FS-Researcherはファイルシステムベースのフレームワークで、永続的なワークスペースを通じてコンテキストウィンドウを超えて深い研究をスケールする。
Context Builderエージェントはインターネットを閲覧し、構造化されたノートを書き、ソースを階層的な知識ベースにアーカイブする。
その後、レポートライターエージェントが最終レポートセクションをセクションごとに構成し、知識ベースを事実のソースとして扱う。
論文 参考訳(メタデータ) (2026-02-02T03:00:19Z) - InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents [36.740230738304525]
InfiAgentは、タスクの持続時間に関係なく、エージェントの推論コンテキストを厳密に拘束する。
20Bのオープンソースモデルを持つInfiAgentは、より大きなプロプライエタリなシステムと競合する。
論文 参考訳(メタデータ) (2026-01-06T17:35:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。