論文の概要: Invalidation Contracts for Cross-Episode Agent Memory
- arxiv url: http://arxiv.org/abs/2609.00243v1
- Date: Mon, 31 Aug 2026 18:45:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.006953
- Title: Invalidation Contracts for Cross-Episode Agent Memory
- Title(参考訳): クロスエポソードエージェントメモリの無効化契約
- Authors: Michael Wu, Arquimedes Canedo,
- Abstract要約: APIエラーからのリカバリ提案をキャッシュするLLMエージェントは、後続のエピソードでリデリベーションをスキップすることができる。
サーバ側のデータドリフトは、キャッシュされた修正をサイレント障害にします。
バージョンスタンプとキャッシュ可能性ヒントをすべてのリカバリ提案にアタッチするプロトコル層である、無効化契約を導入する。
- 参考スコア(独自算出の注目度): 0.8673353590830692
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents that cache recovery suggestions from API errors can skip re-derivation in later episodes, spending fewer tokens and fewer model calls on constraints they have already learned. Server-side data drift turns those cached fixes into silent failures, and the usual remedy, re-deriving on every episode, gives the savings back. We introduce invalidation contracts, a protocol layer that attaches version stamps and cacheability hints to every recovery suggestion so the client can evict stale entries without trial and error, and keep the rest. The contract decomposes realized savings into two independent factors: validity, the fraction of cached suggestions that remain correct after a drift event, and compliance, the fraction the planner applies on the first attempt. Validity depends only on the protocol and is vendor-independent. Compliance depends on the planner model: identical wire bytes yield 100% first-try compliance on Claude Haiku 4.5 and 11% or below on Claude Sonnet 5, which exhibits input-schema conservatism, refusing fixes that add fields the original request did not contain. We evaluate across seven models, three serving paths, two domains, and approximately 9,400 episodes. Row-level invalidation raises compliance by 0 to 66.7 percentage points across the seven models, 55.6 to 66.7 on three, and recovers 29-33% of baseline token cost on four of seven models, while table-level invalidation destroys co-located entries and drops post-drift first-try rates to 0% on five of seven. Eviction precision is 1.00 at row granularity on every model under the row-level oracle of Section 4.1. The contract adds 15% to response payload. Version-stamp validity is deterministic by construction and produced identical results across every model and serving path, with zero contract failures in the entire evaluation.
- Abstract(参考訳): APIエラーからのリカバリ提案をキャッシュするLLMエージェントは、後続のエピソードでリデリベーションをスキップし、トークンを減らし、すでに学んだ制約に対するモデルコールを減らすことができる。
サーバ側のデータドリフトは、キャッシュされた修正をサイレントな障害に変えます。
バージョンスタンプとキャッシュ可能性ヒントをすべてのリカバリ提案にアタッチするプロトコルレイヤである無効化コントラクトを導入し、クライアントが試行錯誤なしに古いエントリを排除し、残りを維持できるようにします。
契約は、実現した貯蓄を2つの独立した要因に分解する。妥当性、ドリフトイベント後に正しいキャッシュされた提案の分数、コンプライアンス、プランナーが最初の試みで適用する分数である。
妥当性はプロトコルにのみ依存し、ベンダーに依存しない。
同一のワイヤバイトは、Claude Haiku 4.5で100%、Claude Sonnet 5で11%以下で、入力スキーマ保守性を示し、元の要求が含まないフィールドを追加する修正を拒否する。
我々は,7つのモデル,3つのサービス経路,2つのドメイン,約9,400エピソードを評価した。
ロウレベルの無効化は、7つのモデルで0から66.7ポイント、3つのモデルで55.6から66.7ポイント、ベースライントークンコストの29~33%を回復し、テーブルレベルの無効化は7つのモデルのうち5つのモデルでコロケーションされたエントリを破壊し、ドリフト後のファーストトライレートを0%まで下げる。
推定精度は、セクション4.1の行レベルのオラクルの下の全てのモデルの行の粒度で1.00である。
レスポンスペイロードに15%追加される。
バージョンスタンプの妥当性は構築によって決定的であり、すべてのモデルとサービスパスに同じ結果をもたらし、評価全体において契約の失敗はゼロである。
関連論文リスト
- When Stale Constraints Go Unchecked: Budgeted Verification Failures in Inherited Agent Memory [0.0]
証拠リンクは、継承された信条の裏にある証拠を保持しており、検証予算を持つエージェントは、検査するリンクを選択する必要がある。
我々は、決定制約を記述し、ソースレコードを削除したレコードに置き換えた統合記憶について研究する。
16の言語モデルは、落ち着いたように読む制約を再検証することはめったにない。
ひとたび制約が過小評価されると、77.3%、74.7%、74.7%のエピソードが一次実行、複製、保留領域で安定的な決定を下した。
論文 参考訳(メタデータ) (2026-08-26T09:04:21Z) - QuoteBench: How Matched Scores Can Hide Command-Path Failures [30.480838412827907]
実行スコアだけでは、ジェネレーションエラーとジェネレーション後に導入された失敗を区別できない。
QuoteBenchはこの境界線を、インシデントから派生した14のファミリーから56のワンショットタスクに対して正確に最終状態の検証を行う。
コマンド発行エージェントの評価は、一致したスコアを本質的なモデル特性として扱うよりも、モデル構成、生成契約、実行経路、操作点、最終状態などを報告すべきである。
論文 参考訳(メタデータ) (2026-08-13T17:57:20Z) - Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer [38.62073085926841]
LLMベースのコーディングエージェントはソースコードを編集したり、変更を正当化するための十分なリポジトリ証拠を調べる前にパッチを提出する。
我々は、エビデンス条件付き実行を実行するために、エージェントとレポジトリの間を介在する実行層であるECLoopを提案する。
論文 参考訳(メタデータ) (2026-07-30T20:16:35Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Re-feeding Is Not Replaying: Measuring Replay Noise in Counterfactual Token-Credit Estimation [0.0]
言語モデルのロールアウトにおいて、どのトークンが最終回答が正しいか間違っているかを尋ねる。
我々は、この仮定がストック推論エンジンのコストを3パスの設計で測定する。
6つの構成と3つのモデルにまたがって、リフィーディングはレプリカフロアよりも14-28ポイント高いレートでクレジットの見積もりを変更する。
論文 参考訳(メタデータ) (2026-06-14T06:09:16Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks [40.270213696031625]
OverEager-Genは、良質なタスクの振る舞いをオーバーイーガーするベンチマークである。
クロード・コードでは、同意宣言を削除するだけで、オーバーイーガー率は0.0%から17.1%に上昇する。
オーバーイーガー・ジェン(OverEager-Gen)は、入場前に各シナリオの識別力を認定する。
論文 参考訳(メタデータ) (2026-05-18T16:00:41Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。