論文の概要: When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses
- arxiv url: http://arxiv.org/abs/2608.01619v1
- Date: Mon, 03 Aug 2026 02:49:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.304302
- Title: When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses
- Title(参考訳): 記憶が更新されるが行動が起こらないとき--パーソナライズされたエージェント応答における不必要な静的依存の修復
- Authors: Haofei Sun, Lin He,
- Abstract要約: メモリ拡張されたエージェントは、ユーザの格納された状態が時代遅れであることを知ることができ、なおも古い値を計画する。
私たちは1つの構造的コントリビュータを特定します。 ドラフトアンコールによる検証は、応答が何を言っているかをチェックします。
- 参考スコア(独自算出の注目度): 1.5770673503612611
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Memory-augmented agents can know that a user's stored state is outdated and still plan around the old value. The STALE benchmark calls this the implicit policy adaptation (IPA) gap. We identify one structural contributor: draft-anchored verification checks what a response says, and in an open-ended response the stale dependency is usually unsaid. StateAuditor therefore audits in the opposite direction, from stored state to draft. An LLM proposes candidate old-to-new transitions from timestamped evidence; deterministic code pins each quotation to a single entry, checks that the new evidence really is newer, and lets only these verified transitions trigger repair. What is verified is provenance and chronology - not semantic supersession. On STALE's full protocol (400 scenarios, 50-session histories, one independent response per query), strict single-query VTA scores .736 against .686 for our locked predecessor under the same judge: a +5.0-point paired gain (95% CI [+2.9, +7.2]) coming almost entirely from IPA and premise resistance (PR). The benchmark's own judge, from a third model family, reproduces the gain (.738 vs. .680). On an independent cross-family preference-evolution benchmark (HorizonBench), the full draft-audit-repair pipeline over a gold-derived structured store raises current-preference accuracy (user-clustered p<.01), though a matched control shows most of this external gain is the draft-side audit itself; a harder authored lifecycle set gives no gain, bounding the claim while false invalidation stays controlled. On STALE, by contrast, a matched control (same evidence, adapter, and call budget) scores only .692 (+0.6 over the predecessor, n.s.), attributing the STALE gain to the transition machinery rather than added context or calls. We make no claim about general-purpose agent memory.
- Abstract(参考訳): メモリ拡張されたエージェントは、ユーザの格納された状態が時代遅れであることを知ることができ、なおも古い値を計画する。
STALEベンチマークは、これを暗黙のポリシー適応(IPA)ギャップと呼んでいる。
私たちは1つの構造的コントリビュータを特定します。 ドラフトアンコールによる検証は、応答が何を言っているかをチェックします。
したがってStateAuditorは、保存された状態からドラフトまで、反対方向に監査する。
決定論的コードでは、各引用を単一のエントリにピン留めし、新しいエビデンスが本当に新しいことを確認し、これらの検証されたトランジションだけが修復をトリガーする。
検証対象は証明と年代 – セマンティックスーパーセッションではない。
STALEの完全なプロトコル(400のシナリオ、50セッションの履歴、クエリ毎の1つの独立レスポンス)では、厳密な単一クエリのVTAスコアが.686に対して.736であり、同じ判断の下でロックされた前任者の.686である: a +5.0ポイントのペアゲイン(95% CI [+2.9, +7.2])は、ほぼ完全にIPAと前提抵抗(PR)から来ている。
ベンチマークの判断は、第3モデルファミリーからのものであり、利得を再現する(.738対.680)。
独立したクロスファミリーの選好進化ベンチマーク(HorizonBench)では、ゴールド由来の構造化ストア上の完全なドラフトオーディット・リペアパイプラインが、現在の参照精度を高める(ユーザクラスタ化されたp<.01)が、一致した制御は、この外部の利得の大部分がドラフトサイド監査そのものであることを示している。
対照的にSTALEでは、一致した制御(同じ証拠、アダプタ、呼び出し予算)は.692(前任者よりは+0.6)しか得点せず、STALEは追加の文脈や呼び出しよりも遷移機械に利益をもたらす。
汎用的なエージェントメモリについては何も主張しません。
関連論文リスト
- Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks [25.519850997497283]
短解VQAベンチマークは2つの異なる量を説明する。
我々は、人間公認のセマンティック・ジャッジを使用して37k以上の公式エラーを監査する。
論文 参考訳(メタデータ) (2026-07-11T10:01:29Z) - Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge [0.0]
Retrieval-augmented generationは、エージェントに蓄積した知識へのアクセスを与えるが、時間のモデルを持たない。
本稿では,時間的妥当性を維持する検索メモリMemStrataを提案する。
6つのベンチマークは7Bモデルでローカルに実行され、MemStrataはRAGを静的知識で結び、進化する知識で0.95-1.00の精度に達する。
論文 参考訳(メタデータ) (2026-06-25T01:31:53Z) - AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows [0.0]
AuditWeaveは、AIアシストとデータ変換のステップを1つのハッシュチェーンの台帳に記録する軽量Pythonライブラリである。
本稿では,参照実装におけるオーバヘッド,拡張性,タンパー検出の正確さを設計し,評価する。
論文 参考訳(メタデータ) (2026-06-14T21:46:04Z) - STALE: Can LLM Agents Know When Their Memories Are No Longer Valid? [5.361950931863979]
大規模言語モデル(LLM)エージェントは、コヒーレントで長期的なパーソナライズされたメモリを維持することがますます期待されている。
現在のベンチマークは、主に静的な事実検索を計測し、新しい証拠が現れたときに保存された信念を更新する能力を見下ろしている。
専門家が検証した400の競合シナリオのベンチマークであるSTALEを紹介します。
CUPMemは,構造化状態統合と伝搬認識探索による書き込み時間リビジョンを強化するプロトタイプである。
論文 参考訳(メタデータ) (2026-05-07T16:31:15Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。