論文の概要: Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One
- arxiv url: http://arxiv.org/abs/2606.25449v2
- Date: Mon, 29 Jun 2026 07:03:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.046425
- Title: Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One
- Title(参考訳): 記憶力の低下は「記憶力の低下」と評価する「Reclaim Evaluation」
- Abstract要約: 言語モデルのメモリは、メモリを全く持たないよりも悪い場合がある。
間違った結論を維持しながら、その背後にある作業を捨てるメモリは、確実な答えとして古い値を出力する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A language model's memory can be worse than no memory at all. A memory that keeps a wrong conclusion but drops the work behind it makes the model emit the stale value as a confident answer, where an empty memory would make it abstain; we call this brittle memory. We measure it with reclaim evaluation: compress a drifted interaction at a fixed budget, then test whether a correction recovers the known answer, scored against ground truth with no judge. Correctability is bottlenecked not by capability but by whether the answer-determining source survives compression, so an 8B model and a frontier one wall in the same place. Across eight models a lossy memory is never better than an empty one, and strictly worse on those disposed to answer rather than abstain. A one-line source-first policy, keep the recomputable source and drop the re-derivable conclusion, restores correctability at equal budget where the answer-determining source is compact and identifiable; a length-matched control rules out added text, and a deployable one-prompt form reclaims 0.49-0.88, rising toward the oracle's 1.00 when a frontier model writes the note. The failure compounds through a memory loop and replicates on three deployed memory systems and on real dialogue (MultiWOZ), with a located boundary past which the fix fails silently unless the note records its completeness. This is a controlled study of a mechanism: judge-free exact scoring, matched-budget controls, and validators built to come out false; we release the harness, the paired memory conditions, and these validators.
- Abstract(参考訳): 言語モデルのメモリは、メモリを全く持たないよりも悪い場合がある。
間違った結論を保ちながら、その裏にある作業を捨てるメモリは、古い値を自信ある答えとして出力する。
固定された予算でドリフトされた相互作用を圧縮し、その補正が既知の答えを回復するかどうかを判断することなく、地上の真実に対して測定する。
補正性は、能力ではなく、解答決定源が圧縮に耐えられるかどうかによってボトルネックとなるため、8Bモデルとフロンティア1壁は同じ場所にある。
8つのモデルにまたがって、失われたメモリは空のメモリよりは決して良くない。
ワンラインのソースファーストポリシーは、再計算可能なソースを保持し、再導出可能な結論を下し、解答決定されたソースがコンパクトで識別可能な等予算で修正可能性を復元する。
障害はメモリループを通して発生し、3つのメモリシステムと実際の対話(MultiWOZ)に複製される。
これは、判定のない正確なスコア付け、一致した予算管理、そして偽造されるように構築されたバリデータ、そしてハーネス、ペア化されたメモリ条件、そしてそれらのバリデータである。
関連論文リスト
- The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination [5.158280959759542]
クローズドブックの質問応答における幻覚は、しばしばカバレッジ問題として扱われる。
本研究では,この効果を,ファクトリコールの単純なカバレッジ・圧縮モデルを用いて検討する。
予測されたシグネチャを理論的に実装したシミュレーションと,現代言語モデルにおける制御されたファクトインジェクションプローブを用いて検討する。
論文 参考訳(メタデータ) (2026-09-10T18:37:44Z) - Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem [12.078734827417685]
メモリが何であるか、いつ最適かに関する統一的な公式な説明はない。
中心的な考え方は、記憶は基礎であり、知識はその範囲であり、答え可能性はカバレッジの問題である。
最適なメモリは、期待されるカバレッジのキャパシティ制限された最大値である。
論文 参考訳(メタデータ) (2026-08-12T04:54:26Z) - From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents [19.125716338799545]
textbfdependency-guided rollback repairは、出所からの型付きメモリ対アクショングラフを構築し、明示的な下流依存性をトレースし、応答関連処理のみを選択的に再生する。
本手法は,3つのツール使用領域と4つのメモリ障害タイプにまたがる150ケースのベンチマークで評価する。
論文 参考訳(メタデータ) (2026-08-11T05:19:55Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory [32.094723684433895]
長期記憶システムは、ユーザが外部ストアで言ったことを格納し、関連するクエリが到着したときにそれを検索する。
このインターフェースは、非常に自然な仮定に基づいており、滅多に述べられません:必要なメモリは、それを必要とするクエリに似ているでしょう。
この障害モードを暗黙の連想盲点と呼び、10つの生命ドメインにまたがるベンチマークであるInMindを紹介します。
論文 参考訳(メタデータ) (2026-07-27T12:42:12Z) - Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory [7.254575731198877]
オンデバイス言語モデルエージェントは、重みを更新するよりも、取得したメモリでの経験を蓄積することで改善する。
エージェントのエクスペリエンス・メモリのライフサイクルを管理する1バイト当たりのネット値スコアであるsysを提案する。
論文 参考訳(メタデータ) (2026-06-23T19:42:07Z) - Learning What to Remember: A Cognitively Grounded Multi-Factor Value Model for Agentic Memory [1.2127875744950842]
LLMエージェントは、どのコンテキストウィンドウよりもはるかに大きなインタラクション履歴を蓄積する。
生産システムは意味的類似性や傾向に答える。
本研究では、7つの解釈可能な因子に対する多要素記憶関数 V(m)=sum_i w_i f_i(m) を提案する。
論文 参考訳(メタデータ) (2026-06-11T06:17:31Z) - Echo-Memory: A Controlled Study of Memory in Action World Models [58.77172260403133]
本研究では,行動条件付き世界モデルにおける記憶機構の制御に関する研究を行う。
既存のメモリ設計と比較するのは難しいのは、ゲインにはバックボーン、トレーニング、検索、評価の違いが絡み合っているからである。
我々はEcho-Memoryを使ってアクション・ツー・ビデオのインタフェースを修正し、生成元によって履歴が保存され読み込まれるかだけを変える。
論文 参考訳(メタデータ) (2026-06-08T17:54:10Z) - Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle [0.0]
基準自由忠実度測定は、モデルが基底真理に対して行う各原子的クレームを検証する。
彼らが盲点を共有していることを示す:彼らは精度だけを計測し、主張されている主張は支持されているか?
戦略的基底真理が決定論的に導出される領域であるF1テレメトリを用いて、この測定を可能にする。
論文 参考訳(メタデータ) (2026-06-08T11:56:25Z) - TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory [22.85129722207174]
矛盾の解決は書き込み時の制御であり、欠落した契約を明確にすることを示しています。
TOKIは、二重行スキーマ上での2時間演算子の1つのファミリとして、四重項をタイプする。
8つのシステムにまたがる判定行列はギャップをローカライズする: 書き込みパス上の言語モデル判断を保持するすべてのベースラインは、3つの書き込み時異常のうちの少なくとも1つを許容する。
論文 参考訳(メタデータ) (2026-06-04T14:46:52Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory [120.68750043918249]
記憶は、決定にとって重要な区別を、記述ではなく保存すべきであることを示す。
DeMemは,共有状態が決定競合を誘発することを示すデータに対してのみ,分割を洗練させるオンラインメモリ学習システムである。
論文 参考訳(メタデータ) (2026-05-11T17:20:58Z) - When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory [4.425240080125479]
本稿では,エビデンス保存型成長下でのエージェントメモリのスケールコンディション評価プロトコルを提案する。
各クエリに対して、タスクエビデンスが固定され、無関係なセッションが追加される。
このプロトコルはエージェントメモリトラジェクトリをログし、4つの診断結果を報告する。
論文 参考訳(メタデータ) (2026-05-08T06:22:31Z) - Belief Memory: Agent Memory Under Partial Observability [56.41506249481312]
本稿では,メモリパラダイムを観測毎に1つの結論にシフトし,その確率で複数の結論を導出するBeliefMemを提案する。
BeliefMemは決定論的パラダイムが破棄されるという不確実性を保ち、エージェントが高い信頼を持って行動することを可能にする。
LoCoMoとALFWorldベンチマークの実証的な評価は、限られたデータであっても、BeliefMemが最高の平均パフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2026-05-07T02:03:13Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution [52.76038908826961]
我々は静的ストレージと動的推論のギャップを埋めるため、$textbfReMe$ ($textitRemember Me, Refine Me$)を提案する。
ReMeは3つのメカニズムを通じてメモリライフサイクルを革新する: $textitmulti-faceted distillation$, きめ細かい経験を抽出する。
BFCL-V3とAppWorldの実験では、ReMeが新しい最先端のエージェントメモリシステムを確立している。
論文 参考訳(メタデータ) (2025-12-11T14:40:01Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。