論文の概要: Presentation, Not Mechanism: A Render Confound in Deprecation-Aware Memory Evaluation
- arxiv url: http://arxiv.org/abs/2607.16019v1
- Date: Fri, 17 Jul 2026 14:55:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.877138
- Title: Presentation, Not Mechanism: A Render Confound in Deprecation-Aware Memory Evaluation
- Title(参考訳): 表現, メカニズムではなく:非推奨記憶評価における性差
- Abstract要約: 我々は,2,907質問に対して,平坦な検索,粗いエッジ無効化,きめ細かいRevisionLedgerを比較し,Evidence-State Revisionについて検討した。
値が変更され、後に復元されたとき、RevisionLedgerはフラットベースラインを+0.182で打ち負かしているように見える。
粗い無効化は、現在のクエリに課金する唯一のメカニズムであり、微細な台帳を0.084で上回っている。
- 参考スコア(独自算出の注目度): 14.101636730819175
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI systems increasingly retrieve from records that revise themselves: issue threads, encyclopedic histories, policy logs, and long conversations. The challenge is not only finding relevant evidence, but deciding which claims remain in force, which were superseded, and when to abstain. Structured memories promise to solve this with typed edges, temporal updates, and conflict status, yet evaluations often change mechanism and prompt presentation together. We study this as Evidence-State Revision, comparing flat retrieval, coarse edge invalidation, and fine-grained RevisionLedger on 2,907 high-agreement questions from GitHub, multi-repo issue histories, Wikipedia, and DyKnow-style temporal streams. A render-matched control (same layout, deprecation disabled) reveals the central confound: when a value is changed and later restored, RevisionLedger appears to beat a flat baseline by +0.182, but almost all the gain comes from easier presentation; the fine-grained mechanism residual is indistinguishable from zero (+0.021 to +0.025 across two judge families). After presentation is controlled, coarse invalidation is the only mechanism that pays for current-state queries, beating the fine ledger by 0.084; the same query-sufficiency principle says provenance mainly needs retained invalidated evidence, not richer typing. Memory evaluations should hold render fixed, and deprecation-aware systems should deploy the coarsest retained state that covers their queries.
- Abstract(参考訳): AIシステムは、スレッドの発行、百科事典の履歴、ポリシーログ、長い会話など、自分自身を改定するレコードから、ますます回収される。
課題は、関連する証拠を見つけるだけでなく、どの主張が有効か、どの主張が取って代わられ、いつ棄権するかを判断することである。
構造化メモリは、型付きエッジ、時間的更新、コンフリクトステータスでこの問題を解決することを約束するが、評価はしばしばメカニズムを変更し、一緒にプレゼンテーションを促す。
我々はこれをEvidence-State Revisionとして研究し、GitHubから2,907件の高精細なRevisionLedger、マルチリポジトリイシューヒストリー、Wikipedia、DyKnowスタイルの時間ストリームを比較した。
値が変更され、後に復元されたとき、RevisionLedgerはフラットなベースラインを+0.182で打ち破るように見えるが、ほとんどすべての利得は簡単な表示によって得られ、きめ細かいメカニズムはゼロ(2つの判断族で+0.021から+0.025)と区別できない。
プレゼンテーションが制御された後、粗い無効化が、現在のクエリに支払う唯一のメカニズムであり、微細な台帳を0.084で打ち負かしている。
メモリ評価はレンダリングを固定し、非推奨のシステムは、クエリをカバーする最も粗い保持状態をデプロイする必要がある。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering [25.519927761448603]
REVEALは、長いビデオ質問応答のためのルーリック誘導エージェントフレームワークである。
本稿では,視覚的コヒーレントな隣接フレームを自然なイベント単位にグループ化する適応型視覚類似性に基づく前処理パイプラインを提案する。
この構造化メモリ上に構築されたREVEALは、自動的に構築されたルーリックライブラリを使用して、検索された証拠が満足度基準を満たすかどうかを明示的に検証する。
論文 参考訳(メタデータ) (2026-08-09T09:55:42Z) - StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems [6.160059055899747]
StateFuseは、標準のOpsSet/CRDTマージ上に構築された、コンフリクト対応の複製メモリコントラクトである。
整合型リゾルバと検証ポリシの下で, フラットなマルチ値, 生ログ, プロファイランススタイル, 崩壊ベースラインに対してStateFuseを評価する。
論文 参考訳(メタデータ) (2026-07-07T05:06:33Z) - MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory [80.97855900579512]
既存の評価では、エージェントが後続の推論に必要な視覚的証拠を保存するかどうかを検査することはめったにない。
メモリ性能を2次元から評価するフレームワークであるMemEyeを紹介する。
本フレームワークでは,8つのライフシナリオタスクにまたがる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-14T17:37:52Z) - STALE: Can LLM Agents Know When Their Memories Are No Longer Valid? [5.361950931863979]
大規模言語モデル(LLM)エージェントは、コヒーレントで長期的なパーソナライズされたメモリを維持することがますます期待されている。
現在のベンチマークは、主に静的な事実検索を計測し、新しい証拠が現れたときに保存された信念を更新する能力を見下ろしている。
専門家が検証した400の競合シナリオのベンチマークであるSTALEを紹介します。
CUPMemは,構造化状態統合と伝搬認識探索による書き込み時間リビジョンを強化するプロトタイプである。
論文 参考訳(メタデータ) (2026-05-07T16:31:15Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models [66.75310318710073]
textttHistoricalMisinfoは45ドル(約4,400円)の国から50ドル(約5,800円)のコンテストイベントを収集したデータセットです。
実世界の利用を近似するために、一般的な通信設定を反映したプロンプトシナリオを11ドルで、各イベントをインスタンス化する。
論文 参考訳(メタデータ) (2026-02-19T15:05:10Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - Memory in Large Language Models: Mechanisms, Evaluation and Evolution [8.158439933515131]
我々は,4つの分類法(パラメトリック,文脈,外部,手続き/エピソード)とメモリ四倍法(ロケーション,永続性,書き込み/アクセスパス,制御性)を提案する。
DMM Gov: DAPT/TAPT, PEFT, モデル編集(ROME, MEND, MEMIT, SERAC)、RAGをコーディネートして監査可能なループを形成する。
これにより、再現可能で、同等で、統制可能な、研究と展開のための座標系が得られる。
論文 参考訳(メタデータ) (2025-09-23T10:06:58Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。