論文の概要: TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Agents
- arxiv url: http://arxiv.org/abs/2608.03699v2
- Date: Tue, 11 Aug 2026 12:23:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.349473
- Title: TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Agents
- Title(参考訳): TARL: 長期エージェントにおける実行可能メモリ管理のためのトランザクション対応信頼性レジャー
- Abstract要約: メモリ状態更新フレームワークであるTARLを導入し、各ステートメントを5つの実行可能なアクションのうちの1つにマップする。
TARLは、影響を受けるメモリを特定し、その時間的スコープを解決し、ソースの信頼性を比較し、受け入れ、保留、拒否された台帳を更新する。
また、粒度の細かいアクションラベルと次の状態目標を持つベンチマークであるTARL-Memについても紹介する。
- 参考スコア(独自算出の注目度): 20.123133746969398
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Persistent memory helps long-term agents retain knowledge, yet a single update error can repeatedly distort future retrieval and reasoning. Most existing systems reduce memory updating to a binary Write/Hold decision, which cannot distinguish whether new information should be added, ignored, used to revise an outdated belief, rejected as unreliable, or deferred for verification. These choices may share the same binary label while producing fundamentally different memory states. We introduce TARL, a memory state update framework that maps each statement to one of five executable actions. TARL identifies the affected memory, resolves its temporal scope, compares source reliability, and updates accepted, pending, and rejected ledgers. It is further trained by comparing the memory states produced by alternative update operations, encouraging the model to select the operation that leads to the correct result. We also introduce TARL-Mem, a benchmark with fine-grained action labels and next-state targets. Across in-domain, cross-source, temporal, counterfactual, and sequential evaluations, TARL improves action prediction and state recovery, reduces memory pollution, preserves conflicting evidence, and limits cumulative corruption.
- Abstract(参考訳): 永続メモリは、長期的なエージェントが知識を保持するのに役立つが、単一の更新エラーは、将来の検索と推論を何度も歪めてしまうことがある。
既存のシステムの多くはメモリ更新をバイナリWrite/Holdの決定に還元しており、これは新しい情報が追加されるべきか、無視されるべきか、古い信条を改定するために使用されるか、信頼性が低いか、検証のために延期されるかを区別できない。
これらの選択は、基本的に異なるメモリ状態を生成しながら、同じバイナリラベルを共有することができる。
メモリ状態更新フレームワークであるTARLを導入し、各ステートメントを5つの実行可能なアクションのうちの1つにマップする。
TARLは、影響を受けるメモリを特定し、その時間的スコープを解決し、ソースの信頼性を比較し、受け入れ、保留、拒否された台帳を更新する。
さらに、代替更新操作によって生成されたメモリ状態を比較することで、モデルが正しい結果につながる操作を選択することを奨励する。
また、粒度の細かいアクションラベルと次の状態目標を持つベンチマークであるTARL-Memについても紹介する。
ドメイン内、クロスソース、時間的、反ファクト的、シーケンシャルな評価によって、TARLはアクション予測と状態回復を改善し、メモリ汚染を低減し、矛盾する証拠を保存し、累積的腐敗を制限する。
関連論文リスト
- EvoGraph-Mem: Failure-Aware Editable Graph Memory for Long-Term Language Agents [4.265255679736993]
既存のメモリ拡張エージェントは、主に過去の経験の保存と検索に重点を置いている。
これまで蒸留された洞察は、新しいタスクコンテキスト下で時代遅れになり、過度に一般化され、有害になる可能性がある。
本稿では,編集可能なインサイトグラフに基づく障害対応メモリメンテナンスフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-03T12:35:44Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - The Past Is Prologue: A Plug-in Controller for Selective Updates in Sequentially Evolving LLM Memory [53.50071717647285]
我々はJanusを提案する。Janusは、候補メモリの更新を受け付けるか、以前のメモリを保持するかを決定するプラグインメモリコントローラである。
Janus は Memory Momentum Trigger を使用して、メモリ更新軌道における不審な偏差を識別する。
Janusは、対応するベース更新器に対して、平均精度を+2.7から+4.6ポイント改善する。
論文 参考訳(メタデータ) (2026-06-30T04:33:18Z) - TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory [11.528637007309937]
大規模言語モデル(LLM)エージェントは、拡張されたインタラクションをサポートし、有限コンテキストウィンドウを超えてパーソナライズされたアシストをサポートするために、長期記憶に依存している。
既存のメモリエージェントは、生成された書き込み、修正、削除によって外部メモリを積極的に更新する。
これらの更新は、重要な情報を省略したり、既存の記憶を破損させたり、幻覚コンテンツを導入したりする可能性がある。
本稿では,メモリ統合の信頼性向上を目的としたフレームワークであるTrustMemを提案する。
論文 参考訳(メタデータ) (2026-06-23T20:49:28Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents [10.128343847630552]
HiMPO (Hindsight-Informed Memory Policy Optimization) は、メモリ書き込みアクションに少なからぬクレジットを割り当てるためのフレームワークである。
また,HMPOは,ツールによるエラーによる非難の漏洩を低減し,メモリ更新の帰属性を改善する。
論文 参考訳(メタデータ) (2026-06-15T06:49:18Z) - REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs [17.526686616588794]
大きな言語モデル(LLM)は、長い時間をかけてユーザーと対話することがますます期待されている。
LLMは過去のすべてのインタラクションを保持することができず、履歴情報の保存、更新、検索には長期記憶管理が不可欠である。
REALは長期会話記憶を時間的かつ信頼性に配慮したプロパティグラフとして構成する。
論文 参考訳(メタデータ) (2026-06-09T10:53:10Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory [3.263386002412657]
長時間稼働するAIエージェントは永続的なメモリを必要とする。
現在のエージェントメモリシステムとデータベースパラダイムはメモリを記憶として扱う。
私たちのビジョンでは、長期エージェントメモリは新しいデータ管理ワークロードです。
論文 参考訳(メタデータ) (2026-05-25T18:22:42Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。