論文の概要: MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2608.02113v1
- Date: Mon, 03 Aug 2026 12:10:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.522659
- Title: MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
- Title(参考訳): MemArbiter:長期LDMエージェントのための決定時間メモリアロケーション
- Authors: Jiajun Dong, Yutao Hu, Fengrui Fan, Shihan Dou, Yueming Wu, Deqing Zou,
- Abstract要約: 本稿では,関数対応メモリ調停フレームワークであるMemArbiterを提案する。
MemArbiterは、インタラクション履歴をアトミックアイテムに分解し、5つの機能的メモリバンクに編成する。
MemArbiterは、500と750の予算で82.8%、92.5%の成功率を達成した。
- 参考スコア(独自算出の注目度): 14.82470944373943
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents must retain and use cross-step information to act coherently in long-horizon tasks. Existing methods improve memory accessibility, yet action-relevant information may still fail to guide the current decision because it is poorly formed, organized, prioritized, or presented. We call this post-access failure the Memory-Action Gap. We propose MemArbiter, a function-aware memory arbitration framework that addresses the memory-management-induced component of this gap. MemArbiter decomposes interaction histories into atomic items, organizes them into five functional Memory Banks, and combines bank-level demand, item-level relevance, focal-ambient representations, and a temporal presentation gate to dynamically control memory salience. We evaluate MemArbiter on ALFWorld against Flat Retrieval and Flat Recency under unified per-step memory budgets. With an open-weight action-generation model, MemArbiter achieves success rates of 82.8% and 92.5% under 500- and 750-token budgets, outperforming the strongest baseline by 20.9 and 25.4 percentage points, respectively. It also improves post-failure recovery and reduces failed-action repetition and state-action recurrence. These results show that function-aware memory arbitration enables accessible information to guide actions more effectively.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、長期的タスクにおいて一貫性のある動作を行うために、横断的な情報を保持し、使用する必要がある。
既存の方法ではメモリアクセシビリティが向上するが、アクション関連情報は形成、整理、優先順位付け、提示が不十分であるため、現在の決定を導くのに失敗する可能性がある。
アクセス後障害をMemory-Action Gapと呼びます。
本稿では,メモリ管理によって引き起こされるこのギャップのコンポーネントに対処する関数対応メモリ調停フレームワークであるMemArbiterを提案する。
MemArbiterは、相互作用履歴をアトミックな項目に分解し、5つの機能的メモリバンクに整理し、銀行レベルの要求、アイテムレベルの関連性、焦点環境表現、時間的表現ゲートを組み合わせて、メモリサリエンスを動的に制御する。
ALFWorld上のMemArbiterとFlat RetrievalとFlat Recencyを、ステップ単位のメモリ予算で評価する。
オープンウェイトなアクションジェネレーションモデルにより、MemArbiterは、500と750の予算で82.8%と92.5%の成功率を獲得し、それぞれ20.9と25.4で最強のベースラインを上回っている。
また、障害後の回復を改善し、失敗した動作の繰り返しと状態反応の再発を減少させる。
これらの結果から,機能認識メモリの調停により,アクセス可能な情報によりより効果的な行動案内が可能であることが示唆された。
関連論文リスト
- Mechanistic Attention Guidance for Agent Memory Refinement [32.57216046158823]
検索ヘッドアテンションは,セグメントレベルのメモリ使用量を明らかにするためのメカニスティック信号を提供する。
本稿では,注意による利用パターンを用いてセグメントレベルのメモリ更新を誘導するフレームワークであるAttention-Guided Memory Refinement (AGMR)を提案する。
論文 参考訳(メタデータ) (2026-07-20T07:17:50Z) - HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents [10.128343847630552]
HiMPO (Hindsight-Informed Memory Policy Optimization) は、メモリ書き込みアクションに少なからぬクレジットを割り当てるためのフレームワークである。
また,HMPOは,ツールによるエラーによる非難の漏洩を低減し,メモリ更新の帰属性を改善する。
論文 参考訳(メタデータ) (2026-06-15T06:49:18Z) - ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning [46.225019133047965]
メモリは、大規模言語モデル(LLM)エージェントが長距離推論タスクを処理できるようにするために必須である。
コア推論プロセスからエージェントメモリを分離するフレームワークであるActiveMemを提案する。
BrowseComp-PlusとGAIAの実験では、ActiveMemはオーバーヘッドを大幅に削減して最先端の精度を実現している。
論文 参考訳(メタデータ) (2026-06-09T08:03:38Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - MemPO: Self-Memory Policy Optimization for Long-Horizon Agents [52.00646524941419]
既存のメソッドは通常、外部メモリモジュールを導入し、格納されたメモリから関連する情報を検索する。
本稿では,自己記憶ポリシー最適化アルゴリズム(MemPO)を提案する。
MemPOはF1の絶対スコアが25.98%、SOTAベースラインが7.1%、トークン使用率が67.58%、73.12%である。
論文 参考訳(メタデータ) (2026-02-28T14:43:02Z) - ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents [14.695250837875454]
本稿では,ActMemと呼ばれる新しい動作可能なメモリフレームワークを提案する。
ActMemは非構造化対話履歴を構造化因果グラフと意味グラフに変換する。
エージェントは暗黙の制約を推論し、過去の状態と現在の意図の間の潜在的な衝突を解決することができる。
論文 参考訳(メタデータ) (2026-02-04T00:54:53Z) - Mem-T: Densifying Rewards for Long-Horizon Memory Agents [23.19373149519922]
我々は,動的更新やストリーミング入力によるマルチターン検索を行うために,軽量な階層型メモリデータベースと対話する自律メモリエージェントMem-Tを紹介する。
また,木誘導型強化学習フレームワークであるMoT-GRPOを提案する。
論文 参考訳(メタデータ) (2026-01-30T14:23:33Z) - Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management [63.48041801851891]
Fine-Memは、きめ細かいフィードバックアライメントのために設計された統一されたフレームワークである。
MemalphaとMemoryAgentBenchの実験は、Fin-Memが強いベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-01-13T11:06:17Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。