論文の概要: FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
- arxiv url: http://arxiv.org/abs/2608.04095v1
- Date: Tue, 04 Aug 2026 18:00:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.562932
- Title: FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
- Title(参考訳): FinPerMA: LLMエージェントのための理論インフォームド、イベントグラウンドパーソナライズドメモリベンチマーク
- Abstract要約: FinPerMAは、凍結した縦方向の投資家軌跡に対してパーソナライズされたメモリを評価する、イベントグラウンドのベンチマークである。
完全コンテキスト構成は、全体的な精度が約0.47以上、複数選択の質問では約39%を超えない。
属性分析により、要約ベースのメモリは、パーソナライズに必要な選好信号を失いながら、事実の詳細を保存していることが示された。
- 参考スコア(独自算出の注目度): 9.305912044747368
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents are increasingly used as personalized assistants in high-stakes domains such as financial advising, yet it remains unclear whether they can maintain and update an individualized user model over long horizons. Existing personalized-memory benchmarks primarily test factual retention or rely on weakly constrained model-generated trajectories, leaving event-driven preference adaptation underexplored. We introduce FinPerMA, an event-grounded benchmark that evaluates personalized memory against frozen longitudinal investor trajectories. Its generation pipeline combines deterministic, theory-informed impact rules, controlled LLM narration, and automated quality screening; a Post-Shock checkpoint isolates whether an agent has integrated a material event into its persistent user model. On 2,994 questions from 276 personas, seven frontier LLMs and up to seven memory configurations remain far from saturated: no full-context configuration exceeds approximately 0.47 overall accuracy or approximately 39% on multiple-choice questions. Attribution analysis shows that summary-based memory often preserves factual details while losing the preference signals needed for personalization; simple retrieval can therefore outperform purpose-built memory systems, with the gap widening after shocks.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、金融アドバイスなどの高額な分野において、パーソナライズされたアシスタントとして使われることが多いが、長期にわたって個別のユーザーモデルを維持・更新できるかどうかは不明だ。
既存のパーソナライズされたメモリベンチマークは、主に事実の保持をテストするか、あるいは制約の弱いモデル生成トラジェクトリに依存しており、イベント駆動の優先順応は未調査のままである。
我々はFinPerMAを紹介した。FinPerMAは、凍結した経時的投資家軌跡に対してパーソナライズされたメモリを評価する。
その生成パイプラインは、決定論的で理論に反する影響ルール、制御されたLLMナレーション、自動品質スクリーニングを組み合わせたもので、Post-Shockチェックポイントは、エージェントが物質イベントを永続的なユーザモデルに統合したかどうかを分離する。
276のペルソナ、7つのフロンティアLSM、最大7つのメモリ構成からの2,994の質問は、まだ飽和していない。
属性分析により、要約ベースのメモリは、パーソナライズに必要な選好信号を失いながら、事実の詳細を保存しがちであることが示された。
関連論文リスト
- Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving [0.8419406375517101]
VLMは自動運転を約束するが、それでも弱い時間的認識と限定的な一般化に悩まされている。
最近の手法は、CoTの説明、検索強化生成、ツール出力の静的注入による推論と意思決定を改善する。
クローズドループでのプロアクティブツール呼び出しと階層的メモリを密結合する最初のシナジスティックフレームワークである、私たちの知識を提示する。
論文 参考訳(メタデータ) (2026-09-08T03:59:10Z) - Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner [55.80248281761638]
マルチモーダルな大言語モデル (MLLM) は、科学的および数学的推論において、印象的な認識を提供する。
本稿では,DG-Memを提案する。DG-Memは,トレーニングタイムのロールアウトから一度構築した外部記憶メモリと,テスト時に読み取り専用に相談することで,凍結したMLLMを拡張可能なエージェントメモリフレームワークである。
論文 参考訳(メタデータ) (2026-08-24T13:56:01Z) - Long-Horizon Embodied Decision-Making via Multimodal Memory Compression [71.16335993005139]
DunphyBenchは、長期的な人間中心の意思決定のエージェントを評価するための新しいベンチマークだ。
MeMentoは、ユーザの好みに基づいて決定関連情報を選択的に圧縮する、優先条件付きマルチモーダルメモリ圧縮機である。
MeMentoはVLM駆動エージェントの精度を7.18%向上させ、メモリ使用率を最強のベースラインに比べて85.38%削減する。
論文 参考訳(メタデータ) (2026-08-02T19:29:48Z) - Multi-Head Recurrent Memory Agents [6.282017902182834]
マルチヘッドリカレントメモリは、ステージワイド選択更新戦略によって管理される独立したヘッドにメモリを分割する。
軽量なインスタンス化としてLHM-LRU(Least-Recently-Updated MHM)を導入する。
論文 参考訳(メタデータ) (2026-07-01T22:38:54Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment [54.72137309071243]
AlpsBenchはWildChatからキュレートされた2500の長期的相互作用配列から構成され、人間によって検証された構造化記憶と組み合わせられる。
我々は、パーソナライズされた情報抽出、更新、検索、利用の4つの重要なタスクを定義し、メモリ管理のライフサイクル全体を評価するためのプロトコルを確立する。
i)モデルが潜在ユーザ特性を確実に抽出するのに苦労していること、(ii)メモリ更新が最強モデルでもパフォーマンス天井に直面すること、(iii)大きなイントラクタプールの存在下での検索精度が急激に低下すること、(iv)明示的なメモリ機構がリコールを改善する一方で、リコールは行わないこと、などである。
論文 参考訳(メタデータ) (2026-03-09T11:06:19Z) - MemPO: Self-Memory Policy Optimization for Long-Horizon Agents [52.00646524941419]
既存のメソッドは通常、外部メモリモジュールを導入し、格納されたメモリから関連する情報を検索する。
本稿では,自己記憶ポリシー最適化アルゴリズム(MemPO)を提案する。
MemPOはF1の絶対スコアが25.98%、SOTAベースラインが7.1%、トークン使用率が67.58%、73.12%である。
論文 参考訳(メタデータ) (2026-02-28T14:43:02Z) - How Does Personalized Memory Shape LLM Behavior? Benchmarking Rational Preference Utilization in Personalized Assistants [25.83552447206606]
大規模言語モデル(LLM)を利用したアシスタントは、最近、ユーザの好みを記録するメモリメカニズムを統合し、よりパーソナライズされ、ユーザに準拠した応答をもたらす。
RPEvalは、パーソナライズされた意図推論データセットとマルチグラニュラリティ評価プロトコルからなるベンチマークである。
RPEvalは、既存のLCMにおける不合理なパーソナライゼーションの広範な現象を明らかにし、エラーパターン解析を通じて、ユーザエクスペリエンスに悪影響を及ぼすことを示す。
本稿では、メモリ利用を実用的な推論プロセスとして扱い、パーソナライズされた情報の選択的統合を可能にするRP-Reasonerを紹介する。
論文 参考訳(メタデータ) (2026-01-23T10:19:48Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。