論文の概要: Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data
- arxiv url: http://arxiv.org/abs/2607.27056v2
- Date: Mon, 03 Aug 2026 12:10:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.021637
- Title: Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data
- Title(参考訳): セトカ:不均一データに対する個人化エージェントの階層的ユーザ理解のためのベンチマーク
- Abstract要約: メモリ拡張されたパーソナライズされたエージェントを評価するためのベンチマークであるセトカを提案する。
セトカは、意味記憶、エピソード記憶、行動パターン、性格特性の4つのレベルのユーザー理解を定義している。
その結果,既存のシステムではセマンティックメモリの検索に優れていたが,セマンティックメモリでは性能が低下していることがわかった。
- 参考スコア(独自算出の注目度): 8.564332409420473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personalized agents are increasingly applied to assist users across a wide range of tasks. Effective personalized assistance requires not only retrieving explicit facts from past interactions stored in agent memory, but also inferring abstract personal characteristics. However, existing memory benchmarks primarily evaluate whether an agent can retrieve information explicitly stated in conversational histories, failing to provide an effective assessment of deeper user understanding. In this work, we propose Setoka, a benchmark for evaluating memory-augmented personalized agents with hierarchical user understanding from heterogeneous data. Grounded in theories from cognitive and personality psychology, Setoka defines four levels of user understanding, i.e., semantic memory, episodic memory, behavior pattern, and personality trait. Moreover, to enable realistic yet privacy-preserving evaluation, we design a psychometrics-based pipeline that synthesizes diverse, coherent heterogeneous user data and queries at scale. Finally, we leverage Setoka to evaluate 3 language models combined with 5 memory systems for 10 synthetic users. Our comprehensive evaluation reveals that while existing systems perform well on semantic memory retrieval, their performance declines on episodic memory. Moreover, when dealing with behavior pattern and personality trait understanding tasks that require integrating heterogeneous and fragmented information dispersed over time, performance declines even further. These findings demonstrate that user understanding cannot be handled by simple fact retrieval, motivating the design of memory mechanisms for cross-source integration and abstraction over long-term user behavior.
- Abstract(参考訳): パーソナライズされたエージェントは、幅広いタスクにまたがってユーザーを支援するためにますます応用されている。
効果的なパーソナライズされた支援は、エージェントメモリに格納された過去のインタラクションから明確な事実を検索するだけでなく、抽象的な個人的特徴を推測する。
しかし、既存のメモリベンチマークは、エージェントが会話履歴に明記されている情報を検索できるかどうかを主に評価し、より深いユーザー理解の効果的な評価を提供していない。
本研究では,異種データからの階層的ユーザ理解を用いたメモリ拡張型パーソナライズされたエージェント評価のためのベンチマークであるセトカを提案する。
セトカは認知心理学とパーソナリティ心理学の理論に基づいて、意味記憶、エピソード記憶、行動パターン、パーソナリティ特性という4つのレベルのユーザー理解を定義している。
さらに,現実的かつプライバシー保護的な評価を実現するため,多様な不均一なユーザデータと大規模クエリを合成するサイコメトリックスベースのパイプラインを設計する。
最後に,セトカを利用して,合成ユーザ10人を対象に,5つのメモリシステムと組み合わせた3つの言語モデルを評価する。
その結果,既存のシステムではセマンティックメモリの検索に優れていたが,セマンティックメモリでは性能が低下していることがわかった。
さらに、時間とともに分散した異種・断片化された情報を統合する必要がある行動パターンや性格特性理解タスクを扱う場合、さらに性能が低下する。
これらの結果から,ユーザ理解は単純な事実検索によっては扱えないことが示され,長期的ユーザ行動に対するクロスソース統合と抽象化のためのメモリ機構の設計が動機となっている。
関連論文リスト
- Graph-Based Personalized Memory for LLM Agents: Representation, Evolution, Retrieval, and Evaluation [10.79929452695567]
大規模言語モデル(LLM)エージェントは、シングルセッションツールから長期的なパーソナルアシスタントへと進化している。
このシフトは、ユーザの好み、目標、制約、関係性、過去の経験が徐々に蓄積され、時間とともに頻繁に変化するため、メモリをパーソナライズするためのコア要件にします。
グラフベースのパーソナライズドメモリは、明示的な関係、時間的コンテキスト、エビデンスリンクを通じて、そのようなユーザ情報をモデル化する構造化された方法を提供する。
論文 参考訳(メタデータ) (2026-09-08T11:34:04Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments [72.02445514666428]
静的な嗜好リコールを超えてペルマの一貫性を評価するためのベンチマークであるPERMAを紹介する。
PerMAは、複数のセッションとドメインにまたがる時間的に順序付けられたインタラクションイベントと、時間とともに好みに関連するクエリで構成されている。
実験により、関連するインタラクションをリンクすることで、高度なメモリシステムはより正確な好みを抽出し、トークン消費を減らすことができることが示された。
論文 参考訳(メタデータ) (2026-03-24T14:04:11Z) - AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment [54.72137309071243]
AlpsBenchはWildChatからキュレートされた2500の長期的相互作用配列から構成され、人間によって検証された構造化記憶と組み合わせられる。
我々は、パーソナライズされた情報抽出、更新、検索、利用の4つの重要なタスクを定義し、メモリ管理のライフサイクル全体を評価するためのプロトコルを確立する。
i)モデルが潜在ユーザ特性を確実に抽出するのに苦労していること、(ii)メモリ更新が最強モデルでもパフォーマンス天井に直面すること、(iii)大きなイントラクタプールの存在下での検索精度が急激に低下すること、(iv)明示的なメモリ機構がリコールを改善する一方で、リコールは行わないこと、などである。
論文 参考訳(メタデータ) (2026-03-09T11:06:19Z) - Cognitive Prosthetic: An AI-Enabled Multimodal System for Episodic Recall in Knowledge Work [6.688814515265279]
本稿では,構造化されたエピソードキャプチャと自然言語検索による知識作業におけるエピソードリコールを支援するために,AIを利用した概念証明を提案する。
異種センサデータを問合せ可能なエピソード記憶に変換する技術的実現可能性を示す機能実証として,CPMSを提案する。
この作業は、職場環境におけるAI対応メモリ拡張のためのエンドツーエンドのプライバシ対応アーキテクチャに寄与する。
論文 参考訳(メタデータ) (2026-03-02T16:58:53Z) - Learning Personalized Agents from Human Feedback [36.47803872623135]
連続的なパーソナライズのための枠組みであるPAHF(Personalized Agents from Human Feedback)を紹介する。
PAHFは、ユーザ毎の明示的なメモリを使用して、ライブインタラクションからオンラインで学習する。
ベンチマークは、エージェントが最初の好みをスクラッチから学習し、その後ペルソナシフトに適応する能力を定量化する。
論文 参考訳(メタデータ) (2026-02-18T04:18:47Z) - OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents [55.27061195244624]
オーバーパーソナライゼーションを3つのタイプに分類する。
エージェントは不要な場合でも、ユーザメモリを取得およびオーバーアタッチする傾向があります。
我々の研究は、メモリ拡張対話システムにおいて、より制御可能で適切なパーソナライズに向けた最初の一歩を踏み出した。
論文 参考訳(メタデータ) (2026-01-20T08:27:13Z) - Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey [211.01908189012184]
今年、何百もの論文が公開されたメモリは、ユーティリティギャップを埋めるための重要なソリューションとして現れます。
ファンデーションエージェントのメモリを3次元に統一したビューを提供する。
次に、異なるエージェントトポロジの下でメモリがどのようにインスタンス化され、操作されるかを分析する。
論文 参考訳(メタデータ) (2026-01-14T07:38:38Z) - O-Mem: Omni Memory System for Personalized, Long Horizon, Self-Evolving Agents [60.1848551962911]
O-Memはアクティブユーザプロファイリングに基づく新しいメモリフレームワークである。
O-Memはペルソナ属性とトピック関連コンテキストの階層的検索をサポートする。
論文 参考訳(メタデータ) (2025-11-17T16:55:19Z) - Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization [26.34637576545121]
LLMを動力とするエンボディエージェントは、従来のオブジェクト配置タスクで成功している。
しかし、過去のインタラクションからユーザ固有の知識を活用するパーソナライズされた支援を提供することで、新たな課題が浮かび上がっている。
エージェントのメモリ利用のレンズを通してこれらの課題を考察する。
論文 参考訳(メタデータ) (2025-05-22T08:00:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。