論文の概要: PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails
- arxiv url: http://arxiv.org/abs/2607.20482v1
- Date: Sat, 30 May 2026 13:27:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.194842
- Title: PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails
- Title(参考訳): PersonaTrail: Browsing Trailsを通じてパーソナライズされたWebエージェントのベンチマーク
- Abstract要約: PersonaTrailは、管理されたオープンなWeb環境で動作するパーソナライズされたWebエージェントのベンチマークである。
PACMemは、生のブラウジング履歴を2種類の構造化メモリに分解するフレームワークである。
実験の結果、PACMemは両方のタスクで既存のメモリベースベースラインを一貫して上回っていることがわかった。
- 参考スコア(独自算出の注目度): 42.825314356642956
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in large language models have enabled web agents to autonomously execute complex tasks. In practice, users frequently provide underspecified instructions, requiring agents to infer the missing context from their raw browsing histories. Existing benchmarks fail to capture this form of personalization, as they either restrict tasks to fully explicit prompts or abstract web interaction history into simplified forms. To bridge this gap, we introduce PersonaTrail, a benchmark for personalized web agents operating in a managed open web environment. By leveraging realistic browsing trajectories as user history, PersonaTrail evaluates an agent's ability to infer user preferences and recall information from past browsing sessions. We further propose Preference-Aware Contextual Memory (PACMem), a framework that decomposes raw browsing histories into two types of structured memory: factual memories that summarize individual sessions and preference memories that distill recurring behavioral patterns. At inference time, the agent retrieves the most relevant entries from these memories to guide personalized navigation. Extensive experiments show that PACMem consistently outperforms existing memory-based baselines on both tasks.
- Abstract(参考訳): 近年の大規模言語モデルの進歩により、Webエージェントは複雑なタスクを自律的に実行できるようになった。
実際には、ユーザは不特定な指示を頻繁に提供し、エージェントは元のブラウジング履歴から行方不明のコンテキストを推測する必要がある。
既存のベンチマークは、タスクを完全に明示的なプロンプトに制限するか、Webインタラクション履歴を単純化した形式に抽象化するので、この形式のパーソナライズを捕捉することができない。
このギャップを埋めるために、管理されたオープンな環境で動作するパーソナライズされたWebエージェントのベンチマークであるPersonaTrailを紹介します。
リアルなブラウジングトラジェクトリをユーザ履歴として活用することにより、PersonaTrailは、過去のブラウジングセッションからユーザの好みを推測し、情報をリコールするエージェントの能力を評価する。
さらに,個別のセッションを要約した事実記憶と,繰り返し発生する行動パターンを再現した嗜好記憶という,生の閲覧履歴を構造化記憶に分解するフレームワークであるPreference-Aware Contextual Memory (PACMem)を提案する。
推論時に、エージェントはこれらの記憶から最も関連性の高いエントリを取得し、パーソナライズされたナビゲーションをガイドする。
大規模な実験では、PACMemは既存のメモリベースベースラインを両タスクで一貫して上回っている。
関連論文リスト
- APeB: Benchmarking Personalization Ability of Large Language Model Agents [17.77241512443464]
LLMを利用したエージェントは、ユーザが未特定クエリを発行する際にパーソナライズに苦労する。
既存のベンチマークでは、ユーザ定義クエリや単純化された履歴に依存することが多いため、この機能をテストすることはめったにない。
生クエリと多様な履歴の下でのエージェントパーソナライズのためのテストベッドであるパーソナライズされた製品検索(PPS)を導入する。
論文 参考訳(メタデータ) (2026-07-03T10:03:35Z) - DocOS: Towards Proactive Document-Guided Actions in GUI Agents [54.27655693145045]
textbfDocOSは、完全にインタラクティブな環境で文書誘導問題解決を評価するために設計されたベンチマークである。
実験の結果、エージェントはプロアクティブ検索中に関連情報を確実に見つけるのに苦労し、検索した指示を忠実に正確な行動に移すのに失敗することが判明した。
論文 参考訳(メタデータ) (2026-05-18T08:36:04Z) - PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments [72.02445514666428]
静的な嗜好リコールを超えてペルマの一貫性を評価するためのベンチマークであるPERMAを紹介する。
PerMAは、複数のセッションとドメインにまたがる時間的に順序付けられたインタラクションイベントと、時間とともに好みに関連するクエリで構成されている。
実験により、関連するインタラクションをリンクすることで、高度なメモリシステムはより正確な好みを抽出し、トークン消費を減らすことができることが示された。
論文 参考訳(メタデータ) (2026-03-24T14:04:11Z) - Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History [8.085230376705887]
Persona2Webは、実際のオープンウェブ上でパーソナライズされたWebエージェントを評価するための最初のベンチマークである。
1) 長期にわたる嗜好を暗黙的に明らかにするユーザ履歴,(2) 暗黙的な嗜好を推論するエージェントを必要とするあいまいなクエリ,(3) パーソナライゼーションのきめ細かい評価を可能にする推論対応評価フレームワークから構成される。
論文 参考訳(メタデータ) (2026-02-19T01:54:26Z) - Learning Personalized Agents from Human Feedback [36.47803872623135]
連続的なパーソナライズのための枠組みであるPAHF(Personalized Agents from Human Feedback)を紹介する。
PAHFは、ユーザ毎の明示的なメモリを使用して、ライブインタラクションからオンラインで学習する。
ベンチマークは、エージェントが最初の好みをスクラッチから学習し、その後ペルソナシフトに適応する能力を定量化する。
論文 参考訳(メタデータ) (2026-02-18T04:18:47Z) - OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents [55.27061195244624]
オーバーパーソナライゼーションを3つのタイプに分類する。
エージェントは不要な場合でも、ユーザメモリを取得およびオーバーアタッチする傾向があります。
我々の研究は、メモリ拡張対話システムにおいて、より制御可能で適切なパーソナライズに向けた最初の一歩を踏み出した。
論文 参考訳(メタデータ) (2026-01-20T08:27:13Z) - MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation [12.075641773020152]
本稿では,ユーザのテキスト履歴全体を階層記憶に織り込み,パーソナライズされた生成を行うフレームワークを提案する。
MemWeaverは、時間情報と意味情報を統合した2つの補完的なメモリコンポーネントを構築している。
論文 参考訳(メタデータ) (2025-10-09T02:47:21Z) - PersonaAgent: When Large Language Model Agents Meet Personalization at Test Time [87.99027488664282]
PersonaAgentは、汎用的なパーソナライゼーションタスクに対処するために設計されたフレームワークである。
パーソナライズされたメモリモジュールとパーソナライズされたアクションモジュールを統合する。
テストタイムのユーザ嗜好アライメント戦略は、リアルタイムのユーザの嗜好アライメントを保証する。
論文 参考訳(メタデータ) (2025-06-06T17:29:49Z) - Large Language Models Empowered Personalized Web Agents [54.944908837494374]
Webエージェントは、従来のエージェントから、LLM(Large Language Models)ベースのWebエージェントへと進化してきた。
まず, LLMを活用したパーソナライズされたWebエージェントのタスクを定式化し, パーソナライズされたデータとユーザ指示を統合する。
我々はパーソナライズされたユーザメモリ拡張アライメント(PUMA)フレームワークを提案し、パーソナライズされたWebエージェントタスクにLLMを適用する。
論文 参考訳(メタデータ) (2024-10-22T17:54:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。