論文の概要: APeB: Benchmarking Personalization Ability of Large Language Model Agents
- arxiv url: http://arxiv.org/abs/2607.03162v1
- Date: Fri, 03 Jul 2026 10:03:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.538922
- Title: APeB: Benchmarking Personalization Ability of Large Language Model Agents
- Title(参考訳): APeB:大規模言語モデルエージェントのパーソナライズ能力のベンチマーク
- Authors: Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou,
- Abstract要約: LLMを利用したエージェントは、ユーザが未特定クエリを発行する際にパーソナライズに苦労する。
既存のベンチマークでは、ユーザ定義クエリや単純化された履歴に依存することが多いため、この機能をテストすることはめったにない。
生クエリと多様な履歴の下でのエージェントパーソナライズのためのテストベッドであるパーソナライズされた製品検索(PPS)を導入する。
- 参考スコア(独自算出の注目度): 17.77241512443464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-powered agents struggle with personalization when users issue raw, underspecified queries. In this setting, agents must infer latent intent, extract preferences from noisy interaction histories, and select among competing alternatives. Existing benchmarks rarely test this capability, as they often rely on user-refined queries or simplified histories. We introduce personalized product search (PPS), a testbed for agentic personalization under raw queries and diverse histories. We construct Agent Personalized Benchmark (APeB) from action logs, pairing underspecified intents with rich histories and user-viewed candidate items. Evaluating state-of-the-art LLMs with multi-step agent workflows, we find that models handle explicit queries well but struggle with early-stage queries requiring intent and preference discovery. Rubric analysis attributes this gap mainly to ineffective history use. A simple history-aware query-refinement pipeline, VQRA, yields consistent gains, highlighting the need for dedicated history-utilization modules in personalized agents.
- Abstract(参考訳): LLMを利用したエージェントは、ユーザが未特定クエリを発行する際にパーソナライズに苦労する。
この設定では、エージェントは遅延意図を推測し、ノイズの多い相互作用履歴から好みを抽出し、競合する選択肢を選択する必要がある。
既存のベンチマークでは、ユーザ定義クエリや単純化された履歴に依存することが多いため、この機能をテストすることはめったにない。
生クエリと多様な履歴の下でのエージェントパーソナライズのためのテストベッドであるパーソナライズされた製品検索(PPS)を導入する。
アクションログからエージェントパーソナライズドベンチマーク(APeB)を構築し,リッチな履歴とユーザビューの候補項目とのペアリングを行う。
多段階のエージェントワークフローで最先端のLCMを評価すると、モデルは明示的なクエリをうまく扱えるが、意図と好みの発見を必要とするアーリーステージのクエリには耐え難いことが分かる。
ルーブリック分析は、このギャップを主に非効率な歴史利用とみなしている。
シンプルな履歴対応クエリリファインメントパイプラインであるVQRAは、パーソナライズされたエージェントに専用の履歴利用モジュールの必要性を強調し、一貫性のあるゲインを得る。
関連論文リスト
- Latent Preference Modeling for Cross-Session Personalized Tool Calling [9.4096596518028]
MPTは265のマルチセッション対話からなるベンチマークで、優先度リコール、優先度誘導、優先度伝達の3つの課題をカバーしている。
また、ユーザの好みを進化する仮説として表現するテスト時間メモリ拡張手法であるPRefineを提案する。
これらの結果から,エージェントシステムにおけるロバストなパーソナライゼーションは,選択自体だけでなく,ユーザの選択の背景にある理由を捉えるメモリに依存することが示唆された。
論文 参考訳(メタデータ) (2026-04-20T06:57:50Z) - Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions [50.70965714314064]
大規模言語モデル(LLM)は、ユーザが拡張されたインタラクションよりも複雑で多様な好みを共有するパーソナルアシスタントとして、ますます機能している。
この研究は、パーソナライズされたユーザ-LLMインタラクションにおいて、リアルな嗜好フォローを評価するためのベンチマークであるRealPrefを提案する。
論文 参考訳(メタデータ) (2026-03-04T15:42:43Z) - ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding [53.88804678012327]
ALPBenchは属性レベルの長期的個人行動理解のためのベンチマークである。
ユーザと興味のある属性の組み合わせを予測し、基幹構造評価を可能にする。
ユーザの明示的に表現された要求よりも、長期的な歴史的行動の好みをモデル化する。
論文 参考訳(メタデータ) (2026-02-03T03:32:16Z) - Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization [27.490675380289318]
関連性はユーティリティの信頼性の低いプロキシとして機能する、と私たちは主張する。
Llm pErsonalization のために UseR Profiles をoPtimizeする文脈的帯域幅フレームワーク PURPLE を提案する。
PURPLEは、最も関連性の高いレコードの欲求選択とは対照的に、プロファイル構築をセット生成プロセスとして扱う。
論文 参考訳(メタデータ) (2026-01-17T15:05:36Z) - LongDA: Benchmarking LLM Agents for Long-Document Data Analysis [55.32211515932351]
LongDAは、長いドキュメントと複雑なデータをナビゲートする実際の設定をターゲットとしています。
LongTAは、ドキュメントアクセス、検索、コード実行を可能にするツール拡張されたエージェントフレームワークである。
実験の結果, 最先端モデルにおいても, かなりの性能差が認められた。
論文 参考訳(メタデータ) (2026-01-05T23:23:16Z) - SessionIntentBench: A Multi-task Inter-session Intention-shift Modeling Benchmark for E-commerce Customer Behavior Understanding [64.45047674586671]
本稿では,意図木の概念を導入し,データセットキュレーションパイプラインを提案する。
我々は,L(V)LMsのセッション間意図シフト理解能力を評価するマルチモーダルベンチマークSessionIntentBenchを構築した。
1,952,177の意図的エントリ,1,132,145のセッション意図軌跡,および10,905のセッションを使用してマイニングされた13,003,664のタスクにより,既存のセッションデータを活用可能なスケーラブルな方法を提供する。
論文 参考訳(メタデータ) (2025-07-27T09:04:17Z) - From Prompting to Alignment: A Generative Framework for Query Recommendation [35.654879254147964]
本稿では,クエリ生成とユーザの好みを一致させる生成クエリ推薦(GQR)フレームワークを提案する。
具体的には、多様なクエリレコメンデーションタスクを普遍的なプロンプトフレームワークで統一する。
また,クエリワイドCTR予測器をプロセス報酬モデルとしてトレーニングするCTRアライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-14T13:21:29Z) - ProductAgent: Benchmarking Conversational Product Search Agent with Asking Clarification Questions [68.81939215223818]
ProductAgentは,戦略的明確化質問生成機能と動的製品検索機能を備えた対話情報探索エージェントである。
我々は,製品特徴の要約,クエリ生成,製品検索のための戦略を持ったエージェントを開発する。
実験の結果,ProductAgentはユーザとポジティブに対話し,対話のターンの増加に伴う検索性能の向上を図っている。
論文 参考訳(メタデータ) (2024-07-01T03:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。