論文の概要: ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding
- arxiv url: http://arxiv.org/abs/2602.03056v1
- Date: Tue, 03 Feb 2026 03:32:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-04 18:37:15.223822
- Title: ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding
- Title(参考訳): ALPBench: 属性レベルの長期的個人行動理解のためのベンチマーク
- Abstract要約: ALPBenchは属性レベルの長期的個人行動理解のためのベンチマークである。
ユーザと興味のある属性の組み合わせを予測し、基幹構造評価を可能にする。
ユーザの明示的に表現された要求よりも、長期的な歴史的行動の好みをモデル化する。
- 参考スコア(独自算出の注目度): 53.88804678012327
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in large language models have highlighted their potential for personalized recommendation, where accurately capturing user preferences remains a key challenge. Leveraging their strong reasoning and generalization capabilities, LLMs offer new opportunities for modeling long-term user behavior. To systematically evaluate this, we introduce ALPBench, a Benchmark for Attribution-level Long-term Personal Behavior Understanding. Unlike item-focused benchmarks, ALPBench predicts user-interested attribute combinations, enabling ground-truth evaluation even for newly introduced items. It models preferences from long-term historical behaviors rather than users' explicitly expressed requests, better reflecting enduring interests. User histories are represented as natural language sequences, allowing interpretable, reasoning-based personalization. ALPBench enables fine-grained evaluation of personalization by focusing on the prediction of attribute combinations task that remains highly challenging for current LLMs due to the need to capture complex interactions among multiple attributes and reason over long-term user behavior sequences.
- Abstract(参考訳): 大規模言語モデルの最近の進歩は、パーソナライズされたレコメンデーションの可能性を強調している。
強力な推論と一般化機能を活用することで、LLMは長期的なユーザの振る舞いをモデリングする新たな機会を提供する。
これを体系的に評価するために、属性レベルの長期的個人行動理解のためのベンチマークであるALPBenchを紹介する。
アイテム中心のベンチマークとは異なり、ALPBenchはユーザーが興味を持つ属性の組み合わせを予測する。
ユーザの明示的に表現された要求よりも、長期的な歴史的行動の好みをモデル化し、永続的な関心を反映する。
ユーザ履歴は自然言語シーケンスとして表現され、解釈可能な推論に基づくパーソナライズを可能にする。
ALPBenchは、複数の属性間の複雑な相互作用をキャプチャし、長期間のユーザ動作シーケンスに対する理由付けを必要とするため、現在のLLMでは依然として非常に困難な属性組合せタスクの予測に焦点をあてて、パーソナライゼーションのきめ細かい評価を可能にする。
関連論文リスト
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - Preference-Aware Rubric Learning for Personalized Evaluation [59.539429430690156]
既存の評価手法では、長期的なインタラクション履歴に埋め込まれたユーザ固有の嗜好をキャプチャできない。
静的判断よりも学習問題としてパーソナライズされた評価を定式化するパラダイムであるパーソナライズド・アズ・ラーニングを提案する。
実験により、PARLはユーザ対応の応答を確実に識別し、ユーザ間で一般化する高忠実なルーブリックを一貫して誘導することが示された。
論文 参考訳(メタデータ) (2026-05-29T17:00:55Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - SLSREC: Self-Supervised Contrastive Learning for Adaptive Fusion of Long- and Short-Term User Interests [22.535188624090353]
SLSRecは、長期と短期の勧告を融合したセッションベースのモデルである。
長期的および短期的な関心表現の正確な校正を保証するために、対照的な学習戦略を導入する。
3つの公開ベンチマークデータセットの実験は、SLSRecが一貫して最先端モデルを上回っていることを示している。
論文 参考訳(メタデータ) (2026-04-06T08:49:46Z) - Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions [50.70965714314064]
大規模言語モデル(LLM)は、ユーザが拡張されたインタラクションよりも複雑で多様な好みを共有するパーソナルアシスタントとして、ますます機能している。
この研究は、パーソナライズされたユーザ-LLMインタラクションにおいて、リアルな嗜好フォローを評価するためのベンチマークであるRealPrefを提案する。
論文 参考訳(メタデータ) (2026-03-04T15:42:43Z) - Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction [55.24448139349266]
PAL-Benchは、長期ユーザエージェントインタラクションにおけるサービス指向アシスタントのパーソナライズ機能を評価するために設計された新しいベンチマークである。
サービス指向のインタラクションをパーソナライズするために、階層的で異質なメモリフレームワークであるH$2$Memoryを提案する。
論文 参考訳(メタデータ) (2025-11-17T14:22:32Z) - Using LLMs to Capture Users' Temporal Context for Recommendation [3.719862246745416]
本稿では,Large Language Models (LLMs) を用いて,意味的にリッチでタイムアウェアなユーザプロファイルを生成する手法を提案する。
我々は、新しいエンドツーエンドレコメンデーションアーキテクチャを提案していないが、中核となる貢献は、LLMの有効性の程度を体系的に調査することである。
Movies&TV と Video Games のドメイン間での評価では、LLM の生成したプロファイルは意味的な深さと時間構造を提供するが、コンテキスト対応のレコメンデーションの有効性はユーザーインタラクション履歴の豊かさに特有である。
論文 参考訳(メタデータ) (2025-08-11T22:48:31Z) - Temporal User Profiling with LLMs: Balancing Short-Term and Long-Term Preferences for Recommendations [3.719862246745416]
本稿では,短期および長期の嗜好を明示的にモデル化するユーザプロファイリング手法を提案する。
LLM-TUPは、いくつかのベースラインに対して大幅に改善されている。
論文 参考訳(メタデータ) (2025-08-11T20:28:24Z) - What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context [56.590259941275434]
RecPOは、シーケンシャルなレコメンデーションのための優先順位最適化フレームワークである。
これは、推定された嗜好階層と時間信号に基づいて適応的な報酬マージンを利用する。
タイムリーな満足感、コヒーレントな嗜好の維持、変化する状況下での識別の行使など、人間の意思決定の重要な特徴を反映している。
論文 参考訳(メタデータ) (2025-06-02T21:09:29Z) - A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations [112.81207927088117]
PersonaConvBenchは、大規模言語モデル(LLM)とのマルチターン会話におけるパーソナライズされた推論と生成を評価するためのベンチマークである。
我々は,複数の商用およびオープンソース LLM を統一的なプロンプト設定でベンチマークし,パーソナライズされた履歴を組み込むことで大幅な性能向上が得られることを観察した。
論文 参考訳(メタデータ) (2025-05-20T09:13:22Z) - Towards Explainable Temporal User Profiling with LLMs [3.719862246745416]
我々は,大規模言語モデル(LLM)を利用して,ユーザのインタラクション履歴の自然言語要約を生成する。
我々のフレームワークは、時間的ユーザの好みをモデル化するだけでなく、解釈可能な方法でレコメンデーションを説明するために使える自然言語プロファイルも生成する。
論文 参考訳(メタデータ) (2025-05-01T22:02:46Z) - PersonalLLM: Tailoring LLMs to Individual Preferences [11.717169516971856]
我々は、特定のユーザに対して最大限のメリットを提供するためにLLMを適用することに焦点を当てた、PersonalLLMという公開ベンチマークを提示する。
我々は、ユーザーが不均一な潜伏傾向を示すことを期待する高品質な回答と組み合わせたオープンエンドプロンプトをキュレートする。
私たちのデータセットと生成された個人性は、パーソナライズアルゴリズムを開発するための革新的なテストベッドを提供します。
論文 参考訳(メタデータ) (2024-09-30T13:55:42Z) - Dynamic Memory based Attention Network for Sequential Recommendation [79.5901228623551]
DMAN(Dynamic Memory-based Attention Network)と呼ばれる新しい連続的推薦モデルを提案する。
長い動作シーケンス全体を一連のサブシーケンスに分割し、モデルをトレーニングし、ユーザの長期的な利益を維持するためにメモリブロックのセットを維持する。
動的メモリに基づいて、ユーザの短期的および長期的関心を明示的に抽出し、組み合わせて効率的な共同推薦を行うことができる。
論文 参考訳(メタデータ) (2021-02-18T11:08:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。