論文の概要: From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
- arxiv url: http://arxiv.org/abs/2608.02171v1
- Date: Mon, 03 Aug 2026 12:52:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.569212
- Title: From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
- Title(参考訳): プロファイリングから合成へ:パーソナライズされたLLMエージェントにおける意図しない行動アライメントのベンチマーク
- Authors: Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu,
- Abstract要約: 大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
- 参考スコア(独自算出の注目度): 56.187590188698955
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models have enabled increasingly capable autonomous agents, yet personalization remains critical for making such agents practically useful. Recent benchmarks have begun evaluating personalization in agents, but they largely rely on static preference snapshots, fixed interaction logs, or question answering over predefined user profiles. Such designs fail to capture the complexity of evolving user preferences and neglect preference-conditioned task execution-a discrepancy we term as the knowledge-to-action gap. To address this challenge, we introduce IBA-Bench, a benchmark for implicit behavioral alignment constructed from longitudinal interaction histories that contain noise, implicit cues, and temporal inconsistencies. Unlike prior work, IBA-Bench evaluates whether an agent can execute tasks while satisfying implicit user constraints inferred from historical interactions. We further propose IBA-Agent, an agent framework that reconciles conflicting priorities through broad retrieval and trajectory-level alignment. Experiment results on IBA-Bench show that effective personalization remains a significant challenge for state-of-the-art LLM agents, and the proposed IBA-Agent substantially improves behavioral alignment in complex scenarios across nine application domains.
- Abstract(参考訳): 大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
このような設計は、進化するユーザの好みの複雑さを捉えることができず、優先順位付けされたタスクの実行を無視する。
この課題に対処するために、雑音、暗黙の手がかり、時間的不整合を含む縦断的相互作用履歴から構築された暗黙的な行動アライメントのベンチマークであるIBA-Benchを紹介する。
以前の作業とは異なり、IBA-Benchは、エージェントが履歴的相互作用から推測される暗黙のユーザ制約を満たしながらタスクを実行できるかどうかを評価する。
IBA-Agentはまた、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークを提案する。
IBA-Benchの実験結果によると、有効なパーソナライゼーションは最先端のLLMエージェントにとって重要な課題であり、提案したIBA-Agentは9つのアプリケーションドメインにわたる複雑なシナリオにおける行動アライメントを大幅に改善する。
関連論文リスト
- ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning [48.692251671993574]
エージェント推論をパーソナライズするフレームワークODYSSEを提案する。
ODYSSEは、パーソナライズされたエージェント推論において、長いアクション水平線と強力なクロスステップ依存に対処する。
ODYSSEは、専門的・汎用的なLVLMよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-07-28T07:25:04Z) - APeB: Benchmarking Personalization Ability of Large Language Model Agents [17.77241512443464]
LLMを利用したエージェントは、ユーザが未特定クエリを発行する際にパーソナライズに苦労する。
既存のベンチマークでは、ユーザ定義クエリや単純化された履歴に依存することが多いため、この機能をテストすることはめったにない。
生クエリと多様な履歴の下でのエージェントパーソナライズのためのテストベッドであるパーソナライズされた製品検索(PPS)を導入する。
論文 参考訳(メタデータ) (2026-07-03T10:03:35Z) - Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations [14.480725554900777]
マルチセッションサービス環境における永続的エージェントタスク補完のためのベンチマークであるMomentoを紹介する。
実験結果から,現在のエージェントはユーザ状態の誤推定によってフェールすることが明らかとなった。
論文 参考訳(メタデータ) (2026-05-30T18:08:51Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments [60.3427704389541]
大規模言語モデルは、自律エージェントの意思決定コアとして、ますます多くデプロイされている。
しかし、会話のベンチマークでは、誤った意思決定のカスケード効果のために、これらのエージェントは頻繁に失敗する。
これらの課題に対処するために、Failure-Aware Meta-Agenticフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T02:21:53Z) - PersonaAgent: When Large Language Model Agents Meet Personalization at Test Time [87.99027488664282]
PersonaAgentは、汎用的なパーソナライゼーションタスクに対処するために設計されたフレームワークである。
パーソナライズされたメモリモジュールとパーソナライズされたアクションモジュールを統合する。
テストタイムのユーザ嗜好アライメント戦略は、リアルタイムのユーザの嗜好アライメントを保証する。
論文 参考訳(メタデータ) (2025-06-06T17:29:49Z) - AgentCF: Collaborative Learning with Autonomous Language Agents for
Recommender Systems [112.76941157194544]
本稿では,エージェントベースの協調フィルタリングにより,レコメンデータシステムにおけるユーザとイテムのインタラクションをシミュレートするエージェントCFを提案する。
我々は、ユーザだけでなく、アイテムをエージェントとして、創造的に考慮し、両方のエージェントを同時に最適化する協調学習アプローチを開発します。
全体として、最適化されたエージェントは、ユーザ・イテム、ユーザ・ユーザ・ユーザ、アイテム・イテム、集合的インタラクションなど、フレームワーク内での多様なインタラクションの振る舞いを示す。
論文 参考訳(メタデータ) (2023-10-13T16:37:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。