論文の概要: VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences
- arxiv url: http://arxiv.org/abs/2609.00921v1
- Date: Tue, 01 Sep 2026 08:45:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.485642
- Title: VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences
- Title(参考訳): VIBE-Bench: プロファイルが好ましくない場合に、パーソナライズされた大規模言語モデルを評価する
- Authors: Yiwen Jiang, Yang Deng, Stephanie Fong, Zimu Wang, Yaling Shen, Wei Feng, Hongxi Yang, Xiangyu Zhao, Zhongxing Xu, Deval Mehta, Xuelian Cheng, Zongyuan Ge,
- Abstract要約: 既存のベンチマークでは、セマンティックな歴史から好みを検索できると推定されている。
我々は、未調査だが実際は重要な制度であるプロファイル参照概念の誤りについて研究する。
心理学的な2つのタスクと12,239の対話を備えたベンチマークであるVIBE-Benchを紹介する。
- 参考スコア(独自算出の注目度): 40.195544693657396
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personalized Large Language Models (PLLMs) aim to tailor responses to individual users, where a central challenge is preference reasoning: inferring query-relevant preferences from user-related history. Existing benchmarks, however, largely assume that such preference can be retrieved from semantically related history. We study an underexplored but practically important regime, profile-preference conceptual misalignment (PRCM), where observable profile cues and query-specific preferences lie in different concept spaces, making semantic retrieval inconsistent for personalization. We introduce VIBE-Bench, a benchmark with two psychology-grounded tasks, 3,504 personas and 12,239 dialogues, including a manually verified gold test set, and requires cross-concept preference reasoning beyond surface semantic overlap. Experiments with several personalization methods show that current PLLMs largely rely on shallow semantic correlations and fail to acquire robust cross-concept mappings. These findings establish PRCM as a distinct failure regime in PLLMs and position VIBE-Bench as a focused testbed for advancing preference reasoning beyond semantic matching.
- Abstract(参考訳): パーソナライズされた大規模言語モデル(PLLM)は、個々のユーザに対する応答を調整することを目的としている。
しかし、既存のベンチマークでは、そのような嗜好は意味論的に関係した歴史から取り出すことができると推定されている。
本研究では,観察可能なプロファイルキューとクエリ固有の嗜好を異なる概念空間に配置し,パーソナライズに不整合な意味的検索を実現する,過度に検討されているが,実際は重要なシステムであるPRCM(Protocol-preference Concept misalignment)について検討する。
我々は,2つの心理学的課題,3,504人のペルソナ,12,239人の対話のベンチマークであるVIBE-Benchを紹介した。
いくつかのパーソナライズ手法による実験では、現在のPLLMは浅いセマンティックな相関に大きく依存しており、堅牢なクロスコンセプトマッピングの獲得に失敗している。
これらの結果から,PRCMはPLLMの障害機構として確立され,VIBE-Benchはセマンティックマッチングを超えて嗜好推論を推し進めるための集中的なテストベッドとして位置づけられた。
関連論文リスト
- Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval [37.821022474615994]
Think-to-Personalize (TTP) は、ユーザ中心の意図的推論を高密度検索で統一する新しいフレームワークである。
TTPは最先端のベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-08-19T12:28:20Z) - Preference-Aware Rubric Learning for Personalized Evaluation [59.539429430690156]
既存の評価手法では、長期的なインタラクション履歴に埋め込まれたユーザ固有の嗜好をキャプチャできない。
静的判断よりも学習問題としてパーソナライズされた評価を定式化するパラダイムであるパーソナライズド・アズ・ラーニングを提案する。
実験により、PARLはユーザ対応の応答を確実に識別し、ユーザ間で一般化する高忠実なルーブリックを一貫して誘導することが示された。
論文 参考訳(メタデータ) (2026-05-29T17:00:55Z) - Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization [5.909152930998754]
マルチロール対話要約では、複数の話者間の複雑な相互作用をモデル化する必要がある。
既存のほとんどのメソッドはROUGEやBERTScoreのような自動メトリクスに最適化されている。
報酬に基づく最適化と明示的な認知的推論を結合する新しい枠組みを提案する。
論文 参考訳(メタデータ) (2026-04-19T01:27:41Z) - PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments [72.02445514666428]
静的な嗜好リコールを超えてペルマの一貫性を評価するためのベンチマークであるPERMAを紹介する。
PerMAは、複数のセッションとドメインにまたがる時間的に順序付けられたインタラクションイベントと、時間とともに好みに関連するクエリで構成されている。
実験により、関連するインタラクションをリンクすることで、高度なメモリシステムはより正確な好みを抽出し、トークン消費を減らすことができることが示された。
論文 参考訳(メタデータ) (2026-03-24T14:04:11Z) - Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions [50.70965714314064]
大規模言語モデル(LLM)は、ユーザが拡張されたインタラクションよりも複雑で多様な好みを共有するパーソナルアシスタントとして、ますます機能している。
この研究は、パーソナライズされたユーザ-LLMインタラクションにおいて、リアルな嗜好フォローを評価するためのベンチマークであるRealPrefを提案する。
論文 参考訳(メタデータ) (2026-03-04T15:42:43Z) - Personalized Reasoning: Just-In-Time Personalization and Why LLMs Fail At It [81.50711040539566]
現在の大規模言語モデル(LLM)開発は、タスク解決と優先順位調整を別の課題として扱う。
静的ベンチマークを対話型パーソナライズタスクに変換する評価手法であるPreFDISCOを紹介する。
我々のフレームワークは、ユーザコンテキストに応じて、同じ質問が異なる推論チェーンを必要とするシナリオを作成します。
論文 参考訳(メタデータ) (2025-09-30T18:55:28Z) - Pathways of Thoughts: Multi-Directional Thinking for Long-form Personalized Question Answering [57.12316804290369]
ユーザ固有の情報ニーズに質問応答システムを適用するためには,パーソナライゼーションが不可欠である。
本稿では,タスク固有の微調整を必要とせず,任意の大規模言語モデル (LLM) に適用可能な推論段階の方法として,思考の経路 (PoT) を提案する。
PoTは競争ベースラインを一貫して上回り、13.1%の相対的な改善を達成している。
論文 参考訳(メタデータ) (2025-09-23T14:44:46Z) - Comparison-based Active Preference Learning for Multi-dimensional Personalization [7.349038301460469]
大きな言語モデル(LLM)は目覚ましい成功を収めていますが、それらを人間の好みに合わせることは、依然として重要な課題です。
近年,多次元のパーソナライゼーションが研究されている。これはモデルが明示的な嗜好に合った応答を生成できるようにすることを目的としている。
対話的に収集された比較フィードバックから暗黙的なユーザの嗜好を捉えるために,能動多次元選好学習(AMPLe)を提案する。
論文 参考訳(メタデータ) (2024-11-01T11:49:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。