論文の概要: As It Was: Aligning LLM Search Evaluation with Historical User Preferences
- arxiv url: http://arxiv.org/abs/2607.01040v1
- Date: Wed, 01 Jul 2026 15:05:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.953022
- Title: As It Was: Aligning LLM Search Evaluation with Historical User Preferences
- Title(参考訳): 歴史的ユーザの選好によるLLM検索評価の調整
- Abstract要約: 本稿では,各検索ページを軽量かつ監査可能な動作前で拡張する行動接地型LCM判定手法を提案する。
Spotifyの楽曲検索評価では,行動判断による判断がユーザの好みと強く一致している。
5つの言語にまたがる多言語ヒューマン・ジャッジデータセットでは、グラウンド化により、人間関係判定との相関が15%増加する。
- 参考スコア(独自算出の注目度): 10.704343230963877
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large-scale search systems evolve faster than human quality assurance can scale, especially for long-tail intents and multilingual queries. LLM-as-a-judge approaches provide a scalable alternative for evaluating the relevance of search engine result pages (SERPs), but judgments based solely on semantic similarity or world knowledge can drift from actual user preferences, particularly for ambiguous queries. We introduce a behavior-grounded LLM judge that augments each SERP item with a lightweight and auditable behavioral prior in the form of a Query-Relevance-Impressions (QRI) card. Each card summarizes how users have historically interacted with similar queries and results, providing compact empirical evidence that the judge can cite to resolve ambiguity and make more consistent relevance judgments while still relying on semantic reasoning. In a large-scale music search evaluation at Spotify, using relevance estimates derived from historical user interactions across 6,000 recomposed SERPs, the behavior-grounded judge achieves stronger alignment with user preferences, improving Spearman rank correlation by approximately 5% overall and yielding a 91% relative improvement on disagreement cases. On a multilingual human-judged dataset spanning five languages, grounding further increases correlation with human relevance judgments by 15%. Importantly, when evaluated against outcomes from a live A/B test, the grounded judge shows consistently higher alignment with the observed winning model. While absolute alignment remains moderate, these findings demonstrate that lightweight behavioral grounding can improve the reliability and practical usefulness of LLM-based evaluation in real-world search systems.
- Abstract(参考訳): 大規模検索システムは人間の品質保証よりも高速に進化し、特にロングテールインテントやマルチリンガルクエリのために拡張される。
LLM-as-a-judgeアプローチは、検索エンジン結果ページ(SERP)の関連性を評価するためのスケーラブルな代替手段を提供する。
本稿では,各SERP項目をQRI(Query-Relevance-Impressions)カードの形で,軽量かつ監査可能な振る舞いで拡張する行動接地型LCM判定手法を提案する。
それぞれのカードは、ユーザが過去に類似したクエリや結果とどのように相互作用したのかを要約し、裁判官があいまいさを解決し、意味論的推論に依存しながらより一貫性のある関連性判断を行うための、コンパクトな実証的な証拠を提供する。
Spotifyの大規模音楽検索評価において、6000の繰り返しSERP間での歴史的ユーザインタラクションから導かれる関連性評価を用いて、行動グラウンドドジャッジは、ユーザの好みとのより強い整合性を達成し、スピアマンのランク相関を全体として約5%改善し、不一致事例に対して91%の相対的な改善をもたらす。
5つの言語にまたがる多言語ヒューマン・ジャッジデータセットでは、グラウンド化により、人間関係判定との相関が15%増加する。
また,ライブA/Bテストの結果に対して評価すると,接地判定器は,観測された入賞モデルとの整合性が常に高いことを示す。
絶対アライメントは依然として適度であるが,これらの結果は,LLMに基づくリアルタイム検索システムにおける軽量な行動グラウンドリングが信頼性と実用性を向上させることを示唆している。
関連論文リスト
- Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions [50.70965714314064]
大規模言語モデル(LLM)は、ユーザが拡張されたインタラクションよりも複雑で多様な好みを共有するパーソナルアシスタントとして、ますます機能している。
この研究は、パーソナライズされたユーザ-LLMインタラクションにおいて、リアルな嗜好フォローを評価するためのベンチマークであるRealPrefを提案する。
論文 参考訳(メタデータ) (2026-03-04T15:42:43Z) - When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment [29.603396943658428]
大型言語モデル(LLM)は、人間の判断のためのプロキシとして使用できる。
モデルは、真に基礎となる情報要求を満たさない通路に、インフレータブルな関連度スコアを常に割り当てていることを示す。
実験の結果,LSMによる相対性判定は通路長や表面の語彙的手がかりに非常に敏感であることが示唆された。
論文 参考訳(メタデータ) (2026-02-19T08:37:21Z) - Topic-Specific Classifiers are Better Relevance Judges than Prompted LLMs [34.14678608130442]
未判断の文書問題は、情報検索におけるテストコレクションの再利用可能性にとって重要な障害である。
個別のLoRA重み適応でMonoT5を微調整することにより、トピック固有の関連分類器を訓練する。
トピックごとの最初の128の判断は、モデルの互換性を改善するのに十分である。
論文 参考訳(メタデータ) (2025-10-06T09:38:13Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Real-World Summarization: When Evaluation Reaches Its Limits [1.4197924572122094]
従来のメトリクス、トレーニング可能なメソッド、LCM-as-a-judgeアプローチを比較します。
その結果、単語のような単純なメトリクスは、人間の判断と驚くほどよく重なることがわかった。
実世界のビジネスへの影響を分析すると、誤った情報やチェック不可能な情報が最大のリスクを生んでいることが分かる。
論文 参考訳(メタデータ) (2025-07-15T17:23:56Z) - Expanding Relevance Judgments for Medical Case-based Retrieval Task with Multimodal LLMs [0.032771631221674334]
我々は、MLLM(Multimodal Large Language Model)を用いて、関連判断を拡張し、新しい自動判断データセットを作成する。
以上の結果から,MLLMが関連判断の規模を拡大する可能性を示し,医療・マルチモーダルIRタスクにおける検索評価を支援する上で有望な方向性を提供する。
論文 参考訳(メタデータ) (2025-06-21T18:29:33Z) - Quantitative LLM Judges [60.773734899532336]
本研究では,既存のLLM審査員の評価スコアを,与えられた領域内の人間と一致させる定量的LLM審査員を提案する。
モデルは、その合理性とスコアを使用して、元の審査員のスコアを改善するために訓練される。
実験の結果, 定量的な判断は, ポストホックモデリングにより, 既存の判断の予測力を向上できることがわかった。
論文 参考訳(メタデータ) (2025-06-03T14:44:23Z) - Mind the Gap! Static and Interactive Evaluations of Large Audio Models [55.87220295533817]
大型オーディオモデル(LAM)は、音声ネイティブな体験をパワーアップするために設計されている。
本研究は,484名の参加者から,LAMを評価し,7,500名のLAMインタラクションを収集する対話的アプローチを提案する。
論文 参考訳(メタデータ) (2025-02-21T20:29:02Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - CFaiRLLM: Consumer Fairness Evaluation in Large-Language Model Recommender System [16.84754752395103]
本研究は,Large Language Model (LLM) ベースのレコメンデータシステムにおける公平性評価に関する過去の研究に批判的な立場を取る。
CFaiRLLMは、真の嗜好アライメントを組み込むだけでなく、交叉フェアネスを厳格に検証する拡張評価フレームワークである。
CFaiRLLMの有効性を検証するため,MovieLensとLastFMを用いた広範囲な実験を行った。
論文 参考訳(メタデータ) (2024-03-08T20:44:59Z) - Perspectives on Large Language Models for Relevance Judgment [56.935731584323996]
大型言語モデル(LLM)は、関連判断を支援することができると主張している。
自動判定が検索システムの評価に確実に利用できるかどうかは不明である。
論文 参考訳(メタデータ) (2023-04-13T13:08:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。