論文の概要: LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation
- arxiv url: http://arxiv.org/abs/2607.25640v1
- Date: Tue, 28 Jul 2026 12:26:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.833376
- Title: LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation
- Title(参考訳): 対話型音楽レコメンデーションにおけるシステム応答評価のためのLCM-as-a-Judge
- Abstract要約: 本稿では,CRS応答評価のためのLCM-as-a-judgeの信頼性を実証的に評価する最初のユーザスタディを提案する。
20のドメインエキスパートアノテータから$n=400$のレーティングを収集し、各レスポンスをパーソナライズ品質と説明品質の2つの次元にわたって評価する。
LLMに基づく審査員は、人間の評価と適度な正の一致を示し、基準ベースラインを上回ります。
- 参考スコア(独自算出の注目度): 20.276417246845593
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Conversational Recommendation Systems (CRS) aim to achieve two primary objectives: recommending relevant items and generating natural language responses. While recommendation accuracy is effectively measured by established ranking metrics, the evaluation of response generation poses a more fundamental challenge. Although human evaluation remains the gold standard, its cost and scalability constraints have motivated the adoption of LLM-as-a-judge as a promising proxy, whose alignment with human judgment in the context of CRS remains an open question. In this paper, we present the first user study to empirically assess the reliability of LLM-as-a-judge for evaluating CRS responses. We sample 20 multi-turn music recommendation sessions and generate candidate system responses using four instruction-tuned LLMs, inducing variance in response quality across model scales. We collect $n{=}400$ ratings from 20 domain-expert annotators, who evaluate each response across two dimensions: Personalization Quality and Explanation Quality. Through bootstrapped correlation analysis, we find that LLM-based judges exhibit moderate positive alignment with human assessments and outperform all reference-based baselines. Furthermore, we analyze how judge performance varies according to model scale and conditioning information, providing practical guidance for deploying LLM-as-a-judge.
- Abstract(参考訳): Conversational Recommendation Systems (CRS) は、関連項目の推薦と自然言語応答の生成という、2つの主要な目的を達成することを目的としている。
推薦精度は確立されたランキング指標によって効果的に測定されるが、応答生成の評価はより根本的な課題となる。
人間の評価は依然として金の基準となっているが、そのコストとスケーラビリティの制約は、CRSの文脈における人間の判断と整合性を持つ有望なプロキシとしてLLM-as-a-judgeの採用を動機付けている。
本稿では,CRS応答評価のためのLCM-as-a-judgeの信頼性を実証的に評価する最初のユーザスタディを提案する。
20のマルチターン音楽レコメンデーションセッションをサンプリングし、4つの命令調整LDMを用いて候補システム応答を生成し、モデルスケール間の応答品質のばらつきを誘導する。
ドメインエキスパートアノテータ20名から$n{=}400$のレーティングを収集し、パーソナライズ品質と説明品質の2つの側面でそれぞれのレスポンスを評価します。
自己相関分析により, LLMに基づく審査員は, 人的評価と適度な正の相関を示し, 基準ベースラインを上回る結果を得た。
さらに、モデルスケールや条件情報に応じて判断性能がどのように変化するかを分析し、LCM-as-a-judgeをデプロイするための実践的なガイダンスを提供する。
関連論文リスト
- On Evaluating LLM Alignment by Evaluating LLMs as Judges [68.15541137648721]
大規模言語モデル(LLM)のアライメントを評価するには、助け、誠実、安全、正確に人間の指示に従う必要がある。
本研究では,LLMの生成能力と評価能力の関係について検討した。
モデル出力を直接評価することなくアライメントを評価するベンチマークを提案する。
論文 参考訳(メタデータ) (2025-11-25T18:33:24Z) - Auto-Prompt Ensemble for LLM Judge [24.30935583220292]
既存のLLM審査員は、人間の評価の基礎となる暗黙の基準を認識できないため、重要な評価基準を見逃すことがしばしばある。
本稿では,自動プロンプト・アンサンブル(APE)を提案する。
APEは信頼に基づくアンサンブル機構を導入し、新たな評価次元から判断をいつ採用するかを決定する。
論文 参考訳(メタデータ) (2025-10-08T00:28:51Z) - Quantitative LLM Judges [60.773734899532336]
本研究では,既存のLLM審査員の評価スコアを,与えられた領域内の人間と一致させる定量的LLM審査員を提案する。
モデルは、その合理性とスコアを使用して、元の審査員のスコアを改善するために訓練される。
実験の結果, 定量的な判断は, ポストホックモデリングにより, 既存の判断の予測力を向上できることがわかった。
論文 参考訳(メタデータ) (2025-06-03T14:44:23Z) - RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning [64.46921169261852]
RAG-Zevalは、ルール誘導推論タスクとして忠実さと正しさの評価を定式化する、新しいエンドツーエンドフレームワークである。
提案手法は、強化学習による評価者を訓練し、コンパクトなモデルにより包括的および音質評価を生成する。
実験では、RAG-Zevalの優れた性能を示し、人間の判断と最も強い相関性を達成した。
論文 参考訳(メタデータ) (2025-05-28T14:55:33Z) - DAFE: LLM-Based Evaluation Through Dynamic Arbitration for Free-Form Question-Answering [12.879551933541345]
大規模言語モデル評価のための動的アロケーションフレームワーク(DAFE)を提案する。
DAFEは2つの主要なLCM-as-judgesを採用し、不一致の場合のみ第3の仲裁を行う。
DAFEが一貫した、スケーラブルで、リソース効率の高いアセスメントを提供する能力を示す。
論文 参考訳(メタデータ) (2025-03-11T15:29:55Z) - HREF: Human Response-Guided Evaluation of Instruction Following in Language Models [61.273153125847166]
我々は新しい評価ベンチマークHREF(Human Response-Guided Evaluation of Instruction following)を開発した。
HREFは信頼性の高い評価を提供するだけでなく、個々のタスクのパフォーマンスを強調し、汚染を受けない。
本稿では,評価セットのサイズ,判断モデル,ベースラインモデル,プロンプトテンプレートなど,HREFにおける鍵設計選択の影響について検討する。
論文 参考訳(メタデータ) (2024-12-20T03:26:47Z) - CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution [74.41064280094064]
textbfJudger-1は、最初のオープンソースのtextbfall-in-one judge LLMである。
CompassJudger-1は、優れた汎用性を示す汎用LLMである。
textbfJudgerBenchは、様々な主観評価タスクを含む新しいベンチマークである。
論文 参考訳(メタデータ) (2024-10-21T17:56:51Z) - Evaluating the Evaluator: Measuring LLMs' Adherence to Task Evaluation Instructions [18.93335792080899]
LLMs-as-a-judgeがAI判断と人間の判断の整合性に与える影響について検討する。
我々は、LLMによる最先端評価で一般的に使用される品質基準の分類を集約し、それを審査員として厳密なモデルベンチマークとして提供する。
論文 参考訳(メタデータ) (2024-08-16T14:49:35Z) - Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators [48.54465599914978]
大規模言語モデル(LLM)は、生成された自然言語の品質を評価するための自動評価器として有望な能力を示した。
LLMは依然として評価のバイアスを示しており、人間の評価と整合したコヒーレントな評価を生成するのに苦労することが多い。
Pairwise-preference Search (PAIRS) は、LLMを用いた不確実性誘導検索に基づくランクアグリゲーション手法で、局所的にペアワイズ比較を行い、グローバルに候補テキストを効率よくランク付けする。
論文 参考訳(メタデータ) (2024-03-25T17:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。