論文の概要: The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations
- arxiv url: http://arxiv.org/abs/2608.18300v2
- Date: Thu, 20 Aug 2026 23:11:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:31.827941
- Title: The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations
- Title(参考訳): 大規模勧告記述のためのLCM-as-a-Judgeのライフサイクル
- Abstract要約: 実運用システムで実行されているLCMの判断は、ライフサイクルを持つものとしてよりよく理解されている、と我々は主張する。
我々は,LLM審査員に対して,Netflixにおけるユーザアライズドレコメンデーションの説明を評価するライフサイクルを提案する。
我々は5週間のA/Bテストの結果を何千万人もの会員に対して報告した。
- 参考スコア(独自算出の注目度): 0.5673416639353487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-as-a-Judge, which leverages a large language model to evaluate natural language generated by another AI application or model, has become a standard, scalable approach for accelerating and extending costly human evaluation. However, most work treats a judge as a static artifact, evaluating it once at construction or against a fixed benchmark. In contrast, we argue that an LLM judge running in a production system is better understood as having a lifecycle: it must be built, trained, deployed, and continuously maintained as the surrounding data evolves, and each phase poses distinct technical and operational challenges. We present such a lifecycle for the LLM judges that evaluate user-facing recommendation explanations at Netflix, where our pipeline generates and the judges assess hundreds of thousands of distinct show-level explanations per week, served across the mobile experience to millions of members. Our framework has four phases: (I) Birth, defining multiple evaluation criteria and building curated benchmark datasets with human labels and rationales; (II) Training, refining the judges' rubrics via Reasoning-Aligned Rubric Tuning (RART), a rubric-tuning procedure that uses a meta-judge over reasoning output as the learning signal; (III) Deployment, in which one judge serves two production roles: quality gating and reflective generation; and (IV) Monitoring, a continuous Human-in-the-Loop alignment process that detects drift and triggers re-tuning behind a human review gate. We report post-launch results from a five-week A/B test over tens of millions of members, in which the judge-aligned explanations shifted member viewing toward novel content (previously unwatched) and increased successful browse-to-play sessions relative to a no-explanation control, with no quality-related takedowns.
- Abstract(参考訳): LLM-as-a-Judgeは、大きな言語モデルを利用して、別のAIアプリケーションやモデルによって生成された自然言語を評価する。
しかし、ほとんどの研究は、審査員を静的アーティファクトとして扱い、建設時に、あるいは固定されたベンチマークに対して評価する。
対照的に、本番システムで実行されているLCMの判断はライフサイクルを持つものとして理解され、周囲のデータが進化するにつれて構築され、訓練され、デプロイされ、継続的に維持されなければならない。
われわれのパイプラインが生成し、審査員は毎週何十万もの異なるショーレベルの説明を評価し、モバイルエクスペリエンスを数百万のメンバに提供します。
筆者らのフレームワークには、4つのフェーズがある: (I) 出生、複数の評価基準の定義、人間のラベルと合理性によるベンチマークデータセットの構築、 (II) 推論を学習信号として解釈するメタジャッジを用いたルーブリックチューニング手順であるReasoning-Aligned Rubric Tuning (RART) の訓練、 (III) 品質ゲーティングと反射生成という2つの生産的役割を担うデプロイ、 (IV) 人間のレビューゲートの後方でドリフトとトリガを検出する継続的ヒューマンイン・ザ・ループアライメントプロセスであるモニタリング。
5週間にわたるA/Bテストの結果を報告し、審査員による説明は、新規コンテンツ(以前は見ていなかった)に対する観衆の視点に移行し、また、非説明制御による視聴・再生セッションの増加が、品質関連の低下を伴わずに達成された。
関連論文リスト
- LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation [20.276417246845593]
本稿では,CRS応答評価のためのLCM-as-a-judgeの信頼性を実証的に評価する最初のユーザスタディを提案する。
20のドメインエキスパートアノテータから$n=400$のレーティングを収集し、各レスポンスをパーソナライズ品質と説明品質の2つの次元にわたって評価する。
LLMに基づく審査員は、人間の評価と適度な正の一致を示し、基準ベースラインを上回ります。
論文 参考訳(メタデータ) (2026-07-28T12:26:55Z) - Quantitative LLM Judges [60.773734899532336]
本研究では,既存のLLM審査員の評価スコアを,与えられた領域内の人間と一致させる定量的LLM審査員を提案する。
モデルは、その合理性とスコアを使用して、元の審査員のスコアを改善するために訓練される。
実験の結果, 定量的な判断は, ポストホックモデリングにより, 既存の判断の予測力を向上できることがわかった。
論文 参考訳(メタデータ) (2025-06-03T14:44:23Z) - Multi-Agent LLM Judge: automatic personalized LLM judge design for evaluating natural language generation applications [0.0]
大規模言語モデル(LLM)は、さまざまなドメインにまたがって素晴らしいパフォーマンスを示しているが、ドメイン固有の知識の不足、バイアス、幻覚といった問題に直面している。
単語重複やテキスト埋め込みに依存する従来の評価手法は、動的でオープンなテキスト生成を評価するのに必要なニュアンスドセマンティック情報を取得するには不十分である。
本稿では,様々な自然言語生成アプリケーション向けにパーソナライズされたLLM判断器を自動設計する動的マルチエージェントシステムを提案する。
論文 参考訳(メタデータ) (2025-04-01T09:36:56Z) - HREF: Human Response-Guided Evaluation of Instruction Following in Language Models [61.273153125847166]
我々は新しい評価ベンチマークHREF(Human Response-Guided Evaluation of Instruction following)を開発した。
HREFは信頼性の高い評価を提供するだけでなく、個々のタスクのパフォーマンスを強調し、汚染を受けない。
本稿では,評価セットのサイズ,判断モデル,ベースラインモデル,プロンプトテンプレートなど,HREFにおける鍵設計選択の影響について検討する。
論文 参考訳(メタデータ) (2024-12-20T03:26:47Z) - MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs [97.94579295913606]
MLLM(Multimodal Large Language Models)は、産業と学術の両方から注目を集めている。
開発プロセスでは、モデルの改善に関する直感的なフィードバックとガイダンスを提供するため、評価が重要である。
この研究は、研究者に異なるニーズに応じてMLLMを効果的に評価する方法を簡単に把握し、より良い評価方法を促すことを目的としている。
論文 参考訳(メタデータ) (2024-11-22T18:59:54Z) - CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution [74.41064280094064]
textbfJudger-1は、最初のオープンソースのtextbfall-in-one judge LLMである。
CompassJudger-1は、優れた汎用性を示す汎用LLMである。
textbfJudgerBenchは、様々な主観評価タスクを含む新しいベンチマークである。
論文 参考訳(メタデータ) (2024-10-21T17:56:51Z) - Large Language Models are Not Yet Human-Level Evaluators for Abstractive
Summarization [66.08074487429477]
抽象的な要約のための自動評価器として,大規模言語モデル(LLM)の安定性と信頼性について検討する。
また、ChatGPTとGPT-4は、一般的に使われている自動測定値よりも優れていますが、人間の代替品として準備ができていません。
論文 参考訳(メタデータ) (2023-05-22T14:58:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。