論文の概要: Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution
- arxiv url: http://arxiv.org/abs/2607.08700v1
- Date: Thu, 09 Jul 2026 17:01:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.605103
- Title: Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution
- Title(参考訳): クエンテーション検証器としてフロンティアモデルが必要か?
- Abstract要約: ディープリサーチシステムにおける励磁品質の校正問題について検討する。
LLM審査員8名に対し、1248件の粗悪な判断を下し、金のラベルに異議を唱えた。
以上の結果から,このキャリブレーションは最も高価なモデルを必要としないことがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning increasingly relies on an LLM judge to score each rubric criterion, and that judge acts as the reward model during training. Before such a signal can be trusted, we need to know how capable the judge must be and how biased it is. We study this calibration question for citation quality in deep-research systems, where a search-grounded LLM must support each claim it writes with a cited source. Citation quality is a structured rubric task in which each attribution-citation pair is judged along two dimensions that require an LLM, source relevance and factual support. On an adversarial long-form benchmark, we score 8 off-the-shelf LLM judges from 3 model families against gold labels over 1,248 rubric decisions, all of which were human-reviewed and 378 of which were hard cases adjudicated from judge disagreements. Cheaper judges remain competitive across both dimensions, with GPT-5-mini attaining the strongest source-relevance pass-class F1 at 0.908 ($κ$=0.636), while on factual support the judges are statistically indistinguishable (overlapping confidence intervals), so no single model dominates. At comparable F1, the judges still differ substantially in pass-rate drift, false positive rate, and false negative rate. Scalar F1 obscures this directional bias, yet it is exactly what a downstream reinforcement learning loop would reinforce. Calibrating the judge is therefore a prerequisite for using citation rubrics as reward signals, and our results show that this calibration does not require the most expensive available model.
- Abstract(参考訳): 強化学習は、LLMの審査員が各ルーブリック基準を採点し、審査員が訓練中に報酬モデルとして機能することをますます頼りにしている。
このような信号が信頼される前に、裁判官の能力とバイアスの度合いを知る必要があります。
深層検索システムにおいて,このキャリブレーション問題について検討し,検索対象のLLMが引用元で記述する各クレームをサポートする必要があることを示す。
クエンテーション品質(Citation quality)は、LLM、ソース関連性、事実支援を必要とする2つの次元に沿って各属性-引用対を判定する構造化されたルーリックタスクである。
逆長式ベンチマークでは,3モデルファミリーのLLM審査員8名に対して1,248ルーブリック判定を行い,その内378名が不一致から判断された。
GPT-5-mini は 0.908 (κ$=0.636) で最強のソース関連パスクラス F1 に達する一方で、実際の支持では、審査員は統計的に区別できない(信頼区間が重なる)ため、単一のモデルが支配的ではない。
同等のF1では、審査員は依然としてパスレートドリフト、偽陽性率、偽陰性率で大きく異なる。
Scalar F1は、この方向バイアスを曖昧にしていますが、まさに、下流の強化学習ループが強化するものです。
したがって, 審判員のキャリブレーションは報酬信号として引用ルーブリックを使用するための前提条件であり, このキャリブレーションがもっとも高価なモデルを必要としないことを示す。
関連論文リスト
- Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration [0.5294698352039444]
より現実的なユースケースを反映した絶対スコアリングタスクについて検討する。
モデルのタスク精度は、その判断精度を強く予測することを示す。
より有能な試験モデルは、すべての裁判官からより寛大な判断を受ける。
論文 参考訳(メタデータ) (2026-09-10T00:25:39Z) - Small Language Models as Judges for Rubric-Based Reinforcement Learning [57.707881387886516]
より小型の言語モデルが,より効率的かつ信頼性の高いルーリック・ベース・ジャッジとして機能するかどうかを考察する。
生成的評定,Yes/No Logprobマージン,Probe judgesの3つの基準レベルの判断を,小モデルから抽出する方法を比較した。
どちらのデータセットでも、Qwen3-1.7B Probeの審査員はこれらの方法の中で最強の基準レベルの合意を達成している。
論文 参考訳(メタデータ) (2026-08-30T20:00:17Z) - Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks [1.2555090617748867]
我々は、標準の0-10品質判断と厳密な二項意味等価判定とを、人為的な基準に対して組み合わせた二重判断プロトコルを寄贈する。
我々は、制御された視覚的基盤を持つ規制課題について研究し、その意味は、すべての入力に対して既知の参照を持つコーデレートされた質問である。
論文 参考訳(メタデータ) (2026-08-25T08:49:46Z) - Benchmarking LLM Judges for Mobile Agent Evaluation [19.646382307148418]
我々は,移動エージェント軌道上でのLCM-as-judge法の評価ベンチマークであるMobileJudgeBenchを紹介する。
ベンチマークは,6つのモバイルエージェントベンチマーク,4つのエージェントモデル,68のアプリにまたがる931の人的注釈付きトラジェクトリで構成されている。
まず、サンプルのスクリーンショットを持つ単純な基準判定器は、目的の手法と競合し、しばしば競合する。
第二に、ベンチマークの品質指標は現実世界の判断の有用性を確実に予測する。
論文 参考訳(メタデータ) (2026-08-11T21:00:46Z) - Ask the Right Comparison:Bias-Aware Bayesian Active Top-$k$ Ranking with LLM Judges [31.082191748525137]
大規模言語モデル(LLM)は、候補出力をペアで比較する、安価でスケーラブルな判断器として、ますます使われている。
固定比較予算の下で,トップクアイテムを識別する実践的目標について検討する。
我々は,次の比較を選択し,不確実性を最大に低減する,トップク対応のアクティブな獲得ルールを導入する。
論文 参考訳(メタデータ) (2026-07-02T12:39:30Z) - Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges [3.974554103907186]
ラベル付きキャリブレーションデータを用いたマルチジャッジ評価では、弱い判断を精度だけで破棄しないことが示されている。
本稿では, 適切なスコアリングルール下での最適校正リスクが, 付加的な判定信号が利用可能になった場合に増大しないことを示すオラクル分析による逆転について説明する。
論文 参考訳(メタデータ) (2026-05-10T18:49:58Z) - Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training [75.98427023288052]
LLM(Reasoning LLMs-as-Judges)は、推論モデルの成功を検証不可能な領域に拡張するための有望な道を提供する。
本研究では、強化学習に基づくLLMアライメントにおける非推論および推論判断の実際の影響について検討した。
我々は,高い効率の対向出力を生成することを学ぶことによって,理性判断訓練された政策が,そのような高い性能を達成することを見出した。
論文 参考訳(メタデータ) (2026-03-12T17:57:06Z) - Quantitative LLM Judges [60.773734899532336]
本研究では,既存のLLM審査員の評価スコアを,与えられた領域内の人間と一致させる定量的LLM審査員を提案する。
モデルは、その合理性とスコアを使用して、元の審査員のスコアを改善するために訓練される。
実験の結果, 定量的な判断は, ポストホックモデリングにより, 既存の判断の予測力を向上できることがわかった。
論文 参考訳(メタデータ) (2025-06-03T14:44:23Z) - JudgeLRM: Large Reasoning Models as a Judge [80.07261839142548]
判断指向大規模言語モデル(LLM)のファミリーであるジャッジLRMを紹介する。
SFTの性能向上と推論要求サンプルの比率との間には負の相関が見られ、これらのシナリオにおけるSFTの限界が明らかになる。
判定LRMは、他のRLおよびSFTの変種と同様に、同じサイズでSFTチューニングベースラインを一貫して上回り、最先端の推論モデルを超えていることを示す。
論文 参考訳(メタデータ) (2025-03-31T02:18:51Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z) - Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges [6.609843448260634]
LLM-as-a-judgeパラダイムは,大規模言語モデルを評価するアプローチとして急速に普及している。
本稿では,人間間の合意が高いクリーンなシナリオに焦点を当てる。
我々は、複雑性や長さを早めるための感度や、寛大さへの傾向など、審査モデルの脆弱性を識別する。
論文 参考訳(メタデータ) (2024-06-18T13:49:54Z) - JudgeLM: Fine-tuned Large Language Models are Scalable Judges [48.053949045598344]
大規模言語モデル(LLM)をオープンなシナリオで評価することは、既存のベンチマークやメトリクスがそれらを包括的に測定できないため、難しい。
本稿では,拡張性のある審査員 (JudgeLM) としてLLMを微調整し,LLMを効率よく,かつ効率的に評価する手法を提案する。
我々は7B,13Bから33Bパラメータの異なるスケールでJiceLMを訓練し、その能力と振る舞いを体系的に分析する。
論文 参考訳(メタデータ) (2023-10-26T17:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。