論文の概要: Stopping and Routing LLM Judge Panels
- arxiv url: http://arxiv.org/abs/2608.19802v1
- Date: Thu, 20 Aug 2026 08:58:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.516397
- Title: Stopping and Routing LLM Judge Panels
- Title(参考訳): LLM審査パネルの停止とルーティング
- Abstract要約: デプロイの問題は、どの裁判官が最善かだけでなく、どの例、パネル構築がいつ停止するかである。
我々は,役割条件付アロケーション問題として判断パネル設計を定式化する。
この手法は、単一の審査員、平らなパネル、一致した多様性、フルコールの積み重ね、信頼性の判定、フグのカスケードと比較される。
- 参考スコア(独自算出の注目度): 20.569427412312297
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM evaluation pipelines often have many candidate judges: general LLM-as-a-judge prompts, reward models, safety classifiers, confidence variants, and task-specific verifiers. The deployment question is not only which judge is best, but which judges should be called, on which examples, and when panel construction should stop. We formulate judge-panel design as a role-conditioned allocation problem. From a small labeled audit set, declared slices, and judge costs, the method estimates target-relative roles: copies add no conditional information, complements improve the global panel, and specialists help only on slices. These roles induce a policy: drop copies, add complements globally, route specialists conditionally, and stop when validation gain falls below a threshold. Across reasoning, code, safety, preference, reward-model, summarization, and math audits, the method is compared with single judges, flat panels, matched diversity heuristics, full-call stacking, reliability juries, and frugal cascades. The result is a regime map for judge calls: route specialists on deployable slices, stop in saturated verifier regimes, keep broad ensembles when their risk benefit is worth the cost, and ignore conditional copies. The output is a reusable, auditable call plan for the next evaluation batch.
- Abstract(参考訳): LLM評価パイプラインには、一般的なLCM-as-a-judgeプロンプト、報酬モデル、安全分類器、信頼性変種、タスク固有の検証器など、多くの候補がある。
デプロイの問題は、どの裁判官が最善かというだけでなく、どの裁判官を呼ぶべきか、どの例、パネル構築がいつ停止するかという問題である。
我々は,役割条件付アロケーション問題として判断パネル設計を定式化する。
小さなラベル付き監査セット、宣言されたスライス、および判断コストから、コピーは条件付き情報を追加せずにターゲット相対的な役割を推定する。
これらの役割は、コピーをドロップし、補完をグローバルに追加し、専門家を条件付きでルートし、バリデーションのゲインがしきい値以下になると停止する、というポリシーを導出する。
推論、コード、安全性、嗜好、報酬モデル、要約、数学の監査などにおいて、この手法は単一の審査員、フラットパネル、マッチングされた多様性ヒューリスティックス、フルコール・スタックリング、信頼性判定、フグのカスケードと比較される。
その結果、審査員の判断は、デプロイ可能なスライスに関するルートスペシャリスト、飽和検証制度の停止、リスクの利点がコストに価値がある場合に広範囲のアンサンブルを維持すること、条件付きコピーを無視することである。
出力は、次の評価バッチに対する再利用可能な監査可能なコールプランである。
関連論文リスト
- RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition [0.30586855806896046]
本研究では,SESSE(Sketch, Expand, Sort, Summarize, Evaluate)を提案する。
RewardBench (n=1,000)では、SESSEはチェーンオブソートベースラインとほぼ一致しており、微調整のスペシャリストであるRISE-Judge-32B (92.7%)と競合している。
論文 参考訳(メタデータ) (2026-08-18T20:27:56Z) - Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees [16.73004625486562]
LLMを審査員として使用することは、大規模にモデル出力を評価するための標準的なプラクティスとなっている。
基準回答がない場合、審査員はパラメトリック知識またはツール拡張を通じて事実の正しさを評価する。
提案するリスク管理フレームワークは,不確実性のしきい値の正当性を判定し,ユーザの特定レベル以下で検証できる。
論文 参考訳(メタデータ) (2026-08-18T16:42:02Z) - Sharding Prevents LLM Oversight Failures and Adversarial Exploitation [45.380649793616705]
シャーディングは要求を小さなグループに分割し、各グループを別の呼び出しに割り当て、評決を集約する。
シャードの弱い裁判官は、より有能な総合的な裁判官よりも優れており、後者がパネルの全予算を受け取ったとしても、その裁判官と一致することができる。
論文 参考訳(メタデータ) (2026-08-05T18:21:21Z) - MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following [8.500414706731036]
本稿では,制約レベル判定のベンチマークであるMCJudgeBenchを紹介する。
各インスタンスには、命令、候補応答、明示的な制約リスト、Yes、部分的、ノー、制御された応答側の摂動を含む。
我々は、正確性と矛盾性の両方の指標を用いて、プロプライエタリかつオープンソースのLCM審査員を評価した。
論文 参考訳(メタデータ) (2026-05-05T15:20:42Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Validating LLM-as-a-Judge Systems under Rating Indeterminacy [65.137380612741]
評価の不確定性の下でLLM-as-a-judgeシステムを検証するための枠組みを提案する。
本研究では, 強制選択評価指示に応答する際の評価の不確定性を人間とLLMがどう解決するかの相違が, 偏見の検証に大きく寄与することを示した。
論文 参考訳(メタデータ) (2025-03-07T22:09:47Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。