論文の概要: LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
- arxiv url: http://arxiv.org/abs/2609.02246v1
- Date: Wed, 02 Sep 2026 07:54:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.141499
- Title: LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
- Title(参考訳): LLM-as-a-JudgeはOracleではない:なぜ自己改善エージェントは決定論的ガードレールを必要とするのか
- Authors: Vansh Wahi,
- Abstract要約: 自己改善エージェントパイプラインは、その中心に問題がある。
評価信号は、判定バイアス、ハーネスとメートル法故障、地道エラー、報酬ハッキングの11のクラスで失敗した。
ProCTORは、ステートフルオーケストレータがすべてのツールアクセスを保持し、ステートレスサブエージェントが障害を診断し、それらが適用できないドラフト突然変異を診断する、教師と学生のループである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-improving agent pipelines have a problem at their center. An optimizer rewrites prompts to score higher, and the score comes from a judge that is itself an LLM. That judge has the last word on whether the system is getting better, and our position is that it has not earned it. The judge should be demoted from oracle to advisor: its verdict becomes one input among several, and every change is gated instead by a deterministic verification layer the judge cannot override. We reached this position by building the alternative and running it. Over months of running autonomous prompt-optimization loops in production across contract analysis, compliance review, and code quality, we cataloged eleven ways the evaluation signal failed, in four classes: judge bias, harness and metric failures, ground-truth errors, and reward hacking. Agents achieved perfect scores by reading cached answer keys from their environment, a 100% pass rate concealing 68% true capability. A corrupted ground-truth label caused the optimizer to delete correct compliance rules to agree with it. A syntactically broken prompt was promoted as the winner because a silent parser fallback improved the metric. Attempts to fix the judge by rewriting its rubric plateaued; the only reliable gain came from a structural constraint on its output order. In response we describe PROCTOR, a Teacher-Student loop in which a stateful orchestrator holds all tool access, stateless subagents diagnose failures and draft mutations they cannot apply, and a Teacher grades those mutations under five deterministic guardrails: hermetic sandboxes, capability-disjoint roles, acceptance checks that outrank the Teacher, frozen holdouts, and canary cases engineered so that a perfect score is itself evidence of cheating. We report the failures this prevented, and, because the Teacher is itself an LLM judge, the failures it did not.
- Abstract(参考訳): 自己改善エージェントパイプラインは、その中心に問題がある。
オープティマイザは、スコアを高くするプロンプトをリライトし、スコアは、それ自体が LLM である審査員から得られる。
その判事は、システムが良くなっているかどうかについて最後の言葉を持っている。
裁判官は、宣誓供述書から顧問へ降格すべきであり、その評決は複数の意見の1つとなり、すべての変更は決定論的検証層によって強制され、裁判官は上書きできない。
私たちは代替手段を構築して運用することで、このポジションに到達しました。
コントラクト分析、コンプライアンスレビュー、コード品質などを通じて、運用環境で自律的なプロンプト最適化ループを実行して数ヶ月にわたって、評価シグナルが失敗する11の方法を、判断バイアス、ハーネスとメトリックの失敗、地道エラー、報酬ハックの4つのクラスに分類しました。
エージェントはその環境からキャッシュされた応答キーを読み、100%パスレートで68%の真の能力を隠すことで、完璧なスコアを得た。
破損した基盤構造ラベルにより、オプティマイザは正しいコンプライアンスルールを削除してそれに同意した。
サイレントパーサーのフォールバックが改善したため、構文的に壊れたプロンプトが勝者として昇格した。
判事を直そうとする試みは、そのルーブを台帳に書き直し、唯一信頼できる利得は、その出力順序に関する構造的な制約によるものであった。
PROCTORは、ステートフルなオーケストレータがすべてのツールアクセスを保持し、ステートレスなサブエージェントは、それらが適用できない失敗とドラフト突然変異を診断し、教師は、5つの決定論的ガードレール(ハーメティックサンドボックス、能力分離型ロール、受け入れチェック、教師、フリーズホールドアウト、カナリアケース)に基づいてこれらの変異を分類する。
我々は、この障害が予防されたことを報告し、教師自身がLLM審査員であるため、失敗しなかったことを報告した。
関連論文リスト
- Commit-first LLM judging inherits the judge's own errors [0.0]
LLMジャッジは、他のシステムの出力をスコアするモデルであり、彼らがスコアするシステムによってゲームをすることができる。
裁判官は最初にタスクを解決し、その答えにコミットし、2つが一致した場合のみ候補者を受け入れる。
これをコミットファースト判断と呼び、出荷されたソフトウェアがそれを実装しているかどうか、そのコストについて尋ねます。
論文 参考訳(メタデータ) (2026-08-31T12:14:14Z) - trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories [0.0]
アウトカムのみの評価は、LLMエージェントのプロダクションデフォルトである。
地下の真実が建設によって知られている盲点を測定する。
審査員の評価は、結果の生存によって、リコールを成す必要があると論じる。
論文 参考訳(メタデータ) (2026-08-29T10:14:05Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization [9.9751102700286]
テキスト空間スキル最適化は、自然言語スキルドキュメントを進化させ、検証ゲートを介して各候補を受け入れることで凍結エージェントに適応する。
審査員をループに配置する前に、そのスコアが不正な回答とは全く違うかどうかを判断できますか?
我々は、基準のない裁判官を潜在問題解決者として定式化し、その評決は、その結論と一致しているので、評価する能力は解決する能力によって制限される。
我々は、もし能力が床の近くにあり、その上に使用可能な場合、偶然に差別性を見出す。
論文 参考訳(メタデータ) (2026-08-19T09:19:23Z) - Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior [0.0]
効果的な大規模言語モデル (LLM) チューターは、容易に作成できる答えを与えるために、しばしば辞退しなければならない。
本稿では,ターン毎の機械チェック可能な契約として回答保持を強制する教育システムについて報告する。
人間の被験者を使わない自動評価で行動を調整する。
論文 参考訳(メタデータ) (2026-08-12T17:35:58Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering [0.0]
大規模な言語モデルは、コードのアーティファクトを評価するために裁判官としてますます使われています。
現在のプラクティスには、信頼性とバイアスの原則的な説明が欠けている。
計測ファーストレンズを用いたLCM-as-a-Judgeの符号化について検討する。
論文 参考訳(メタデータ) (2026-04-18T02:35:05Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Validating LLM-as-a-Judge Systems under Rating Indeterminacy [65.137380612741]
評価の不確定性の下でLLM-as-a-judgeシステムを検証するための枠組みを提案する。
本研究では, 強制選択評価指示に応答する際の評価の不確定性を人間とLLMがどう解決するかの相違が, 偏見の検証に大きく寄与することを示した。
論文 参考訳(メタデータ) (2025-03-07T22:09:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。