論文の概要: More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges
- arxiv url: http://arxiv.org/abs/2607.05904v1
- Date: Tue, 07 Jul 2026 06:59:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.415724
- Title: More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges
- Title(参考訳): レファレンスフリーのLLM審査員を自力でハッキング
- Authors: Chenyu Zhou,
- Abstract要約: 言語モデルをそれ自身の参照なし判断に対して訓練することは、モデルが答えの正しさを判断することを前提にしている。
候補者に条件付きで、裁判官は正当性ではなく妥当性をスコアし、政策が悪用することを学習する偽陽性の盆地を残す。
- 参考スコア(独自算出の注目度): 4.167333498582309
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training a language model against its own reference-free judgments (the premise of self-rewarding, self-play, and LLM-as-a-judge pipelines) assumes a model's verdict on a shown answer tracks correctness. We show it fails structurally: conditioned on a candidate, a judge scores plausibility, not correctness, leaving false-positive basins a policy learns to exploit. We measure this with a hidden-anchor audit: a held-out, cross-source exact-match check the judge never sees. On GSM8K with Qwen3 policies, self-play drives the judge's pass rate from 0.72 to 0.94 while true accuracy stays at 0.20 (three seeds). This reward hacking is not white-box gaming: the errors transfer across judge families (Qwen, Llama, Gemma) and scales, a strict three-judge ensemble still accepts 55% of them, and no plausibility-scoring defense closes the basin. The decisive variable is whether the judge commits an answer of its own before using the candidate: committing first drops the false-positive rate from 0.719 to 0.012, blind solving lifts discrimination to 0.96, and used as the training reward the de-anchored channel keeps false positives at zero, preventing the basin rather than only detecting it. A falsifiable bound (the gap is at most 1 - accuracy) predicts which regimes are exposed. The full arc replicates without training under best-of-N selection in code and competition math, and with a Gemma policy.
- Abstract(参考訳): 言語モデルを自身の参照なし判断(自己回帰、自己再生、LSM-as-a-judgeパイプラインの前提)に対して訓練すると、モデルによる判断が正当性を判断する。
候補者に条件付きで、裁判官は正当性ではなく妥当性をスコアし、政策が悪用することを学習する偽陽性の盆地を残す。
ホールドアウトされた、クロスソースな正確なマッチングチェックが、裁判官が決して見ていない。
Qwen3ポリシーのGSM8Kでは、セルフプレイは裁判官のパスレートを0.72から0.94に駆動し、真の精度は0.20(3つのシード)に留まる。
審査員の家族(クウェン、ラマ、ジェマ)とスケールのエラー、厳格な3人組のアンサンブルはまだ55%を受け入れており、正当性のある防御力はない。
決定的な変数は、裁判官が候補者を使用する前に、自己の回答をコミットするかどうかである: まず、偽陽性率を0.719から0.012に下げ、ブラインド解決は差別を0.96に引き上げ、訓練報酬として、非アンコールチャネルは偽陽性をゼロに保ち、検出するだけでなく、盆地を阻止する。
ファルシブル境界(ギャップは少なくとも1 - 精度)は、どの状態が露出しているかを予測する。
完全な弧は、コードと競合数学のベスト・オブ・Nの選択とGemmaポリシーによるトレーニングなしで複製される。
関連論文リスト
- How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring [7.789295015218435]
LLMジェイルブレイクとプロンプトインジェクションに関するほぼすべての論文は、アタック・サクセス・レート(ASR)を報告している。
我々は2人の裁判官の家族と人間の多数決を比較して攻撃する。
審査員の精度とリコールを報告し、審査員の精度を補正したASRを報告し、審査員の逆チェックを含めることを推奨する。
論文 参考訳(メタデータ) (2026-06-24T07:14:17Z) - Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift [0.0]
私は、ProtectAI-v2とPrompt-Guard-2チェックポイントの3つの放出検出器を1つのソース校正閾値で評価した。
重大度指標Sを報告し、検知器が犯した攻撃に対する自信と、偽陰性率と差別を報告します。
3つとも間接的行動ヒジャック注入を確実に通過し、2つのベンダーに共通する盲点と4倍の大きさの範囲を達成します。
論文 参考訳(メタデータ) (2026-06-21T20:30:12Z) - Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines [0.22843885788439797]
製品の継続的な評価は、基底真理として扱われる強いLCMの判断に依存している。
judgeはそれ自体がAPIの背後にあるモデルであり、サイレントバージョンアップやスコアの更新はスコアの方法を変える。
我々は、アンカーが保護するメインプロセスを追い越さなければならないという設計法則を持つ帰属レースである(裁判官だけがアンカーを動かすことができる)任意の時間的正当性、一方的な識別を証明します。
論文 参考訳(メタデータ) (2026-06-13T21:12:27Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior [0.0]
審査員は一貫性があるが、互いに一致していない。
評価は3,240件を超え、中間合意はほぼゼロに近い。
審査員の平均得点は、審査員の実際の値に該当しない合成判定を生成する。
論文 参考訳(メタデータ) (2026-01-08T17:02:22Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。