論文の概要: Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence
- arxiv url: http://arxiv.org/abs/2608.12645v1
- Date: Wed, 12 Aug 2026 23:14:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.341339
- Title: Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence
- Title(参考訳): Jagged Judges: 沈黙,圧力,永続性の下でのてんかんの安定性
- Abstract要約: 我々は,LLM審査員の安定のための統一ストレステストであるemphWiggle Frameworkを紹介する。
このフレームワークを使用して、安全性、毒性、AI書き込みの検出、政治的応答性評価など、14の判定タスクにわたる9つのフロンティアモデルを調査します。
我々は、裁判官の評決を変えるのに成功する圧力が、根底的な真実に関してほとんど常にネット崩壊していることに気付く。
- 参考スコア(独自算出の注目度): 2.3273914394869393
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM judges have become central infrastructure for model evaluations, online grading, and reward modeling. Judges are typically validated by accuracy on golden data, but accuracy says little about whether they are stable under re-prompting, challenge, or sustained pushback. We introduce the \emph{Wiggle Framework}, a unified stress test for epistemic stability in LLM judges. The framework decomposes judge robustness along three dimensions: Mechanical Consistency (stability under re-prompting and reframing), Single-turn Conviction (stability under a single challenge), and Multi-turn Persistence (stability under sustained or adaptive pressure). We use the framework to study 9 frontier models across 14 judging tasks spanning safety, toxicity, AI writing detection, and political-response evaluation. Every model exhibits substantial wiggle as a judge --- flipping verdicts 25--71\% of the time under static pushback, and 62--91\% with an adversarial LLM persuader. Critically, we find that pressure that succeeds in changing a judge's verdict is almost always net-corrupting with respect to ground truth. Beyond the framework itself, we identify baseline jury majority strength as the most effective single-shot signal for anticipating which items wiggle. Taken together, this is the first apples-to-apples cross-dataset comparison of mechanical, conformity, and persuadability tests in a judging context.
- Abstract(参考訳): LLM審査員は、モデル評価、オンライングレーディング、報酬モデリングの中心的な基盤となっている。
審査員は通常、金のデータの正確さによって検証されるが、その正確さは、再試行、挑戦、または持続的な押し戻しの下で安定しているかどうかについてはほとんど語らない。
我々は,LLM審査員の頭蓋骨の安定性を統一したストレステストである 'emph{Wiggle Framework} を紹介した。
この枠組みは、機械的一貫性(再跳躍と再フレーミングの下での安定性)、シングルターン信念(単一課題下での安定性)、マルチターン永続(持続的または適応的圧力下での安定性)の3つの側面に沿って、判断の堅牢性を分解する。
このフレームワークを使用して、安全性、毒性、AI書き込みの検出、政治的応答性評価など、14の判定タスクにわたる9つのフロンティアモデルを調査します。
あらゆるモデルは、審査員としてかなりのウィグルを示します -- 静的なプッシュバックの下で25--71\%の時間を反転し、62--91\%を敵のLLM説得器で予測します。
批判的に言えば、裁判官の評決を変えるのに成功する圧力は、地上の真実に関してほぼ常にネット崩壊している。
フレームワーク自体を超えて、どのアイテムが揺れるかを予測する最も効果的なシングルショット信号として、基本的陪審員の過半数の強さを識別する。
まとめると、これは判断コンテキストにおける機械的、適合性、説得性テストの最初のリンゴとアプレットのクロスデータセット比較である。
関連論文リスト
- LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation [79.03892269184145]
LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
論文 参考訳(メタデータ) (2026-06-19T06:20:58Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - Judge Reliability Harness: Stress Testing the Reliability of LLM Judges [1.1699027359021665]
Judge Reliability Harnessは、LCM判事の信頼性をテストする検証スイートを構築するためのオープンソースライブラリである。
安全性,説得性,誤用,エージェント行動の4つのベンチマークで,最先端の4つの審査員を評価した。
論文 参考訳(メタデータ) (2026-03-05T17:27:07Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior [0.0]
審査員は一貫性があるが、互いに一致していない。
評価は3,240件を超え、中間合意はほぼゼロに近い。
審査員の平均得点は、審査員の実際の値に該当しない合成判定を生成する。
論文 参考訳(メタデータ) (2026-01-08T17:02:22Z) - Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems [2.9141470183751674]
スケーラブルでコンテキスト対応な評価のための動的学習ベースのフレームワークを提案する。
本手法は,LLM審査員が人間専門家といつ一致するかを評価するために,信頼度予測器のセットを訓練する。
要約およびRAGベンチマーク実験により,我々の動的陪審法は,単一判定基準と静的判定基準の両方よりも,人間の判断との相関が著しく高いことを示した。
論文 参考訳(メタデータ) (2025-12-01T15:26:20Z) - CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards [72.44810390478229]
CompassJudger-2は、タスク駆動のマルチドメインデータキュレーション戦略によって制限を克服する新しいジェネラリストジャッジモデルである。
CompassJudger-2は、複数の判定と報奨ベンチマークで優れた結果を得る。
論文 参考訳(メタデータ) (2025-07-12T01:34:24Z) - Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges [3.168632659778101]
我々は、一般的に見落とされがちな2つの重要な課題について強調する: (i) 迅速な感度や分布シフトなどの要因がパフォーマンスに影響を及ぼす野生における評価、(ii) 裁判官を標的とする敵攻撃。
モデル出力のスタイルなどの小さな変更は、同じデータセット上の偽陰性率で最大0.24のジャンプを引き起こす可能性がある一方で、モデル生成に対する敵対的な攻撃は、一部の裁判官を騙して、有害な世代を100%安全なものと誤分類する可能性があることを示す。
論文 参考訳(メタデータ) (2025-03-06T14:24:12Z) - JudgeBench: A Benchmark for Evaluating LLM-based Judges [61.048125269475854]
judgeBenchは、知識、推論、数学、コーディングにまたがる挑戦的な応答ペアに関するLSMベースの判断を評価するためのベンチマークである。
審査員、微調整された審査員、マルチエージェントの審査員、報酬モデルに関する包括的な評価は、審査員ベンチが以前のベンチマークよりもかなり大きな課題を課していることを示している。
論文 参考訳(メタデータ) (2024-10-16T17:58:19Z) - JudgeLM: Fine-tuned Large Language Models are Scalable Judges [48.053949045598344]
大規模言語モデル(LLM)をオープンなシナリオで評価することは、既存のベンチマークやメトリクスがそれらを包括的に測定できないため、難しい。
本稿では,拡張性のある審査員 (JudgeLM) としてLLMを微調整し,LLMを効率よく,かつ効率的に評価する手法を提案する。
我々は7B,13Bから33Bパラメータの異なるスケールでJiceLMを訓練し、その能力と振る舞いを体系的に分析する。
論文 参考訳(メタデータ) (2023-10-26T17:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。