論文の概要: How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
- arxiv url: http://arxiv.org/abs/2606.25487v2
- Date: Thu, 25 Jun 2026 02:04:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 15:44:16.377942
- Title: How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
- Title(参考訳): あなたのジェイルブレイク判事はどれほど信頼できるのか? 自動ASRスコーリングの校正と逆境ロバスト性
- Abstract要約: LLMジェイルブレイクとプロンプトインジェクションに関するほぼすべての論文は、アタック・サクセス・レート(ASR)を報告している。
我々は2人の裁判官の家族と人間の多数決を比較して攻撃する。
審査員の精度とリコールを報告し、審査員の精度を補正したASRを報告し、審査員の逆チェックを含めることを推奨する。
- 参考スコア(独自算出の注目度): 7.789295015218435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Almost every paper on LLM jailbreaks and prompt injection reports an attack-success rate (ASR), and that number is assigned not by people but by an automated judge: either a safety classifier trained for the task, or a general chat model prompted to grade. The judge is rarely checked. We check it. Using 596 human-labeled completions from the HarmBench classifier validation set, we compare the two judge families against human majority votes and then attack them. The two families fail in opposite ways. The dedicated classifier over-flags (precision 0.835, recall 0.974); three different LLM-as-judges keep high precision (0.81 to 0.94) but show erratic recall (0.06 to 0.65), so the same responses produce very different ASR depending on which judge scores them. The two families also differ sharply in robustness. Wrappers that leave the harmful text untouched and only add benign framing flip every LLM-judge between 57% and 100% of the time, and a single prepended refusal sentence accounts for much of this (39% to 88%). The dedicated classifier resists these surface attacks (at most 6.7%), but a white-box GCG attack on its open weights flips 70% of confident true positives (21 of 30; 95% CI 54 to 86%) even at a small optimization budget. A two-annotator audit confirms the attacks leave the harm intact: every one of 80 sampled flips still contained the harmful content. Because a large and growing share of reported ASR comes from LLM-judges, many such numbers are unreliable both on average and under deliberate pressure. We recommend that papers report judge precision and recall on a human-labeled slice, report ASR corrected for judge precision, and include an adversarial check of the judge. Our code is released.
- Abstract(参考訳): LLMのジェイルブレイクとプロンプトインジェクションに関するほぼすべての論文は、アタック・サクセス・レート(ASR)を報告しており、その数字は人ではなく、自動化された裁判官によって割り当てられている。
裁判官はめったにチェックされない。
チェックします。
HarmBench分類器の検証セットから596件の人間ラベル付き完了点を用いて, 判定された2つの家族を人的多数決と比較し, 攻撃した。
2家族は反対方向に失敗します。
専用分類器オーバーフラッグ(精度0.835、リコール0.974)、3つの異なるLCM-as-judgeは高い精度(0.81から0.94)を維持しているが、不規則なリコール(0.06から0.65)を示すため、同じ応答は審査員のスコアによって非常に異なるASRを生成する。
2つの家系は、強靭性も著しく異なる。
有害なテキストを残したラッパーは、すべてのLSM-judgeを57%から100%フリップするだけでよい。
専用分類器はこれらの表面攻撃(最大6.7%)に抵抗するが、オープンウェイトに対するGCG攻撃は、小さな最適化予算でも自信のある正の70%(30点中21点、95% CI 54点から86%点)を反転させる。
2つのアノテータによる監査では、攻撃は無害のままで、80個のサンプルフリップのうち1つに有害な内容が含まれていることが確認された。
報告されているASRのシェアは LLM-judges から来ているため、そのような数字の多くは平均的および故意の圧力下では信頼できない。
審査員の精度とリコールを報告し、審査員の精度を補正したASRを報告し、審査員の逆チェックを含めることを推奨する。
私たちのコードはリリースされます。
関連論文リスト
- Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts [2.583375572224943]
重み付き重み付けによるフリップ率と騒音床の測定を行った。
ほとんどの裁判官はほとんど動けないが、特定の裁判官は安価に悪用できる盲点を持っている。
データセット、ラッパー、コード、評価ラベル毎にリリースしています。
論文 参考訳(メタデータ) (2026-09-08T04:27:22Z) - trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories [0.0]
アウトカムのみの評価は、LLMエージェントのプロダクションデフォルトである。
地下の真実が建設によって知られている盲点を測定する。
審査員の評価は、結果の生存によって、リコールを成す必要があると論じる。
論文 参考訳(メタデータ) (2026-08-29T10:14:05Z) - Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG [0.0]
本稿では,ソースグラウンドRAGのための制御メタ評価プロトコルであるEval-Pair Matrixを紹介する。
GPT,Grok,Geminiモデルを用いた摂動通路から解答を生成し,視覚障害者と同じモデルを用いて各解答を元の解答に対して評価する。
実験には300個のコアレコード、897個のラベル付きジェネレータ出力、および2,683個の判定結果が含まれている。
論文 参考訳(メタデータ) (2026-07-12T07:39:45Z) - More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges [4.167333498582309]
言語モデルをそれ自身の参照なし判断に対して訓練することは、モデルが答えの正しさを判断することを前提にしている。
候補者に条件付きで、裁判官は正当性ではなく妥当性をスコアし、政策が悪用することを学習する偽陽性の盆地を残す。
論文 参考訳(メタデータ) (2026-07-07T06:59:30Z) - On the Adversarial Robustness of Multimodal LLM Judges [49.80009278197918]
審査員として機能する汎用MLLMの対角的堅牢性を評価するための最初のフレームワークであるRobustMLLMJudgeを紹介する。
RobustMLLMJudgeを用いて、異なるMLLM審査員は、スコアを膨らませる敵攻撃に対して非常に脆弱であることを明らかにした。
MGSIAは,MLLM審査員に対するより効果的かつ伝達可能な攻撃を可能にするために,これらの制約を回避した新しい手法である。
論文 参考訳(メタデータ) (2026-06-14T05:30:20Z) - Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines [0.22843885788439797]
製品の継続的な評価は、基底真理として扱われる強いLCMの判断に依存している。
judgeはそれ自体がAPIの背後にあるモデルであり、サイレントバージョンアップやスコアの更新はスコアの方法を変える。
我々は、アンカーが保護するメインプロセスを追い越さなければならないという設計法則を持つ帰属レースである(裁判官だけがアンカーを動かすことができる)任意の時間的正当性、一方的な識別を証明します。
論文 参考訳(メタデータ) (2026-06-13T21:12:27Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - How Sensitive Are Safety Benchmarks to Judge Configuration Choices? [5.94231111588812]
HarmBenchのような安全ベンチマークは、モデル応答を有害または安全と分類する判断に頼っている。
判定モデルと判定プロンプトの組み合わせは,一般に一定の実装の詳細として扱われる。
審査員モデルの定式化により, 評価された有害応答率を最大24.2%にシフトした。
論文 参考訳(メタデータ) (2026-04-27T05:59:59Z) - JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems [0.0]
大規模言語モデルは、他のモデルを評価するための自動判断器として、ますます多くデプロイされている。
我々は、判断感度スコア(JSS)を通じて、このプロパティを定量化するフレームワークとベンチマークであるJiceSenseを紹介します。
事実として、すべての審査員は、極性反転プロンプトアーティファクトによって駆動されるJSS付近に約0.63のクラスタをクラスタする。
コード、意思決定ログ、検証済みのパラフレーズデータセットをリリースし、標準化されたJSSレポートをサポートします。
論文 参考訳(メタデータ) (2026-04-26T00:08:30Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior [0.0]
審査員は一貫性があるが、互いに一致していない。
評価は3,240件を超え、中間合意はほぼゼロに近い。
審査員の平均得点は、審査員の実際の値に該当しない合成判定を生成する。
論文 参考訳(メタデータ) (2026-01-08T17:02:22Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - JudgeLM: Fine-tuned Large Language Models are Scalable Judges [48.053949045598344]
大規模言語モデル(LLM)をオープンなシナリオで評価することは、既存のベンチマークやメトリクスがそれらを包括的に測定できないため、難しい。
本稿では,拡張性のある審査員 (JudgeLM) としてLLMを微調整し,LLMを効率よく,かつ効率的に評価する手法を提案する。
我々は7B,13Bから33Bパラメータの異なるスケールでJiceLMを訓練し、その能力と振る舞いを体系的に分析する。
論文 参考訳(メタデータ) (2023-10-26T17:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。