論文の概要: What AI Red-Team Evaluations Can and Cannot Prove
- arxiv url: http://arxiv.org/abs/2607.21735v2
- Date: Thu, 30 Jul 2026 16:46:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 15:03:14.035999
- Title: What AI Red-Team Evaluations Can and Cannot Prove
- Title(参考訳): AIのレッドチーム評価が証明できないこと
- Authors: Bandana Kaur,
- Abstract要約: AIモデルのレッドチーム評価は、いくつかのクレームをサポートし、他のクレームをサポートしておらず、両者の境界は計算可能である。
我々は、評価の明確な天井を、ある結果が一定の試験予算の下で信念を移動できる最大の要因として定義する。
計算可能なハーフレートを超えると、控えめな大きさのベンチマークは、あるカテゴリーを明示的な基準に認定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Red-team evaluations of AI models support some claims and not others, and the boundary between the two is calculable rather than merely a matter of judgment. We define the evidential ceiling of an evaluation as the largest factor by which one result can move belief under a fixed testing budget, derive it in closed form for the benchmark null result, and use it to locate that boundary exactly. We find that above a calculable harm rate, a benchmark of modest size certifies a category to a stated evidentiary standard, and a clean sheet is then the stronger of the two possible observations, outweighing a single reproduced failure. Below that rate, no passive benchmark of feasible size provides the specified evidence of safety under the fixed scoring rule and approximately independent trial structure. The crossing between the two regimes has a closed form. The bound is not specific to benchmarks: written in terms of a procedure's hypothesis conditioned elicitation rates, it covers adaptive and automated red teaming as well, and shows that discrimination between the hypotheses rather than attack success is what determines evidential worth. Auditing eight evaluation suites against the boundary, we find that current benchmarks are adequate for high-frequency harm categories and several orders of magnitude short for rare, catastrophic ones. Safety benchmarks are not uninformative. They are informative about a specific and computable set of propositions, and the discipline they need is to state which.
- Abstract(参考訳): AIモデルのレッドチーム評価は、いくつかの主張を支持し、他の主張を支持し、両者の境界は単なる判断の問題ではなく計算可能である。
評価の明確な天井は、ある結果が固定されたテスト予算の下で信念を移動し、ベンチマークnull結果のクローズドな形で導出し、その境界を正確に特定できる最大の要因として定義する。
計算可能なハーフレートを超えると、モデムサイズのベンチマークはカテゴリーを明示的な基準に認定し、クリーンシートは2つの可能な観測よりも強く、単一の再現された故障よりも高い値となる。
この速度以下では、有効な大きさのパッシブなベンチマークは、一定のスコアリングルールとほぼ独立した試験構造の下での安全性の特定の証拠を与えていない。
2つの政権間の交差は閉じた形をしている。
このバウンダリはベンチマークに特有ではない: 手順の仮説条件付きエリケーション率の観点から書かれており、適応的で自動化されたレッドチームもカバーしており、攻撃の成功よりも仮説間の差別が明らかな価値を決定することを示しています。
境界に対して8つの評価スイートを評価すると、現在のベンチマークは高周波調和カテゴリに適しており、稀で破滅的なカテゴリには数桁の差があることがわかった。
安全性ベンチマークは非形式的ではない。
彼らは特定の、計算可能な命題の集合について情報を提供しており、それらが必要とする規律はどれを記述するかである。
関連論文リスト
- PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone [11.663456969895462]
機械学習におけるアライメント評価は、主にモデルの評価となっている。
本稿では, モデルレベルの評価だけでは, 配置関連アライメントを推定できないことを論じる。
論文 参考訳(メタデータ) (2026-05-06T03:28:30Z) - C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning [0.6138671548064355]
大型言語モデル (LLMs) は、チェーン・オブ・ソート (CoT) 推論の判断としてますます使われている。
C2-Faithは、因果性(各ステップは以前の文脈から論理的に従うのか?
二つの因果検出,因果ステップの定位,カバレッジスコアの3つの課題において,フロンティア判事の評価を行った。
論文 参考訳(メタデータ) (2026-03-05T13:36:47Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity [21.192000569821943]
我々は、厳密な目標と検証可能な構成がなければ、ベンチマークのランキングは、ほぼノイズの多い高信頼度ランキングを生成することができると論じる。
本稿では,Arena-Hard Autoが使用するELOスタイルのアグリゲーションが崩壊し,真のランキングの不確かさをマスクすることを示す。
我々の結果は、妥当性を損なう設計上の失敗を強調し、より良いスコープで信頼性に配慮したベンチマークを構築するための実用的な原則を提供する。
論文 参考訳(メタデータ) (2025-09-24T16:26:47Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。