論文の概要: False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift
- arxiv url: http://arxiv.org/abs/2610.01535v1
- Date: Thu, 01 Oct 2026 12:09:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.103603
- Title: False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift
- Title(参考訳): False Floors: LLMの安全計画評価は流通シフトで破る
- Abstract要約: 安全ルータは、各要求を複数のモデルのいずれかに送信し、最良の単一モデルに対して判断される。
私たちはそれを害と正確性に基づいてサイズし、測定した保持された分割よりも大きいことを示し、楽観主義とシフト依存の後悔によって束縛します。
- 参考スコア(独自算出の注目度): 0.8041659727964307
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety routers send each request to one of several models and are judged against the best single model. A major routing benchmark picks that comparator on the evaluation data. In the benchmark's own setting this is harmless, but under distribution shift it is not. On HELM Safety the selection cost is 0.003-0.030 of harm under random splits and 0.045-0.113 under held-out categories, comparable to the whole deficit attributed to routing, with its direction holding under either published judge alone. It rises seven- to ninefold on AgentDojo when suites are held out. Across seven safety corpora chosen by rules fixed in advance, three meet a registered interval test and four beat a later permutation null, and three of the four interval misses are corpora where some models have zero observed harm. Prior work proves the direction of this bias. We size it on harm and accuracy, show that it is larger under the held-out splits we measure, and bound it by optimism plus a shift-dependent regret. Scored honestly under shift, routing buys little on these benchmarks. In most pool cells the nested router serves the honest baseline's model, and on the nearly saturated AgentDojo corpus a perfect pre-dispatch router is worth at most two points of harm. We also find a model's expressed recognition of a late injection steerable. On held-out reruns an attacker who knows which model it faces lowers GPT-5.4's judged recognition by 19.6 points, confirmed by an independent label. In an offline counterfactual composition into a controller, the same attack raises or lowers estimated harm depending on the fallback model. Safety routing should be evaluated under shift, against a baseline chosen without the test labels, and recognition-based defences should be scored on harm against an attacker who chooses what the model sees.
- Abstract(参考訳): 安全ルータは、各要求を複数のモデルのいずれかに送信し、最良の単一モデルに対して判断される。
主要なルーティングベンチマークは、評価データに基づいてコンパレータを選択する。
ベンチマーク自身の設定では、これは無害であるが、分散シフトの下ではそうではない。
HELMセーフティでは、選択コストはランダムな分割の下で0.003-0.030、ホールドアウトカテゴリーで0.045-0.113であり、ルーティングによる全赤字に匹敵する。
スイートが保留されていると、AgentDojoの7倍から9倍になる。
予め決められたルールで選択された7つの安全コーパスのうち、3つは登録されたインターバルテストに適合し、4つは後続の順列ヌルを負い、4つのインターバルミスのうち3つは、いくつかのモデルが観測された害をゼロとするコーパスである。
事前の作業は、このバイアスの方向を証明します。
私たちはそれを害と正確性に基づいてサイズし、測定した保持された分割よりも大きいことを示し、楽観主義とシフト依存の後悔によって束縛します。
率直に言って、これらのベンチマークではルーティングがほとんど買わない。
ほとんどのプールセルでは、ネストされたルータは、正直なベースラインのモデルとして機能し、ほぼ飽和したAgentDojoコーパスでは、完全なプリディスパッチルータは、少なくとも2ポイントの害を受ける価値がある。
また、遅延インジェクションステアブルのモデルによる認識も見いだす。
ホールドアウトで、どのモデルに直面しているかを知っている攻撃者は、独立レーベルによって確認された、GPT-5.4の判定された認識を19.6ポイント下げる。
コントローラへのオフラインの反ファクト構成では、同じ攻撃がフォールバックモデルに応じて推定された損害を上昇または低下させる。
安全ルーティングは、テストラベルなしで選択されたベースラインに対してシフトで評価され、認識ベースの防御は、モデルが見ているものを選択するアタッカーに対して害を与えて評価されるべきである。
関連論文リスト
- CounterSteer: Suppressing Indirect Prompt Injection with Activation Steering [4.1626636325601405]
間接的なプロンプトインジェクションにより、エージェントは信頼できない検索されたテキストを命令として扱う。
モデル内のこの振る舞いを抑える推論時間ディフェンスであるCounterSteerを提案する。
論文 参考訳(メタデータ) (2026-09-29T02:51:31Z) - Calibrated Decision Models for Autonomous Penetration-Testing Harnesses: JEV and Laya as System One Decision Layers for LLM-Driven Pentest Agents [0.0]
システム1決定モデルが自律的な浸透テストハーネスをどのようにサポートするかを検討する。
本稿では,TypeSafe System One (Jev) とそれのないものと13の脆弱性を含むWebターゲットとを比較した探索的NeuroSploitケーススタディを提案する。
ドメイン適応型System OneモデルであるRaveを提案し、そのトレーニングデータ、評価プロトコル、およびハーネス保証に対する潜在的影響について概説する。
論文 参考訳(メタデータ) (2026-09-24T02:47:20Z) - When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide [0.0]
5つのデータセットと2つの既知のエフェクトスイープにまたがる6つの推定器をベンチマークし、非シミュレートされたペア参照に対してそのメカニズムを検証する。
ターゲット自身のスコアからロガーをシャープすると、テスト対象範囲をわずかにオーバーラップし、アクションレベルの不一致が崩壊する。
結果のニュアンスのみを適合させることは、再利用バイアスをその場に残し、それを悪化させます。
論文 参考訳(メタデータ) (2026-08-12T18:10:10Z) - Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks [8.249133191294703]
内部安全スコアは、テキストが生成される前にプロンプトを判断する。
間違った量を測定するスコアに調整されたフィルターは、いずれにせよ失敗した攻撃に対して偽陽性の予算を費やす。
固定コンテンツ独立計測座標を提供するアクティブアテンション・プロービングを導入する。
論文 参考訳(メタデータ) (2026-08-10T14:05:32Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift [0.0]
私は、ProtectAI-v2とPrompt-Guard-2チェックポイントの3つの放出検出器を1つのソース校正閾値で評価した。
重大度指標Sを報告し、検知器が犯した攻撃に対する自信と、偽陰性率と差別を報告します。
3つとも間接的行動ヒジャック注入を確実に通過し、2つのベンダーに共通する盲点と4倍の大きさの範囲を達成します。
論文 参考訳(メタデータ) (2026-06-21T20:30:12Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。