論文の概要: What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models
- arxiv url: http://arxiv.org/abs/2608.16852v1
- Date: Mon, 17 Aug 2026 17:37:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.821824
- Title: What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models
- Title(参考訳): コンプライアンス・ディテクターの読み方 : アクティベーション・プローブとガード・モデル
- Authors: Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth,
- Abstract要約: ICS(Internal Compliance Score)は、10組のラベル付きペアからのトレーニング不要のアクティベーション読み出しであり、単一のプロジェクションで得点される。
この状態は、現在のコンプライアンス・ディテクターのクラスにまたがって失敗することを示し、これはルール・ブラインドネスと呼ばれる失敗である。
対策プロトコルとクロスルールベンチマークを公開し、将来の調査でルールの盲点をテストし、クレームを保護します。
- 参考スコア(独自算出の注目度): 3.3598755777055374
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Regulatory compliance monitoring in deployed language models is increasingly implemented as a legal and audit control, checking model outputs against written rules spanning data protection, healthcare, financial regulation, and platform policy. Such monitoring is meaningful only if a detector's verdict depends on the stated rule rather than on surface features of the scenario. We show this condition fails across the current class of compliance detectors, a failure we call rule blindness. Deleting, permuting, or substituting the governing rule leaves detection accuracy unchanged for every guard and activation probe we test, including a policy-conditioned guard that correctly cites the governing clause yet barely changes its verdict when that clause is swapped for its permissive counterpart. A purpose-built benchmark crossing two rules with two scenarios, so that neither alone predicts the label, confirms the failure under a design no prior benchmark rules out, and shows that step by step reasoning, not any fast detector we test, is what escapes it. Auditing at scale requires a retraining-free detector, so we introduce the Internal Compliance Score (ICS): a training-free activation readout calibrated from ten labelled pairs and scored by a single projection. We hold ICS to the same scrutiny as the guards it audits: a pre-registered criterion for beating trivial baselines is not met, and a bag-of-words model matches its pooled generalisation exactly. It remains useful because it is inexpensive, letting us audit four deployed guard models, an 8B zero-shot judge, and thirteen benchmarks, and it raises the mechanically verified pass rate when used to rank candidate responses, though an adaptive white-box attack removes this gain. We release the counterfactual protocol and crossed-rule benchmark so rule blindness can be tested in future probe and guard claims.
- Abstract(参考訳): デプロイされた言語モデルにおける規制コンプライアンス監視は、データ保護、医療、金融規制、プラットフォームポリシーを含む記述されたルールに対して、モデル出力をチェックする、法的および監査コントロールとして、ますます実装されている。
このようなモニタリングは、検出器の判定がシナリオの表面的な特徴よりも、記述された規則に依存する場合にのみ意味がある。
この状態は、現在のコンプライアンス・ディテクターのクラスにまたがって失敗することを示し、これはルール・ブラインドネスと呼ばれる失敗である。
ルールの削除、置換、置換は、私たちがテストするすべてのガードおよびアクティベーションプローブに対して、検出精度が変わらないままである。
2つのルールを2つのシナリオで横断する目的で構築されたベンチマークで、ラベルを予測せず、事前のベンチマークルールなしで設計の下で失敗を確認し、テストする高速検出器ではなくステップバイステップの推論がエスケープされることを示す。
そこで我々は,10組のラベル付きペアから校正され,単一のプロジェクションで得点されるトレーニングフリーのアクティベーション・リードアウトであるICS(Internal Compliance Score)を導入する。
自明なベースラインを打つための事前登録基準は満たされておらず、単語のバッグ・オブ・ワードモデルは、プール化された一般化と正確に一致します。
安価で、配置された4つのガードモデル、8Bのゼロショットジャッジ、13のベンチマークを監査できます。
対策プロトコルとクロスルールベンチマークを公開し、将来の調査でルールの盲点をテストし、クレームを保護します。
関連論文リスト
- SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases [0.0]
SynthGuard-ReleaseBenchは、評価の前に使用、候補パネル、許容度、監査スケジュールをロックする監査フレームワークである。
保護されたデータ上で、実際のトレーニングと合成トレーニングを比較し、損失ギャップの有限サンプル境界を同時に与え、コントロールを必要とし、実用性と経験的なプライバシーリスクメカニズムを分離する。
論文 参考訳(メタデータ) (2026-08-14T03:12:17Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - What Can Be Enforced? A Theory of Certified Runtime Safety for Tool-Using Agents [0.0]
ガードレールは不可逆のツールコールの前に動作しますが、その保証は、どのポリシー状態が表現可能であるかによって異なります。
ピアソン表現攻撃はマージンを増すので、良性校正だけでは移動しない。
実験は静的診断、制御モデル列挙、表現書き直し、ペア化された閉ループ再実行を通じてこれらの区別を目標とする。
論文 参考訳(メタデータ) (2026-07-24T19:14:26Z) - Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis [2.7092559671391]
OpenScholarやPaperQA2のようなエージェントLLMシステムは科学論文を読み、引用された回答を返す。
どちらもそのチェックの信頼性を監査しません。
私たちはそれが信頼できないこと、そしてこれが重要であることを示します。
本報告では,ゴールドアンコール評価プロトコルとデプロイ可能なガードについて述べる。
論文 参考訳(メタデータ) (2026-07-10T02:05:17Z) - Verification of Adaptive Agentic Controllers through Finite Rule Revision [0.0]
本稿では,有限記号規則で表される適応エージェント制御系に対する有界検証プロトコルを定式化する。
診断の失敗は、ルールの追加、ルール削除、優先度修正など、事前に定義されたルールレベルの編集にマップされる。
修理されたコントローラは、保持されたシミュレーションシードまたはクローンされた初期状態に基づいて評価される。
論文 参考訳(メタデータ) (2026-07-07T13:38:01Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering [67.8271652641864]
我々は,隠蔽状態の介入によって検証の厳密性を制御できるかどうかを検討した。
VerifySteerは、サンプルレベルのルーティングに潜時補正信号を使用し、段落境界に選択的に介入する。
論文 参考訳(メタデータ) (2026-05-20T05:48:16Z) - When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels [34.86529553336423]
多くのデプロイメントは、関連する言語、セクター、または規制体制のためにラベル付きベンチマークが存在する前に、安全のために候補言語モデルを比較する必要がある。
我々は、この設定をベンチマークレス比較安全スコアとして定式化し、シナリオベースの監査をデプロイ証拠として解釈できる契約を指定する。
スコアは固定されたシナリオパック、ルーリック、監査、審査、サンプリング設定、再実行予算でのみ有効である。
論文 参考訳(メタデータ) (2026-05-07T17:56:41Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。