論文の概要: From Probe Scores to Alarm Policies: Operational Validity of Activation Monitors for Language-Model Agents
- arxiv url: http://arxiv.org/abs/2610.04575v1
- Date: Sat, 03 Oct 2026 15:11:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 18:40:55.593957
- Title: From Probe Scores to Alarm Policies: Operational Validity of Activation Monitors for Language-Model Agents
- Title(参考訳): Probe ScoresからAlarm Policiesへ:言語モデルエージェントのアクティベーションモニターの動作妥当性
- Abstract要約: アクティベーションプローブは、受信動作特性曲線(AUROC)の下で高い領域を持つ言語モデルの安全性関連特性を予測することができる
配備されたエージェントモニターは、厳格な偽アラーム予算の下で閾値付きアラーム決定を行う。
我々は,モニタの目標,可観測性,アイデンティティ,タイミング,介入ユニット,コンパレータ,キャリブレーション,コストを修正する操作検証契約を導入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Activation probes can predict safety-relevant properties of language models with high area under the receiver-operating-characteristic curve (AUROC), but deployed agent monitors make thresholded alarm decisions under tight false-alarm budgets. These are different estimands. We introduce an Operational Validity Contract that fixes a monitor's target, observability, identity, timing, intervention unit, comparator, calibration, and cost. We formalize risk at the semantic request or trajectory level: when one task contains repeated alarm opportunities, row-level AUROC and false positive rate do not identify semantic-unit any-alarm risk. A confidence-certified threshold also requires enough independent negative units, a tie-safe rule, and transport to deployment. Across Models Under Pressure, LASR refusal prediction, immutable AgentDojo, and a prospectively protocol-frozen ST-WebAgentBench replication, joint activation-observable monitors reach AUROC 0.957 and 0.935 on the first two benchmarks, yet their locked 5%/10% detection rates are only .642/.742 and .719/.782, respectively. On AgentDojo, the secondary mean-activation rollout monitor reaches AUROC 0.922 but detects none of 38 positive semantic cases at the locked 5% operating point; thresholds intended for 10% false alarms realize 18.7-20.0% on test. Because the test misses its prospectively frozen 40-positive support gate, we label it support-insufficient. On ST-WebAgentBench, activation reaches AUROC .874, but 23 independent calibration negatives cannot identify even a 10% controller; the locked policy abstains rather than reporting its mechanical zero FPR as a success. An exploratory counterexample also lowers full AUROC while improving realized 10% utility. The fail-closed compiler caps MUP and LASR at restricted predictive value and AgentDojo and ST-Web at representation accessibility; no setting reaches alarm-policy validity.
- Abstract(参考訳): アクティベーションプローブは、受信動作特性曲線(AUROC)の下で高い領域を持つ言語モデルの安全性関連特性を予測することができるが、デプロイされたエージェントモニタは、厳密な偽警報予算の下で閾値付きアラーム決定を行う。
これらは異なる推定値である。
我々は,モニタの目標,可観測性,アイデンティティ,タイミング,介入ユニット,コンパレータ,キャリブレーション,コストを修正する操作検証契約を導入する。
1つのタスクが繰り返しアラームの機会を含む場合、行レベルのAUROCと偽陽性率は意味単位のアラームリスクを特定しない。
信頼性確認しきい値には、十分な独立した負のユニット、タイセーフルール、デプロイメントへのトランスポートも必要である。
Across Models Under Pressure, LASR refusal Prediction, Immutable AgentDojo, and a prospectively protocol-frozen ST-WebAgentBench replication, joint activation-observable Monitors reach AUROC 0.957 and 0.935 in the first two benchmarks, but their lock 5%/10% detection rate are only .642/.742 and .719/.782。
AgentDojoでは、二次平均アクティベーションロールアウトモニターがAUROC 0.922に達するが、ロックされた5%の操作ポイントにおいて38の陽性なセマンティックケースは検出されない。
テストは凍結した40陽性のサポートゲートを見逃しているので、サポート不足とラベル付けします。
ST-WebAgentBenchでは、アクティベーションはAUROC .874に達するが、23個の独立キャリブレーション陰性は10%のコントローラを特定できない。
探索的な反例では、完全なAUROCを低くし、実現された10%のユーティリティを改善している。
フェールクロースされたコンパイラは、MUPとLASRを制限された予測値で、AgentDojoとST-Webは表現アクセシビリティで、アラームポリシーの妥当性に到達しない。
関連論文リスト
- hacktrace: behavior-supervised detection of reward hacking during code generation [52.709361620508595]
コーディングエージェントは、コードを修正するか、バグを露呈するテストを削除することで、パスグレードを得ることができる。
我々はQwen3-8Bから173,561個の注釈付きマルチターン符号化トラジェクトリをリリースし、成功を活かさないショートカット動作の監視が検出を大幅に改善することを示す。
HACKTRACEは、エージェントがコードを生成する際に既に計算している内部状態を読み取る行動監視モニターである。
論文 参考訳(メタデータ) (2026-10-02T09:35:59Z) - Positive-Unlabeled Learning for Agent Safety False Alarm Auditing [20.558472786027284]
安全監視は、言語モデルエージェントが外部のツールや環境と対話するのを保護するのに役立つ。
偽のアラームと真偽のアラームは、ネイティブモニターのスコアにインターリーブされることが多いため、信頼できるカットオフを得るには、かなりの手作業による検証が必要である。
本稿では,Trust-Aware PU Supervisionがアラーム領域に対して安全な参照を適応させる2段階フレームワークを提案する。
論文 参考訳(メタデータ) (2026-10-02T07:16:33Z) - Silent Failures in Agentic Security Evaluation: A Validated Harness for Tool-Call Mediation Under Indirect Prompt Injection [0.0]
特権ツールを起動するLLMエージェントは間接的プロンプトインジェクション(IPI)に脆弱である
4つの欠陥クラス - サイレントペイロードの非配信、引数ではなくツールアイデンティティによるアタック成功、モデル非能力と混同された偽リジェクション率、監査証跡の欠如 - を識別する。
我々は、欠陥と修正された定義の下で同じ実行トレースを再描画することで、歪みを定量化する。
論文 参考訳(メタデータ) (2026-09-26T14:53:42Z) - Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement [74.92755267784983]
強化学習は、視覚言語モデルにおける推論を改善するが、チェーン・オブ・オファシケーションを誘発することができる。
本稿では, 行動フィードバックとテンプレート関連アクティベーションの標的抑制を組み合わせ, メカニスティック・エンハンスメント(TAME)を用いた標的的アンチ・オブファシケーションを提案する。
VIRL-39k、SPA-VL、および2つのモデルファミリの中で、TAMEはグループ相対政策最適化よりも最大30.9および16.7%のCoT監視性を改善している。
論文 参考訳(メタデータ) (2026-09-21T08:08:56Z) - Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems [1.7327102304628392]
Retrieval-Augmented Generation (RAG) は、Large Language Model (LLM) を外部知識で出力する。
本稿では,自然言語推論(NLI)の事実検証,関連性重み付けによる5信号毒素検出,信頼指数T = 0.4 F + 0.35 C + 0.25 (1 - P) を組み合わせた評価エージェントを提案する。
Llama 3.3 70BのTrathfulQAでは、エージェントは91%の精度と100%の精度に達し、インストラクションインジェクションで100%リコールされる。
論文 参考訳(メタデータ) (2026-08-21T13:42:41Z) - Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation [2.1734195143282693]
我々は,n = 独立ロールアウトとc = 完全パスロールアウト(タスク,エージェント)ペアで適用したのと同じ推定器であるReliability@kを提案する。
機能的正当性がセキュリティの安全性を示唆しないという証拠によって、セキュリティ調整された信頼性も提案する。
論文 参考訳(メタデータ) (2026-08-11T16:01:15Z) - A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use [28.57781785937644]
PRISMS(Probing Representations In Support of Monitoring and Steering)は,スパース検出とアクティベーションの間に障害特異的ニューロンベースを共有するクローズループフレームワークである。
6つのモデル全体で、PRISMSはプールされたオーバーコール率を80%削減し、ツール要求の精度を14.2%向上させた。
論文 参考訳(メタデータ) (2026-07-31T19:03:44Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Malicious Agent Detection for Robust Multi-Agent Collaborative Perception [52.261231738242266]
多エージェント協調(MAC)知覚は、単エージェント認識よりも敵攻撃に対して脆弱である。
MAC知覚に特異的な反応防御であるMADE(Malicious Agent Detection)を提案する。
我々は、ベンチマーク3DデータセットV2X-simとリアルタイムデータセットDAIR-V2Xで包括的な評価を行う。
論文 参考訳(メタデータ) (2023-10-18T11:36:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。