論文の概要: Threat-Preserving Representation Sensitivity in Agent-Security Benchmarks
- arxiv url: http://arxiv.org/abs/2610.03585v1
- Date: Fri, 02 Oct 2026 16:55:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.494921
- Title: Threat-Preserving Representation Sensitivity in Agent-Security Benchmarks
- Title(参考訳): エージェントセキュリティベンチマークにおける脅威保存表現感度
- Abstract要約: LLMベースのエージェントのセキュリティベンチマークでは、しばしばモデル堅牢性の尺度として攻撃成功率(ASR)を報告している。
脅威保存表現感度(TPRS)を導入し,エージェント可視表現を変更すると,ASRがどの程度変化するかを測定する。
その結果、1つの表現の下で測定されたセキュリティスコアは、同一のセキュリティ問題の脅威保存表現をまたいだ一般化に失敗する可能性が示唆された。
- 参考スコア(独自算出の注目度): 5.556549314359057
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Security benchmarks for LLM-based agents often report the attack success rate (ASR) as a measure of model robustness and use these scores to compare different models and defense mechanisms, assuming that they describe the security of the agent. In this paper, we explore whether it also influences the benchmark's measurement. To measure the effect of the benchmark representation, we introduce threat-preserving representation sensitivity (TPRS), which measures how much the ASR changes when we change the agent-visible representation while holding the underlying task, harmful action, security policy, ground truth, environment, and the evaluation criteria fixed. On Agent Security Bench (ASB), replacing threat-related tool names with threat-neutral names raises the committed attack success rate by 11.67 percentage points on GPT-5-mini and by 13.21 points on Claude Haiku 4.5. On MCPTox, replacing the original neutral tool name with an explicit threat-related name lowers the ASR by 11.00 percentage points on GPT-5-mini and 4.11 points on Claude Haiku 4.5. On AgentDojo, adding threat-related wording to the attack-relevant tool changes ASR by only 0.50 percentage points on GPT-4o-mini, yet the benign utility falls by 5.36 points on tasks requiring that tool. We ran an experiment on MCPTox where we observed that a threat-neutral name matched on token count, length, and casing reproduces most of the shift produced by the threat-explicit name (8.54 of 11.00 points on GPT-5-mini). The results show that a security score measured under one representation may fail to generalize across threat-preserving representations of the same security problem. Robustness claims should therefore be supported by performance across a controlled set of threat-preserving representations rather than relying on a single representation-dependent score.
- Abstract(参考訳): LLMベースのエージェントのセキュリティベンチマークは、しばしば攻撃成功率(ASR)をモデル堅牢性の尺度として報告し、エージェントのセキュリティを記述すると仮定して、これらのスコアを使用して異なるモデルと防御メカニズムを比較する。
本稿では,それがベンチマークの測定にも影響を及ぼすかどうかを考察する。
ベンチマーク表現の効果を測定するため,脅威保存表現感度 (TPRS) を導入し,エージェント可視表現を変化させる際,エージェント可視表現がどの程度変化するかを測定する。
エージェントセキュリティベンチ(ASB)では、脅威関連ツール名を脅威中立名に置き換えることで、GPT-5-miniで11.67ポイント、Claude Haiku 4.5で13.21ポイントの攻撃成功率が上昇する。
MCPToxでは、元の中立ツール名を明示的な脅威関連名に置き換えると、GPT-5-miniでは11.00ポイント、Claude Haiku 4.5では4.11ポイント低下する。
AgentDojoでは、攻撃関連ツールに脅威関連用語を追加すると、GPT-4o-miniでASRがわずか0.50ポイント変更されるが、そのツールを必要とするタスクでは、良質なユーティリティが5.36ポイント低下する。
我々はMCPToxで実験を行い、脅威ニュートラルな名前がトークン数、長さ、ケーシングと一致しているのを観察した(GPT-5-miniで11.00点中8.54点)。
その結果、1つの表現の下で測定されたセキュリティスコアは、同一のセキュリティ問題の脅威保存表現をまたいだ一般化に失敗する可能性が示唆された。
したがってロバストネスのクレームは、単一の表現依存スコアに頼るのではなく、制御された脅威保存表現のセットのパフォーマンスによってサポートされるべきである。
関連論文リスト
- AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents [13.557645845585776]
大規模な言語モデルの安全性の整合性は、要求に答えるか拒否するかに大きく取り組まれている。
エージェント的設定では、同じモデルが実行中にパーミッションクリティカルな証拠として振る舞うかどうかを判断しなければならない。
AgentBoundは、ツール使用エージェントの安全性のための、最初の4方向の対物生成・評価フレームワークである。
論文 参考訳(メタデータ) (2026-09-27T15:19:52Z) - MemSentry: A Framework for Detecting Persistent Memory Poisoning in Agentic AI [0.0]
提案する永続メモリ書き込みをインターセプトし,決定論的アクセプション,レビュー,あるいはQuantine決定を生成するフレームワークであるMemSentryを提示する。
MemSentryは、ソース信頼、セマンティックリスク、コンポーネント依存DAGに対する攻撃半径、アクセスリスク、署名されたセキュリティ状態デルタを共同で検討することで、各書き込みを評価する。
SBERT+LRは91.7%の精度と0.908のマクロF1スコアで最高性能を達成し、4つの手法はすべて外部の隔離クラスの脅威を100%検出した。
論文 参考訳(メタデータ) (2026-09-08T13:40:13Z) - EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - Discovering Agentic Safety Specifications from 1-Bit Danger Signals [6.599344783327054]
EPO-Safeは、エージェントが反復的にアクションプランを生成し、スパースバイナリ警告を受け取り、リフレクションを通じて自然言語の振る舞い仕様を進化させるフレームワークである。
EPO-Safeは、構造化された低次元環境において、厳格に貧弱な信号から安全推論を行うことができることを示す。
標準的な報酬駆動リフレクションは安全性を積極的に低下させ、リフレクションを専用の安全チャンネルと組み合わせなければならないことを示す。
論文 参考訳(メタデータ) (2026-04-25T08:35:36Z) - SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment [19.947119280467934]
セーフハーネス(Safeharness)は、4つの防衛レイヤがエージェントライフサイクルに直接織られるセキュリティアーキテクチャである。
ベンチマークデータセットの安全性を、多様なハーネス構成で評価する。
論文 参考訳(メタデータ) (2026-04-15T08:59:00Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z) - Safety Margins for Reinforcement Learning [53.10194953873209]
安全マージンを生成するためにプロキシ臨界度メトリクスをどのように活用するかを示す。
Atari 環境での APE-X と A3C からの学習方針に対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-07-25T16:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。