論文の概要: EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
- arxiv url: http://arxiv.org/abs/2609.05903v1
- Date: Sat, 05 Sep 2026 05:56:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 12:22:09.370853
- Title: EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
- Title(参考訳): EvoSafeHarness: 安全なエージェントのためのモデルとドメイン特有のハーネスの進化
- Abstract要約: EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
- 参考スコア(独自算出の注目度): 74.54929751174289
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents are turning language into real-world effects, making safety necessary against both indirect prompt injections and direct harmful requests. System-level safety harnesses add an enforcement layer beyond model-level defenses, but existing harnesses are usually designed once by experts and applied across heterogeneous models and domains. Effective protection is deployment-dependent: models differ in how much enforcement they need before utility declines, while domains differ in the effects, state, and action sequences that must be governed. A harness that is strict enough for one model may over-block another, and a policy that transfers across domains may miss application-specific safety relations. We present EvoSafeHarness, a safety-specific optimization framework that synthesizes a deployable harness for a frozen model in a target domain. It jointly searches a natural-language policy and executable code logic, guided by model behavior, domain specifications, and fresh-context adversarial review to reject benchmark-specific rules. Across four agent benchmark families, EvoSafeHarness achieves a stronger safety-utility frontier than fixed expert-designed defenses. On DecodingTrust-Agent, it reduces average attack success rate from 45.6% to 10.0% at a 3.3-point utility cost and achieves the best score in 14 of 15 cells. On AgentDojo, it reaches 82.8% utility at 0.0% ASR, twice CaMeL's utility at the same operating point, and transfers unchanged to unseen AgentDyn suites. It also achieves the best score on Agent-SafetyBench for every victim and keeps mean ASR below 20% under adaptive PAIR attacks with a refinement budget of 16. Analysis shows that domain semantics determine which safety relations and trajectory state are needed, while model and runtime behavior determine how and where those relations should be enforced.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、言語を現実世界のエフェクトにし、間接的なプロンプトインジェクションと直接的な有害なリクエストの両方に対して安全性を必要としています。
システムレベルの安全ハーネスは、モデルレベルの防御以上の強制レイヤを追加するが、既存のハーネスは通常、専門家によって一度設計され、異種モデルやドメインに適用される。
モデルではユーティリティが低下する前にどれだけの強制力が必要かが異なり、一方ドメインでは、管理しなければならないエフェクト、状態、アクションシーケンスが異なる。
あるモデルに十分な厳格なハーネスは、別のモデルに過剰にブロックされ、ドメイン間で転送されるポリシーは、アプリケーション固有の安全関係を見逃す可能性がある。
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルに対するデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
自然言語ポリシーと実行可能なコードロジックを共同で検索し、モデルビヘイビア、ドメイン仕様、新しいコンテキストの逆レビューによって、ベンチマーク固有のルールを拒否する。
4つのエージェントベンチマークファミリの中で、EvoSafeHarnessは、専門家が設計した固定された防御よりも強力な安全ユーティリティフロンティアを実現している。
DecodingTrust-Agentでは、平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に削減し、15セル中14セルで最高のスコアを得る。
AgentDojoでは、0.0% ASRで82.8%のユーティリティ、同じ運用ポイントでCaMeLの2倍のユーティリティに到達し、目に見えないAgentDynスイートに転送する。
また、ASRが適応的なPAIR攻撃を受けた場合、ASRの平均値を20%以下に維持し、改善予算は16。
分析により、ドメインセマンティクスはどの安全関係と軌道状態が必要かを決定する一方、モデルと実行時の振る舞いは、それらの関係がどこに、どこで強制されるべきかを決定する。
関連論文リスト
- BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents [20.217145643468598]
我々は、長距離ツール使用エージェントの軌道レベルの安全校正のためのベンチマークであるBlindspotを紹介する。
Blindspotは、適応的な対角的相互作用、ステートフルなツールの実行、実行に基づく適応を通じて、完全なユーザ-エージェント-環境トラジェクトリを評価する。
安全でない完成度, 適切な拒絶性, 便宜性, 過度な拒絶性, 繰り返し発生する頑健性, 拒絶後の失敗などをカバーする8つの指標を用いて, 13のプロプライエタリかつオープンウェイトLCMを評価した。
論文 参考訳(メタデータ) (2026-09-14T20:12:27Z) - HazardAuditor: From Executable Threats to Safer Computer-Use Agents [50.06351661912873]
既存のガードモデルは静的なプロンプトと応答をターゲットとしている。
既存の安全プラットフォームは、正規化された監督ではなく、ガードモデルで学ぶ必要がある評価判断を生成する。
両ギャップを埋める実行基盤フレームワークであるHazardAuditorを紹介します。
論文 参考訳(メタデータ) (2026-09-14T07:09:33Z) - HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety [45.163264704448125]
エージェントの安全性を6つの運用フェーズにまとめるライフサイクル指向ベンチマークを提案する。
実用性, 攻撃成功率, 永続性, 検出性を用いて各軌道の評価を行った。
明示的なリスク認識は、90%以上の実行中のリスクを検出する構成であるため、安全行動に確実に結びつくものではないことが分かっています。
論文 参考訳(メタデータ) (2026-08-18T10:03:58Z) - Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Spider-Sense: Intrinsic Risk Sensing for Efficient Agent Defense with Hierarchical Adaptive Screening [23.066685616914807]
効果的なエージェントセキュリティは、アーキテクチャ上の分離や強制よりも、本質的で選択的であるべきだ、と我々は主張する。
我々はスパイダーセンス・フレームワークを提案する。スパイダーセンス・フレームワークは、エージェントが潜伏警戒を維持し、リスク認識によってのみ防御をトリガーすることができる。
スパイダーセンスは、最低攻撃成功率(ASR)と偽陽性率(FPR)を達成して、競争力または優れた防御性能を達成する
論文 参考訳(メタデータ) (2026-02-05T07:11:05Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models [66.71948519280669]
MLRM(Multimodal Large Reasoning Models)は、クロスモーダルな推論を示すが、しばしば敵のプロンプトによる安全性のリスクを増幅する。
既存の防御は主に出力レベルで動作し、推論プロセスを制約せず、モデルは暗黙のリスクに置かれる。
4つのコンポーネントを統合し,表面レベルのフィルタリングを超える動的かつ解釈可能な安全性決定をサポートするSaFeR-VLMを提案する。
論文 参考訳(メタデータ) (2025-10-08T10:39:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。