論文の概要: The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions
- arxiv url: http://arxiv.org/abs/2608.27009v1
- Date: Thu, 27 Aug 2026 11:55:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.378167
- Title: The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions
- Title(参考訳): ウルフを非難するガードレールは、いかにしてエージェントガードレールが合法的な行動を避けているか
- Abstract要約: Cautious Benchは、エージェントガードレールの構成を過度に安全にするための最初のベンチマークである。
ビルドタイムゲートは、すべての例を再帰して認証するので、各ラベルはポリシーの機械的な結果である。
それぞれが認証されたアクションを、怖いオブジェクト名の下でより頻繁に、過度に排除します。
- 参考スコア(独自算出の注目度): 12.920644711310109
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Agent guardrails are checks that approve or refuse each action before an LLM executes it. Sometimes they refuse requests that are genuinely safe. This over-safety blocks deployment when a guardrail refuses an authorized task. Evaluating over-safety is hard: at the boundary an authorized action resembles an unauthorized one, and the safe-versus-unsafe label is a choice of authorization policy, not fixed by the action alone. We argue it therefore requires a benchmark that does not yet exist, one that maps the decision boundary of an ideal guardrail. Harvesting such a benchmark from real data is impractical: boundary cases are hard to collect, their labels hard to verify. The gap is real, so we construct Cautious Bench, the first benchmark to make over-safety the construct for agent guardrails; it codesigns each sample and its label with a stated authorization policy. A build-time gate re-derives every example to certify it, so each label is a mechanical consequence of the policy rather than an annotator's per-sample verdict, a reference against which researchers can measure real guardrails. The benchmark renders 756 Decidable benign/twin pairs, each under three object-name types (2,268 measured pairs), and 40 Undecidable pairs reported separately. Measuring six guardrails from five designs, we find a name-superstition effect: each over-refuses an authorized action more often under a scary-looking object name than a benign one. Since only the object name varies in the aforementioned contrast experiments, the deviation is the name's doing: the guardrails read the surface label, not the authorization context.
- Abstract(参考訳): エージェントガードレールは、LSMが実行する前に各アクションを承認または拒否するチェックである。
真に安全な要求を拒否することもある。
この過度な安全は、ガードレールが承認されたタスクを拒否した場合、デプロイメントをブロックする。
過度な安全を評価することは難しい - 境界において、認可された行動は、許可されていない行動に似ており、安全でないラベルは、行動だけでは固定されない、認可ポリシーの選択である。
したがって、まだ存在しないベンチマークが必要であり、理想的なガードレールの決定境界をマッピングする必要がある、と我々は主張する。
境界ケースの収集は困難であり、ラベルの検証は困難である。
ギャップは本物なので、エージェントガードレールの構成を過度に安全にするための最初のベンチマークであるCautious Benchを構築します。
ビルドタイムゲートは、すべての例を再帰して認証するので、各ラベルは、アノテータのサンプルごとの評定ではなく、実際のガードレールを測定するための基準であるポリシーの機械的な結果である。
ベンチマークでは756個の決定可能なベニグナ/ツインペアを、それぞれ3つのオブジェクト名タイプ(2,268個の測定ペア)と40個の決定不可能ペアを別々に報告している。
5つのデザインから6つのガードレールを測定すると、名前の優越効果が見つかります。
オブジェクト名だけが上記のコントラスト実験で異なるため、逸脱は名前のとおりである:ガードレールは、認証コンテキストではなく、表面ラベルを読み取る。
関連論文リスト
- Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails [24.794304039477495]
ガードレールの実際の安全のシェアは、そのすべてから本質的には、どれにも及ばない。
ガードブロックがモデルの応答を置き換えるため、スプリットは余分なコストでリカバリ可能である。
論文 参考訳(メタデータ) (2026-08-09T11:19:30Z) - Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit [0.0]
本稿では, 宣言的契約により, エージェントが自身の境界を公開し, 軌跡が生成される, 集合時間意味的自己分離を提案する。
エージェントはその推測を名付けるので、レビュアーは名前で無効にすることができます。
次に、宣言を削除して生き残るものについて尋ねる。カットポイントが仮説ではなく、モデルが行動ブロックを2倍の確率で支配仮説に属性付けする。
コードブラインドアノテータは、ランダム配置が11.5と一致し、機械的なテストを行う。
論文 参考訳(メタデータ) (2026-08-03T14:27:58Z) - Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents [0.0]
エージェントのレッドチームベンチマークは、インジェクトされたエージェントが単一ビットとして侵入されたかどうかを報告している。
このバイナリ・アタック・サクセス・レートは、ディフェンダーが最も必要とする情報、すなわち、結果として生じるアクションがどれほど有害であるかを破棄する。
本研究では,7段階の順序尺度(L0〜L6)でエージェントのツールコール軌跡をスコアし,実行された動作が可逆性であったか,他者への到達範囲を超えたか,特権を拡大したかに応じて,アクショングレード調和ルーリックを導入する。
論文 参考訳(メタデータ) (2026-07-08T14:38:01Z) - Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human [0.0]
エージェントは不可逆的な行動をとるので、標準的な安全パターンは、ループ内の人間承認ゲートである。
ゲートは容易な部分であり、難しい部分は、フィールドが2つの誤った仮定に対して評価する判断(どの行動を止めるか)である。
我々の貢献はオープンソースのエージェント監視システムであり、LLMエージェントアクションゲーティング環境でそれらを運用し、測定する。
論文 参考訳(メタデータ) (2026-06-08T01:52:22Z) - ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails [57.25411733152009]
推論に基づくガードレールは、最終的な決定を下す前に明確な合理性を生成することによって安全性のモデレーションを改善する。
モデルは、その推論において有害な意図を認識することができるが、それでも安全なラベルを予測したり、政策を根拠とした正当化なしに安全でない決定を下す。
推論に基づくガードレールのための一貫性を考慮したフレームワークであるConsisGuardを提案する。
論文 参考訳(メタデータ) (2026-05-29T09:42:08Z) - AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents [0.2864713389096699]
本稿では,AgentSecBenchを,この問題に対する正式なセキュリティフレームワークの実証的なインスタンス化として紹介する。
3つのゲーム・インストラクション・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)を定めている。
これは、承認された観察と能力に対するプロジェクションとしてのアプリケーションポリシーを表し、プロジェクションの即時アノテーションとプロジェクションの強化を区別し、敵のアドバンテージと、防衛が生成前に関連するモデル可視チャネルを閉鎖するかどうかを計測する。
論文 参考訳(メタデータ) (2026-05-25T18:53:22Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Bag of Tricks for Subverting Reasoning-based Safety Guardrails [62.139297207938036]
推論に基づくガードレールを覆い隠すジェイルブレイク手法の袋を提示する。
攻撃対象は白、グレー、ブラックボックスの設定で、無駄なテンプレート操作から完全に自動化された最適化までさまざまです。
論文 参考訳(メタデータ) (2025-10-13T16:16:44Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z) - Certifying LLM Safety against Adversarial Prompting [70.96868018621167]
大規模言語モデル(LLM)は、入力プロンプトに悪意のあるトークンを追加する敵攻撃に対して脆弱である。
我々は,認証された安全保証とともに,敵のプロンプトを防御する最初の枠組みである消去・チェックを導入する。
論文 参考訳(メタデータ) (2023-09-06T04:37:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。