論文の概要: Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring
- arxiv url: http://arxiv.org/abs/2607.02121v1
- Date: Thu, 02 Jul 2026 12:59:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.834618
- Title: Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring
- Title(参考訳): 拒絶の背景:行動モニタリングによるガードレールの活性化決定
- Authors: William Hackett, Peter Garraghan,
- Abstract要約: 悪意のある命令を検出してブロックするガードレールシステムは、AIセキュリティの重要なコンポーネントである。
対象AIシステム内にガードレールが存在することを検知する最初のブラックボックスガードレール偵察手法を提案する。
- 参考スコア(独自算出の注目度): 1.1391142149008149
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As Large Language Models (LLMs) and agentic systems become integrated into real-world applications, ensuring their safety and security is critical. Guardrail systems that detect and block malicious instructions sent to and from an LLM are an essential component of AI security. However, researchers conducting black-box adversarial emulation against production AI systems often struggle to determine whether a guardrail block or an LLM rejection has occurred. This distinction is important because the techniques used to bypass guardrails can differ substantially from those used to bypass LLM safety alignment, and has a material impact on attack technique selection and optimization. We propose the first black-box guardrail reconnaissance methodology, which detects the presence of a guardrail within a target AI system through behavioral monitoring of HTTP, lexical, and timing signals, assuming only black-box access and zero prior knowledge of the guardrail or AI system. Experiments demonstrate that our approach detects guardrail presence with 100% accuracy, with statistically significant behavioral separation between benign and malicious interactions (q < 0.001). Our approach further identifies the content categories a guardrail is designed to block, and distinguishes guardrail blocks from LLM rejection on unseen prompts with an average F1 score of 98%.
- Abstract(参考訳): 大規模言語モデル(LLM)とエージェントシステムが現実世界のアプリケーションに統合されるにつれて、安全性とセキュリティが重要になる。
LLMに送信された悪意ある命令を検知し、ブロックするガードレールシステムは、AIセキュリティの重要なコンポーネントである。
しかし、生産AIシステムに対するブラックボックスの敵エミュレーションを行う研究者は、ガードレールブロックやLDMの拒絶が発生したかどうかを判断するのに苦労することが多い。
ガードレールをバイパスする技術は、LLMの安全アライメントをバイパスする技術とは大きく異なり、攻撃技術の選択と最適化に大きな影響を及ぼすため、この区別は重要である。
我々は,HTTP,語彙,タイミング信号の動作監視を通じて,目標AIシステム内のガードレールの存在を検知し,ブラックボックスアクセスのみを仮定し,ガードレールやAIシステムの事前知識をゼロにする,最初のブラックボックスガードレール偵察手法を提案する。
実験により,本手法は良性相互作用と悪意相互作用(q < 0.001)を統計的に有意に分離し,100%の精度でガードレールの存在を検出する。
提案手法は,ガードレールがブロックするように設計したコンテンツカテゴリをさらに特定し,平均98%のF1スコアを持つ未確認プロンプトに対するLDM拒絶ブロックとガードレールブロックを区別する。
関連論文リスト
- Prompt Overflow: What the Guardrail Inspects Is Not What the Model Infers [22.77036856603702]
Guardrailモデルは、大きな言語モデル(LLM)に到達する前に、ユーザ入力をスクリーニングするために広くデプロイされます。
本稿では,ガードレールモデルの限られた検査窓と下流LLMのかなり大きなコンテキスト推論窓とのミスマッチを利用した,プロンプトオーバーフロー攻撃を提案する。
ショートコンテクスト設定で確実に検出されたプロンプトは、オーバーロング入力に逆向きに操作するとガードレールモデルを回避することができることを示す。
論文 参考訳(メタデータ) (2026-05-22T03:27:18Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Black-Box Guardrail Reverse-engineering Attack [12.937652779951156]
ブラックボックスLLMガードレールのリバースエンジニアリング攻撃に関する最初の研究を行った。
強化学習に基づくフレームワークであるガードレールリバースエンジニアリングアタック(GRA)を提案する。
GRAは、APIコストが85ドル未満で、規則マッチングレートが0.92を超えている。
論文 参考訳(メタデータ) (2025-11-06T09:24:49Z) - PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents [60.23552141928126]
PSG-AgentはLLMベースのエージェントのためのパーソナライズされた動的システムである。
まずPSG-Agentは、安定した特性のために相互作用履歴をマイニングすることでパーソナライズされたガードレールを作成する。
第二に、PSG-Agentは特別なガードでエージェントパイプラインを横断する継続的監視を実装している。
論文 参考訳(メタデータ) (2025-09-28T03:31:59Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Bypassing LLM Guardrails: An Empirical Analysis of Evasion Attacks against Prompt Injection and Jailbreak Detection Systems [4.225223514207515]
大規模言語モデル(LLM)ガードレールシステムは、迅速な注入や脱獄攻撃を防ぐために設計されている。
本稿では, 点検と脱獄検出の2つの方法を示す。
両手法が対向ユーティリティを維持しながら検出を回避できることを示す。
論文 参考訳(メタデータ) (2025-04-15T13:16:02Z) - Attention Tracker: Detecting Prompt Injection Attacks in LLMs [62.247841717696765]
大型言語モデル (LLM) は様々なドメインに革命をもたらしたが、インジェクション攻撃に弱いままである。
そこで本研究では,特定の注意点が本来の指示から注入指示へと焦点を移す,注意散逸効果の概念を紹介した。
本研究では,アテンション・トラッカーを提案する。アテンション・トラッカーは,インジェクション・アタックを検出するために,インストラクション上の注意パターンを追跡する訓練不要な検出手法である。
論文 参考訳(メタデータ) (2024-11-01T04:05:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。