論文の概要: ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents
- arxiv url: http://arxiv.org/abs/2608.21101v1
- Date: Fri, 21 Aug 2026 13:47:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.55911
- Title: ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents
- Title(参考訳): ClawSentry: 自律LLMエージェントの保護のためのプログレッシブなマルチティアセキュリティモニタ
- Abstract要約: 悪意のあるサードパーティのスキルにハイジャックされた単一のエージェントは、データの流出、特権のエスカレーション、カスケード妥協を引き起こす可能性がある。
我々は、エージェントランタイムのためのオープンソースのフレームワークに依存しないセキュリティ監視ゲートウェイであるClawSentryを紹介する。
- 参考スコア(独自算出の注目度): 24.540638169054812
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language model (LLM) agents move from conversation to executing code, reading local files, and orchestrating external tools, a single agent hijacked by a malicious third-party skill can cause data exfiltration, privilege escalation, or cascading compromise. We argue that agentic risk is progressive: it can enter at four loci of the agent control loop--skill admission, invocation-time intent, execution-time effect, and post-action consequence--while a denied dangerous objective can reappear across surface forms, tools, or turns; existing safeguards are typically local to one lifecycle boundary or one call. Guided by this threat model, we present ClawSentry, an open-source, framework-agnostic security supervision gateway for agent runtimes. Before a skill package is ever executed, First-use Skill Package Review (FSPR) audits it under a deterministic evidence floor, escalating unresolved cases to bounded read-only agentic review (locus A). At runtime, a three-tier progressive decision engine--a deterministic L1 layer, a rule-anchored L2 semantic reviewer, and a read-only L3 evidence-seeking agent--spends contextual review only on the residual ambiguity, while a session-level anti-bypass mechanism recognizes tool-switching and rephrased retries (loci B--C); a post-action path feeds high-severity evidence non-retroactively into later review (locus D). An Agent Harness Protocol (AHP) abstraction applies one policy across Codex, Claude Code, Kimi CLI, and Gemini CLI without modifying agent internals. On SkillInject with Codex/GPT-5.4, contextual ASR falls from 39.55% to 2.61% while contextual TSR moves only from 83.78% to 83.05%. Across five Work Agents on the full SkillsSafety benchmark, ClawSentry confines ASR to 9.09--15.03% from 33.5--49.7% unprotected, and aggregate TSR on clean skills remains 98.7%.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントが会話からコードの実行、ローカルファイルの読み込み、外部ツールのオーケストレーションに移行すると、悪意のあるサードパーティスキルによってハイジャックされた単一のエージェントがデータ消去、特権エスカレーション、カスケード妥協を引き起こす可能性がある。
エージェント・リスクは、エージェント・コントロール・ループの4つの領域に侵入することができる: スキル・ループの入場、起動時インテント、実行時効果、そしてポスト・アクションの結果である。
この脅威モデルによってガイドされたClawSentryは、エージェントランタイムのための、オープンソースのフレームワークに依存しないセキュリティ監視ゲートウェイである。
スキルパッケージが実行される前に、FSPR(First-use Skill Package Review)は決定論的エビデンスフロアの下でそれを監査し、未解決のケースを境界付き読み取り専用エージェントレビュー(locus A)にエスカレートする。
実行時に3段階のプログレッシブな決定エンジン - 決定論的L1層、ルールアンコールされたL2セマンティックレビュアー、読み取り専用L3エビデンス検索エージェント - 残余のあいまいさにのみコンテキストレビューをスプレッドし、セッションレベルのアンチバイパス機構はツールスイッチングとリフレッシュされたリトライ(loci B-C)を認識する。
Agent Harness Protocol(AHP)抽象化は、エージェント内部を変更することなく、Codex、Claude Code、Kimi CLI、Gemini CLIに1つのポリシーを適用する。
Codex/GPT-5.4のSkillInjectでは、文脈的ASRは39.55%から2.61%に低下し、文脈的TSRは83.78%から83.05%に低下する。
完全なスキルセーフティベンチマークの5つの作業エージェントの中で、ClawSentryはASRを33.5--49.7%から9.09--15.03%に制限し、クリーンスキルに関するTSRの集計は98.7%のままである。
関連論文リスト
- SIR: Self-improving Red-teaming for Compute Use Agents [71.71987044117371]
コンピュータ・ユース・エージェント(CUA、Computer use agent)は、マウス、キーボード、端末を通じて画面を認識し、実際のオペレーティングシステムに作用する視覚言語モデルである。
操作中に信頼できないコンテンツに晒されるため、間接的プロンプトインジェクション(IPI)に弱い。
SIRは,平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成するブラックボックスIPIアタックである。
論文 参考訳(メタデータ) (2026-08-31T03:39:43Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents [0.0]
12個の生産スタブに4つのサイレント障害プロファイルを注入する、軽量なブラックボックス監査フレームワークを導入する。
我々は,HSR(Honest Surrender),製造(FAR),不信の安全拒絶(Unfaithful Safety Refusal)が支配的であることを発見した。
USRは、システム内の安全語彙が政策論理を素数に促すと活性化される潜伏行動である。
論文 参考訳(メタデータ) (2026-07-21T13:23:05Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - SecureClaw: Clawing Back Control of LLM Agents [5.952015302242554]
ツールを使用する大規模言語モデル(LLM)エージェントは2つの異なるセキュリティ障害に直面している。
本稿では、エフェクトシンクに認証を配置し、リードバウンダリにプレーンテキストを閉じ込めるデュアルバウンダリアーキテクチャであるSecureClawを提案する。
AgentDojo、AgentLeak、Agent Security Bench (ASB)、SecureClawは、私たちが共通のハーネスで評価する唯一の防御です。
論文 参考訳(メタデータ) (2026-06-08T14:29:01Z) - AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use [2.9991161518367875]
AgentTrustは実行前にエージェントツールコールをインターセプトし、構造化されたバリデーションを返す。
6つのリスクカテゴリにまたがる300-scenarioベンチマークと、630が独立して構築された現実世界の敵シナリオです。
パッチされたルールセットで評価された630秒のベンチマークでは、AgentTrustは96.7%の精度を達成している。
論文 参考訳(メタデータ) (2026-05-06T11:38:16Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents [58.83028403414688]
大規模言語モデル(LLM)エージェントは、計画、メモリ、ツールの使用を組み合わせた多段階ワークフローを通じてタスクを実行する。
エージェントワークフローの特定のステージに注入されたバックドアトリガーは、複数の中間状態を通して持続し、下流出力に悪影響を及ぼす可能性がある。
LLMエージェントにおけるバックドア脅威を統一したエージェント中心のビューを提供するモジュールおよびステージアウェアフレームワークである textbfBackdoorAgent を提案する。
論文 参考訳(メタデータ) (2026-01-08T03:49:39Z) - Securing the Model Context Protocol: Defending LLMs Against Tool Poisoning and Adversarial Attacks [8.419049623790618]
本研究は,MPP統合システムに対するセマンティックアタックの3つのクラスを分析する。
ディスクリプタの整合性を強制するためのRSAベースのマニフェスト署名、不審なツール定義を検出するためのLLM-on-LLMセマンティックベッティング、実行時に異常なツール動作をブロックする軽量ガードレールである。
提案手法は, モデル微調整や内部修正を伴わずに, 安全でないツール実行率を低減できることを示す。
論文 参考訳(メタデータ) (2025-12-06T20:07:58Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。