論文の概要: Can AI Remediate Backend Failures Safely? GuardedAct with Blast-Radius-Aware Sandboxing
- arxiv url: http://arxiv.org/abs/2609.11264v1
- Date: Thu, 10 Sep 2026 08:58:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.27531
- Title: Can AI Remediate Backend Failures Safely? GuardedAct with Blast-Radius-Aware Sandboxing
- Title(参考訳): ブレスト・ラディウス・アウェアのサンドボックスでAIがバックアップの失敗を安全に防ぐことができるか?
- Abstract要約: GuardedActはサンドボックスファーストの修復フレームワークで、アクションジェネレータとプロダクション環境の間にブラスト・ラディウス対応の検証層を介在する。
我々は、DeathStarBenchソーシャルネットワークアプリケーションに注入された5つの障害シナリオについて、GuardedActを評価する。
- 参考スコア(独自算出の注目度): 3.809305837930236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have shown promising capabilities in generating remediation actions for microservice failures. However, directly executing AI-generated repair actions in production risks cascading collateral damage. We propose GuardedAct, a sandbox-first remediation framework that interposes a blast-radius-aware verification layer between the LLM action generator and the production environment. GuardedAct operates in four phases: (1) ingesting a diagnosis report together with the live system topology and recent telemetry, (2) prompting an LLM to produce a ranked list of candidate remediation actions, (3) simulating each action in a lightweight digital-twin sandbox that estimates the blast radius and assigns a risk label, and (4) enforcing a rollback-confidence gate that auto-executes only low-risk actions while escalating high-risk ones for human review. We evaluate GuardedAct on five fault scenarios injected into the DeathStarBench social-network application. Experimental results show that GuardedAct achieves an overall recovery rate of 87.4% while reducing collateral damage by 79.7% relative to direct LLM execution (from 25.6% to 5.2%), at the cost of a modest sandbox-induced increase in mean time to recovery (approximately 8 s). Ablation studies confirm that each component contributes meaningfully to the safety-speed trade-off.
- Abstract(参考訳): 大規模言語モデル(LLM)は、マイクロサービスの障害に対する修正アクションを生成する上で有望な機能を示している。
しかし、生産リスクにおいてAI生成の修復アクションを直接実行すると、横方向の損傷を発生させる。
本稿では, LLM アクションジェネレータと生産環境との間に, ブラスト・ラディウス・アウェア・検証層を介在するサンドボックスファースト修復フレームワークである GuardedAct を提案する。
GuardedActは,(1)ライブシステムトポロジと最近のテレメトリとともに診断レポートを取り込み,(2)LLMに候補修正行動のランクリストを作成するように促す,(3)爆発半径を推定してリスクラベルを割り当てる軽量デジタルツインサンドボックスで各アクションをシミュレートする,(4)低リスク行動のみを自動実行するロールバック信頼ゲートの実施,の4つのフェーズで機能する。
我々は、DeathStarBenchソーシャルネットワークアプリケーションに注入された5つの障害シナリオについて、GuardedActを評価する。
実験の結果、GardedActは、平均回復時間(約8秒)の緩やかなサンドボックスによる増加(約8秒)を犠牲にして、横行性損傷を79.7%減らし(25.6%から5.2%)、全体の回復率87.4%を達成した。
アブレーション研究は、各成分が安全-速度トレードオフに有意義に寄与することを確認する。
関連論文リスト
- StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing [80.39644823192113]
StepGuardは、完了したエージェントの軌跡を監査し、実行前にツールアクションをチェックするステップレベルのガードモデルである。
StepGuardは、GPT-5.4に匹敵するパフォーマンスで、オープンウェイトガードモデルの中で最高の平均精度を達成した。
AgentDojoとAgentDynのエージェントを保護するために使用される場合、StepGuardは平均攻撃成功率を77.3%削減する。
論文 参考訳(メタデータ) (2026-08-25T16:17:27Z) - REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems [21.484325207774166]
逆入力はエージェントと環境の間の相互作用を利用することができ、実行中にエージェントが安全ポリシーに違反する。
自律的なリピートと忠実な測定を行うためのフレームワークであるREDAgentBenchを紹介する。
明示的な安全制約と関連するエージェントシステム脆弱性から攻撃を導き、独立したサービスサンドボックスでそれらを実行し、サービスレシートと最終状態の変更による有害な影響を検証する。
論文 参考訳(メタデータ) (2026-08-11T08:48:54Z) - Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems [0.0]
エージェントスキルは実行可能な振る舞いとコンテキスト設定ドキュメンテーションの両方を公開する。
現実的な攻撃者は、監査と実行時のフィードバックを使って、繰り返しスキルを書き直すことができる。
Proteusは形式化された5軸スキルアタックスペースを検索する。
論文 参考訳(メタデータ) (2026-05-12T10:05:54Z) - LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments [26.85543164204341]
行動ジェイルブレイクは、敵がエージェントに危険なOSレベルの操作を不可逆的な結果で実行するように誘導する場所である。
既存のベンチマークでは、セマンティックレイヤ単独で安全性を評価したり、物理的レイヤの障害を欠いたり、テストケースの分離に失敗したりしている。
セマンティック物理二重検証機構とOSレベルの状態ロールバックにより,両方のギャップに対処するベンチマークLITMUSを提案する。
論文 参考訳(メタデータ) (2026-05-11T16:14:04Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - Quantifying Return on Security Controls in LLM Systems [0.0]
本稿では、残留リスクを定量化するための意思決定指向フレームワークを提案する。
敵のプローブの結果を金融リスク推定と戻り制御の指標に変換する。
論文 参考訳(メタデータ) (2025-12-17T04:58:09Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities [49.09703018511403]
大規模言語モデル(LLM)のリスクと能力の評価は、AIのリスク管理とガバナンスフレームワークにますます取り入れられている。
現在、ほとんどのリスク評価は、システムから有害な振る舞いを誘発する入力を設計することで実施されている。
本稿では,遅延活性化や重みへの修正が可能なモデル改ざん攻撃を用いたLCMの評価を提案する。
論文 参考訳(メタデータ) (2025-02-03T18:59:16Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z) - Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes [61.916827858666906]
大規模言語モデル(LLM)は、ユーザがクエリを入力し、LLMが回答を生成する、顕著な生成AIツールになりつつある。
害と誤用を減らすため、人間のフィードバックからの強化学習のような高度な訓練技術を用いて、これらのLLMを人間の価値に合わせる努力がなされている。
近年の研究では、組込み安全ガードレールを転覆させようとする敵のジェイルブレイクの試みに対するLLMの脆弱性を強調している。
本稿では,脱獄を検知するGradient Cuffという手法を提案する。
論文 参考訳(メタデータ) (2024-03-01T03:29:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。