論文の概要: Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems
- arxiv url: http://arxiv.org/abs/2607.20005v1
- Date: Wed, 22 Jul 2026 10:43:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.06009
- Title: Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems
- Title(参考訳): マイクロサービスシステムにおけるリスク拘束型介入決定としての安全対策
- Authors: Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang,
- Abstract要約: 現代のITオペレーション(IT-Ops)では、不正な修理のコストは、アクションのコストをまったく上回ることが多い。
このギャップを埋めるためには, (i) リスク制約のある介入決定問題として安全な修復を再構築し, (ii) 三次元的リスク分解を導入し, (iii) コンテキスト適応型ヒューマン・イン・ザ・ループ(HITL)ゲートを設計し, バイナリ・フェイルセーフから帯域幅対応制御層に転換する。
- 参考スコア(独自算出の注目度): 2.1686718805804976
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In modern IT operations (IT-Ops), the cost of an incorrect repair often exceeds the cost of no action at all. Yet existing automated remediation systems are designed to generate actions rather than to decide whether intervention is warranted, leaving safety as an afterthought enforced by manual approval. This paper makes three contributions to close this gap: (i) we reformulate safe remediation as a risk-constrained intervention decision problem and cast it as a Constrained Markov Decision Process (CMDP), in which the agent maximizes repair success subject to a bounded false remediation rate (FRR); (ii) we introduce a three-dimensional risk decomposition comprising blast radius, reversibility, and epistemic uncertainty, providing operators with an interpretable per-action safety interface; and (iii) we design a context-adaptive human-in-the-loop (HITL) gate that turns escalation from a binary failsafe into a bandwidth-aware control layer responsive to on-call load and business criticality. The full policy is learned offline from historical incident logs, enabling explicit control of the expected FRR. Experiments on the Train Ticket microservice benchmark with Chaos Mesh fault injection and an RCAEval-aligned fault taxonomy show that our framework reduces FRR by 39% while improving repair success by 2.5 points over a strong runbook baseline, and reduces on-call escalation load by 17% relative to a fixed-threshold variant.
- Abstract(参考訳): 現代のITオペレーション(IT-Ops)では、不正な修理のコストは、アクションのコストをまったく上回ることが多い。
しかし、既存の自動修復システムは、介入が保証されているかどうかを判断するよりも、手動による承認によって実施された後回しとして安全を保ちながら行動を起こすように設計されている。
本稿では,このギャップを埋めるために3つの貢献をする。
一 リスク制約付き介入決定問題として安全修復を改定し、これを制限付きマルコフ決定プロセス(CMDP)とみなし、そのエージェントが限界付き偽修復率(FRR)による修理成功を最大化する。
(二)爆発半径、可逆性及びてんかん不確実性を含む3次元リスク分解を導入し、オペレーターに解釈可能なアクションごとの安全インターフェースを提供する。
3) オンコール負荷とビジネスクリティカル性に応答して,エスカレーションをバイナリフェールセーフから帯域幅対応制御層に変換する,コンテキスト適応型Human-in-the-loop(HITL)ゲートを設計する。
完全なポリシーは、過去のインシデントログからオフラインで学習され、期待されるFRRを明示的に制御できる。
カオスメッシュのフォールトインジェクションとRCAEvalのフォールトタクトノミーを用いたTrain Ticketマイクロサービスベンチマークの実験では、当社のフレームワークはFRRを39%削減し、強いランブックベースライン上での修復成功を2.5ポイント改善し、固定閾値の変動に対してオンコールエスカレーション負荷を17%削減した。
関連論文リスト
- Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents [0.0]
Risk-Aware Causal Gating (RACG) は、モデルの予測から行動するか、延期するかを判断するフレームワークである。
RACGは、候補行動から結果への因果経路をモデル化し、予測された対実リスクに応じて各決定をゲートする。
RACGは,非ゲートポリシーの効用の大部分を保ちながら,コストエラーを大幅に低減することを示す。
論文 参考訳(メタデータ) (2026-06-11T20:19:35Z) - Adversarially Robust Control of Conditional Value-at-Risk via Rockafellar-Uryasev Conformal Inference [15.255874441202872]
CVaR(Conditional Value-at-Risk)を制御するオンライン分散フリーフレームワークを提案する。
古典的リスク制御法とは異なり、この手法は任意のデータ生成プロセス下で機能する非線形テールリスクに対して証明可能な安全保証を提供する。
論文 参考訳(メタデータ) (2026-05-29T19:52:36Z) - Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability [79.08785366532287]
部分観測可能性下でのリスク感応制御のための軽量なリスクゲート強化学習近似を提案する。
安全クリティカルな部分観測可能な2つの領域 – 自動グルコース調節と安全制約ナビゲーション – でアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-14T01:23:09Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services [0.0]
本稿では,銀行,金融サービス,保険のセキュリティ障害に対するリスク対応評価フレームワークを提案する。
我々は、金融害のドメイン固有の分類法、自動化されたマルチラウンド赤チームパイプライン、およびアンサンブルに基づく判断プロトコルを組み合わせる。
論文 参考訳(メタデータ) (2026-03-11T14:14:13Z) - Conformal Thinking: Risk Control for Reasoning on a Compute Budget [60.65072883773352]
大規模言語モデル(LLM)の推論により、トークンの予算が増加するにつれて、データセットレベルの精度が向上する。
我々は、予算設定問題をリスクコントロールとして再設定し、計算を最小化しながらエラー率を制限する。
我々のフレームワークは、モデルが自信のあるときに推論を停止する上位しきい値と、未解決のインスタンスを事前に停止させる新しい下位しきい値を導入する。
論文 参考訳(メタデータ) (2026-02-03T18:17:22Z) - Quantifying Return on Security Controls in LLM Systems [0.0]
本稿では、残留リスクを定量化するための意思決定指向フレームワークを提案する。
敵のプローブの結果を金融リスク推定と戻り制御の指標に変換する。
論文 参考訳(メタデータ) (2025-12-17T04:58:09Z) - Constraint-Aware Reinforcement Learning via Adaptive Action Scaling [6.6638441348404855]
本稿では,予測制約違反に基づいてエージェントの行動をスケールするモジュール型コスト認識レギュレータを提案する。
規制当局は、行動の抑制を回避しつつ、制約違反を最小限に抑えるよう訓練されている。
提案手法は, SAC や TD3 などの非政治的 RL 手法とシームレスに連携し, 安全ガイムの移動作業における最先端のリターン・ツー・コスト比を実現する。
論文 参考訳(メタデータ) (2025-10-13T14:59:28Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention [68.95008546581339]
Contrastive Decodingのような既存のデコーディングタイムの介入は、安全と応答品質の間に深刻なトレードオフを強いることが多い。
本稿では,3つの重要なコンポーネントを統合した,復号時安全アライメントのための新しいフレームワークであるCAREを提案する。
このフレームワークは、安全性、品質、効率のバランスが良く、有害な応答率が低く、ユーザエクスペリエンスを最小限に破壊できる。
論文 参考訳(メタデータ) (2025-09-01T04:50:02Z) - Uniformly Safe RL with Objective Suppression for Multi-Constraint Safety-Critical Applications [73.58451824894568]
広く採用されているCMDPモデルは予測のリスクを制約しており、長い尾の州で危険な行動を起こす余地がある。
安全クリティカルな領域では、そのような行動は破滅的な結果をもたらす可能性がある。
本稿では,目標を最大化するタスク報酬を適応的に抑制する新しい手法であるObjective Suppressionを提案する。
論文 参考訳(メタデータ) (2024-02-23T23:22:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。