論文の概要: SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI
- arxiv url: http://arxiv.org/abs/2607.22926v1
- Date: Fri, 24 Jul 2026 21:36:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.929832
- Title: SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI
- Title(参考訳): SAGE:高信頼な生成AIのライフサイクル管理を検証するための安全第一のディフェンディング・イン・ディースガードレール
- Authors: Mahdi Eslamimehr,
- Abstract要約: SAGEは安全第一、認可分離アーキテクチャである。
署名されたリリースマニフェスト、多様な検知器、堅牢なリスクエンベロープ、最小リスクデフォルト、アウトプットチェック、保護された監査チェーン、封じ込め、ロールバックを組み合わせる。
正式な結果は、安全性の優先、保守的な検出器境界、モノトーン放出ゲーティング、タンパー証拠記録、認可カットを確立する。
- 参考スコア(独自算出の注目度): 0.152292571922932
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-impact generative AI makes catastrophic misuse a lifecycle-control problem, not merely a prompt-filtering problem. SAGE is a safety-first, authorization-separated architecture in which credible catastrophic-enablement risk constrains admissibility before utility, latency, or commercial objectives are considered. It combines signed release manifests, diverse detectors, robust risk envelopes, least-risk defaults, output checking, three-valued monitoring, protected audit chains, containment, and rollback. Formal results establish safety priority, conservative detector bounds, monotone release gating, tamper-evident records, and an authorization cut; two PRISM abstractions verify authorization separation and lifecycle invariants under explicit assumptions. A frozen, vendor-symmetric study sent 84 cases to each of four GPT, four Claude, and two Gemini snapshots: 840 calls yielded 794 target responses, 46 provider errors, and 449 successful judgments covering 375 responses. Eight snapshots had complete judged domain coverage. Harmful-compliance estimates were low; variation arose mainly from benign utility and safe redirection. Seven multiplicity-adjusted contrasts involving Claude, Gemini, or GPT-5 snapshots and the GPT-5 mini and GPT-5 nano snapshots were supported, while no tested contrast between the Claude or Gemini snapshots and GPT-5 or GPT-5.5 survived correction. The observed harmful-compliance range is a conservative, protocol-bound view from one generation per prompt with no tools, retrieval, history, or human adjudication; it is not an upper bound on operational assistance. A preregistered extension specifies how to test a wider best-worst gap using a locked split, repeated sampling, multi-turn and sandboxed-tool conditions, and domain-expert scoring.
- Abstract(参考訳): 高インパクト生成AIは、破滅的な誤用をライフサイクルコントロールの問題にします。
SAGEは安全第一の、認可分離アーキテクチャであり、信頼性の高い破滅的なリスクは、実用性、レイテンシ、商用目的よりも前に許容性を制限する。
署名されたリリースマニフェスト、多様な検知器、堅牢なリスクエンベロープ、最小リスクデフォルト、アウトプットチェック、3値監視、3値監視、保護された監査チェーン、封じ込め、ロールバックを組み合わせたものだ。
2つのPRISM抽象化は、明示的な仮定の下で、認証分離とライフサイクル不変性を検証している。
凍結したベンダー対称の調査では、4つのGPT、4つのClaude、2つのGeminiスナップショットそれぞれに84のケースが送信された。
8枚のスナップショットがドメインカバレッジを判定した。
悪質なコンプライアンスの見積もりは低く、主に良質なユーティリティと安全なリダイレクトから変化が生じた。
クロード、ジェミニ、GPT-5のスナップショット、GPT-5のミニとGPT-5のナノスナップショットを含む7つの多重度調整されたコントラストがサポートされたが、クロードとジェミニのスナップショットとGPT-5またはGPT-5.5の間のテストされたコントラストのコントラストは残っていない。
観察された有害な順応範囲は、ツール、検索、歴史、または人間の適応のないプロンプト毎の1世代からの保守的でプロトコルに縛られた視点であり、運用支援の上限ではない。
事前登録された拡張は、ロックされたスプリット、繰り返しサンプリング、マルチターンおよびサンドボックス付きツール条件、ドメインエキスパートスコアを使用して、より広いベストワーストギャップをテストする方法を指定する。
関連論文リスト
- Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense [37.10272384523361]
我々は、各検出器のサンプルごとの信頼性と遅延を、同様の過去の入力に対する動作から予測するためのフレームワークを開発する。
SCOUT-450は、古いプロンプトインジェクションが表現下にある構造的に複雑でエージェント対応のインジェクションをキャプチャするベンチマークである。
SCOUT-450では、安全指向の動作点が攻撃発生率を46%減らし、壁時計全体の40%減らした。
論文 参考訳(メタデータ) (2026-05-29T04:49:20Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Acceptance Cards:A Four-Diagnostic Standard for Safe Fine-Tuning Defense Claims [0.6882042556551609]
本稿では,評価プロトコルであるアクセプタンスカード,文書オブジェクト,実行可能監査パッケージ,クレーム固有の明細調整型ディフェンスクレームのための明細書標準について紹介する。
このプロトコルは、ギャップ低減をフルカードパスとして扱う前に、統計的信頼性、新鮮なセマンティック一般化、メカニズムアライメント、およびクロスタスク転送をチェックする。
これは1つのモデルファミリ上の狭いインストールギャップ監査であり、SafeLoRAの有効性のグローバルな判断ではない。
論文 参考訳(メタデータ) (2026-05-11T13:48:42Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Broken by Default: A Formal Verification Study of Security Vulnerabilities in AI-Generated Code [0.0]
Broken by Defaultは、500のセキュリティクリティカルなプロンプトにまたがる7つの広くデプロイされたLLMによって生成される3500のコードアーティファクトの正式な検証研究である。
すべてのモデル全体で、55.8%のアーティファクトは少なくとも1つのCOBALT識別された脆弱性を含んでいる。
GPT-4oは62.4%(グレードF)、Gemini 2.5 Flashは48.4%(グレードD)である。
論文 参考訳(メタデータ) (2026-04-07T00:55:42Z) - TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol [1.0195618602298684]
TraceGuardは5次元にわたるエージェントアクションを評価する構造化多次元監視プロトコルである。
オープンソースのControlArenaフレームワーク用の新しいモニタタイプとして実装されている。
論文 参考訳(メタデータ) (2026-04-05T05:05:59Z) - Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away [97.11976870616273]
本稿では,安全回復を目的ではなく満足度の高い制約として扱う軽量な推論時防衛法を提案する。
6つのオープンソースMLRMと4つのjailbreakベンチマークで評価した結果、SafeThinkは攻撃成功率を30~60%削減しました。
論文 参考訳(メタデータ) (2026-02-11T18:09:17Z) - ProGuard: Towards Proactive Multimodal Safeguard [48.89789547707647]
ProGuardは視覚言語プロアクティブガードであり、アウト・オブ・ディストリビューション(OOD)の安全性リスクを特定し記述する。
まず,2次安全ラベルとリスクカテゴリの両方を付加した87Kサンプルのモダリティバランスデータセットを構築した。
次に、強化学習を通して視覚言語ベースモデルを純粋に訓練し、効率的かつ簡潔な推論を実現する。
論文 参考訳(メタデータ) (2025-12-29T16:13:23Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - GSAE: Graph-Regularized Sparse Autoencoders for Robust LLM Safety Steering [5.124731939041066]
大規模言語モデル(LLM)は、敵のプロンプトやジェイルブレイク攻撃を通じて有害なコンテンツを生成するように操作できるため、重要な安全上の課題に直面している。
グラフ正規化スパースオートエンコーダ (GSAE) を導入し, ニューロン共活性化グラフ上にラプラシアンスムーズネスペナルティを持つSAEを拡張した。
GSAEは, 効果的な安全ステアリング, 特徴を重み付けした安全関連方向に組み立て, 2段階のゲーティング機構で制御できることを実証した。
論文 参考訳(メタデータ) (2025-12-07T04:46:30Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。