論文の概要: When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models
- arxiv url: http://arxiv.org/abs/2605.02914v1
- Date: Wed, 08 Apr 2026 05:27:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 06:56:26.51663
- Title: When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models
- Title(参考訳): 安全幾何学の崩壊:エージェントガードモデルにおける微調整脆弱性
- Authors: Ismail Hossain, Sai Puppala, Jannatul Ferdaus, Md Jahangir Alam, Yoonpyo Lee, Syed Bahauddin Alam, Sajedul Talukder,
- Abstract要約: 完全な良性データに微調整されたガードモデルは、すべての安全アライメントを失う可能性がある。
本研究は, 潜伏した安全形状の破壊に起因していることを示す。
漁業用安全部分空間規則化を提案する。
- 参考スコア(独自算出の注目度): 0.9772267314090434
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A guard model fine-tuned on entirely benign data can lose all safety alignment -- not through adversarial manipulation, but through standard domain specialization. We demonstrate this failure across three purpose-built safety classifiers -- LlamaGuard, WildGuard, and Granite Guardian -- deployed as protection layers in agentic AI pipelines, and show that it originates in the destruction of latent safety geometry: the structured harmful -- benign representational boundary that guides classification. We extract per-layer safety subspaces via SVD on class-conditional activation differences and track how this boundary evolves under benign fine-tuning. Granite Guardian undergoes complete collapse -- refusal rate drops from 85\% to 0\%, CKA falls to zero, and 100\% of outputs become ambiguous -- a severity exceeding prior findings on general-purpose LLMs, explained by the specialization hypothesis: concentrated safety representations are efficient but catastrophically brittle. To mitigate this, we propose Fisher-Weighted Safety Subspace Regularization (FW-SSR), a training-time penalty combining (i) curvature-aware direction weights derived from diagonal Fisher information and (ii) an adaptive $λ_t$ that scales with task-safety gradient conflict. FW-SSR recovers 75\% refusal on Granite Guardian (CKA = 0.983) and reduces WildGuard's Attack Success Rate to 3.6\% -- below the unmodified baseline -- by actively sharpening the safety subspace rather than merely anchoring it. Across all three models, structural representational geometry (CKA, Fisher score) predicts safety behavior more reliably than absolute displacement metrics, establishing geometry-based monitoring as a necessary component of guard model evaluation in agentic deployments.
- Abstract(参考訳): 完全に良質なデータに微調整されたガードモデルは、敵の操作ではなく、標準的なドメインの特殊化によって、すべての安全アライメントを失う可能性がある。
LlamaGuard、WildGuard、Granite Guardianという3つの目的に構築された安全分類器でこの障害を実証し、エージェントAIパイプラインの保護層としてデプロイした。
クラス-条件のアクティベーション差についてSVDを用いて層間安全部分空間を抽出し、良質な微調整の下でこの境界がどのように進化するかを追跡する。
グラニット・ガーディアンは完全に崩壊する -- 拒絶率は85.%から0.%に低下し、CKAは0に低下し、100.%のアウトプットは曖昧になる -- 汎用LDMの事前の発見を上回る重大さが、特殊化仮説で説明されている: 集中した安全表現は効率的だが、破滅的に不安定である。
これを軽減するために,FW-SSR(Fisher-Weighted Safety Subspace Regularization)を提案する。
一 対角漁獲情報及び対角漁獲物から得られる曲率を考慮した方向重み
(ii)タスクセーフティ勾配競合でスケールする適応的な$λ_t$。
FW-SSRはGranite Guardian(CKA = 0.983)の75\%の拒絶を回復し、WildGuardのアタック成功率(修正されていないベースライン以下)を3.6\%に下げる。
これら3つのモデル全体で、構造表現幾何学(CKA, Fisher score)は絶対変位測定値よりも確実な安全性挙動を予測し、エージェント配置におけるガードモデル評価に必要なコンポーネントとして幾何学に基づくモニタリングを確立する。
関連論文リスト
- RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs [5.100622189286672]
下流タスクのための微調整型セーフティアライメント言語モデルは、拒否動作を著しく低下させる可能性がある。
本稿では,モデル適応時の安全関連構造を保存する表現レベルの微調整フレームワークREFUSALGUARDを紹介する。
論文 参考訳(メタデータ) (2026-05-03T14:48:18Z) - HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task [42.665798473119516]
CG-CoT(Context-Guided Chain-of-Thought)を特徴とするアーキテクチャ非依存型セーフガードを提案する。
CG-CoTは、リスクアセスメントをアクティブな知覚に分解し、相互作用対象や関連する空間近傍への注意を順次固定する。
実験により、我々のモデルであるHomeGuardは安全性を大幅に向上し、ベースモデルと比較してリスクマッチ率を30%以上改善することが示された。
論文 参考訳(メタデータ) (2026-03-15T13:09:43Z) - ProGuard: Towards Proactive Multimodal Safeguard [48.89789547707647]
ProGuardは視覚言語プロアクティブガードであり、アウト・オブ・ディストリビューション(OOD)の安全性リスクを特定し記述する。
まず,2次安全ラベルとリスクカテゴリの両方を付加した87Kサンプルのモダリティバランスデータセットを構築した。
次に、強化学習を通して視覚言語ベースモデルを純粋に訓練し、効率的かつ簡潔な推論を実現する。
論文 参考訳(メタデータ) (2025-12-29T16:13:23Z) - A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space [91.99501941169831]
GuardSpaceは、微調整全体を通して安全アライメントを維持するためのガードレールフレームワークである。
GSM8Kで微調整されたLlama-2-7B-Chatでは、ガードスペースは最先端のAsFTよりも優れている。
論文 参考訳(メタデータ) (2025-10-16T04:57:53Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - AlignGuard-LoRA: Alignment-Preserving Fine-Tuning via Fisher-Guided Decomposition and Riemannian-Geodesic Collision Regularization [6.5225344327304535]
低ランク適応(LoRA)は、大規模言語モデルを効率的に微調整するための標準ツールとなっている。
LoRA更新はアライメントドリフトを誘発し、安全性と行動制約を弱める。
ファインタニング時にアライメントを保存するための原則的フレームワークであるAlignGuard-LoRAを提案する。
論文 参考訳(メタデータ) (2025-08-04T05:45:24Z) - AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin [38.577959886489076]
大規模言語モデル(LLM)は、微調整中に安全性のリスクに対して脆弱である。
AsFT(Anchoring Safety in Fine-Tuning)と呼ばれる安全微調整手法を提案する。
論文 参考訳(メタデータ) (2025-06-10T05:59:48Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。