論文の概要: Defenses at Odds: Measuring and Explaining Defense Conflicts in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.14514v1
- Date: Thu, 14 May 2026 07:58:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.69752
- Title: Defenses at Odds: Measuring and Explaining Defense Conflicts in Large Language Models
- Title(参考訳): Oddsにおける防衛 - 大規模言語モデルにおける防衛紛争の測定と説明
- Authors: Xiangtao Meng, Wenyu Chen, Chuanchao Zang, Xinyu Gao, Jianing Wang, Li Wang, Zheng Li, Shanqing Guo,
- Abstract要約: 本研究は, シーケンシャル展開下でのクロス・ディフェンス・インタラクションに関する最初の体系的研究である。
38.9%は、もともと防御された次元で測定可能なリスクの悪化を示す。
本稿では、シーケンシャルデプロイメント中に高複雑性層を選択的に凍結する軽量な緩和法を提案する。
- 参考スコア(独自算出の注目度): 21.944459747448974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) deployed in high-stakes applications must simultaneously manage multiple risks, yet existing defenses are almost exclusively evaluated in isolation under a one-shot deployment assumption. In practice, providers patch models incrementally throughout their lifecycle-responding to newly exposed vulnerabilities or targeted data-removal requests without retraining from scratch. This raises a fundamental but underexplored question: does a later defense preserve the protections established by an earlier one? We present the first systematic study of cross-defense interactions under sequential deployment. Evaluating 144 ordered sequences across three risk dimensions and three model families, we find that 38.9% exhibit measurable risk exacerbation on the originally defended dimension. These interactions are highly asymmetric and order-dependent. To explain these phenomena, we conduct a mechanistic analysis on representative deployment sequences. Using layer-wise representational divergence and activation patching, we localize each defense to a compact set of critical layers. In conflicting sequences, the overlapping critical layers exhibit strongly anti-aligned parameter updates, whereas benign orderings maintain near-orthogonal updates. PCA trajectory analysis reveals that defense collapse stems from activation pattern reversals in these shared layers. We further introduce a layer-wise conflict score that quantifies the geometric tension between defense-induced activation subspaces, offering mechanistic insight into the observed reversals. Guided by this diagnosis, we propose conflict-guided layer freezing, a lightweight mitigation that selectively freezes high-conflict layers during sequential deployment, preserving prior protections without degrading secondary defense performance.
- Abstract(参考訳): 大規模言語モデル(LLM)をハイリスクアプリケーションにデプロイするには,複数のリスクを同時に管理する必要がある。
実際には、スクラッチからリトレーニングすることなく、新たに公開された脆弱性やターゲットとするデータ削除要求に対応して、ライフサイクルを通じてモデルを段階的にパッチします。
これは根本的だが未解決の疑問を提起する: 後続の防衛隊は、以前の防衛隊が確立した保護を守りますか?
本研究は, シーケンシャル展開下でのクロス・ディフェンス・インタラクションに関する最初の体系的研究である。
3つのリスク次元と3つのモデルファミリーにわたる144の順序列を評価すると、38.9%がもともと防御された次元に対して測定可能なリスク悪化を示す。
これらの相互作用は高度に非対称で秩序に依存している。
これらの現象を説明するため、代表的な展開シーケンスの力学解析を行う。
レイヤワイドな表現分散とアクティベーションパッチを用いることで、各ディフェンスをコンパクトなクリティカルレイヤにローカライズする。
競合するシーケンスでは、重なり合う臨界層は強い反整合のパラメータ更新を示すが、良性順序はほぼ直交の更新を保持する。
PCA軌道解析により,これらの共有層における活性化パターン逆転による防御崩壊が明らかになった。
さらに、防衛により誘導される活性化部分空間間の幾何張力を定量化し、観測された逆転の力学的な洞察を与える階層的な競合スコアを導入する。
本報告では, 二次防御性能を低下させることなく, 高強度層を選択的に凍結する軽量な緩和策として, コンフリクト誘導層凍結法を提案する。
関連論文リスト
- TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - The Autonomy Tax: Defense Training Breaks LLM Agents [5.990318568221089]
安全を改善するために設計された防衛訓練は、高度な攻撃を防ぐのに失敗しながら、エージェントの能力を体系的に破壊する。
我々は,97件のエージェントタスクと1,000件の敵のプロンプトにまたがる無防備なベースラインに対する防御モデルの評価を行った。
その結果,現在の防衛パラダイムは,マルチステップエージェントを基本的に信頼できないようにレンダリングしながら,シングルターンリフェールベンチマークに最適化されていることがわかった。
論文 参考訳(メタデータ) (2026-03-19T19:33:17Z) - Beyond Passive Aggregation: Active Auditing and Topology-Aware Defense in Decentralized Federated Learning [1.8262547855491456]
分散学習(DFL)は、従来の防御指標をバイパスするために設計されたバックドア攻撃に対して、非常に脆弱である。
この制限に対処するため、我々は防衛パラダイムを新しいアクティブな介入監査フレームワークにシフトする。
論文 参考訳(メタデータ) (2026-03-19T06:46:55Z) - Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification [52.63017280231648]
人物再識別(ReID)は、歩行者軌道追跡などの現実の多くの応用において、基本的な課題である。
Person ReIDモデルは、歩行者画像に対する知覚不能な摂動が完全に誤った予測を引き起こすような、敵の攻撃に非常に敏感である。
本稿では,2つの相からなる二重不変防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-13T03:56:40Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - Curriculum-Guided Antifragile Reinforcement Learning for Secure UAV Deconfliction under Observation-Space Attacks [6.367978467906828]
強化学習政策は、観測空間における敵の攻撃に対して脆弱である。
本稿では,段階的対向摂動のカリキュラムに適応するために設計された反フレジブルなRLフレームワークを提案する。
その結果, 反フランジ政策は標準およびロバストなRLベースラインよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-06-26T10:10:41Z) - The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense [56.32083100401117]
Vision Large Language Models(VLLMs)のジェイルブレイク攻撃に対する脆弱性は、驚くにあたらない。
これらの攻撃に対する最近の防御機構は、ベンチマーク評価においてほぼ飽和状態に達している。
論文 参考訳(メタデータ) (2024-11-13T07:57:19Z) - Game-Theoretic Defenses for Robust Conformal Prediction Against Adversarial Attacks in Medical Imaging [12.644923600594176]
敵対的攻撃は、ディープラーニングモデルの信頼性と安全性に重大な脅威をもたらす。
本稿では,共形予測とゲーム理論の防衛戦略を統合する新しい枠組みを提案する。
論文 参考訳(メタデータ) (2024-11-07T02:20:04Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z) - Reliable evaluation of adversarial robustness with an ensemble of
diverse parameter-free attacks [65.20660287833537]
本稿では,最適段差の大きさと目的関数の問題による障害を克服するPGD攻撃の2つの拡張を提案する。
そして、我々の新しい攻撃と2つの補完的な既存の攻撃を組み合わせることで、パラメータフリーで、計算に手頃な価格で、ユーザに依存しない攻撃のアンサンブルを形成し、敵の堅牢性をテストする。
論文 参考訳(メタデータ) (2020-03-03T18:15:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。