論文の概要: Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
- arxiv url: http://arxiv.org/abs/2609.16204v1
- Date: Mon, 14 Sep 2026 18:36:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.176123
- Title: Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
- Title(参考訳): ディコイ方向最適化: LLM の消滅に対するポストホック防御
- Abstract要約: RFA(Refusal Feature Ablation)を用いたオープンウェイト言語モデルの安全ガードレールのバイパス
本稿では,DDO(Decoy Direction Optimization)について紹介する。
この効果を定式化するスペクトル境界を証明し、6つのモデルファミリーでDDOを評価し、標準RFA下で10%のASRを達成する。
- 参考スコア(独自算出の注目度): 37.700303596218184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety guardrails in open-weight language models can be readily bypassed using Refusal Feature Ablation (RFA), a technique that identifies and projects out a linear refusal direction from the residual stream, often achieving a high attack success rate (ASR) while preserving model capability. Defending against these attacks typically requires computationally expensive safety finetuning for every new checkpoint. We introduce Decoy Direction Optimization (DDO), a fast, post-hoc weight-editing defense that requires no base-model finetuning. Our approach is based on a simple mechanistic insight: ablation attacks rely on contrastive estimators to find the refusal direction. Rather than trying to hide the true refusal circuitry, DDO actively injects a high-magnitude, nonlinear decoy signal into the network's MLP neurons. When an attacker attempts to locate the refusal direction, the decoy corrupts their estimator, tricking them into ablating a harmless orthogonal feature while the actual safety mechanism remains intact. We prove a spectral bound formalizing this effect and evaluate DDO across six model families, achieving <10% ASR under standard RFA. On Llama-3-8B-Instruct, DDO remains comparable to trained defenses under adaptive multi-phase attacks (65% vs. 58% worst-case ASR) and reduces Heretic weight-level attack ASR from 88.7% to 18%, all at 30 to 450 times lower optimization cost per configuration than the trained baselines.
- Abstract(参考訳): オープンウェイト言語モデルの安全ガードレールは、Refusal Feature Ablation (RFA)を使用して容易にバイパスすることができる。これは、モデル能力を維持しながら、しばしば高い攻撃成功率(ASR)を達成するために、残留ストリームから線形の拒絶方向を特定し、投影する技術である。
これらの攻撃に対する防御には、通常、新しいチェックポイントごとに計算的に高価な安全性の微調整が必要である。
本稿では,DDO(Decoy Direction Optimization)について紹介する。
アブレーション攻撃は、拒絶方向を見つけるためにコントラスト推定器に依存する。
真の拒絶回路を隠そうとするのではなく、DDOは高次非線形デコイ信号をネットワークのMLPニューロンに積極的に注入する。
攻撃者が拒絶方向を見つけようとすると、デコイは推定器を破損させ、実際の安全機構がそのままである間に無害な直交特徴を非難する。
この効果を定式化するスペクトル境界を証明し、6つのモデルファミリーでDDOを評価し、標準RFAの下で10%のASRを達成した。
Llama-3-8B-Instructでは、DDOは適応的なマルチフェーズ攻撃(65%対58%最悪のASR)の下で訓練された防御と同等であり、ヘレティック重量レベル攻撃のASRを88.7%から18%に下げる。
関連論文リスト
- Fine-grained Distributed Backdoor Attacks in Federated Learning [9.374638533613313]
プライバシを保存する分散機械学習パラダイムとしてのフェデレーション学習は、バックドア攻撃による重大な脅威に直面している。
細粒度分散バックドアアタックフレームワーク(FDBA)を提案する。
このフレームワークは、動的トリガ生成と埋め込みベクター最適化を使用して、有毒なサンプルの少ないアタックを実行する。
論文 参考訳(メタデータ) (2026-09-07T07:46:52Z) - On the Vulnerability of Parameter-Level Defenses to Model Merging [75.62810606927121]
我々は,既存の安全対策を回避するため,アンカー誘導攻撃(AGA)を提案する。
AGAは、現実的な防衛非依存シナリオの下で、個々の防衛と複合防衛の両方を一貫してバイパスする。
我々は、AGAが活用するアンカーの優位性を軽減するために、アンカー推進ファインチューニング(ARF)を提供する。
論文 参考訳(メタデータ) (2026-06-29T14:26:13Z) - Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents [0.0]
最近の研究は、間接的プロンプトインジェクションに対するツール使用 LLM エージェントの防御戦略に集約されている。
我々はこれらのアウト・オブ・バンド・ディフェンスを古典的整合性保護の事例として整理する。
我々は、このプロトコルを、Progent自身の適応攻撃解析の独立した複製と拡張として実行している。
論文 参考訳(メタデータ) (2026-06-25T00:35:23Z) - Defense effectiveness across architectural layers: a mechanistic evaluation of persistent memory attacks on stateful LLM agents [0.0]
LLMエージェントに対する永続メモリ攻撃は、オープンソースモデルに対する高い攻撃成功率を達成する。
これらの攻撃では、RAGが取得したドキュメントを介して注入された悪意のある命令は永続的なメモリに格納され、後続のセッションで実行される。
我々は,9つのオープンソースモデルに対する遅延トリガー攻撃に対して,4つのアーキテクチャ層にまたがる6つの防御効果を評価した。
論文 参考訳(メタデータ) (2026-05-08T20:04:57Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks [3.206339985805037]
ダッシュラインディフェンス(Dashed Line Defense, DLD)は、適応的なクエリ戦略に対処するために設計された、プラグアンドプレイのポストプロセッシング手法である。
DLDは、観測された損失がどのように真の敵の強さを反映しているかの曖昧さを導入することで、攻撃者がクエリを確実に分析し、適応することを防ぐ。
我々は,DLDの防御能力を理論的に保証し,ImageNetの実験を通じてその有効性を検証する。
論文 参考訳(メタデータ) (2026-02-09T14:02:32Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - MARS: A Malignity-Aware Backdoor Defense in Federated Learning [51.77354308287098]
最近提案されたSOTA攻撃(3DFed)は、ディフェンダーがバックドアモデルを受け入れたかどうかを判断するためにインジケータ機構を使用する。
本稿では,各ニューロンの有害な範囲を示すためにバックドアエネルギーを利用するMARS(Maignity-Aware backdooR defenSe)を提案する。
実験により、MARSはSOTAのバックドア攻撃に対して防御でき、既存の防御を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2025-09-21T14:50:02Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization [0.0]
悪意のあるRL微調整は、優れた効率で安全ガードレールを解体する。
監督された微調整を狙った既存の防御は効果がない。
我々は、RL微調整攻撃に対して特別に設計された最初の防御フレームワークであるReward Neutralizationを紹介する。
論文 参考訳(メタデータ) (2025-05-07T17:18:48Z) - Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP [51.04452017089568]
CBPT(Class-wise Backdoor Prompt Tuning)は、テキストプロンプトでCLIPを間接的に浄化する効率的な防御機構である。
CBPTは、モデルユーティリティを保持しながら、バックドアの脅威を著しく軽減する。
論文 参考訳(メタデータ) (2025-02-26T16:25:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。