論文の概要: Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons
- arxiv url: http://arxiv.org/abs/2608.14392v1
- Date: Fri, 14 Aug 2026 15:33:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.421638
- Title: Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons
- Title(参考訳): Tripwire: 統計的に認証された安全ニューロンを介して、アライメントされた拒絶をトリガーする
- Abstract要約: 我々は、ニューロンごとの仮説テストを通じて、安全性特異的ニューロンを識別する、トレーニング不要の防御法を提示する。
実験の結果,MT-Benchでは実用性低下率は0.5%から5.3%に留まり,平均攻撃成功率は少なくとも2.0%に低下した。
- 参考スコア(独自算出の注目度): 8.627671856044527
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Neuron- and path-level interventions offer the finest-grained route to defending large language models (LLMs) against jailbreak attacks, yet existing methods fall short of this promise, i.e., they often compromise model utility significantly. Specifically, one line of work suppresses toxic neurons to erase harmful semantics, but since such semantics are distributed across the network, blocking every pathway forces a large intervention footprint. An alternative line of research focus on identify safety neurons using external classifiers. While promising, the existing approaches suffer from compromising neurons that are important for the model utility as well. Moreover, both approaches remain always on and thus perturb every benign request even when no attack is present. To address these limitations, we present \ours{}, a training-free defense that first identifies safety-specific neurons through per-neuron hypothesis tests under false-discovery-rate control together with a utility-specificity filter. Based on this identification, a trigger-style clamp holds the selected neurons at their harmful-conditional mean activations, injecting an internal harmful-input signal that triggers the refusal behavior learned during alignment. The clamp is then realized by two provably equivalent deployment modes, namely a detector-gated inference-time intervention and an offline bias-patch weight edit. Extensive experiments across four safety-aligned LLMs and four representative attacks demonstrate that \ours{} reduces the average attack success rate to at most 2.0\% while incurring a utility drop of only 0.5\% to 5.3\% on MT-Bench, the smallest among all defenses. Code is available at https://anonymous.4open.science/r/Tripwire-65C4.
- Abstract(参考訳): ニューロンやパスレベルの介入は、大きな言語モデル(LLM)をジェイルブレイク攻撃から守るための最もきめ細かい経路を提供するが、既存の手法はこの約束には達していない。
具体的には、ある研究の行は有害な神経細胞を抑制して有害な意味論を消去するが、そのような意味論はネットワーク全体に分散しているため、全ての経路をブロックすると大きな介入の足跡が生じる。
もう一つの研究は、外部分類器を用いた安全性ニューロンの同定に焦点を当てている。
将来性はあるものの、既存のアプローチは、モデルユーティリティーにとっても重要な、妥協ニューロンに悩まされている。
さらに、どちらのアプローチも常に継続しており、攻撃が存在しない場合でも、すべての良心的な要求を妨害する。
これらの制限に対処するため,我々は,偽発見レート制御下でのニューロン間仮説テストにより,まず安全性特異的ニューロンを同定する訓練不要な防御法である \ours{} を提案する。
この同定に基づいて、トリガースタイルのクランプは、選択されたニューロンを有害な条件の平均的なアクティベーションに保持し、アライメント中に学習された拒絶行動を引き起こす内部の有害な入力シグナルを注入する。
クランプは、検出ゲート推論時間介入とオフラインバイアスパッチ重み付けという、証明可能な2つの配置モードによって実現される。
4つの安全アライメントLDMと4つの代表的な攻撃に対する大規模な実験では、平均攻撃成功率を少なくとも2.0 %まで下げる一方、MT-Benchでは0.5 %から5.3 %に低下する。
コードはhttps://anonymous.4open.science/r/Tripwire-65C4で公開されている。
関連論文リスト
- NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution [9.458292549037155]
大規模言語モデル(LLM)における安全性の整合性は、拡大する攻撃に対して脆弱である。
ジェイルブレイクはプロンプトによって安全メカニズムをバイパスし、ニューロンレベルの攻撃は、デプロイ後直接、安全クリティカルなニューロンを発生させる。
我々は、より広い範囲のニューロンに安全信号を再分配することにより、両方の攻撃クラスに対してLDMを同時に強化する、微調整段階の防御であるNeuronGuardを紹介する。
論文 参考訳(メタデータ) (2026-08-25T01:36:54Z) - No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks [61.07406641465909]
複数の計算ニューロンにまたがる安全性を符号化した分散安全アライメントを提案する。
DSAは、汎用言語とマルチモーダルユーティリティを保ちながら、ホワイトボックスニューロンレベルの安全攻撃に対して大幅に改善されていることを示す。
論文 参考訳(メタデータ) (2026-08-02T17:49:07Z) - SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs [69.51621286001262]
我々は、専用のニューロンレベルの介入戦略を採用する、モーダル間安全アライメントフレームワークであるSafeNexusを紹介する。
我々は、モダリティ結合型安全ニューロン(BS-Neurons)を同定し、各モダリティ内の安全行動の調節におけるそれらの役割を検証した。
我々は,アクティベーションレベル安全増幅器と安全ニューロン校正器の2つの安全アライメント戦略を提案する。
論文 参考訳(メタデータ) (2026-07-31T02:45:56Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models [14.630626774362606]
大型言語モデル(LLM)の安全性アライメントは、有害な内容を抑えるためにニューロンの活性化を調節する微調整機構によって達成される。
本稿では,安全性の制約を負うニューロンを同定し,修正することにより,不整合を誘導する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-04-29T05:49:35Z) - Imperceptible Backdoor Attack: From Input Space to Feature
Representation [24.82632240825927]
バックドア攻撃はディープニューラルネットワーク(DNN)への脅威が急速に高まっている
本稿では,既存の攻撃手法の欠点を分析し,新たな非受容的バックドア攻撃を提案する。
我々のトリガーは、良性画像の1%以下のピクセルしか変更せず、大きさは1。
論文 参考訳(メタデータ) (2022-05-06T13:02:26Z) - Improving Adversarial Transferability via Neuron Attribution-Based
Attacks [35.02147088207232]
本稿では,より正確なニューロン重要度推定を行う機能レベルアタック(NAA)を提案する。
我々は、オーバーヘッドを大幅に減らすために、ニューロンの属性の近似スキームを導出する。
実験により、最先端のベンチマークに対する我々のアプローチの優位性が確認された。
論文 参考訳(メタデータ) (2022-03-31T13:47:30Z) - Few-shot Backdoor Defense Using Shapley Estimation [123.56934991060788]
我々は、深層ニューラルネットワークに対するバックドア攻撃を軽減するために、Shapley Pruningと呼ばれる新しいアプローチを開発した。
ShapPruningは、感染した数少ないニューロン(全ニューロンの1%以下)を特定し、モデルの構造と正確性を保護する。
様々な攻撃やタスクに対して,本手法の有効性とロバスト性を示す実験を行った。
論文 参考訳(メタデータ) (2021-12-30T02:27:03Z) - Hidden Backdoor Attack against Semantic Segmentation Models [60.0327238844584]
Emphbackdoor攻撃は、深層ニューラルネットワーク(DNN)に隠れたバックドアを埋め込み、トレーニングデータに毒を盛ることを目的としている。
我々は,対象ラベルを画像レベルではなくオブジェクトレベルから扱う,新たな攻撃パラダイムであるemphfine-fine-grained attackを提案する。
実験により、提案手法はわずかなトレーニングデータだけを毒殺することでセマンティックセグメンテーションモデルを攻撃することに成功した。
論文 参考訳(メタデータ) (2021-03-06T05:50:29Z) - And/or trade-off in artificial neurons: impact on adversarial robustness [91.3755431537592]
ネットワークに十分な数のOR様ニューロンが存在すると、分類の脆さと敵の攻撃に対する脆弱性が増加する。
そこで我々は,AND様ニューロンを定義し,ネットワーク内での割合を増大させる対策を提案する。
MNISTデータセットによる実験結果から,本手法はさらなる探索の方向として有望であることが示唆された。
論文 参考訳(メタデータ) (2021-02-15T08:19:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。