論文の概要: Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal
- arxiv url: http://arxiv.org/abs/2607.08883v1
- Date: Thu, 09 Jul 2026 19:21:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.732267
- Title: Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal
- Title(参考訳): 安全表現の最適化--アクティベーションガイド付き逆接接尾辞と拒絶の幾何学
- Abstract要約: 大きな言語モデルにおける行動アライメントは、しばしば脆弱な内部安全表現を隠蔽する。
本研究では, 対向接尾辞攻撃を表現的アライメントのプローブとして検討した。
その結果,全層にまたがる拒絶の抑制は,単一層配置対よりも効果的であることが判明した。
- 参考スコア(独自算出の注目度): 3.441021278275805
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Behavioral alignment in large language models often masks fragile internal safety representations. Recent work suggests that refusal behavior is mediated by low-dimensional directions in activation space. This raises questions about how such representations are structured, localized, and accessed by optimization. We study adversarial suffix attacks as a probe of representational alignment. We introduce Activation-Guided GCG, which replaces output-based objectives with losses that directly target a model's internal refusal direction. Across several objective variants, we find that suppressing refusal globally across all layers and positions is more effective than targeting a single layer-position pair. This suggests that safety representations are distributed across the forward pass rather than causally localized to a single site. We further introduce Soft-GCG, a continuous relaxation of discrete suffix optimization using Gumbel-Softmax. Soft-GCG achieves a 33 $\times$ speedup over standard GCG while improving attack success rates. Evaluating across model scales, we find that smaller models remain vulnerable while larger models resist both activation- and suffix-based attacks at our compute-constrained settings, consistent with larger and better safety trained models being harder to jailbreak. Together, our results clarify how safety mechanisms are encoded and can be broken in contemporary models. These insights provide concrete guidance for designing more robust and representation-aware alignment strategies.
- Abstract(参考訳): 大きな言語モデルにおける行動アライメントは、しばしば脆弱な内部安全表現を隠蔽する。
近年の研究では、リフレクションの挙動は活性化空間における低次元方向によって媒介されていることが示唆されている。
これにより、このような表現がどのように構造化され、ローカライズされ、最適化によってアクセスされるかという疑問が提起される。
本研究では, 対向接尾辞攻撃を表現的アライメントのプローブとして検討した。
本稿では,出力に基づく目的をモデルの内部拒絶方向を直接ターゲットとした損失に置き換える Activation-Guided GCG を提案する。
複数の目的変数に対して,全層にまたがる拒絶を抑制することは,単一層配置対よりも効果的であることがわかった。
これは、安全表現が単一のサイトへの因果的ローカライズではなく、フォワードパスに分散していることを示唆している。
さらに,Gumbel-Softmaxを用いた離散接尾辞最適化の連続緩和であるSoft-GCGを紹介する。
Soft-GCGは、標準的なGCGよりも33$\times$のスピードアップを達成し、攻撃の成功率を改善している。
モデルスケールを評価すると、より大規模なモデルではアクティベーションとサフィックスベースの攻撃の両方に抵抗する一方で、より大規模でより安全なトレーニングモデルではジェイルブレイクが難しくなるのが分かります。
この結果から, 安全機構のコード化と, 現代モデルにおける破壊の仕方を明らかにすることができた。
これらの洞察は、より堅牢で表現に敏感なアライメント戦略を設計するための具体的なガイダンスを提供する。
関連論文リスト
- Defending against Model Extraction for GNNs with Model Reprogramming [57.82196268649236]
グラフニューラルネットワーク(GNN)は、ML(Machine-Learning-as-a-Service)における高スループットアプリケーションのバックボーンとして機能する。
それでも、ブラックボックスのデプロイメントは、モデル抽出(ME)攻撃に晒される。
既存の防衛は「ユークリッドバイアス」に苦しむ
セキュリティのためにモデル再プログラミングを再利用するプロアクティブディフェンスフレームワークであるGraphRPを提案する。
論文 参考訳(メタデータ) (2026-08-11T23:20:15Z) - Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance [48.34904668359272]
大規模言語モデルに対するアドリアック攻撃は、広範な研究にもかかわらず、実用的影響が限られている。
本稿では,Greedy Coordinate Diffusion(GCD)について紹介する。
GCDは、敵の本来の意図に低い難易度と高い意味的固執を維持している。
論文 参考訳(メタデータ) (2026-06-14T01:18:53Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation [28.208102468217394]
本研究は,セマンティックセグメンテーションに適したバックドア攻撃を系統的に検討する。
本稿では、トリガ設計を最適化し、ラベル操作戦略を適用して攻撃性能を最大化する統合フレームワークBADSEGを紹介する。
我々の研究は、セマンティックセグメンテーションにおけるこれまで見過ごされていたセキュリティの脆弱性を明らかにし、セグメンテーション固有の脅威モデルに合わせたディフェンスの開発を動機付けている。
論文 参考訳(メタデータ) (2026-03-17T11:42:17Z) - Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models [0.0]
我々は、一般的なGreedy Coordinate Gradient(GCG)攻撃に注目し、ジェイルブレイク攻撃の未発見の攻撃軸を特定する。
ケーススタディとしてGCGを用いて, 接尾辞の代わりに接頭辞を生成するよう攻撃を最適化し, 攻撃成功率に実質的に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2026-02-03T08:53:35Z) - Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models [50.91504059485288]
本報告では,全頭部のグローバルな最適化により,安全クリティカルな注意点を同時に識別するフレームワークを提案する。
我々は,アクティベーション・リマッチによって同定された安全ベクトルを利用する,新しい推論時ホワイトボックス・ジェイルブレイク法を開発した。
論文 参考訳(メタデータ) (2026-01-22T09:32:43Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring [13.497048408038935]
LVLM(Large Vision-Language Models)は、増え続けるマルチモーダル・ジェイルブレイク攻撃に対して脆弱である。
現在の異常検出法は、新しい良性入力を悪意のある入力と混同する傾向があり、信頼性の低いオーバーリジェクションにつながる。
我々は,LVLMの内部表現に最も強力な安全信号が存在するという,重要な洞察に基づくフレームワークであるRepresentational Contrastive Scoring (RCS)を提案する。
論文 参考訳(メタデータ) (2025-12-12T22:31:38Z) - ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack [22.48980625853356]
大規模言語モデル(LLM)は、単純な言語的変化によって回避できる脆い拒絶行動を示す。
本研究では、この特定の脆弱性を外科的に軽減する、洞察に富んだ機械的インフォームドフレームワークであるアクティベーション・スケーリングガード(ASGuard)を紹介する。
論文 参考訳(メタデータ) (2025-09-30T06:33:52Z) - Probing the Robustness of Large Language Models Safety to Latent Perturbations [30.16804362984161]
安全アライメントは、信頼できる人工知能を構築する上で重要な要件である。
我々は、小さな潜伏シフトが、整列モデルにおける安全でない応答を引き起こすことを観察する。
学習中に隠された表現に制御された摂動を注入する微調整戦略であるLayer-wise Adversarial Patch Training (LAPT)を導入する。
論文 参考訳(メタデータ) (2025-06-19T07:03:05Z) - Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses [10.08464073347558]
細調整による防御に対するホワイトボックス攻撃であるCheckpoint-GCGを導入する。
最強防衛に対する攻撃成功率(ASR)を最大96%まで達成できるチェックポイントGCGを示す。
論文 参考訳(メタデータ) (2025-05-21T16:43:17Z) - Advancing Generalized Transfer Attack with Initialization Derived Bilevel Optimization and Dynamic Sequence Truncation [49.480978190805125]
転送攻撃はブラックボックスアプリケーションに大きな関心を惹きつける。
既存の作業は、本質的に単一のレベルの目的 w.r.t. シュロゲートモデルを直接最適化する。
本稿では,上位レベル(UL)と下位レベル(LL)のサロゲート攻撃とのネスト関係を明示的に再構築する2レベル最適化手法を提案する。
論文 参考訳(メタデータ) (2024-06-04T07:45:27Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。