論文の概要: Backdooring Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2610.06049v1
- Date: Mon, 05 Oct 2026 09:44:21 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:23:54.229381
- Title: Backdooring Sparse Autoencoders
- Title(参考訳): バックドアスパースオートエンコーダ
- Abstract要約: SAEは、言語モデル自体を変更することなく、行動バックドアを持てることを示す。
これらの結果は、SAEが言語モデル自体を変更することなく、行動バックドアを持てることを証明している。
- 参考スコア(独自算出の注目度): 0.7611870296994722
- License:
- Abstract: Sparse autoencoders (SAEs) are increasingly used not only to interpret language models but also to intervene on their internal representations. We show that this creates a supply-chain attack surface: a maliciously modified SAE can induce attacker-chosen behavior when inserted into the forward pass of an otherwise unchanged language model. We introduce a decoder-only SAE backdoor that leaves both the underlying LLM and the SAE encoder frozen, restricting the attack to a single auxiliary component at a single insertion layer. Using code generation as a case study, we demonstrate high rates of unsolicited code insertion across three language models and a wide range of insertion layers, as well as trigger-dependent behavior conditioned on a prompt cue. We further evaluate the modified SAEs using HumanEval and selected SAEBench metrics. While attack effectiveness varies across models and layers, strong backdoor behavior can coexist with relatively small changes in several conventional SAE quality measures. These results establish that SAEs can carry behavioral backdoors without modifying the language model itself and should therefore be treated as security-sensitive components.
- Abstract(参考訳): スパースオートエンコーダ(SAE)は、言語モデルだけでなく、言語の内部表現にも使われるようになっている。
悪意のある修正されたSAEは、変更されていない言語モデルの前方パスに挿入されたとき、攻撃者による動作を誘導することができる。
基礎となるLCMとSAEエンコーダの両方を凍結させるデコーダのみのSAEバックドアを導入し、単一の挿入層における1つの補助部品に攻撃を制限した。
ケーススタディとしてコード生成を用いると、3つの言語モデルと広範囲の挿入層にまたがる非分離コード挿入率と、プロンプトキューで条件付けられたトリガー依存行動を示す。
我々は、HumanEvalとSAEBenchメトリクスを用いて、修正されたSAEを更に評価する。
攻撃の有効性はモデルや層によって異なるが、いくつかの従来のSAEの品質基準において、強力なバックドア行動は比較的小さな変化と共存することができる。
これらの結果は、SAEが言語モデル自体を変更することなく、振る舞いバックドアを持てることを証明し、したがってセキュリティに敏感なコンポーネントとして扱うべきである。
関連論文リスト
- Why Are LLM Backdoor Defenses Fragmented? A Feature-Level Explanation with Sparse Autoencoders [8.978155712937898]
スパースオートエンコーダ (SAE) を用いた大規模言語モデル (LLM) バックドアの系統的特徴レベル力学解析について述べる。
高コントリビュートなSAE特徴にバックドアによるロジットシフトを辿り、それらを4つの役割(interac?tion, suppressed, mixed, weight-modified feature)に分類した。
これらの結果から,SAE分析は防御の断片化を説明できることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-31T07:55:42Z) - DEFUSE: Generalizable Backdoor Defense for Self-Supervised Encoders with Generative Priors [40.98521902229488]
自己教師付き学習(SSL)エンコーダは、バックドア攻撃に対して脆弱である。
DEFUSEはSSLエンコーダの一般的なバックドア検出フレームワークである。
論文 参考訳(メタデータ) (2026-08-26T14:24:05Z) - ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety [54.4092272526747]
MLLM(Multimodal Large Language Models)は、クロスモーダルな理解と生成において大きな成功を収めていますが、そのデプロイは重大な安全性の脆弱性によって脅かされています。
本稿では,MLLMのバックドアを復号化するための解釈可能性フレームワークであるProjLensを提案する。
論文 参考訳(メタデータ) (2026-04-21T04:52:38Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution [49.78359632298156]
大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクにおいて優れたパフォーマンスを達成し、大幅な進歩を遂げている。
標準クエリではモデルが正常に動作しますが、特定のトリガがアクティブになると、有害な応答や意図しない出力を生成します。
本稿では,LLMからのバックドアの挙動を知識希釈により除去する新しい手法LETHEを提案する。
論文 参考訳(メタデータ) (2025-08-28T17:05:18Z) - Ensembling Sparse Autoencoders [10.81463830315253]
スパースオートエンコーダ(SAE)は、ニューラルネットワークの活性化を人間の解釈可能な特徴に分解するために用いられる。
我々は,複数のSAEを包括的袋詰めとブースティングによりアンサンブルすることを提案する。
実験の結果,SAEのアンサンブルにより,言語モデルの活性化,特徴の多様性,SAEの安定性が向上することが示された。
論文 参考訳(メタデータ) (2025-05-21T23:31:21Z) - Don't Forget It! Conditional Sparse Autoencoder Clamping Works for Unlearning [0.306238659426286]
大きな言語モデル(LLM)の能力は大きな可能性をもたらしていますが、新たなリスクも生じています。
例えば、生物兵器、先進化学、サイバー攻撃の知識を持つLSMは、間違った手や故障時に暴力を引き起こす可能性がある。
近黒の箱としての性質から、LLM内部の直観的な解釈は依然としてオープンな研究課題である。
論文 参考訳(メタデータ) (2025-03-14T06:43:19Z) - MEGen: Generative Backdoor into Large Language Models via Model Editing [36.67048791892558]
本稿では,バックドア型大規模言語モデル(LLM)の影響に焦点を当てる。
生成タスクへのバックドア拡張を目的とした,編集ベースの生成バックドアMEGenを提案する。
実験の結果,MEGenは局所パラメータの小さなセットだけを調整することで,高い攻撃成功率を達成することがわかった。
論文 参考訳(メタデータ) (2024-08-20T10:44:29Z) - BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models [57.5404308854535]
大型言語モデル(LLM)における安全バックドア攻撃は、正常な相互作用中の検出を回避しながら、安全でない振る舞いをステルス的に引き起こすことができる。
モデル埋め込み空間において,バックドアトリガーが比較的均一なドリフトを引き起こすという知見を活かした緩和手法であるBEEARを提案する。
両レベル最適化手法は、不要な振る舞いを誘発する普遍的な埋め込み摂動を特定し、モデルパラメータを調整し、これらの摂動に対する安全な振舞いを強化する。
論文 参考訳(メタデータ) (2024-06-24T19:29:47Z) - Defending Large Language Models against Jailbreak Attacks via Semantic
Smoothing [107.97160023681184]
適応型大規模言語モデル(LLM)は、ジェイルブレイク攻撃に対して脆弱である。
提案するSEMANTICSMOOTHは,与えられた入力プロンプトのセマンティック変換されたコピーの予測を集約するスムージングベースのディフェンスである。
論文 参考訳(メタデータ) (2024-02-25T20:36:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。