論文の概要: Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
- arxiv url: http://arxiv.org/abs/2608.17836v1
- Date: Tue, 18 Aug 2026 14:35:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.3678
- Title: Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
- Title(参考訳): LLM上でのWhite-Box攻撃構築のための知識編集におけるアソシエイトコンテキスト検索の活用
- Abstract要約: 本稿では,知識編集分野からの位置情報編集アプローチにインスパイアされた,新しいホワイトボックス攻撃を提案する。
我々の選択は、そのようなスキームで編集されたモデルが、編集対象に異常に高い予測確率を割り当てる傾向にあるという観察によって動機づけられる。
- 参考スコア(独自算出の注目度): 41.986377298239525
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language models (LLMs) are granted increasing autonomy, it is essential to investigate methods that can induce unsafe behavior. We propose a novel white-box attack inspired by locate-then-edit approaches from the field of Knowledge Editing. Our choice is motivated by the observation that models edited with such schemes tend to assign unusually high prediction probabilities to the edit target, a property that is particularly advantageous when designing attacks. We modify the editing framework by incorporating as- sociative knowledge retrieved from the model, thereby extending constraint removal to an entire thematic category rather than being limited to prompts from a predefined dataset. Experiments with various archi- tectures demonstrate improved attack effectiveness over competing methods without dealing critical damage to general model performance.
- Abstract(参考訳): 大規模言語モデル(LLM)は自律性の向上が認められているため、安全でない振る舞いを誘発する手法を検討することが不可欠である。
本稿では,知識編集分野からの位置情報編集アプローチにインスパイアされた,新しいホワイトボックス攻撃を提案する。
我々の選択は、そのようなスキームで編集されたモデルが異常に高い予測確率を編集対象に割り当てる傾向にあるという観察によって動機づけられる。
モデルから取得した連想的知識を組み込むことで編集フレームワークを改良し、事前定義されたデータセットからのプロンプトに制限されるのではなく、制約除去をテーマカテゴリー全体に拡張する。
各種アーチ・テククチャを用いた実験では, 汎用モデルの性能に重大なダメージを与えることなく, 競合手法に対する攻撃効果が向上した。
関連論文リスト
- The Anatomy of an Edit: Mechanism-Guided Activation Steering for Knowledge Editing [52.315369633116255]
大規模言語モデル(LLM)は知識ベースとしてますます使われているが、それらを最新の状態に保つには、目標とする知識編集(KE)が必要である。
ニューロンレベルの知識属性(NLKA)を用いたKEの力学的考察
代表的KE法全体にわたって、我々は一貫したパターンを見出す: ミッド・トゥ・レイト・アテンションは、主に新しいターゲットを促進するが、アテンションとFFNモジュールは、元の事実を抑えるために協力する。
本研究の目的は,MEGA(Mechanism-Guided Activation steering method)を提案することである。
論文 参考訳(メタデータ) (2026-03-21T12:40:15Z) - Consistency-Aware Editing for Entity-level Unlearning in Language Models [53.522931419965424]
本稿では,エンティティレベルのアンラーニングのための新しい一貫性対応編集(CAE)フレームワークを提案する。
CAEは、その属性、関係、および敵のパラフレーズを含む、ターゲットエンティティに関連する多様なプロンプトの集合を集約する。
次に、一貫性レギュレータによってガイドされる低ランクの更新を共同で学習し、プロンプトをまたいだ編集方向を調整する。
論文 参考訳(メタデータ) (2025-12-19T15:18:07Z) - An Information-Theoretic Framework for Robust Large Language Model Editing [17.984683741974063]
大規模言語モデル(LLM)は、科学、技術、社会において欠かせない道具となっている。
これらのモデル内のエラーや時代遅れの情報は、その正確性を損なう可能性があり、安全なデプロイメントを制限することができる。
本稿では,情報ボトルネック理論に基づくLLMの編集フレームワークを提案する。
Information Bottleneck Knowledge Editor (IBKE) を提案する。
論文 参考訳(メタデータ) (2025-12-18T06:21:17Z) - Selective Adversarial Attacks on LLM Benchmarks [1.6307653659652344]
広範に使用されているベンチマークMMLUに対する選択的敵攻撃について検討した。
選択的な敵攻撃が存在し、相対的なランクを実質的に変更できることがわかった。
本研究の結果は摂動を意識した報告とロバストネス評価を動機づけるものである。
論文 参考訳(メタデータ) (2025-10-15T14:08:44Z) - InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing [86.17245523439514]
In-context Learningは、コンテキストエンコーディングを通じて編集情報を解釈することで、有望な編集方法である。
この方法は、大きな言語モデルの限られたコンテキストウィンドウによって制約される。
編集コンテキストの処理能力を向上させるフレキシブルなフレームワークであるInComeSを提案する。
論文 参考訳(メタデータ) (2025-05-28T09:20:18Z) - Seeking Flat Minima over Diverse Surrogates for Improved Adversarial Transferability: A Theoretical Framework and Algorithmic Instantiation [38.12499933796839]
本稿では, 対向転送可能性の証明可能な保証を提供する新しい転送可能性バウンダリを提案する。
以上の結果から,AEsをSurrogateモデル集合上の平らな最小値に最適化すると同時に,Surrogate-Targetモデルシフトを逆モデル不一致で制御することにより,AEの転送性に対する包括的保証が得られることが示唆された。
論文 参考訳(メタデータ) (2025-04-23T07:33:45Z) - Defending Large Language Models Against Attacks With Residual Stream Activation Analysis [0.0]
大規模言語モデル(LLM)は敵の脅威に対して脆弱である。
本稿では, LLM へのホワイトボックスアクセスを前提とした, 革新的な防御戦略を提案する。
そこで本研究では,アタックプロンプト分類のための残差ストリームの固有なアクティベーションパターンを解析するための新しい手法を適用した。
論文 参考訳(メタデータ) (2024-06-05T13:06:33Z) - EVEDIT: Event-based Knowledge Editing with Deductive Editing Boundaries [69.72012539060731]
大規模言語モデル(LLM)における効率的な知識編集(KE)の理論的枠組みを導入する。
本稿では,事象をイベント記述と組み合わせたイベントベースの知識編集タスクを提案する。
編集モデルにおける不確実性を解消するための既存の設定よりもイベントベースの編集の方が優れていることを実証的に示す。
論文 参考訳(メタデータ) (2024-02-17T16:34:50Z) - The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse [58.0132400208411]
単一の編集でさえモデル崩壊を引き起こし、様々なベンチマークタスクで大幅なパフォーマンス低下を示す。
編集後の大規模言語モデルのベンチマークは、過激な時間とリソース集約である。
我々は、GPT-3.5を用いて、ハードケースに基づいた新しいデータセット、HardEditを開発した。
論文 参考訳(メタデータ) (2024-02-15T01:50:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。