論文の概要: The Anatomy of an Edit: Mechanism-Guided Activation Steering for Knowledge Editing
- arxiv url: http://arxiv.org/abs/2603.20795v1
- Date: Sat, 21 Mar 2026 12:40:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.086632
- Title: The Anatomy of an Edit: Mechanism-Guided Activation Steering for Knowledge Editing
- Title(参考訳): 編集の解剖:知識編集のためのメカニズムガイド型アクティベーションステアリング
- Authors: Yuan Cao, Mingyang Wang, Hinrich Schütze,
- Abstract要約: 大規模言語モデル(LLM)は知識ベースとしてますます使われているが、それらを最新の状態に保つには、目標とする知識編集(KE)が必要である。
ニューロンレベルの知識属性(NLKA)を用いたKEの力学的考察
代表的KE法全体にわたって、我々は一貫したパターンを見出す: ミッド・トゥ・レイト・アテンションは、主に新しいターゲットを促進するが、アテンションとFFNモジュールは、元の事実を抑えるために協力する。
本研究の目的は,MEGA(Mechanism-Guided Activation steering method)を提案することである。
- 参考スコア(独自算出の注目度): 52.315369633116255
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used as knowledge bases, but keeping them up to date requires targeted knowledge editing (KE). However, it remains unclear how edits are implemented inside the model once applied. In this work, we take a mechanistic view of KE using neuron-level knowledge attribution (NLKA). Unlike prior work that focuses on pre-edit causal tracing and localization, we use post-edit attribution -- contrasting successful and failed edits -- to isolate the computations that shift when an edit succeeds. Across representative KE methods, we find a consistent pattern: mid-to-late attention predominantly promotes the new target, while attention and FFN modules cooperate to suppress the original fact. Motivated by these findings, we propose MEGA, a MEchanism-Guided Activation steering method that performs attention-residual interventions in attribution-aligned regions without modifying model weights. On CounterFact and Popular, MEGA achieves strong editing performance across KE metrics on GPT2-XL and LLaMA2-7B. Overall, our results elevate post-edit attribution from analysis to engineering signal: by pinpointing where and how edits take hold, it powers MEGA to deliver reliable, architecture-agnostic knowledge edits.
- Abstract(参考訳): 大規模言語モデル (LLM) は知識ベースとしてますます使われているが、それらを最新の状態に保つには、目標とする知識編集 (KE) が必要である。
しかし、一度適用されたモデル内で編集がどのように実装されているかは、まだ不明である。
本研究では,ニューロンレベルの知識属性(NLKA)を用いて,KEのメカニスティックな考察を行う。
編集前の因果トレースとローカライゼーションに焦点を当てた以前の作業とは異なり、編集が成功したときにシフトする計算を分離するために、編集後の属性 -- 成功と失敗した編集とは対照的な -- を使用する。
代表的KE法全体にわたって、我々は一貫したパターンを見出す: ミッド・トゥ・レイト・アテンションは、主に新しいターゲットを促進するが、アテンションとFFNモジュールは、元の事実を抑えるために協力する。
そこで本研究では, モデル重みを変更せずに, 属性整列領域に注意・残留的介入を行う機構誘導型アクティブステアリング法MEGAを提案する。
CounterFact と Popular では、MEGA は GPT2-XL と LLaMA2-7B 上の KE メトリクス間で強力な編集性能を達成している。
全体として、分析からエンジニアリング信号への帰属は、編集がどこでどのように保持されるかをピンポイントすることで、MEGAに信頼性の高いアーキテクチャに依存しない知識編集を提供することを可能にします。
関連論文リスト
- MetaKE: Meta-learning Aligned Knowledge Editing via Bi-level Optimization [11.430206422495829]
最先端の手法はオープンループ制御ミスマッチに悩まされる。
批判的「セマンティック・エクセプション・ディスコネクト」を同定する
両レベルの最適化問題としてKEを再構成する新しいフレームワークであるMetaKEを提案する。
論文 参考訳(メタデータ) (2026-03-13T05:47:00Z) - Tracing and Reversing Rank-One Model Edits [5.260519479124422]
本研究は,Ran-One Model Editing (ROME) 手法に着目し,知識編集のトレーサビリティと可逆性について考察する。
ROMEは, 編集重量行列に特徴的な分布パターンを導入し, 編集重量の探索に有効な信号として機能することを示す。
本稿では,編集プロンプトにアクセスすることなく,修正重みから直接編集対象エンティティを推定し,95%以上の精度を実現する方法を提案する。
論文 参考訳(メタデータ) (2025-05-27T07:27:01Z) - Uncovering Overfitting in Large Language Model Editing [35.55260822503773]
編集対象に不均等に高い確率を割り当てる編集オーバーフィット現象を同定し,検討する。
本稿では,多段階推論制約モジュールを導入し,新しい知識をリコールする際のモデルをガイドするLearning the Inference (LTI)を提案する。
論文 参考訳(メタデータ) (2024-10-10T11:09:00Z) - The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse [58.0132400208411]
単一の編集でさえモデル崩壊を引き起こし、様々なベンチマークタスクで大幅なパフォーマンス低下を示す。
編集後の大規模言語モデルのベンチマークは、過激な時間とリソース集約である。
我々は、GPT-3.5を用いて、ハードケースに基づいた新しいデータセット、HardEditを開発した。
論文 参考訳(メタデータ) (2024-02-15T01:50:38Z) - SWEA: Updating Factual Knowledge in Large Language Models via Subject Word Embedding Altering [17.20346072074533]
近年のモデル編集は,大規模言語モデルの少数の知識を効率的に更新する上で有望な手法である。
本稿では,トークンレベルのマッチングによる埋め込みの編集を行うSWEAフレームワークを提案する。
SWEA$oplus$OSのCounterFactデータセットとzsREデータセット上でのSOTA(State-of-the-art)パフォーマンスを実証する。
論文 参考訳(メタデータ) (2024-01-31T13:08:45Z) - Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue [122.20016030723043]
大規模言語モデル(LLM)におけるモデル編集の副作用を評価する。
分析の結果,モデルの重みを過度に修正したモデル編集によって副作用が生じることが明らかとなった。
これを軽減するために、修正の重み付けを正規化するためにRECTというメソッドが提案されている。
論文 参考訳(メタデータ) (2024-01-09T18:03:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。