論文の概要: The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse
- arxiv url: http://arxiv.org/abs/2402.09656v3
- Date: Thu, 14 Mar 2024 11:18:21 GMT
- ステータス: 処理完了
- システム内更新日: 2024-03-16 01:32:47.178611
- Title: The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse
- Title(参考訳): モデル編集による蝶効果:大言語モデルの崩壊をトリガーできる編集は少ない
- Authors: Wanli Yang, Fei Sun, Xinyu Ma, Xun Liu, Dawei Yin, Xueqi Cheng,
- Abstract要約: 単一の編集でさえモデル崩壊を引き起こし、様々なベンチマークタスクで大幅なパフォーマンス低下を示す。
編集後の大規模言語モデルのベンチマークは、過激な時間とリソース集約である。
提案手法は,下流タスク性能と強い相関を示す広範な実験により検証され,サロゲート指標としてパープレキシティを用いる。
- 参考スコア(独自算出の注目度): 58.0132400208411
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although model editing has shown promise in revising knowledge in Large Language Models (LLMs), its impact on the inherent capabilities of LLMs is often overlooked. In this work, we reveal a critical phenomenon: even a single edit can trigger model collapse, manifesting as significant performance degradation in various benchmark tasks. However, benchmarking LLMs after each edit, while necessary to prevent such collapses, is impractically time-consuming and resource-intensive. To mitigate this, we propose using perplexity as a surrogate metric, validated by extensive experiments demonstrating its strong correlation with downstream tasks performance. We further conduct an in-depth study on sequential editing, a practical setting for real-world scenarios, across various editing methods and LLMs, focusing on hard cases from our previous single edit studies. The results indicate that nearly all examined editing methods result in model collapse after only few edits. To facilitate further research, we have utilized GPT-3.5 to develop a new dataset, HardEdit, based on those hard cases. This dataset aims to establish the foundation for pioneering research in reliable model editing and the mechanisms underlying editing-induced model collapse. We hope this work can draw the community's attention to the potential risks inherent in model editing practices.
- Abstract(参考訳): モデル編集は、Large Language Models (LLMs) における知識の改訂において有望であるが、LLMの本質的な能力への影響はしばしば見過ごされている。
一つの編集でもモデル崩壊を引き起こし、様々なベンチマークタスクで大幅なパフォーマンス低下を示す。
しかし、このような崩壊を防ぐために各編集後のLCMのベンチマークは、致命的であり、資源集約である。
これを軽減するために、下流タスクのパフォーマンスと強い相関を示す広範囲な実験によって検証された、サロゲート計量としてのパープレキシティ(perplexity)の使用を提案する。
さらに,従来の単一編集研究の難題に焦点をあて,様々な編集手法やLLMをまたいだ実世界のシナリオの実践的設定であるシーケンシャル編集について,詳細な研究を行う。
その結果, ほぼすべての編集手法が, ごくわずかの編集後, モデル崩壊を招いたことが示唆された。
さらなる研究を容易にするため,我々はGPT-3.5を用いて,これらのハードケースに基づいた新しいデータセットであるHardEditを開発した。
このデータセットは、信頼性のあるモデル編集の研究の先駆的な基盤と、編集によるモデル崩壊の基礎となるメカニズムを確立することを目的としている。
この作業が、モデル編集プラクティスに固有の潜在的なリスクに、コミュニティの注意を引き付けることを願っています。
関連論文リスト
- The Missing Piece in Model Editing: A Deep Dive into the Hidden Damage
Brought By Model Editing [31.004793394634817]
大規模言語モデルは、その顕著な効果で多くのタスクに革命をもたらした。
これらのモデルの編集は時代遅れまたは誤った情報の修正に不可欠であり、しばしば隠れた空間におけるリップル効果として知られる複雑な問題を引き起こす。
本稿では, モデルの適応とその後の編集の影響を定量的に評価する, 新たな評価手法を提案することによって, この科学的課題に対処する。
さらに,このリップル効果を緩和するモデル編集手法であるSelective Outlier Re-Editing Approach(SORA)を導入する。
論文 参考訳(メタデータ) (2024-03-12T17:04:28Z) - Editing Conceptual Knowledge for Large Language Models [67.8410749469755]
本稿では,Large Language Models(LLMs)における概念知識の編集の先駆者となる。
本研究では,新しいベンチマークデータセットConceptEditを構築し,評価のための新しいメトリクスセットを確立する。
実験の結果,既存の編集手法は概念レベルの定義をある程度効率的に修正できるが,関連する瞬間的知識を歪ませる可能性も示された。
論文 参考訳(メタデータ) (2024-03-10T16:57:10Z) - Consecutive Model Editing with Batch alongside HooK Layers [63.230544803136816]
COMEBA-HK は連続およびバッチをサポートするモデル編集方法である。
重みを更新したいくつかのフック層を格納するためには、少量しか必要としないため、メモリフレンドリーである。
論文 参考訳(メタデータ) (2024-03-08T14:07:44Z) - Model Editing at Scale leads to Gradual and Catastrophic Forgetting [2.887477629420772]
本稿では,ROMEとMEMITの2つの手法に焦点をあてて,現在のモデル編集手法を大規模に評価する。
モデルが複数の事実と逐次的に編集されるにつれて、以前編集された事実と下流タスクの実行能力を常に忘れていることがわかった。
論文 参考訳(メタデータ) (2024-01-15T03:57:15Z) - Model Editing Can Hurt General Abilities of Large Language Models [128.32797540883507]
LLaMA-1 (7B) の編集に特定の方法を用いることで、単一の編集だけで選択された全てのタスクにおいて、大幅な性能低下が0に近づいた。
LLaMA-1 (7B) の編集に特定の方法を用いることで、単一の編集だけで選択された全てのタスクにおいて、大幅な性能低下が0に近づいた。
論文 参考訳(メタデータ) (2024-01-09T18:03:15Z) - Editing Large Language Models: Problems, Methods, and Opportunities [51.903537096207]
本稿では, LLMのモデル編集に関わる問題, 方法, 機会を深く探究する。
本稿では,モデル編集に関わるタスク定義と課題の概観と,現在処理中の最も進歩的な手法の詳細な実証分析について述べる。
本研究の目的は,各編集手法の有効性と実現可能性に関する貴重な知見を提供することであり,特定のタスクやコンテキストに対して,最も適切な方法の選択に関する情報決定を行う上で,コミュニティを支援することである。
論文 参考訳(メタデータ) (2023-05-22T16:00:00Z) - Edit at your own risk: evaluating the robustness of edited models to
distribution shifts [0.0]
モデル編集がモデルの一般的なロバスト性や、編集対象の特定の動作のロバスト性にどのように影響するかを検討する。
編集は一般的な堅牢性を低下させる傾向があるが、劣化の程度は編集アルゴリズムと選択した層に依存している。
これらの観測によって動機付けられた新しいモデル編集アルゴリズムである1-層 (1-LI) を導入し、重み空間を用いて編集タスクの精度と一般的なロバスト性の間のトレードオフをナビゲートする。
論文 参考訳(メタデータ) (2023-02-28T19:41:37Z) - Memory-Based Model Editing at Scale [102.28475739907498]
既存のモデルエディタは、編集対象のスコープを正確にモデル化するのに苦労する。
SERAC(Retrieval-Augmented Counterfactal Model)を用いた半パラメトリック編集を提案する。
SERACは、編集を明示的なメモリに格納し、必要に応じてベースモデルの予測を変更できるように、それらを推論することを学ぶ。
論文 参考訳(メタデータ) (2022-06-13T23:40:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。