Fugu-MT 論文翻訳(概要): Do Localization Methods Actually Localize Memorized Data in LLMs?

論文の概要: Do Localization Methods Actually Localize Memorized Data in LLMs?

arxiv url: http://arxiv.org/abs/2311.09060v1
Date: Wed, 15 Nov 2023 15:52:40 GMT
ステータス: 翻訳完了
システム内更新日: 2023-11-16 15:17:22.598849
Title: Do Localization Methods Actually Localize Memorized Data in LLMs?
Title（参考訳）: LLMにおける記憶データのローカライズ手法は実際に存在するか?
Authors: Ting-Yun Chang, Jesse Thomason, and Robin Jia
Abstract要約: 大規模言語モデル(LLM)は、多くの事前訓練されたシーケンスを冗長に記憶することができる。本研究は, 特定の配列を記憶する責任を負う小ニューロン群をLLM内に発見できるかどうかを考察する。
参考スコア（独自算出の注目度）: 28.46131289972691
License: http://creativecommons.org/licenses/by-nc-nd/4.0/
Abstract: Large language models (LLMs) can memorize many pretrained sequences verbatim. This paper studies if we can locate a small set of neurons in LLMs responsible for memorizing a given sequence. While the concept of localization is often mentioned in prior work, methods for localization have never been systematically and directly evaluated; we address this with two benchmarking approaches. In our INJ Benchmark, we actively inject a piece of new information into a small subset of LLM weights and measure whether localization methods can identify these "ground truth" weights. In the DEL Benchmark, we study localization of pretrained data that LLMs have already memorized; while this setting lacks ground truth, we can still evaluate localization by measuring whether dropping out located neurons erases a memorized sequence from the model. We evaluate five localization methods on our two benchmarks, and both show similar rankings. All methods exhibit promising localization ability, especially for pruning-based methods, though the neurons they identify are not necessarily specific to a single memorized sequence.
Abstract（参考訳）: 大規模言語モデル(llm)は多くの事前学習されたシーケンスを記憶することができる。本研究は, 特定の配列を記憶する責任を負う小ニューロン群をLLM内に発見できるかどうかを考察する。ローカライゼーションの概念は以前の研究でしばしば言及されるが、ローカライゼーションの手法は体系的に直接評価されることはなかった。我々のINJベンチマークでは、LLM重みの小さなサブセットに新しい情報を積極的に注入し、ローカライゼーション手法がこれらの「基底真理」重みを識別できるかどうかを測定する。 DELベンチマークでは、LLMが既に記憶している事前学習データの局所化について検討し、この設定には基礎的な事実が欠けているが、位置を外れたニューロンがモデルから記憶されたシーケンスを消去するかどうかを測定することで、依然として位置化を評価することができる。 2つのベンチマークで5つのローカライズ手法を評価し、同様のランキングを示す。いずれの方法も有望な局所化能力を示し、特にプルーニングベースの方法では、それらが識別するニューロンは必ずしも単一の記憶配列に特有ではない。

関連論文リスト

Findings of the BlackboxNLP 2025 Shared Task: Localizing Circuits and Causal Variables in Language Models [56.73385658981886]
機械的解釈可能性(MI)は、言語モデル(LM)が特定の振る舞いをどのように実装するかを明らかにする。最近リリースされたMechanistic Interpretability Benchmark (MIB)は、回路と因果変数のローカライゼーションを評価するためのフレームワークを提供する。 BlackboxNLP 2025 Shared TaskはMIBを拡張し、MIテクニックのコミュニティ全体で再現可能な比較を行う。
論文参考訳（メタデータ） (2025-11-23T11:33:59Z)
Spatial Preference Rewarding for MLLMs Spatial Understanding [92.25703021388142]
マルチモーダル大言語モデル (MLLM) は, 有望な空間理解能力を示した。彼らの成功にもかかわらず、MLLMは依然として微粒な空間知覚能力に不足している。本稿では,MLLMの空間能力を高めるSPR(Spatial Preference Rewarding)アプローチを提案する。
論文参考訳（メタデータ） (2025-10-16T07:16:18Z)
Do Natural Language Descriptions of Model Activations Convey Privileged Information? [17.883814422888264]
先行作業で使用されるデータセット間での一般的な動詞化手法を批判的に評価する。言語化は,LLMのパラメトリック知識を反映することが多い。
論文参考訳（メタデータ） (2025-09-16T17:59:04Z)
MIB: A Mechanistic Interpretability Benchmark [77.35046700898326]
4つのタスクと5つのモデルにまたがる2トラックのベンチマークであるMIBを提案する。 MIBを用いて、帰属とマスク最適化の手法が回路のローカライゼーションにおいて最適であることがわかった。因果変数の局在化では、教師付きDAS法がニューロンより優れているが、SAEの特徴はニューロンより優れている。
論文参考訳（メタデータ） (2025-04-17T17:55:45Z)
Joint Localization and Activation Editing for Low-Resource Fine-Tuning [73.64004083269424]
本稿では,JoLA(Joal Localization and activation editing)法を提案する。 JoLAは(1)Transformerのどのヘッダーを編集するか、(2)介入が加法的、乗法的、または両方であるべきか、(3)介入パラメータ自体を学習する。 JoLAは既存のメソッドよりも一貫して優れています。
論文参考訳（メタデータ） (2025-02-03T09:13:09Z)
Improved Localized Machine Unlearning Through the Lens of Memorization [23.30800397324838]
我々は局所的アンラーニングについて研究し、未学習アルゴリズムはパラメータの小さなサブセットで動作する。そこで我々は,既存の未学習アルゴリズムと組み合わせた場合,強力な結果が得られるローカライゼーション戦略を提案する。また、最も重要とされるパラメータをリセットする新しい未学習アルゴリズムDeletion by Example Localization (DEL)を提案する。
論文参考訳（メタデータ） (2024-12-03T12:57:08Z)
Mitigating Memorization In Language Models [37.899013074095336]
言語モデル(LM)は情報を「記憶」し、トレーニングデータをその重みにエンコードすることで、推論時クエリがそのデータの冗長な復活につながる。本稿では,メモリ化緩和手法の高速化と評価を目的とした,小型で計算効率のよいLMのスイートであるTinyMemを紹介する。特に,提案した未学習手法である BalancedSubnet は,目標タスクの性能を保ちながら,記憶情報を削除する他の緩和手法よりも優れていることを示す。
論文参考訳（メタデータ） (2024-10-03T02:53:51Z)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale [66.75309523854476]
大規模言語モデル(LLM)が,その世代を理論的にどのように説明するかを考察する。提案手法は帰属に基づく説明よりも「偽り」が少ないことを示す。
論文参考訳（メタデータ） (2024-06-28T20:06:30Z)
SoK: Membership Inference Attacks on LLMs are Rushing Nowhere (and How to Fix It) [16.673210422615348]
LLMに対するメンバーシップ推論攻撃(MIA)を行うための10以上の新しい手法が提案されている。固定された-しかしランダム化された-レコードやモデルに依存する従来のMIAとは対照的に、これらの手法は主にポストホックで収集されたデータセットに基づいて評価される。このランダム化の欠如は、メンバーと非メンバー間の分散シフトの懸念を引き起こす。
論文参考訳（メタデータ） (2024-06-25T23:12:07Z)
Aligning Language Models with Demonstrated Feedback [58.834937450242975]
Demonstration ITerated Task Optimization (DITTO)は、言語モデルの出力とユーザの実証された振る舞いを直接調整する。我々は,DITTOがニュース記事やメール,ブログ記事などのドメイン間できめ細かいスタイルやタスクアライメントを学習する能力を評価する。
論文参考訳（メタデータ） (2024-06-02T23:13:56Z)
RepEval: Effective Text Evaluation with LLM Representation [55.26340302485898]
RepEvalは、評価のためにLarge Language Models(LLM)表現の投影を利用するメトリクスである。我々の研究は、LLM表現に埋め込まれたテキスト品質に関する情報の豊かさを強調し、新しいメトリクスの開発のための洞察を提供する。
論文参考訳（メタデータ） (2024-04-30T13:50:55Z)
Reflection-Tuning: Data Recycling Improves LLM Instruction-Tuning [79.32236399694077]
トレーニングセットの低品質データは、通常、チューニングのチューニングに有害である。我々は「反射チューニング」と呼ばれる新しい手法を提案する。このアプローチでは、オラクルLSMを使用して、データ内の命令や応答の質を検査し、向上することで、元のトレーニングデータをリサイクルする。
論文参考訳（メタデータ） (2023-10-18T05:13:47Z)
Generating Benchmarks for Factuality Evaluation of Language Models [61.69950787311278]
FACTOR: Factual Assessment via Corpus Transformation, a scalable approach for LM factuality。 FACTORは、興味のある事実のコーパスをLMの正当性を評価するベンチマークに自動的に変換し、コーパスから真事実を生成する。その結果, (i) ベンチマークスコアはモデルサイズに応じて増加し, LMが検索によって拡張されたときに向上する; (ii) ベンチマークスコアとパープレキシティは必ずしもモデルランキングに一致しない; (iii) パープレキシティとベンチマークスコアが一致しない場合, 後者はオープンエンド世代における事実性を反映する。
論文参考訳（メタデータ） (2023-07-13T17:14:38Z)
Localization Distillation for Object Detection [134.12664548771534]
物体検出のための従来の知識蒸留法(KD)は、分類ロジットを模倣するのではなく、主に特徴模倣に焦点を当てている。本稿では,教師から生徒に効率よくローカライズ知識を伝達できる新しいローカライズ蒸留法を提案する。われわれは,ロジット模倣が特徴模倣より優れることを示すとともに,ロージット模倣が何年もの間,ロージット模倣が不十分であった理由として,ロージット蒸留が欠如していることが重要である。
論文参考訳（メタデータ） (2022-04-12T17:14:34Z)
On the Limits of Pseudo Ground Truth in Visual Camera Re-localisation [83.29404673257328]
再ローカライゼーションベンチマークは、各メソッドが参照アルゴリズムの結果をいかにうまく再現するかを測定する。このことは、参照アルゴリズムの選択がある種の再ローカライゼーション手法を好むかどうかを問うものである。本稿では、広く使われている2つの再ローカライゼーションデータセットを分析し、参照アルゴリズムの選択によって評価結果が実際に異なることを示す。
論文参考訳（メタデータ） (2021-09-01T12:01:08Z)
Ground Texture Based Localization Using Compact Binary Descriptors [12.160708336715489]
地盤テクスチャに基づく位置決めは、車両の高精度位置決めを実現するための有望なアプローチである。グローバルなローカライゼーションや,その後のローカルローカライゼーション更新に使用できる自己完結型手法を提案する。
論文参考訳（メタデータ） (2020-02-25T17:31:41Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。