論文の概要: MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers
- arxiv url: http://arxiv.org/abs/2607.10034v1
- Date: Fri, 10 Jul 2026 23:22:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.280144
- Title: MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers
- Title(参考訳): MLPはヘビーアンである:変換器のための効率的なFact-Storing MLPの構築
- Authors: Roberto Garcia, Jerry Liu, Ronny Junkins, Sabri Eyuboglu, Atri Rudra, Christopher Ré,
- Abstract要約: 大規模言語モデル(LLM)における事実保存の理論的記述を開発する。
我々は, 埋込量に応じて, ペナル化要因までスケールアップできるストレージ容量が同じであることを示す。
概念実証として,トランスフォーマーを新しいものに置き換えることで,ファクトストアリングがモジュール化されたファクト編集を可能にすることを示す。
- 参考スコア(独自算出の注目度): 38.3661862596903
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) store factual knowledge in their parameters. While recent work has shown that this knowledge resides in MLP layers, existing constructive and mechanistic interpretability models of fact-storage in LLMs fail to explain the surprising empirical phenomenon that they store facts at an information-theoretically optimal rate. In this work, we develop a theoretical account of this phenomenon. We develop the first Transformer-compatible fact-storing MLP closed-form construction that satisfies the following three properties empirically observed in LLMs: it (i) attains optimal fact storage scaling, (ii) handles arbitrary input/output geometries, and (iii) works inside Transformers. Key to our work is to analyze the decoding margin of MLPs, whereas prior work only studies MLP fact storage. Under isotropic embeddings, our construction achieves information-theoretically optimal storage capacity scaling and requires $10$-$104\times$ fewer parameters at matched fact count than prior constructions. For arbitrary key and value embeddings, we show that our construction attains the same storage capacity scaling, up to penalization factors depending on the embedding geometries. Moreover, we demonstrate that our constructed MLPs can be used within Transformer blocks for factual recall tasks at optimal capacity scaling, requiring $15$-$63\times$ fewer parameters at matched fact count than prior constructions. Finally, as a proof-of-concept, we show that fact-storing MLPs enable modular fact editing by swapping a Transformer's MLP with a new one.
- Abstract(参考訳): 大規模言語モデル(LLM)は、実際の知識をパラメータに格納する。
近年の研究では、この知識はMLP層に存在することが示されているが、LLMにおける事実保存の既存の構成的および機械論的解釈可能性モデルは、事実を情報理論的に最適な速度で保存する驚くべき経験的現象を説明できない。
本研究では,この現象を理論的に考察する。
LLMで実証的に観察された以下の3つの特性を満たすトランスフォーマー互換のファクトストア型MLPクローズドフォーム構築を開発する。
(i)最適なファクト・ストレージ・スケーリングを実現する。
(ii)任意の入出力ジオメトリを処理し、
(iii)トランスフォーマー内で動作する。
私たちの研究の鍵は、MPPのデコードマージンを分析することですが、以前の研究では、MPPのファクトストレージのみを研究しています。
等方的埋め込みの下では, 情報理論的に最適な記憶容量のスケーリングを実現し, 一致した事実数において, 先行構成よりも少ないパラメータを10ドル~104ドル要求する。
任意のキーと値の埋め込みに対して、我々は、埋め込みジオメトリに依存するペナル化係数まで、同じストレージ容量のスケーリングを実現していることを示す。
さらに,我々の構築したMLPをトランスフォーマーブロック内で,最適キャパシティスケーリング時のファクトリコールタスクに利用できることを示す。
最後に,コンセプションの証明として,トランスフォーマーのMLPを新しいLPに置き換えることで,ファクトストア型MLPがモジュラーファクト編集を可能にすることを示す。
関連論文リスト
- Geometric Factual Recall in Transformers [57.48371649045765]
一般的な見解では、内部の重み行列は埋め込みのペアに対する連想記憶として捉えられ、事実の数と線形にスケールする記憶数を必要とする。
我々は、学習した埋め込みが直接構造を符号化する、別のエンフェロメトリックな形態の記憶の理論的、実証的な説明を開発する。
単層変圧器が被写体から共有属性集合へのランダムベクトルを記憶しなければならない制御環境では、対数埋め込み次元が十分であることを示す。
これらの結果をマルチホップ設定に拡張し、証明可能なチェーン・オブ・シークレットによる構築を提供する。
論文 参考訳(メタデータ) (2026-05-12T17:22:22Z) - Constructing Efficient Fact-Storing MLPs for Transformers [9.371973249870207]
大きな言語モデルでファクトストアを構築するために、明示的な重み構造を構築します。
本稿では,1層トランスフォーマーのファクト・ストアリングのコンセプト実証を,テキスト全文によるモジュラ・ファクト・編集で同時に実施する。
論文 参考訳(メタデータ) (2025-11-28T21:18:35Z) - Equivalence of Context and Parameter Updates in Modern Transformer Blocks [8.364690240329411]
近年の研究では、バニラ変圧器における文脈の影響は、トークン依存のランク1パッチを重みに形成することで暗黙的に表現できることが判明している。
まず、Gemmaスタイルのトランスフォーマーブロックの正確な解析解を示し、コンテキストの効果をランク1パッチに完全にマッピングできることを証明した。
次に、この結果を一般化し、多層モデルに対する構築的証明とアルゴリズムを提供する。
論文 参考訳(メタデータ) (2025-11-22T01:17:15Z) - Understanding Factual Recall in Transformers via Associative Memories [55.93756571457904]
浅層変圧器は、連想記憶の組み合わせを用いて、ほぼ最適な記憶能力を得ることができることを示す。
本研究では, 1層に1つの自己注意を持つ変圧器にパラメータを付加することにより, ファクトリコールタスクにおいて100%の精度が得られることを示す。
論文 参考訳(メタデータ) (2024-12-09T14:48:14Z) - DoLa: Decoding by Contrasting Layers Improves Factuality in Large
Language Models [79.01926242857613]
大型言語モデル(LLM)は幻覚を起こす傾向があり、事前訓練中に見られる事実から逸脱した内容を生成する。
事前学習したLLMによる幻覚を低減するための簡単な復号法を提案する。
コントラスティング・レイヤ(DoLa)アプローチによるこのデコーディングは,事実知識をよりよく提示し,誤った事実の生成を減らすことができる。
論文 参考訳(メタデータ) (2023-09-07T17:45:31Z) - Efficient Language Modeling with Sparse all-MLP [53.81435968051093]
すべてのMLPは、言語モデリングにおいてTransformerと一致するが、下流タスクではまだ遅れている。
特徴量と入力量の両方でMoE(Mix-of-Experts)を混合したスパースオールMLPを提案する。
6つの下流タスクにおいて、ゼロショットのインコンテキスト学習性能を評価し、トランスフォーマーベースのMoEや高密度トランスフォーマーを上回る結果を得た。
論文 参考訳(メタデータ) (2022-03-14T04:32:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。