論文の概要: On the Dynamics & Transferability of Latent Generalization during Memorization
- arxiv url: http://arxiv.org/abs/2603.19865v1
- Date: Fri, 20 Mar 2026 11:30:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.119773
- Title: On the Dynamics & Transferability of Latent Generalization during Memorization
- Title(参考訳): 覚醒中の潜在一般化のダイナミクスと伝達性について
- Authors: Simran Ketha, Venkatakrishnan Ramaswamy,
- Abstract要約: 暗記中の潜在一般化能力のトレーニングにおける起源とダイナミクスについて検討する。
モデルの一般化により、潜在一般化能力は訓練の初期段階でほぼピークに達することがわかった。
最終層表現に存在する潜在一般化を新しい線形プローブを用いてモデルに転送する方法を考案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deep networks have been known to have extraordinary generalization abilities, via mechanisms that aren't yet well understood. It is also known that upon shuffling labels in the training data to varying degrees, deep networks, trained with standard methods, can still achieve perfect or high accuracy on this corrupted training data. This phenomenon is called memorization, and typically comes at the cost of poorer generalization to true labels. Our recent work has demonstrated, that the internal representations of such models retain significantly better latent generalization abilities than is directly apparent from the model. In particular, it has been shown that such latent generalization can be recovered via simple probes (called MASC probes) on the layer-wise representations of the model. However, the origin and dynamics over training of this latent generalization during memorization is not well understood. Here, we track the training dynamics, empirically, and find that latent generalization abilities largely peak early in training, with model generalization. Next, we investigate to what extent the specific nature of the MASC probe is critical for our ability to extract latent generalization from the model's layerwise outputs. To this end, we first examine the mathematical structure of the MASC probe and show that it is a quadratic classifier, i.e. is non-linear. This brings up the question of the extent to which this latent generalization might be linearly decodable from layerwise outputs. To investigate this, we designed a new linear probe for this setting. Next, we consider the question of whether it is possible to transfer latent generalization to model generalization by directly editing model weights. To this end, we devise a way to transfer the latent generalization present in last-layer representations to the model using the new linear probe.
- Abstract(参考訳): ディープネットワークは、まだよく理解されていないメカニズムを通じて、素晴らしい一般化能力を持つことが知られている。
また、トレーニングデータのラベルを様々な程度にシャッフルすると、標準手法でトレーニングされたディープネットワークが、この破損したトレーニングデータに対して完璧または高い精度で達成できることも知られている。
この現象は記憶化と呼ばれ、典型的には真のラベルへのより低い一般化のコストが伴う。
我々の最近の研究は、そのようなモデルの内部表現はモデルから直接明らかになるよりもはるかに優れた潜在一般化能力を保っていることを示した。
特に、そのような潜在一般化は、モデルの層ワイド表現上の単純なプローブ(MASCプローブと呼ばれる)によって回復できることが示されている。
しかし、暗記中のこの潜在一般化のトレーニングの起源と力学はよく理解されていない。
ここでは,トレーニングのダイナミクスを経験的に追跡し,潜在一般化能力がモデルの一般化とともに訓練の初期段階でほぼピークに達したことを確認する。
次に,MASCプローブの特定の性質が,モデルの層状出力から潜在一般化を抽出する能力にどの程度重要かを検討する。
この目的のために、まずMASCプローブの数学的構造を調べ、それが二次分類器であること、すなわち非線形であることを示す。
このことは、この潜在一般化が階層的な出力から線形に退化可能であるかという問題を引き起こす。
そこで我々は,この設定のための新しい線形プローブを設計した。
次に,モデルの重みを直接編集することで,潜在一般化をモデル一般化に転送できるかどうかを考察する。
この目的のために、我々は、最終層表現に存在する潜在一般化を、新しい線形プローブを用いてモデルに転送する方法を考案した。
関連論文リスト
- Bigger Isn't Always Memorizing: Early Stopping Overparameterized Diffusion Models [56.032091696552094]
自然データ領域の一般化は、記憶の開始前に訓練中に徐々に達成される。
一般化対メモ化は、時間スケール間の競合として最もよく理解される。
この現象学は,確率論的文脈自由文法をランダムな規則で学習する拡散モデルにおいて復元されることを示す。
論文 参考訳(メタデータ) (2025-05-22T17:40:08Z) - Learning Model Successors [31.25792515137003]
我々は、トレーニングで観察された有限標本に基づいて、統一テーマは誘導であると主張する。
本稿では,モデル継承という中心的な概念を取り入れた新しい学習パラダイム,インダクティブラーニングを提案する。
論文 参考訳(メタデータ) (2025-01-31T22:27:09Z) - Decoding Generalization from Memorization in Deep Neural Networks [0.0]
一般化されたディープニューラルネットワークは、近年のDeep Learningの劇的な成功の鍵となった。
ディープネットワークはトレーニングデータを記憶する能力を持っていることが知られており、クラスラベルが様々な程度にシャッフルされた破損したデータでトレーニングされたモデルに対して、完璧または高いトレーニング精度によって証明されている。
ここでは,これらのモデルが,記憶の面においても,その表現に情報を持っていることを示すことによって,後者の可能性を示す証拠を提供する。
論文 参考訳(メタデータ) (2025-01-24T18:01:27Z) - The Implicit Bias of Structured State Space Models Can Be Poisoned With Clean Labels [8.670973157365689]
以前の研究は、構造化状態空間モデル(SSM)の暗黙のバイアスは、低次元の教師によってデータが生成される環境での一般化につながると主張した。
暗黙のバイアスは、多くのトレーニングデータの選択の下で一般化につながるが、トレーニングに含めると暗黙のバイアスが完全に歪む特別な例が存在することを証明している。
この失敗は、教師によってラベル付けされている特別なトレーニング例、すなわちクリーンなラベルを持つにもかかわらず発生します!
論文 参考訳(メタデータ) (2024-10-14T13:08:15Z) - Grokking at the Edge of Linear Separability [1.024113475677323]
グルーキングは非単調なテスト損失行動を伴う一般化が遅れている。
問題のパラメータが臨界点に近くても、グラッキングは自然に発生する。
論文 参考訳(メタデータ) (2024-10-06T14:08:42Z) - When Neural Networks Fail to Generalize? A Model Sensitivity Perspective [82.36758565781153]
ドメイン一般化 (Domain Generalization, DG) は、異なる分布の下で見えないドメインでうまく機能するようにモデルを訓練することを目的としている。
本稿では,より現実的で,より困難なシナリオである単一領域一般化(Single-DG)について考察する。
我々は「モデル感度」と命名する一般化と強く相関するモデルの性質を経験的に確認する。
本稿では、高感度の周波数をターゲットとした拡張画像を生成するために、スペクトル逆データ拡張(SADA)の新たな戦略を提案する。
論文 参考訳(メタデータ) (2022-12-01T20:15:15Z) - Do Quantum Circuit Born Machines Generalize? [58.720142291102135]
本稿では,量子生成モデルの積分評価指標としてQCBMの一般化性能を示す文献で最初に紹介する。
そこで本研究では,QCBMがデータセットの再重み付けを効果的に学習し,未確認のサンプルをトレーニングセットよりも高い品質で生成可能であることを示す。
論文 参考訳(メタデータ) (2022-07-27T17:06:34Z) - Stochastic Training is Not Necessary for Generalization [57.04880404584737]
勾配降下の暗黙的な正則化(SGD)は、ニューラルネットワークで観測される印象的な一般化の振る舞いに基礎的であると広く信じられている。
本研究では,SGDと同等のCIFAR-10において,非確率的フルバッチトレーニングが強力な性能を発揮することを示す。
論文 参考訳(メタデータ) (2021-09-29T00:50:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。