論文の概要: SGD Provably Prioritizes a Shortcut Spurious Feature in the XOR Model
- arxiv url: http://arxiv.org/abs/2606.30444v2
- Date: Fri, 03 Jul 2026 00:43:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 13:04:58.277593
- Title: SGD Provably Prioritizes a Shortcut Spurious Feature in the XOR Model
- Title(参考訳): SGDはおそらくXORモデルにおけるショートカットスパージャ特徴を優先する
- Abstract要約: オンラインミニバッチSGDで学習した2層ReLUニューラルネットワークのロジスティック損失に対するスプリアス特徴学習の理論的評価を行った。
我々は,SGDがスプリアス特徴をまず学習し,指数関数的に高速に学習することを示す。さらに,スプリアス特徴と信号特徴とを,より強力なスプリアス成分が信号特徴学習を阻害する。
- 参考スコア(独自算出の注目度): 10.516362851373982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Neural networks are known to be susceptible to over-reliance on spurious correlations. However, the precise mechanism by which models exploit shortcut features is not fully understood, and algorithms to mitigate this behavior rely on as yet unjustified assumptions about the learned representations. In this work, we provide the first end-to-end theoretical characterization of spurious feature learning for two-layer ReLU neural networks trained by online minibatch SGD on the logistic loss. We consider data drawn from the high-dimensional Boolean hypercube with a quadratic signal function (namely XOR) and a linear spurious correlation. We show that SGD learns the spurious feature first, and exponentially fast. Moreover, the optimization dynamics couple the spurious and signal features, with a stronger spurious component inhibiting signal feature learning. Our analysis reveals precise phase transitions in the learning dynamics. In the first phase, alignment between the signs of the spurious feature and second-layer weight drives rapid growth of the spurious feature. In the second phase, large majority group margin slows learning and the signal feature remains suppressed. When the spurious correlation is maximally strong, we show theoretically that the spurious feature dominates even at the sample complexity threshold where XOR would be learned in isolation (i.e., if the spurious feature was absent). In contrast, when the correlation strength is constant, we provide preliminary empirical evidence that the model can eventually learn the XOR signal, although the spurious feature is not forgotten.
- Abstract(参考訳): ニューラルネットワークは、急激な相関に対する過度な信頼の影響を受けることが知られている。
しかし、モデルがショートカット機能を利用する正確なメカニズムは完全には理解されておらず、この振る舞いを緩和するアルゴリズムは、学習された表現についてまだ正当化されていない仮定に依存している。
本研究では,オンラインミニバッチSGDで学習した2層ReLUニューラルネットワークに対して,ロジスティック損失に基づく突発的特徴学習のエンド・ツー・エンドな理論的評価を行う。
本稿では,2次信号関数(すなわちXOR)と線形スプリアス相関を持つ高次元ブールハイパーキューブから抽出したデータについて考察する。
SGDは,まずその素早い特徴を学習し,指数関数的に高速であることを示す。
さらに、最適化ダイナミクスは、刺激成分と信号成分を結合し、信号成分の学習を阻害する。
解析結果から,学習力学における相転移が明らかとなった。
第1段階では、突発的特徴の兆候と第2層重みのアライメントにより、突発的特徴の急速な成長が促される。
第2フェーズでは、大多数のグループマージンが学習を遅くし、信号特徴が抑制され続けている。
最大相関が強い場合,XORが単独で学習される場合(すなわち,スプリアスが欠如している場合)に,スプリアスが支配的となることが理論的に示されている。
対照的に、相関強度が一定であれば、モデルが最終的にXOR信号を学習できるという予備的な実証的証拠を提供する。
関連論文リスト
- Why Some Models Resist Unlearning: A Linear Stability Perspective [7.446140380340418]
我々は線形コヒーレンス安定性のレンズを通してアンラーニングを行う。
我々は3つの軸に沿ってコヒーレンスを分解する。
データ特性と忘れやすさを更に関連付けるために,信号+雑音モデルの下で2層ReLU CNNについて検討する。
経験的幾何学では、ヘッセンテストとCNNヒートマップが予測境界と密接に一致していることを示し、安定性勾配に基づくアンラーニングを検証、混合、データ/モデルアライメントの関数としてマッピングする。
論文 参考訳(メタデータ) (2026-02-03T01:47:26Z) - Complexity Matters: Dynamics of Feature Learning in the Presence of Spurious Correlations [13.119576365743624]
突発的な相関の下で特徴学習のダイナミクスを考察する。
以上の結果から, 最終層の再トレーニングの成功を正当化し, 急激な相関を除去できることが示唆された。
また、突発的特徴の早期学習を利用する一般的なデバイアスアルゴリズムの限界も特定する。
論文 参考訳(メタデータ) (2024-03-05T23:54:00Z) - Understanding Augmentation-based Self-Supervised Representation Learning
via RKHS Approximation and Regression [53.15502562048627]
最近の研究は、自己教師付き学習とグラフラプラシアン作用素のトップ固有空間の近似との関係を構築している。
この研究は、増強に基づく事前訓練の統計的分析に発展する。
論文 参考訳(メタデータ) (2023-06-01T15:18:55Z) - Identifying Spurious Biases Early in Training through the Lens of
Simplicity Bias [25.559684790787866]
訓練の初期にモデルの出力に基づいて,スプリアス機能のある例が確実に分離可能であることを示す。
SPAREは,訓練の初期段階において,素早い相関関係を同定し,その効果を緩和するために重要サンプリングを利用する。
論文 参考訳(メタデータ) (2023-05-30T05:51:36Z) - How Spurious Features Are Memorized: Precise Analysis for Random and NTK Features [19.261178173399784]
学習課題とは無関係な突発的な特徴について考察する。
それらがどのように2つの異なる用語で記憶されるのかを正確に評価する。
一般化能力の増大に伴い,突発的特徴の記憶が弱まることを示す。
論文 参考訳(メタデータ) (2023-05-20T05:27:41Z) - Temporal Difference Learning with Compressed Updates: Error-Feedback meets Reinforcement Learning [47.904127007515925]
本稿では,従来の時間差学習アルゴリズムの変種について検討する。
我々は、圧縮されたTDアルゴリズムと、最適化に広く用いられているエラーフィードバック機構が組み合わさって、漸近的でない近似を保証することを証明した。
特に、これらは一般圧縮演算子と線形関数近似とマルコフサンプリングを併用したタンデムの誤差フィードバックを考慮に入れたRLにおける最初の有限時間結果である。
論文 参考訳(メタデータ) (2023-01-03T04:09:38Z) - Multi-scale Feature Learning Dynamics: Insights for Double Descent [71.91871020059857]
一般化誤差の「二重降下」現象について検討する。
二重降下は、異なるスケールで学習される異なる特徴に起因する可能性がある。
論文 参考訳(メタデータ) (2021-12-06T18:17:08Z) - Understanding Self-supervised Learning with Dual Deep Networks [74.92916579635336]
本稿では,2組の深層ReLUネットワークを用いたコントラスト型自己教師学習(SSL)手法を理解するための新しい枠組みを提案する。
種々の損失関数を持つSimCLRの各SGD更新において、各層の重みは共分散演算子によって更新されることを示す。
共分散演算子の役割と、そのようなプロセスでどのような特徴が学習されるかをさらに研究するために、我々は、階層的潜在木モデル(HLTM)を用いて、データ生成および増大過程をモデル化する。
論文 参考訳(メタデータ) (2020-10-01T17:51:49Z) - Can Temporal-Difference and Q-Learning Learn Representation? A Mean-Field Theory [110.99247009159726]
時間差とQ-ラーニングは、ニューラルネットワークのような表現力のある非線形関数近似器によって強化される深層強化学習において重要な役割を担っている。
特に時間差学習は、関数近似器が特徴表現において線形であるときに収束する。
論文 参考訳(メタデータ) (2020-06-08T17:25:22Z) - Optimal Learning with Excitatory and Inhibitory synapses [91.3755431537592]
相関関係の存在下でアナログ信号間の関連性を保持するという課題について検討する。
ランダムな入力および出力プロセスのパワースペクトルの観点から、典型的な学習性能を特徴付ける。
論文 参考訳(メタデータ) (2020-05-25T18:25:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。