論文の概要: A Training-Time Diagnostic for Generalization via the Log-Alignment Ratio
- arxiv url: http://arxiv.org/abs/2605.28975v1
- Date: Wed, 27 May 2026 18:26:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.227441
- Title: A Training-Time Diagnostic for Generalization via the Log-Alignment Ratio
- Title(参考訳): ログアライメント比による一般化のための訓練時間診断
- Authors: Ali Shehper, Ashish Vaswani,
- Abstract要約: パラメータ化理論で導入されたパラメータアクティベーションアライメントアライメント尺度であるログアライメント比(LAR)について検討する。
アンエンベディングLARは,2つの異なる設定で記憶と一般化の遷移をトラックすることを示す。
- 参考スコア(独自算出の注目度): 2.691972030289629
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study the log-alignment ratio (LAR), a measure of parameter-activation alignment, introduced in parameterization theory. We reformulate it as the overlap between a weight spectrum $p$ of the normalized squared singular values of a matrix and an activation spectrum $q$ of the normalized squared projections of inputs onto its singular directions. We show that unembedding LAR tracks the transition between memorization and generalization in two different settings by capturing the spread of $p$ and $q$ during training. In grokking, LAR predicts the effective dimension of the learned function: $k \approx n^{2(1-\text{LAR})}$, where $n$ is the input dimension of the matrix. In 3B-parameter language model pre-training, its deviation from a non-overfitting baseline tracks the generalization gap, and its rate of decline increases as overfitting approaches. LAR is computable from quantities available during the forward pass with negligible computational overhead, and requires no held-out validation data.
- Abstract(参考訳): パラメータ化理論で導入されたパラメータアクティベーションアライメントアライメント尺度であるログアライメント比(LAR)について検討する。
我々はこれを、行列の正規化二乗特異値の重みスペクトル$p$と、その特異方向への入力の正規化二乗射影の活性化スペクトル$q$との重なりとして再構成する。
アンエンベッドされたLARは、トレーニング中に$p$と$q$のスプレッドをキャプチャすることで、2つの異なる設定で記憶と一般化の遷移を追跡する。
グラッキングにおいて、LARは学習した関数の有効次元を予測する: $k \approx n^{2(1-\text{LAR})}$、$n$は行列の入力次元である。
3Bパラメータ言語モデルの事前学習では、非オーバーフィッティングベースラインからの逸脱は一般化ギャップをトラックし、オーバーフィッティングアプローチによって減少する。
LARは、計算オーバーヘッドが無視できるフォワードパスで利用可能な量から計算可能であり、保持された検証データを必要としない。
関連論文リスト
- Escape dynamics and implicit bias of one-pass SGD in overparameterized quadratic networks [3.198538967655537]
2層ニューラルネットワークの1パス勾配勾配勾配ダイナミクスを教師の枠組みで解析する。
本研究では,学生の進化を規定する低次元常微分方程式について考察する。
論文 参考訳(メタデータ) (2026-04-03T14:47:24Z) - Regularized Online RLHF with Generalized Bilinear Preferences [68.44113000390544]
一般的な嗜好を伴う文脈的オンラインRLHFの問題を考える。
一般化された双線形選好モデルを用いて、低ランクなスキュー対称行列による選好を捉える。
グリーディポリシーの双対ギャップは推定誤差の正方形によって有界であることを示す。
論文 参考訳(メタデータ) (2026-02-26T15:27:53Z) - New explanations and inference for least angle regression [0.0]
最小角度回帰(LAR)は線形予測のためのアルゴリズムである。
LARは、LAR出力の基本的な振る舞い特性がよく理解されていない「ブラックボックス」のままである。
LARを用いた推論のための新しいフレームワークを提供し、新たな視点からLARを理解することを可能にする。
論文 参考訳(メタデータ) (2026-02-02T18:59:39Z) - Breaking the curse of dimensionality for linear rules: optimal predictors over the ellipsoid [13.057977494657564]
我々は,次元の増大に伴う統計的学習境界の劣化を防止するために,どのような最小構造仮定が必要かを検討する。
分析では, リスクに対する2つの基本的な寄与を取り上げている: (a) データの内在的次元を捉える分散のような用語, (b) ノイズレス誤差(高次元構造において特に発生する用語)。
論文 参考訳(メタデータ) (2025-09-25T13:54:37Z) - Imitation Learning in Discounted Linear MDPs without exploration assumptions [58.81226849657474]
ILARLと呼ばれる無限水平線形MDPにおける模倣学習のための新しいアルゴリズムを提案する。
所望の精度$epsilon$から$mathcalO(epsilon-5)$から$mathcalO(epsilon-4)$への依存を改善する。
線形関数近似による数値実験により、ILARLは他のよく使われるアルゴリズムよりも優れていることが示された。
論文 参考訳(メタデータ) (2024-05-03T15:28:44Z) - Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit
Feedback and Unknown Transition [71.33787410075577]
線形関数近似,未知遷移,および逆損失を用いた強化学習について検討した。
我々は高い確率で$widetildeO(dsqrtHS3K + sqrtHSAK)$ regretを実現する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-07T15:03:50Z) - Exponential Family Model-Based Reinforcement Learning via Score Matching [97.31477125728844]
有限水平表層強化学習(RL)のための楽観的モデルベースアルゴリズムSMRLを提案する。
SMRLは、リッジ回帰によるモデルパラメータの効率的な推定を可能にする非正規化密度推定手法であるスコアマッチングを用いる。
論文 参考訳(メタデータ) (2021-12-28T15:51:07Z) - Benign Overfitting of Constant-Stepsize SGD for Linear Regression [122.70478935214128]
帰納バイアスは 経験的に過剰フィットを防げる中心的存在です
この研究は、この問題を最も基本的な設定として考慮している: 線形回帰に対する定数ステップサイズ SGD。
我々は、(正規化されていない)SGDで得られるアルゴリズム正則化と、通常の最小二乗よりも多くの顕著な違いを反映する。
論文 参考訳(メタデータ) (2021-03-23T17:15:53Z) - Information-Theoretic Limits for the Matrix Tensor Product [8.206394018475708]
本稿では,ランダム行列の行列テンソル積を含む高次元推論問題について検討する。
本稿では,高次元行列保存信号の解析のための新しい手法を紹介する。
論文 参考訳(メタデータ) (2020-05-22T17:03:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。