論文の概要: Relative Generalization Invariance of LLM Pretraining
- arxiv url: http://arxiv.org/abs/2609.33016v1
- Date: Sat, 26 Sep 2026 23:23:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 11:12:21.324107
- Title: Relative Generalization Invariance of LLM Pretraining
- Title(参考訳): LLMプレトレーニングの相対的一般化不変性
- Abstract要約: モデル間での任意の2つのトークン間の検証損失差の不変性である相対一般化不変性(RGI)を紹介する。
RGIは幅広い一般化と適度なアーキテクチャのバリエーションを有しており、これらの選択はトークン単位の損失の概ね均一なシフトを引き起こすことを示唆している。
対照的に、トレーニングデータストリームの変更は、相対的な一般化を著しく変更することができる。
- 参考スコア(独自算出の注目度): 82.89907099656406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) pretraining performance is jointly shaped by three components of the training triplet: the optimizer, model architecture, and training data stream. However, how these components influence performance in distinct ways remains unclear. We take a first step toward isolating their effects by studying relative generalization. We introduce Relative Generalization Invariance (RGI), the invariance of the validation-loss difference between any two tokens across models. We show that RGI approximately holds across a wide range of optimizers and moderate architectural variations, suggesting that these choices induce an approximately uniform shift in token-wise losses. In contrast, changing the training data stream can substantially alter relative generalization. We further show that RGI cannot be explained by the neural tangent kernel or mean-field regimes alone and prove that it can emerge in an overparameterized quadratic model. Overall, our work identifies RGI as a new phenomenon in LLM pretraining that helps distinguish the effects of optimizers and architectures from those of training data.
- Abstract(参考訳): 大規模言語モデル(LLM)事前トレーニングのパフォーマンスは、オプティマイザ、モデルアーキテクチャ、トレーニングデータストリームの3つのコンポーネントによって共同で形成される。
しかし、これらのコンポーネントがパフォーマンスにどのように影響するかは、まだ不明である。
相対的な一般化を研究することによって、その効果を分離する第一歩を踏み出す。
モデル間での任意の2つのトークン間の検証損失差の不変性である相対一般化不変性(RGI)を紹介する。
我々は,RGIが多種多様な最適化手法と中程度のアーキテクチャ的バリエーションを概ね保持していることを示し,これらの選択がトークン単位の損失の概ね均一なシフトを引き起こすことを示唆している。
対照的に、トレーニングデータストリームの変更は、相対的な一般化を著しく変更することができる。
さらに、RGIは、ニューラルネットワークカーネルや平均場状態だけでは説明できないことを示し、過度にパラメータ化された二次モデルに現れることを証明している。
全体として、我々の研究は、RGIをLLMプレトレーニングにおける新しい現象として認識し、最適化器とアーキテクチャの効果をトレーニングデータと区別するのに役立つ。
関連論文リスト
- Implicit Neural Representation-Based Continuous Single Image Super Resolution: An Empirical Study [50.15623093332659]
入射神経表現(INR)は任意のスケール画像超解像(ASSR)の標準的アプローチとなっている
既存の手法を多様な設定で比較し、複数の画像品質指標に対して集計結果を示す。
トレーニング中, エッジ, テクスチャ, 細部を保存しながら, 強度変化をペナライズする新たな損失関数について検討した。
論文 参考訳(メタデータ) (2026-01-25T07:09:20Z) - Nonparametric Data Attribution for Diffusion Models [57.820618036556084]
生成モデルのデータ属性は、個々のトレーニング例がモデル出力に与える影響を定量化する。
生成画像とトレーニング画像のパッチレベルの類似性によって影響を測定する非パラメトリック属性法を提案する。
論文 参考訳(メタデータ) (2025-10-16T03:37:16Z) - Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks [17.067788440109137]
現在、Mixture-of-Experts (MoE)モデルは最先端システムでは標準となっている。
記憶能力と推論能力の2つの異なる能力体制にMoEがどのような影響を及ぼすかを検討する。
論文 参考訳(メタデータ) (2025-08-26T04:31:28Z) - ExPLAIND: Unifying Model, Data, and Training Attribution to Study Model Behavior [39.590138981646696]
ポストホックの解釈可能性のメソッドは、通常、モデルの振る舞いをそのコンポーネント、データ、または独立した訓練軌跡に関連付ける。
これらの観点をすべて統合した統合フレームワークであるExPLAINDを紹介します。
論文 参考訳(メタデータ) (2025-05-26T14:53:11Z) - Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining [74.83412846804977]
強化学習(RL)に基づく微調整は、訓練後の言語モデルにおいて重要なステップとなっている。
数理推論のためのRLファインタニングを、スクラッチから完全にトレーニングモデルを用いて体系的にエンドツーエンドに研究する。
論文 参考訳(メタデータ) (2025-04-10T17:15:53Z) - More Is More -- Narrowing the Generalization Gap by Adding
Classification Heads [8.883733362171032]
我々は「TransNet」と呼ばれる入力変換に基づく既存のニューラルネットワークモデルのためのアーキテクチャ拡張を導入する。
私たちのモデルは、トレーニング時間のみに使用でき、予測のために刈り取られ、結果としてベースモデルと同等のアーキテクチャになります。
論文 参考訳(メタデータ) (2021-02-09T16:30:33Z) - On the Benefits of Invariance in Neural Networks [56.362579457990094]
データ拡張によるトレーニングは、リスクとその勾配をよりよく見積もることを示し、データ拡張でトレーニングされたモデルに対して、PAC-Bayes一般化を提供する。
また,データ拡張と比べ,平均化は凸損失を伴う場合の一般化誤差を低減し,PAC-Bayes境界を狭めることを示した。
論文 参考訳(メタデータ) (2020-05-01T02:08:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。