論文の概要: Critical Windows of Complexity Control: When Transformers Decide to Reason or Memorize
- arxiv url: http://arxiv.org/abs/2605.04396v1
- Date: Wed, 06 May 2026 01:39:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.593811
- Title: Critical Windows of Complexity Control: When Transformers Decide to Reason or Memorize
- Title(参考訳): 複雑度制御のクリティカルウィンドウ:トランスフォーマーが推論か記憶かを決めるとき
- Abstract要約: 本研究では,変圧器の暗記・反響運命が,鋭く識別可能な訓練窓内で決定されることを示す。
クリティカルウィンドウ現象はタスク固有の現象であり、モジュラー演算によるグルーキングには現れないことを示す。
- 参考スコア(独自算出の注目度): 5.237172334460829
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has shown that Transformers' compositional generalization is governed by \emph{complexity control}, initialization scale and weight decay, which steers training toward low-complexity reasoning solutions rather than high-complexity memorization. Existing analyses, however, treat complexity control as a single static hyperparameter choice, leaving open \emph{when} during training this control is actually decisive. We show that the memorization-versus-reasoning fate of a Transformer is determined within a sharp, identifiable window of training. On a controlled compositional task we find that (i)~weight decay applied for a single 25\%-of-training window matches full-training weight decay in out-of-distribution (OOD) accuracy ($0.93$ vs $0.91$); (ii)~holding total regularization budget constant, placing it in the middle of training yields $5{-}9\times$ higher OOD accuracy than placing it early; (iii)~the boundary of the critical window is remarkably sharp, window onset shifted by as little as $100$ optimization steps causes mean OOD to jump from chance ($0.15$) to reasoning-regime ($0.61$); (iv)~the window's position depends systematically on initialization scale, but the basin of attraction for reasoning solutions \emph{shrinks} at small initialization, contradicting the prevailing recommendation that smaller initialization is uniformly better. We further show that the critical-window phenomenon is task-specific: it does not appear on grokking with modular arithmetic, where properly tuned constant weight decay matches scheduled weight decay.
- Abstract(参考訳): 近年の研究では、トランスフォーマーの合成一般化は「emph{complexity control}」や「初期化スケール」、および「重み劣化」によって制御されていることが示されている。
しかし、既存の分析では、複雑性制御を単一の静的ハイパーパラメータ選択として扱い、トレーニング中にオープンな \emph{when} を残している。
本研究では,変圧器の暗記・反響運命が,鋭く識別可能な訓練窓内で決定されることを示す。
制御された構成的タスクについて
(i) トレーニング窓の25\%の重量減衰は、アウト・オブ・ディストリビューション(OOD)の精度(0.93$対0.91$)のフルトレーニングウェイト崩壊と一致する。
(ii)~全正規化予算を一定に保ち、訓練中に置くと、早めに設置するよりも5{-}9\times$OOD精度が上がる。
(iii) クリティカルウィンドウの境界は著しくシャープで、ウィンドウのオンセットが100ドル以下にずれているので、OODは確率(0.15ドル)から推論レジーム(0.61ドル)にジャンプする。
(iv)~ウィンドウの位置は初期化スケールに体系的に依存するが、小さな初期化における推論解 \emph{shrinks} のアトラクションの盆地は、小さい初期化が一様であるという一般的な推奨に反している。
さらに、臨界ウインドウ現象はタスク固有であり、モジュラー算術によるグルーキングには現れず、適切に調整された一定の重みの減衰はスケジュールされた重みの減衰と一致する。
関連論文リスト
- Taming Curvature: Architecture Warm-Up for Stable Transformer Training [52.6838951211596]
本稿では,Hessian-vector製品を用いた暖かくスタートした変種に基づく最大(プレコンディション付き)Hessian固有値(曲率)の高速オンライン推定手法を提案する。
トレーニングの不安定性は、事前条件付き曲率の急激な上昇と一致し、曲率の深さが増加する。
大規模変圧器の実験により,本手法が効率的な曲率追跡を可能にし,不安定性を低減できることを確認した。
論文 参考訳(メタデータ) (2026-06-15T14:16:56Z) - Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization [18.737087162461563]
テストタイムの計算スケーリングは、大規模言語モデルのパフォーマンスを向上させるための強力なレバーとなっている。
しかし、これらのテクニックを有限の推論予算の下で展開するには、現在のシステムがほとんど無視する決定が必要である。
我々はこれを制約付き最適化問題(平均計算予算の予測精度を最大化する)として定式化し、2段階のソルベ・テン・ラーンパイプラインで解いた。
論文 参考訳(メタデータ) (2026-04-16T10:39:22Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Form Follows Function: Recursive Stem Model [0.0]
本稿では,計算量とNP問題を解くためにRecursive Stem Model (RSM)を導入する。
RSMは、初期イテレーションを分離された"ウォームアップ"ステップとして扱い、最終ステップでのみ損失を適用します。
Sudoku-Extremeでは、RSMはテスト時間計算で精度97.5%に達する。
論文 参考訳(メタデータ) (2026-03-03T00:55:00Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Optimal Learning-Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay [9.371921537573346]
機能的スケーリング法則の下で、最適学習率スケジュール(LRS)について検討する。
LRSは線形回帰と大規模言語モデル(LLM)の事前学習の損失ダイナミクスを正確にモデル化する。
我々は,ピーク学習率のみを調整した最適な形状固定スケジュールを解析する。
論文 参考訳(メタデータ) (2026-02-06T15:52:30Z) - Constraint-Aware Discrete-Time PID Gain Optimization for Robotic Joint Control Under Actuator Saturation [18.71390061417015]
実効ループは離散時間実行、アクチュエータ飽和、小さな遅延と測定の不完全さによって連続時間理論から逸脱する。
飽和離散時間ジョイント制御のための実装認識分析およびチューニングワークフローを提案する。
論文 参考訳(メタデータ) (2026-01-26T16:11:05Z) - Revisiting Weighted Strategy for Non-stationary Parametric Bandits and MDPs [56.246783503873225]
本稿では,非定常パラメトリックバンディットの重み付け戦略を再考する。
本稿では,ウィンドウ/リスタートベースアルゴリズムと同様に,より単純な重みに基づくアルゴリズムを提案する。
我々のフレームワークは、他のパラメトリックバンディットの後悔の限界を改善するのに使える。
論文 参考訳(メタデータ) (2026-01-03T04:50:21Z) - Benefits of Learning Rate Annealing for Tuning-Robustness in Stochastic Optimization [29.174036532175855]
勾配法における学習速度は、標準グリッドサーチによるチューニングに費用がかかることで悪名高い超特異性である。
我々は,広く使用されているコサインスケジュールなど,学習率を0に低下させる学習速度アニール方式の理論的利点を同定する。
論文 参考訳(メタデータ) (2025-03-12T14:06:34Z) - Revisiting Weighted Strategy for Non-stationary Parametric Bandits [82.1942459195896]
本稿では,非定常パラメトリックバンディットの重み付け戦略を再考する。
より単純な重みに基づくアルゴリズムを生成する改良された分析フレームワークを提案する。
我々の新しいフレームワークは、他のパラメトリックバンディットの後悔の限界を改善するのに使える。
論文 参考訳(メタデータ) (2023-03-05T15:11:14Z) - Balancing Rates and Variance via Adaptive Batch-Size for Stochastic
Optimization Problems [120.21685755278509]
本研究は,ステップサイズの減衰が正確な収束に必要であるという事実と,一定のステップサイズがエラーまでの時間でより速く学習するという事実のバランスをとることを目的とする。
ステップサイズのミニバッチを最初から修正するのではなく,パラメータを適応的に進化させることを提案する。
論文 参考訳(メタデータ) (2020-07-02T16:02:02Z) - Understanding the Difficulty of Training Transformers [120.99980924577787]
バランスの取れない勾配がトレーニングの不安定性の根本原因ではないことを示す。
我々は,早期段階のトレーニングを安定させ,後期段階においてその潜在能力を最大限に活用するためのアドミンを提案する。
論文 参考訳(メタデータ) (2020-04-17T13:59:07Z) - Optimal Change-Point Detection with Training Sequences in the Large and
Moderate Deviations Regimes [72.68201611113673]
本稿では,情報理論の観点から,新しいオフライン変化点検出問題について検討する。
基礎となる事前および変更後分布の知識は分かっておらず、利用可能なトレーニングシーケンスからのみ学習できると仮定する。
論文 参考訳(メタデータ) (2020-03-13T23:39:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。