論文の概要: Landau theory of quenched criticality in linear in-context learning
- arxiv url: http://arxiv.org/abs/2608.28059v1
- Date: Fri, 28 Aug 2026 08:22:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.252933
- Title: Landau theory of quenched criticality in linear in-context learning
- Title(参考訳): 線形インコンテキスト学習におけるクエンチ臨界性のランドウ理論
- Authors: Daesik Kim, Sumin Choi, Hyojae Jeon, Jung Hoon Han,
- Abstract要約: In-context Learning (ICL) では、事前訓練されたモデルがそのパラメータを更新することなく、プロンプトで提供された例から新しいタスクを推論することができる。
予測誤差は、事前学習サンプルの数が学習可能なパラメータの数に匹敵するときに、二重発散特異点を発達させる。
この特異点を、焼成障害系の臨界現象として定式化する。
- 参考スコア(独自算出の注目度): 3.8658012868021694
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In-context learning (ICL) allows a pretrained model to infer a new task from examples supplied in its prompt without updating its parameters. In linear models of ICL, the prediction error develops a double-descent singularity when the number of pretraining samples becomes comparable to the number of learnable parameters. We formulate this interpolation singularity as a critical phenomenon of a quenched disordered system. By comparing annealed and quenched descriptions of the same linear ICL model, we identify the connected sample-to-sample fluctuations of the learned parameters as the microscopic origin of the singular error. A Landau potential is constructed by integrating the cavity self-consistency equation for the renormalized ridge parameter $ξ$. The role of (magnetization) order parameter is played by $ξ$, while the bare ridge parameter $λ$ becomes its conjugate magnetic field. The normalized sample complexity $τ$ acts as a temperature and the double-descent singularity occurs at the critical temperature $τ_c =1$. The Landau susceptibility is precisely the quantity that diverges in the fluctuation contribution to the prediction error. The order parameter is closely related to the fraction of zero eigenvalues of the empirical relaxation matrix in the ridgeless limit, which define flat directions in the learning dynamics. The Landau theory is generically cubic in the order parameter with critical exponents $(β_{\rm cr},δ_{\rm cr},γ_{\rm cr})=(1,2,1)$. In the large-context regime, there appears a pseudogap-like regime characterized by suppressed order parameter. Predictions of the Landau theory are independently confirmed from numerical solutions of the original learning problem with good quantitative agreement. Our results pave the way for solid statistical-physics understanding of the interpolation criticality in linear in-context learning.
- Abstract(参考訳): In-context Learning (ICL) では、事前訓練されたモデルがそのパラメータを更新することなく、プロンプトで提供された例から新しいタスクを推論することができる。
ICLの線形モデルにおいて、予測誤差は、事前学習サンプルの数が学習可能なパラメータの数に匹敵するときに、二重発散特異点を発達させる。
我々は、この補間特異点を、焼成障害系の臨界現象として定式化する。
同一線形ICLモデルの熱処理と焼入れによる記述を比較することにより,学習パラメータのサンプル・サンプル間変動を特異誤差の顕微鏡的起点として同定する。
ランダウポテンシャルは、再正規化されたリッジパラメータの空洞自己整合方程式(英語版)を統合することで構成される。
磁化(磁化)順序パラメータの役割は$$$で表され、素リッジパラメータ$λ$はその共役磁場となる。
正規化サンプルの複雑さ$τ$は温度として作用し、臨界温度$τ_c = 1$で二重発光特異点が発生する。
ランダウ・サセプティビリティ(Landau susceptibility)は、正確には、予測誤差に対するゆらぎ寄与が分散する量である。
順序パラメータは、学習力学における平坦な方向を定義するリッジレス極限における経験的緩和行列のゼロ固有値の分数と密接に関連している。
ランダウ理論は、臨界指数 $(β_{\rm cr},δ_{\rm cr},γ_{\rm cr})=(1,2,1)$ の順序パラメータで一般立方体である。
大規模文脈では、順序パラメータの抑制によって特徴づけられる擬似ギャップのような状態が現れる。
ランダウ理論の予測は、元の学習問題の数値解から、十分な量的一致で独立に確認される。
本研究は,線形インコンテクスト学習における補間臨界点の統計的・物理的な立体的理解の道を開くものである。
関連論文リスト
- Machine Learning Surrogate Modeling for Homogenization of Hyperelastic Materials with Boolean Microstructures [0.0]
データ駆動サロゲートモデルは、異種物質の数値的均質化の代替となる。
ニューラルネットワークはスカラーと曲線の統計記述子の組み合わせに基づいて訓練される。
パラメータ空間の制限ケースを表す追加データは、トレーニングを安定させ、外挿動作を改善するために組み込まれている。
論文 参考訳(メタデータ) (2026-05-31T00:51:52Z) - Model-free Methods for Event History Analysis and Efficient Adjustment (PhD Thesis) [55.2480439325792]
この論文は、モデルフリーの観点から統一された統計学への独立した貢献のシリーズである。
第1章では、機械学習から予測技術を活用する柔軟なメソッドを定式化するために、モデルフリーの視点をどのように利用できるか、詳しく説明している。
第2章では、あるプロセスの進化が他のプロセスに直接影響されるかどうかを記述した地域独立の概念を研究している。
論文 参考訳(メタデータ) (2025-02-11T19:24:09Z) - Asymptotics of Linear Regression with Linearly Dependent Data [28.005935031887038]
非ガウス共変量の設定における線形回帰の計算について検討する。
本稿では,依存性が推定誤差と正規化パラメータの選択にどのように影響するかを示す。
論文 参考訳(メタデータ) (2024-12-04T20:31:47Z) - Benign overfitting in Fixed Dimension via Physics-Informed Learning with Smooth Inductive Bias [8.668428992331808]
我々は,線形逆問題に対処する際,カーネルリッジ(レス)回帰のためのソボレフノルム学習曲線を開発した。
この結果から, 逆問題におけるPDE演算子は分散を安定化し, 固定次元問題に対して良性オーバーフィッティングを行うことが可能であることがわかった。
論文 参考訳(メタデータ) (2024-06-13T14:54:30Z) - Scaling and renormalization in high-dimensional regression [72.59731158970894]
リッジ回帰に関する最近の結果について統一的な視点を提示する。
我々は、物理とディープラーニングの背景を持つ読者を対象に、ランダム行列理論と自由確率の基本的なツールを使用する。
我々の結果は拡張され、初期のスケーリング法則のモデルについて統一的な視点を提供する。
論文 参考訳(メタデータ) (2024-05-01T15:59:00Z) - Learning with Norm Constrained, Over-parameterized, Two-layer Neural Networks [54.177130905659155]
近年の研究では、再生カーネルヒルベルト空間(RKHS)がニューラルネットワークによる関数のモデル化に適した空間ではないことが示されている。
本稿では,有界ノルムを持つオーバーパラメータ化された2層ニューラルネットワークに適した関数空間について検討する。
論文 参考訳(メタデータ) (2024-04-29T15:04:07Z) - Global Convergence of Over-parameterized Deep Equilibrium Models [52.65330015267245]
ディープ均衡モデル(Deep equilibrium model, DEQ)は、入射を伴う無限深度重み付きモデルの平衡点を通して暗黙的に定義される。
無限の計算の代わりに、ルートフィンディングで直接平衡点を解き、暗黙の微分で勾配を計算する。
本稿では,無限深度重み付きモデルの非漸近解析における技術的困難を克服する新しい確率的枠組みを提案する。
論文 参考訳(メタデータ) (2022-05-27T08:00:13Z) - Inverting brain grey matter models with likelihood-free inference: a
tool for trustable cytoarchitecture measurements [62.997667081978825]
脳の灰白質細胞構造の特徴は、体密度と体積に定量的に敏感であり、dMRIでは未解決の課題である。
我々は新しいフォワードモデル、特に新しい方程式系を提案し、比較的スパースなb殻を必要とする。
次に,提案手法を逆転させるため,確率自由推論 (LFI) として知られるベイズ解析から最新のツールを適用した。
論文 参考訳(メタデータ) (2021-11-15T09:08:27Z) - The Predictive Normalized Maximum Likelihood for Over-parameterized
Linear Regression with Norm Constraint: Regret and Double Descent [12.929639356256928]
現代の機械学習モデルは、予測規則の複雑さとその一般化能力の間のトレードオフに従わないことを示す。
最近提案された予測正規化最大値 (pNML) は、個々のデータに対するmin-max後悔解である。
我々は,pNML後悔を合成データ上でのポイントワイド学習可能性尺度として使用し,二重発生現象の予測に成功していることを示す。
論文 参考訳(メタデータ) (2021-02-14T15:49:04Z) - Leveraging Global Parameters for Flow-based Neural Posterior Estimation [90.21090932619695]
実験観測に基づくモデルのパラメータを推定することは、科学的方法の中心である。
特に困難な設定は、モデルが強く不確定であるとき、すなわち、パラメータの異なるセットが同一の観測をもたらすときである。
本稿では,グローバルパラメータを共有する観測の補助的セットによって伝達される付加情報を利用して,その不確定性を破る手法を提案する。
論文 参考訳(メタデータ) (2021-02-12T12:23:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。