論文の概要: Learning Decision-Stump Thresholds in Context: Dynamics of Softmax Attention
- arxiv url: http://arxiv.org/abs/2610.07074v1
- Date: Mon, 05 Oct 2026 09:00:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.541981
- Title: Learning Decision-Stump Thresholds in Context: Dynamics of Softmax Attention
- Title(参考訳): 文脈における決定基準閾値の学習:ソフトマックスの注意のダイナミクス
- Abstract要約: 決定しきい値を推定するには、未知の境界付近で観測を行う必要がある。
勾配に基づく事前学習は2パラメータのソフトマックスアテンションモデルでこの統計則を学習することを示す。
また, 片頭部モデルの境界限界を同定し, 反射対称性を統計的に説明する。
- 参考スコア(独自算出の注目度): 10.960057599060562
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Estimating a decision threshold requires locating observations near an unknown boundary. We study how gradient-based pretraining learns this statistical rule in a two-parameter softmax-attention model with a fixed feature and inequality direction. Pretraining uses labeled contexts and their true thresholds; a fresh threshold must be inferred from context alone. Under a large-resolution initialization, constant-step gradient descent on $m$ tasks with $n$ examples each produces a frozen estimator with error $\widetilde O((m\wedge n)^{-1}+N^{-1})$ for each fixed interior threshold and every fresh-context size $N$. The two terms separate finite-pretraining accuracy from fresh-context localization. The mechanism is coordinated parameter divergence: population training calibrates the relative label and feature scores, then increases the attention scale as $t^{1/4}$, giving population threshold error $O(t^{-1/4})$. To transfer this mechanism to a fixed finite corpus, we control gradient errors relative to the shrinking directions of progress at successive parameter scales. This certifies a growing training interval without requiring long-time tracking of the population trajectory. We also identify the boundary limitation of the one-head model and explain statistically what a reflected symmetrization could achieve.
- Abstract(参考訳): 決定しきい値を推定するには、未知の境界付近で観測を行う必要がある。
本研究では,2パラメータのソフトマックスアテンションモデルにおいて,勾配に基づく事前学習が,この統計規則をどのように学習するかを検討する。
Pretrainingはラベル付きコンテキストとその真のしきい値を使用します。
大規模な初期化の下では、$m$タスクに$n$の例を持つ定数ステップ勾配は、各固定された内部しきい値とすべての新しいコンテキストサイズ$N$に対して、エラー$\widetilde O((m\wedge n)^{-1}+N^{-1})$で凍結推定子を生成する。
2つの用語は、新しいコンテキストの局所化から有限事前学習の精度を区別する。
人口訓練は相対ラベルと特徴スコアを校正し、注意尺度を$t^{1/4}$に上げ、人口閾値誤差$O(t^{-1/4})$を与える。
この機構を固定有限コーパスに転送するために、連続パラメータスケールでの進行の縮小方向に対する勾配誤差を制御する。
これは、人口軌跡の長期追跡を必要とせずに、成長するトレーニング間隔を認定する。
また, 片頭部モデルの境界限界を同定し, 反射対称性を統計的に説明する。
関連論文リスト
- Ideal Paths for Approximating Logistic Gradient Descent Trajectories at Large Initialization [2.1771821757134915]
我々は、厳密な線形分離可能なデータに基づいて、全バッチロジスティック降下軌道の幾何学的近似を用いる。
固定ステップ GD 軌道が$R$ で割られたことは、固定パラメータ区間毎に$Rtoinfty$ として一様収束することを証明している。
この近似はピーク評価損失と累積トレーニング損失の式を提供する。
論文 参考訳(メタデータ) (2026-10-02T23:29:20Z) - Constrained Online Learning with Noisy Constraint Values [55.29259818039367]
一般的な実現可能性の下では、我々のLEDGERアルゴリズムは、期待される損失$O(sqrt T)と期待される予算違反$O(sqrtTlog(eT))を達成します。
スレーター条件、フィードバックチャネル間の独立性、絶対的制約値境界は不要である。
論文 参考訳(メタデータ) (2026-09-07T01:38:41Z) - Learning the score under shape constraints [7.005582630391827]
正方形の$L2(P_0)$-lossに対するスコア推定の最小リスクについて検討する。
推定問題の2つの基本的な側面を捉えた対数凹密度のサブクラスを定義する。
後者のクラスに対するミニマックスリスクは、次数$L2/(2+1)n-/(2+1)$からpoly-logarithmic factorまでである。
論文 参考訳(メタデータ) (2025-12-16T17:39:54Z) - SGD Convergence under Stepsize Shrinkage in Low-Precision Training [0.0]
量子化勾配の縮退は等級の縮退をもたらし、勾配の傾きが収束する方法を変える。
この収縮は, 有効段数 (mu_k q_k ) の通常の段数 (mu_k q_k ) に影響を及ぼすことを示す。
精度の低いSGDは依然として収束するが, (q_min ) で設定した速度は遅く, 量子化効果による誤差も高い。
論文 参考訳(メタデータ) (2025-08-10T02:25:48Z) - A Mean-Field Analysis of Neural Stochastic Gradient Descent-Ascent for Functional Minimax Optimization [90.87444114491116]
本稿では,超パラメトリック化された2層ニューラルネットワークの無限次元関数クラス上で定義される最小最適化問題について検討する。
i) 勾配降下指数アルゴリズムの収束と, (ii) ニューラルネットワークの表現学習に対処する。
その結果、ニューラルネットワークによって誘導される特徴表現は、ワッサーシュタイン距離で測定された$O(alpha-1)$で初期表現から逸脱することが許された。
論文 参考訳(メタデータ) (2024-04-18T16:46:08Z) - Bridging Discrete and Backpropagation: Straight-Through and Beyond [62.46558842476455]
本稿では,離散潜在変数の生成に関わるパラメータの勾配を近似する新しい手法を提案する。
本稿では,Hunの手法とODEを解くための2次数値法を統合することで,2次精度を実現するReinMaxを提案する。
論文 参考訳(メタデータ) (2023-04-17T20:59:49Z) - Gradient Estimation for Binary Latent Variables via Gradient Variance
Clipping [6.234350105794441]
勾配推定はしばしば、離散潜在変数を持つ生成モデルに適合するために必要である。
DisARMや他の推定器は、パラメータ空間の境界付近でばらつきを爆発させる可能性がある。
パラメータ空間の境界における分散を小さくする勾配推定器 textitbitflip-1 を提案する。
論文 参考訳(メタデータ) (2022-08-12T05:37:52Z) - $\texttt{FedBC}$: Calibrating Global and Local Models via Federated
Learning Beyond Consensus [66.62731854746856]
フェデレートラーニング(FL)では、デバイス全体にわたるモデル更新の集約を通じて、グローバルモデルを協調的に学習する目的は、ローカル情報を通じたパーソナライズという目標に反対する傾向にある。
本研究では,このトレードオフを多基準最適化により定量的にキャリブレーションする。
私たちは、$texttFedBC$が、スイートデータセット間でグローバルおよびローカルモデルのテスト精度のメトリクスのバランスをとることを実証しています。
論文 参考訳(メタデータ) (2022-06-22T02:42:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。