論文の概要: Gate-Zero Growth: A Geometric Framework for Function-Preserving Continual Learning
- arxiv url: http://arxiv.org/abs/2607.14571v1
- Date: Thu, 16 Jul 2026 05:00:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.993355
- Title: Gate-Zero Growth: A Geometric Framework for Function-Preserving Continual Learning
- Title(参考訳): Gate-Zero Growth: 関数保存連続学習のための幾何学的フレームワーク
- Abstract要約: ゲートゼロ成長は連続学習のための関数保存(マグニチュード)演算子である。
新しいゲート方向は、新しい機能的変動の唯一の1次源である。
ゲートゼロ成長(英: Gate-zero growth)は、CLにおける安全なキャパシティ活性化を管理する共有局所幾何学の標準的な例である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce \emph{gate-zero growth}, a function-preserving (FP) operator for continual learning that adds new residual blocks through a zero-initialised gate. Under a transversality condition, gate-zero growth induces \emph{rank separation} in the functional Jacobian: old directions are unchanged, new-weight directions are exactly flat at the growth point, and new gate directions are the only first-order source of new functional variation. As gates open during continual learning, function drift is $O(\|\boldsymbolα\|^2)$ and Jacobian leakage $O(\|\boldsymbolα\|_\infty)$, giving a controlled departure from the FP locus. On a $300\mathrm{M}\to857\mathrm{M}$ Transformer adapted from WikiText-103 to BookCorpus, gate-zero growth reaches near-zero old-domain forgetting ($Δ_A < 0.1$) under both exact-preservation (Isolation) and joint-frontier (Freeze-Nothing) operating points, while a non-FP control ($G_{\text{stack}}$) suffers an order-of-magnitude larger forgetting under the same recipe. The same geometric analysis covers LoRA, ReZero, and zero-init adapter constructions, establishing gate-zero growth as the canonical instance of a shared local geometry that governs safe capacity activation in CL.
- Abstract(参考訳): ゼロ初期化ゲートを介して新たな残留ブロックを追加する連続学習のための関数保存(FP)演算子である \emph{gate-zero growth} を導入する。
直交条件下では、ゲートゼロ成長は機能的ジャコビアンにおいて 'emph{rank separation} を誘導する: 古い方向は変化せず、新しい方向は成長点において正確に平坦であり、新しいゲート方向は新しい機能的変動の唯一の一階の源である。
連続学習中にゲートが開くと、関数のドリフトは$O(\|\boldsymbolα\|^2)$で、ヤコビアンリークは$O(\|\boldsymbolα\|_\infty)$で、FPの軌跡から制御される。
300\mathrm{M}\to857\mathrm{M}$ Transformer with WikiText-103 to BookCorpus, gate-zero growth reach almost-zero old- domain forgetting ($Δ_A < 0.1$) under both exact-servation (Isolation) and joint-frontier (Freeze-Nothing) operating points, while a non-FP control ($G_{\text{stack}}$) are a order-of-magnitude greater forgeting under the same recipe。
同じ幾何学的解析は LoRA, ReZero, および 0-init アダプタの構成をカバーし、CL における安全なキャパシティアクティベーションを管理する共有局所幾何学の標準インスタンスとしてゲートゼロ成長を確立する。
関連論文リスト
- A Provable Oracle-Free Quantum Algorithm for Nonlinear Dynamics on Hybrid Oscillator-Qubit Processors [14.814423713691623]
そこで我々は,次数$L$の非線型常微分方程式に対して,演算次数$dotmathbfx=mathbff(mathbfx)$のハイブリッドqubit-qumodeアルゴリズムを開発した。
このアルゴリズムは状態密度を伝播し、その密度のピークとして小雑音の極限で軌道を返す。
論文 参考訳(メタデータ) (2026-07-30T17:10:47Z) - Eigenbasis-Independent Learnable Spectral Positional Encodings for Directed Graphs via Hermitian Block Krylov Subspaces [4.46261341603246]
エンプグラフのスペクトル位置符号化は2つの障害に直面している。
磁性ラプラシアンはポテンシャルごとに$O(n3)$エルミート固有分解を必要とする。
ここでは、a_q$が正規化磁気演算子であるような、学習可能なスペクトルPEを$h_(A_q),R$として提案する。
PE は作用素のEmphmatrix関数であるため、構成によってゲージ不変である。
論文 参考訳(メタデータ) (2026-07-08T06:05:54Z) - Hidden-State Privacy Has an Empty Middle [51.56484100374058]
すべてのフルランクガウス解放を$O(1)$ Fisher utility で表すと、マハラノビス信号が隠れた幅で直線的に成長する方向を認める。
スクラッチからトレーニングされたスプリットメモリトランスフォーマーは、[20, 33]$90MでG_mathrmMahに達し、固定言語損失ペナルティにおいて、30Mから1Bまでの同じ予算のGPTベースラインに対して6ドル~24ドルという優位性を維持する。
論文 参考訳(メタデータ) (2026-05-21T20:12:09Z) - Learning Theory of Transformers: Local-to-Global Approximation via Softmax Partition of Unity [5.37133760455631]
本稿では,コンパクトユークリッド領域上の回帰タスクに対するトランスフォーマーネットワークの学習理論について検討する。
本稿では,対象関数の局所近似を構築し,それらを大域的近似に集約するトランスフォーマーの構成的近似フレームワークを提案する。
2つのエンコーダブロックと標準単層フィードフォワードネットワークを備えた高密度トランスフォーマーは、$$$Hlder連続関数に対して均一な$varepsilon$-approximation誤差を実現できることを示す。
論文 参考訳(メタデータ) (2026-05-09T09:02:37Z) - Dimensional Criticality at Grokking Across MLPs and Transformers [2.652953665748039]
異なる力学系間の急激な遷移は、複雑なシステムの目印である。
オフライン雪崩探査機 textbfTDU-OFC (Thresholded Diffusion Update--Olami-Feder-Christensen) を紹介する。
モジュラー加算と XOR で訓練された一般化を訓練したトランスフォーマーは、拡散ベースラインの局所的交差をD=1$で発見する。
論文 参考訳(メタデータ) (2026-04-06T13:43:20Z) - Group Representational Position Encoding [66.33026480082025]
グループ行動に基づく位置符号化のための統一的なフレームワークであるGRAPEを提案する。
i)乗法回転 (Multiplicative GRAPE) in $mathrmSO(d)$ と (ii)加法ロジットバイアス (Additive GRAPE) は一般線型群 $mathrmGL$ における一等作用から生じる。
論文 参考訳(メタデータ) (2025-12-08T18:39:13Z) - Symmetry-Breaking Descent for Invariant Cost Functionals [0.0]
タスクコストの関数的$W : Hs(M) を mathbbR$ に還元する問題について検討する。
信号の対称性を破る変形はコストを低減できることを示す。
論文 参考訳(メタデータ) (2025-05-19T15:06:31Z) - Efficient, direct compilation of SU(N) operations into SNAP &
Displacement gates [0.0]
Map $Phi$は、$d$次元のユニタリを直接SNAPと変位ゲートのシーケンスにコンパイルする機能を提供する。
計算回路上の誤差は各回転を$m$$theta/m$回転に分割することで任意に小さくすることができる。
論文 参考訳(メタデータ) (2023-07-21T20:58:17Z) - The Sample Complexity of Online Contract Design [120.9833763323407]
オンライン環境での隠れアクションの主エージェント問題について検討する。
各ラウンドにおいて、主席は、各結果に基づいてエージェントへの支払いを指定する契約を投稿する。
エージェントは、自身のユーティリティを最大化する戦略的な行動選択を行うが、プリンシパルによって直接観察できない。
論文 参考訳(メタデータ) (2022-11-10T17:59:42Z) - Adaptive Stochastic Variance Reduction for Non-convex Finite-Sum
Minimization [52.25843977506935]
有限サム構造をもつ$L$-smooth, non-deuction関数に対して, AdaSpider と呼ばれる適応分散法を提案する。
そうすることで、$tildeOleft + st/epsilonコールで$epsilon-stationaryポイントを計算することができます。
論文 参考訳(メタデータ) (2022-11-03T14:41:46Z) - Proximal Gradient Descent-Ascent: Variable Convergence under K{\L}
Geometry [49.65455534654459]
有限降下指数パラメータ (GDA) はミニマックス最適化問題の解法として広く応用されている。
本稿では、KL-L型幾何学の収束を研究することにより、そのようなギャップを埋める。
論文 参考訳(メタデータ) (2021-02-09T05:35:53Z) - A Simple Convergence Proof of Adam and Adagrad [74.24716715922759]
我々はAdam Adagradと$O(d(N)/st)$アルゴリズムの収束の証明を示す。
Adamはデフォルトパラメータで使用する場合と同じ収束$O(d(N)/st)$で収束する。
論文 参考訳(メタデータ) (2020-03-05T01:56:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。