論文の概要: Backpropagation-Free Trunk Training via the Split Forward Gradients
- arxiv url: http://arxiv.org/abs/2607.16612v1
- Date: Sat, 18 Jul 2026 03:23:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.196249
- Title: Backpropagation-Free Trunk Training via the Split Forward Gradients
- Title(参考訳): スプリットフォワード勾配によるバックプロパゲーションフリートランクトレーニング
- Abstract要約: 中間表現でネットワークを分割するSplit Forward Gradient(Split-FG)を導入する。
Split-FG は出力ヘッド勾配を正確に計算し、ヤコビアンベクトル積のトランク勾配のみを推定する。
ピークメモリは、前モードトランクが成長するにつれてパフォーマンスギャップが拡大するが、マッチしたバックプロパゲーションと比較して最大35%まで削減される。
- 参考スコア(独自算出の注目度): 13.55091281996713
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Backpropagation makes training deep networks memory intensive because it must store intermediate activations. Forward-mode methods avoid this cost, but their gradient estimates become increasingly noisy as the number of trained parameters grows. We introduce Split Forward Gradient (Split-FG), which splits a network at an intermediate representation: it computes the output head gradient exactly and estimates only the trunk gradient with a Jacobian--vector product. This reduces estimator variance and requires no backward pass through the trunk, while retaining an Adam-style convergence guarantee. Our experiments reveal an important practical failure mode. On WikiText-103, naive forward-gradient training of the trunk performs worse than leaving a randomly initialized trunk frozen, likely because Adam updates every noisy, under-determined trunk coordinate too aggressively. Simply using a much smaller learning rate for the trunk reverses this result: a $16$M-parameter GPT-2-style model reaches validation perplexity $387$, compared with $668$ for the frozen-trunk control and $2{,}885$ for a matched pure forward-gradient baseline (backpropagation reaches $150$). Split-FG also produces the strongest backprop-free results on our tabular benchmarks and reaches $60.5\%$ on CIFAR-10 and $35.2\%$ on CIFAR-100 with a heavy-head design. It reduces peak memory by up to $35\%$ relative to matched backpropagation, although the performance gap widens as the forward-mode trunk grows.
- Abstract(参考訳): バックプロパゲーションは、中間的なアクティベーションを格納する必要があるため、ディープネットワークメモリのトレーニングを集中的に行う。
フォワードモード法は、このコストを回避するが、訓練されたパラメータの数が増加するにつれて、その勾配推定がノイズを増す。
スプリット・フォワード・グラディエント (Split Forward Gradient, Split-FG) を導入し, 出力ヘッド勾配を正確に計算し, トランク勾配のみをヤコビアンベクトル積で推定する。
これにより推定値の分散が減少し、Adamスタイルの収束保証を維持しながらトランクを後方通過する必要がなくなる。
我々の実験は重要な実用的失敗モードを明らかにした。
WikiText-103では、無作為に初期化されたトランクを凍結させたままにしておくよりも、トランクの優雅な前方段階の訓練は悪い。
16ドル(約1万2000円)のGPT-2スタイルのモデルは、凍ったトランク制御では668ドル、マッチした純粋な前方勾配ベースラインでは2,885ドル(バックプロパゲーションは150ドル)であるのに対し、検証の難易度は387ドル(約3万3000円)に達します。
Split-FGはまた、私たちの表のベンチマークで最強のバックプロップフリーの結果を生成し、CIFAR-10で60.5 %、CIFAR-100で35.2 %に達した。
前モードのトランクが成長するにつれて、パフォーマンスギャップが拡大するが、ピークメモリをマッチしたバックプロパゲーションと比較して最大35\%まで削減する。
関連論文リスト
- Harmfulness Propagation Dynamics: Layer-wise Trajectories of Adversarial Intent in Large Language Models [0.0]
textbfherald (textbfEncoding textbfRecognition via textbfActivation textbfLayer textbfDynamics)
textbfherald (textbfHarmful textbfEncoding textbfRecognition via textbfActivation textbfLayer textbfDynamics)
論文 参考訳(メタデータ) (2026-09-11T21:04:55Z) - MpSub: A Momentum $p$-Dimensional Subspace Trust-Region Method for Derivative-Free Fine-Tuning of Large Language Models [2.420502889163267]
微調整言語モデルのためのモーメント$p$次元部分空間信頼領域法(MpSub)を提案する。
MpSubは$p$次元の部分空間内を探索し、ある方向は最も最近受け入れられたステップから歴史的運動量を保存する。
3つの種に対して0.673と0.690の平均的な精度を達成し、学習速度の検索なしに調整されたMeZO (0.685)と一致する。
論文 参考訳(メタデータ) (2026-09-07T15:51:11Z) - Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee [14.954293251332894]
Federated Learning (FL)は、クライアントが生データを共有せずにモデルを協調的にトレーニングすることを可能にするが、ビザンティン攻撃に対して非常に脆弱である。
既存の堅牢なアプローチはこれらの脅威を中和するが、かなりの計算オーバーヘッドを発生させる。
ベクトルレベル距離に基づくロバストアグリゲータのための普遍加速度フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-27T11:39:47Z) - Bandit Convex Optimization with Gradient Prediction Adaptivity [56.816177049016794]
本研究では, 楽観的な勾配予測が, 最悪の後悔の保証を予測順応的に改善できるかどうかを考察する。
鍵となるアイデアは、分散が勾配ノルムではなく予測誤差でスケールする、新しい分散還元勾配推定器である。
我々は、$(sqrtmathbbE[S_T])$としてスケールする情報理論の下限を確立し、最も達成可能な予測適応的後悔の基本的な特徴を提供する。
論文 参考訳(メタデータ) (2026-05-21T08:57:38Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - Form Follows Function: Recursive Stem Model [0.0]
本稿では,計算量とNP問題を解くためにRecursive Stem Model (RSM)を導入する。
RSMは、初期イテレーションを分離された"ウォームアップ"ステップとして扱い、最終ステップでのみ損失を適用します。
Sudoku-Extremeでは、RSMはテスト時間計算で精度97.5%に達する。
論文 参考訳(メタデータ) (2026-03-03T00:55:00Z) - LoRIF: Low-Rank Influence Functions for Scalable Training Data Attribution [62.830878652285406]
トレーニングデータ属性は、モデルの予測に最も影響したトレーニング例を特定する。
LoRIFは、両方のボトルネックに対処するために、勾配の低ランク構造を利用する。
数百万のサンプルでデータセットでトレーニングされた0.1Bから70Bパラメータのモデルで、LoRIFは最大20$timesのストレージ削減とクエリ時の高速化を実現している。
論文 参考訳(メタデータ) (2026-01-29T16:18:34Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Statistical-Computational Trade-offs for Recursive Adaptive Partitioning Estimators [11.77169131123735]
我々は,高次元回帰のためのグリーディアルゴリズムが局所最適点において立ち往生していることを示す。
低い推定誤差を達成するために、greedyトレーニングには$exp(Omega(d))$が必要であることを示す。
この二分法は、平均場状態における勾配降下(SGD)を訓練した2層ニューラルネットワークを反映する。
論文 参考訳(メタデータ) (2024-11-07T03:11:53Z) - Generalized Differentiable RANSAC [95.95627475224231]
$nabla$-RANSACは、ランダム化された堅牢な推定パイプライン全体を学ぶことができる、微分可能なRANSACである。
$nabla$-RANSACは、精度という点では最先端のシステムよりも優れているが、精度は低い。
論文 参考訳(メタデータ) (2022-12-26T15:13:13Z) - FRAPPE: $\underline{\text{F}}$ast $\underline{\text{Ra}}$nk $\underline{\text{App}}$roximation with $\underline{\text{E}}$xplainable Features for Tensors [5.39764619690516]
FRAPPEは、CDDを計算することなくテンソルの正準ランクを推定する最初の方法である。
最高のパフォーマンスのベースラインよりも24倍以上高速で、合成データセット上でMAPEが10%改善されている。
論文 参考訳(メタデータ) (2022-06-19T03:19:59Z) - Provably Efficient Offline Reinforcement Learning with Trajectory-Wise
Reward [66.81579829897392]
我々はPessimistic vAlue iteRaTionとrEward Decomposition (PARTED)という新しいオフライン強化学習アルゴリズムを提案する。
PartEDは、最小2乗ベースの報酬再分配を通じて、ステップごとのプロキシ報酬に軌道を分解し、学習したプロキシ報酬に基づいて悲観的な値を実行する。
私たちの知る限りでは、PartEDは、トラジェクティブな報酬を持つ一般のMDPにおいて、証明可能な効率のよい最初のオフラインRLアルゴリズムである。
論文 参考訳(メタデータ) (2022-06-13T19:11:22Z) - Online nonparametric regression with Sobolev kernels [99.12817345416846]
我々は、ソボレフ空間のクラス上の後悔の上限を$W_pbeta(mathcalX)$, $pgeq 2, beta>fracdp$ とする。
上界は minimax regret analysis で支えられ、$beta> fracd2$ または $p=infty$ の場合、これらの値は(本質的に)最適である。
論文 参考訳(メタデータ) (2021-02-06T15:05:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。