論文の概要: When does training on downscaled images yield the same gradients?
- arxiv url: http://arxiv.org/abs/2608.04448v1
- Date: Wed, 05 Aug 2026 04:53:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.725553
- Title: When does training on downscaled images yield the same gradients?
- Title(参考訳): ダウンスケール画像のトレーニングは、いつ同じ勾配になるのか?
- Abstract要約: ダウンスケールステップのトレーニング拡散トランスフォーマーは、重量空間においてほぼネイティブのままながら、一定のステップ予算でトレーニング時間を14.6%短縮する。
ルートとノイズウインドウに制限されたダウンスケールのステップを持つLoRAアダプタの訓練は、固定ステップ予算でトレーニング時間を14.6%削減し、重量空間でほぼネイティブのままにする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Diffusion transformers deliver strong image generation, but their training cost grows superlinearly with resolution. Recent work justifies training or sampling at reduced resolution on a spectral premise: at high noise, a downscaled latent preserves almost the full surviving signal. Whether a downscaled step also preserves the native training gradient signal, however, has remained unresolved. We reduce how that signal changes under downscaling to two terms: a noise-dependent term governed by the downscale ratio, which decays at high noise as the spectral premise predicts, and a σ-independent floor governed by the target grid's absolute token count, carried by the compute graph itself and removed by no noise level. The measured (route, σ) map corroborates the account and uncovers structure the spectral picture cannot express: on the 1024->768 route, a window (0.65 < σ< 0.95), predicted by no spectral criterion at any tolerance, where the downscaled gradient stays within a small margin of the native one. Training LoRA adapters with downscaled steps restricted to the routes and noise windows the map validates reduces training time by 14.6% at a fixed step budget while remaining near-native in weight space. Code is available at https://github.com/sorryhyun/anima_lora.
- Abstract(参考訳): 拡散変換器は強力な画像生成を提供するが、そのトレーニングコストは解像度とともに超直線的に増加する。
最近の研究は、スペクトルの前提で低い分解能でトレーニングやサンプリングを正当化している。
しかし、ダウンスケールステップがネイティブトレーニング勾配信号も保存するかどうかは未解決のままである。
スペクトル前提が予測するように高雑音で減衰するダウンスケール比に支配されるノイズ依存項と、目標格子の絶対トークン数に支配されるσ非依存のフロアとが、計算グラフ自体によって実行され、ノイズレベルなしで除去される。
1024->768経路では、任意の許容度においてスペクトル基準が存在しないウィンドウ (0.65 < σ< 0.95) が予測され、ダウンスケールされた勾配はネイティブ画像の小さなマージンに留まっている。
ルートとノイズウインドウに制限されたダウンスケールのステップを持つLoRAアダプタの訓練は、固定ステップ予算でトレーニング時間を14.6%削減し、重量空間でほぼネイティブのままにする。
コードはhttps://github.com/sorryhyun/anima_lora.comから入手できる。
関連論文リスト
- Spectral Gradient Orthogonalization Improves Differentially Private Training at Scale [17.610398782149293]
空間的相関が勾配エネルギーを低ランクの部分空間に集中させる視覚モデルでは、ほとんどのノイズは信号がほとんどない方向に落ちる。
偏極分解によるスペクトル勾配直交化は後処理ステップとして導入される。
直交スペクトル信号対雑音比(SNR)が特異ベクトル回復に十分である場合にのみ精度が向上する。
論文 参考訳(メタデータ) (2026-08-18T06:35:26Z) - Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps [4.422349568747053]
本稿では,大規模モデル事前学習の既定であるウォームアップ安定度学習スケジュール(WSD)の段階について検討する。
提案手法は, 勾配雑音の構造と勾配雑音の構造が正規化するか否かという2つの特性を同時に有する。
論文 参考訳(メタデータ) (2026-07-14T05:21:38Z) - Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion [46.51681899437508]
本稿では,パラメータフリーで時間条件付き2D-DCTローパス演算子であるSpectral Forcingを導入する。
その遮断は拡散時間とともに単調に膨張し、データエンドポイントのアイデンティティとなる。
JiT-700M/32のImageNet-256では、Spectral Forcingは、異なるトレーニングエポック間で、FIDとInception Scoreの両方を一貫して改善している。
論文 参考訳(メタデータ) (2026-06-13T10:29:11Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime? [78.0226274470175]
我々は、勾配更新にラベルノイズを導入することで、ニューラルネットワーク(NN)のテスト性能が向上するかどうか検討する。
学習中のラベルノイズの付加は,学習過程を支配することを防止し,雑音の記憶を抑制することを実証する。
対照的に、標準GDで訓練されたNNは、同じ低SNR環境でのノイズに過度に適応する傾向にある。
論文 参考訳(メタデータ) (2025-10-20T13:28:13Z) - A Unified Noise-Curvature View of Loss of Trainability [8.602734307457387]
継続的学習におけるトレーニング容易性(LoT)の喪失は、タスクが進化するにつれて、ステップが改善されなくなります。
バッチサイズ対応勾配雑音境界と曲率ボラティリティ制御境界の2つの相補的基準を導入する。
このしきい値を用いることで、各レイヤを安全な限界以下に維持する、単純なレイヤごとのスケジューラを構築します。
論文 参考訳(メタデータ) (2025-09-24T02:11:13Z) - Latent Class-Conditional Noise Model [54.56899309997246]
本稿では,ベイズ的枠組みの下での雑音遷移をパラメータ化するためのLatent Class-Conditional Noise Model (LCCN)を提案する。
次に、Gibs sampler を用いて遅延真のラベルを効率的に推測できる LCCN の動的ラベル回帰法を導出する。
提案手法は,サンプルのミニバッチから事前の任意チューニングを回避するため,ノイズ遷移の安定な更新を保護している。
論文 参考訳(メタデータ) (2023-02-19T15:24:37Z) - Error-aware Quantization through Noise Tempering [43.049102196902844]
量子化対応トレーニング(QAT)は、量子化エラーをシミュレートしながら、エンドタスクに関するモデルパラメータを最適化する。
本研究では,指数関数的に減衰する量子化・エラー認識ノイズと,学習可能なタスク損失勾配のスケールを組み込んで量子化演算子の効果を近似する。
本手法は, 従来の手法を0.5-1.2%絶対値で上回り, 均一な(非混合精度)量子化のための最先端トップ1分類精度を得る。
論文 参考訳(メタデータ) (2022-12-11T20:37:50Z) - GradViT: Gradient Inversion of Vision Transformers [83.54779732309653]
我々は,視力変換器(ViT)の勾配に基づく逆攻撃に対する脆弱性を実証する。
自然に見える画像にランダムノイズを最適化するGradViTという手法を提案する。
元の(隠された)データに対する前例のない高い忠実さと近接性を観察する。
論文 参考訳(メタデータ) (2022-03-22T17:06:07Z) - Implicit Bias in Deep Linear Classification: Initialization Scale vs
Training Accuracy [71.25689267025244]
移行がスケールとトレーニング損失の最小化の関係によってどのように制御されるかを示す。
以上の結果から,勾配降下の限界挙動は,ばかげた訓練精度でのみ引き起こされることが示唆された。
論文 参考訳(メタデータ) (2020-07-13T23:49:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。