論文の概要: When does training on downscaled images yield the same gradients?
- arxiv url: http://arxiv.org/abs/2608.04448v1
- Date: Wed, 05 Aug 2026 04:53:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.725553
- Title: When does training on downscaled images yield the same gradients?
- Title(参考訳): ダウンスケール画像のトレーニングは、いつ同じ勾配になるのか?
- Authors: Seunghyun Ji,
- Abstract要約: ダウンスケールステップのトレーニング拡散トランスフォーマーは、重量空間においてほぼネイティブのままながら、一定のステップ予算でトレーニング時間を14.6%短縮する。
ルートとノイズウインドウに制限されたダウンスケールのステップを持つLoRAアダプタの訓練は、固定ステップ予算でトレーニング時間を14.6%削減し、重量空間でほぼネイティブのままにする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Diffusion transformers deliver strong image generation, but their training cost grows superlinearly with resolution. Recent work justifies training or sampling at reduced resolution on a spectral premise: at high noise, a downscaled latent preserves almost the full surviving signal. Whether a downscaled step also preserves the native training gradient signal, however, has remained unresolved. We reduce how that signal changes under downscaling to two terms: a noise-dependent term governed by the downscale ratio, which decays at high noise as the spectral premise predicts, and a σ-independent floor governed by the target grid's absolute token count, carried by the compute graph itself and removed by no noise level. The measured (route, σ) map corroborates the account and uncovers structure the spectral picture cannot express: on the 1024->768 route, a window (0.65 < σ< 0.95), predicted by no spectral criterion at any tolerance, where the downscaled gradient stays within a small margin of the native one. Training LoRA adapters with downscaled steps restricted to the routes and noise windows the map validates reduces training time by 14.6% at a fixed step budget while remaining near-native in weight space. Code is available at https://github.com/sorryhyun/anima_lora.
- Abstract(参考訳): 拡散変換器は強力な画像生成を提供するが、そのトレーニングコストは解像度とともに超直線的に増加する。
最近の研究は、スペクトルの前提で低い分解能でトレーニングやサンプリングを正当化している。
しかし、ダウンスケールステップがネイティブトレーニング勾配信号も保存するかどうかは未解決のままである。
スペクトル前提が予測するように高雑音で減衰するダウンスケール比に支配されるノイズ依存項と、目標格子の絶対トークン数に支配されるσ非依存のフロアとが、計算グラフ自体によって実行され、ノイズレベルなしで除去される。
1024->768経路では、任意の許容度においてスペクトル基準が存在しないウィンドウ (0.65 < σ< 0.95) が予測され、ダウンスケールされた勾配はネイティブ画像の小さなマージンに留まっている。
ルートとノイズウインドウに制限されたダウンスケールのステップを持つLoRAアダプタの訓練は、固定ステップ予算でトレーニング時間を14.6%削減し、重量空間でほぼネイティブのままにする。
コードはhttps://github.com/sorryhyun/anima_lora.comから入手できる。
関連論文リスト
- Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps [4.422349568747053]
本稿では,大規模モデル事前学習の既定であるウォームアップ安定度学習スケジュール(WSD)の段階について検討する。
提案手法は, 勾配雑音の構造と勾配雑音の構造が正規化するか否かという2つの特性を同時に有する。
論文 参考訳(メタデータ) (2026-07-14T05:21:38Z) - Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion [46.51681899437508]
本稿では,パラメータフリーで時間条件付き2D-DCTローパス演算子であるSpectral Forcingを導入する。
その遮断は拡散時間とともに単調に膨張し、データエンドポイントのアイデンティティとなる。
JiT-700M/32のImageNet-256では、Spectral Forcingは、異なるトレーニングエポック間で、FIDとInception Scoreの両方を一貫して改善している。
論文 参考訳(メタデータ) (2026-06-13T10:29:11Z) - A Unified Noise-Curvature View of Loss of Trainability [8.602734307457387]
継続的学習におけるトレーニング容易性(LoT)の喪失は、タスクが進化するにつれて、ステップが改善されなくなります。
バッチサイズ対応勾配雑音境界と曲率ボラティリティ制御境界の2つの相補的基準を導入する。
このしきい値を用いることで、各レイヤを安全な限界以下に維持する、単純なレイヤごとのスケジューラを構築します。
論文 参考訳(メタデータ) (2025-09-24T02:11:13Z) - Latent Class-Conditional Noise Model [54.56899309997246]
本稿では,ベイズ的枠組みの下での雑音遷移をパラメータ化するためのLatent Class-Conditional Noise Model (LCCN)を提案する。
次に、Gibs sampler を用いて遅延真のラベルを効率的に推測できる LCCN の動的ラベル回帰法を導出する。
提案手法は,サンプルのミニバッチから事前の任意チューニングを回避するため,ノイズ遷移の安定な更新を保護している。
論文 参考訳(メタデータ) (2023-02-19T15:24:37Z) - Error-aware Quantization through Noise Tempering [43.049102196902844]
量子化対応トレーニング(QAT)は、量子化エラーをシミュレートしながら、エンドタスクに関するモデルパラメータを最適化する。
本研究では,指数関数的に減衰する量子化・エラー認識ノイズと,学習可能なタスク損失勾配のスケールを組み込んで量子化演算子の効果を近似する。
本手法は, 従来の手法を0.5-1.2%絶対値で上回り, 均一な(非混合精度)量子化のための最先端トップ1分類精度を得る。
論文 参考訳(メタデータ) (2022-12-11T20:37:50Z) - GradViT: Gradient Inversion of Vision Transformers [83.54779732309653]
我々は,視力変換器(ViT)の勾配に基づく逆攻撃に対する脆弱性を実証する。
自然に見える画像にランダムノイズを最適化するGradViTという手法を提案する。
元の(隠された)データに対する前例のない高い忠実さと近接性を観察する。
論文 参考訳(メタデータ) (2022-03-22T17:06:07Z) - Implicit Bias in Deep Linear Classification: Initialization Scale vs
Training Accuracy [71.25689267025244]
移行がスケールとトレーニング損失の最小化の関係によってどのように制御されるかを示す。
以上の結果から,勾配降下の限界挙動は,ばかげた訓練精度でのみ引き起こされることが示唆された。
論文 参考訳(メタデータ) (2020-07-13T23:49:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。