論文の概要: You May Be Running the Wrong Inception Crop
- arxiv url: http://arxiv.org/abs/2610.04147v1
- Date: Fri, 02 Oct 2026 23:44:52 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:04:24.242465
- Title: You May Be Running the Wrong Inception Crop
- Title(参考訳): 懐かしいインセプション・クロップを走らせるかもしれない
- Abstract要約: インセプション作物は、ディープビジョンモデルをトレーニングするための標準の作物ベースのデータ拡張手法となっている。
我々はImageNet-1kデータセットで522 ViT-S/16モデルをトレーニングし、様々なトレーニング予算と作物のスケール分布を計測する。
より高いトレーニング予算には、より強力な拡張が必要です。
より高いトレーニング予算で訓練されたモデルは、作物の規模分布や体重減少にかかわらず、スパサーサリエンシを示す。
- 参考スコア(独自算出の注目度): 2.538209532048867
- License:
- Abstract: A decade after its inception, Inception crop has become the standard crop-based data augmentation method for training deep vision models. Not only is its practice of uniformly sampling crop scale and aspect ratio widely adopted, but also its lower and upper bounds, with the scale lower bound being the sole exception that is sometimes tuned. It is therefore surprising that the standard implementation in the TensorFlow / JAX ecosystem samples crop scale with probability density function $f(A) \propto \frac{1}{\sqrt{A}}$ unlike the PyTorch counterpart, which follows the original description. Motivated by this discovery, we train 522 ViT-S/16 models on the ImageNet-1k dataset with various training budgets and crop scale distributions. We reach $78.78\pm0.09$ top-1 val. accuracy with 90 epochs of training budget and find that 1. Higher training budget requires stronger augmentation; 2. Lower tail of the distribution of the crop scale determines the augmentation strength of Inception crop; 3. Models trained with higher training budget exhibit sparser saliency, regardless of the crop scale distribution or weight decay. Based on 2. we revisit the performance of Beta crop, whose softer cutoff allows it to optimize model performance across training budgets with less compromise. We replicate 1. and 3. with Scion optimizer in addition to AdamW, suggesting that the results may be general.
- Abstract(参考訳): 開始から10年が経ち、インセプション作物は、ディープビジョンモデルをトレーニングするための標準の作物ベースのデータ拡張方法となった。
作物のスケールとアスペクト比を均一にサンプリングするプラクティスが広く採用されているだけでなく、その下限と上限も広く採用されており、スケールの低い境界は時折調整される唯一の例外である。
したがって、TensorFlow / JAXエコシステムの標準実装が、オリジナルの記述に従うPyTorchと異なり、確率密度関数$f(A) \propto \frac{1}{\sqrt{A}}$で作物のスケールをサンプリングするのは驚きである。
この発見に触発されて、ImageNet-1kデータセットで522ViT-S/16モデルをトレーニングし、様々なトレーニング予算と作物のスケール分布を作成しました。
778.78\pm0.09$ top-1 valに到達しました。
訓練予算の90倍の精度で
1 より高い訓練予算には、強化の強化が必要である。
二 作物の分布の低い尾は、開始作物の増量強度を決定する。
3) 訓練予算を引き上げたモデルでは, 作物の粒度分布や体重減少にかかわらず, スペーサーの正当性を示す。
略歴
よりソフトなカットオフによって、より妥協の少ないトレーニング予算でのモデルパフォーマンスの最適化が可能になります。
複製する
1 および
3. AdamW に加えて Scion のオプティマイザも加わり、その結果は一般的なものになるかもしれない。
関連論文リスト
- Abra: Scaling Diffusion Image Training [19.77608057281383]
本稿では,テキスト・画像拡散モデルのための体系的スケーリング法則について述べる。
拡散モデルは言語モデルと同等にスケールするが、最適なトレーニングを行うにははるかに多くのデータが必要であることを示す。
言語モデルとは異なり、拡散モデルはオーバートレーニングに対して堅牢であり、実践者はより大きなモデルではなく、より多くのデータ側で学習すべきである。
論文 参考訳(メタデータ) (2026-08-18T02:36:25Z) - A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples [53.8898272536272]
画素空間拡散モデルは、生のピクセル上でエンドツーエンドのジェネレータを直接学習することを目的としている。
最近の研究は、代替の予測ターゲット、訓練目標、アーキテクチャによるピクセル拡散を改善している。
我々は、より安価で相補的な戦略があることを示します。textbfaフリーズ、事前訓練されたピクセル拡散モデルは、自身をガイドすることができます。
論文 参考訳(メタデータ) (2026-07-31T07:52:08Z) - A Large-Scale Study on the Accuracy vs Cost Trade-offs of Training and Evaluation Settings in Fine-Grained Image Recognition [38.6676446931066]
6つのトレーニングと評価設定、9つの事前訓練されたバックボーン、17のデータセットで2000以上の実験を行い、大規模な研究を行っている。
微粒化学習におけるデータ強化の有効性に関する予備的考察 : 対実的注意学習(CAL)の拡張を動機とする
推論コストを低減しつつ、競争精度を維持する効率的な評価専用変種を提案する。
論文 参考訳(メタデータ) (2026-05-18T17:36:30Z) - Test-Time Scaling Makes Overtraining Compute-Optimal [23.520624926542755]
モデルサイズ、トレーニングトークン、推論サンプルの数を共同で最適化するTrain-to-Test(T2$)スケーリング法則を提示します。
T2$は、テストタイムスケーリングに使用されるpass@k$モデリングで事前トレーニングの法則を近代化し、その後、共同で事前トレーニングとテストタイムの決定を最適化する。
論文 参考訳(メタデータ) (2026-04-01T21:17:32Z) - Efficient Neural Network Training via Subset Pretraining [5.352839075466439]
ニューラルネットワークのトレーニングでは、バッチ上で計算された部分勾配を使用するのが一般的である。
トレーニングセットの損失最小限は、そのサブセットのミニマによって適切に近似されることが期待できる。
実験の結果 従来の訓練に匹敵する結果に 達できることが確認されました。
論文 参考訳(メタデータ) (2024-10-21T21:31:12Z) - Rejection via Learning Density Ratios [50.91522897152437]
拒絶による分類は、モデルを予測しないことを許容する学習パラダイムとして現れます。
そこで我々は,事前学習したモデルの性能を最大化する理想的なデータ分布を求める。
私たちのフレームワークは、クリーンでノイズの多いデータセットで実証的にテストされます。
論文 参考訳(メタデータ) (2024-05-29T01:32:17Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z) - The effectiveness of MAE pre-pretraining for billion-scale pretraining [65.98338857597935]
モデルの初期化には自己教師付きMAE技術を用いる。
画像分類, 映像認識, 物体検出, ローショット分類, ゼロショット認識にまたがる10種類の視覚的タスクに対して, 事前学習の有効性を評価する。
論文 参考訳(メタデータ) (2023-03-23T17:56:12Z) - Soft Augmentation for Image Classification [68.71067594724663]
本稿では,変分変換による拡張の一般化とソフト拡張を提案する。
ソフトターゲットは、より攻撃的なデータ拡張を可能にすることを示す。
また,ソフト拡張が自己教師付き分類タスクに一般化されることも示している。
論文 参考訳(メタデータ) (2022-11-09T01:04:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。