論文の概要: Abra: Scaling Diffusion Image Training
- arxiv url: http://arxiv.org/abs/2608.17286v1
- Date: Tue, 18 Aug 2026 02:36:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.186265
- Title: Abra: Scaling Diffusion Image Training
- Title(参考訳): Abra: 拡散画像トレーニングのスケーリング
- Abstract要約: 本稿では,テキスト・画像拡散モデルのための体系的スケーリング法則について述べる。
拡散モデルは言語モデルと同等にスケールするが、最適なトレーニングを行うにははるかに多くのデータが必要であることを示す。
言語モデルとは異なり、拡散モデルはオーバートレーニングに対して堅牢であり、実践者はより大きなモデルではなく、より多くのデータ側で学習すべきである。
- 参考スコア(独自算出の注目度): 19.77608057281383
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Compute-optimal scaling laws guide the training of frontier language models yet remain largely unexplored for visual generation. We present a systematic scaling law study for text-to-image diffusion models using Abra, a controlled family of flow-matching transformers trained across three orders of magnitude worth of compute ($10^{19}$ to $10^{22}$ FLOPs), reaching significantly larger compute budgets than previous works. We demonstrate that diffusion models scale just as predictably as language models but require far more data to train optimally: compute optimality occurs at approximately $200$ image tokens per parameter, ten times the Chinchilla compute-optimal prescription for LLMs. We show that unlike language models, diffusion models are robust to overtraining and that practitioners should err on the side of more data rather than a larger model. Finally, we show that this predictability extends beyond training loss to generative quality metrics, optimal CFG settings, representation quality, and even the shape of the training curves, which collapse onto a universal form.
- Abstract(参考訳): コンピュータ最適スケーリング法則は、フロンティア言語モデルのトレーニングをガイドするが、ビジュアルジェネレーションには未解明のままである。
本稿では,Abraを用いたテキスト・画像拡散モデルの体系的スケーリング法則について述べる。Abraは3桁の計算量(10^{19}$から10^{22}$ FLOPs)で訓練されたフローマッチング変換器の制御系であり,従来よりもはるかに大きな計算予算を達成している。
拡散モデルは言語モデルと同等にスケールするが、最適にトレーニングするためにははるかに多くのデータが必要であることを実証する。
言語モデルとは異なり、拡散モデルはオーバートレーニングに対して堅牢であり、実践者はより大きなモデルではなく、より多くのデータ側で学習すべきである。
最後に、この予測可能性は、トレーニング損失を超えて、生成的品質指標、最適なCFG設定、表現的品質、さらには普遍的な形式に崩壊するトレーニング曲線の形状にまで及んでいることを示す。
関連論文リスト
- How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models [57.34034448977433]
自動運転のためのビデオ生成は、プライバシ要件に縛られ、収集に費用がかかるため、自由にスクラップすることはできません。
本稿では,スクラッチから学習した映像拡散モデルのスケーリング法則について述べる。
我々は、スクラッチからトレーニングされた最大のビデオ拡散モデルをトレーニングし、ビデオ生成を駆動するための新たなオープンソース状態を設定する。
論文 参考訳(メタデータ) (2026-08-28T14:56:01Z) - Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts [2.2554080765044717]
Mixture-of-Experts (MoE)アーキテクチャは、計算コストの比例的に増加することなく、モデル容量を大幅に拡張する。
大規模MOEモデルの学習に最適な学習率を推定する計算効率の高い2段階のハイパーパラメータ転送フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-20T13:57:43Z) - Scaling Law Analysis in Federated Learning: How to Select the Optimal Model Size? [12.791994483385409]
高品質で精度の高いトレーニングデータの枯渇に対する懸念が高まっている。
Federated Learningにおけるトレーニングデータセットの分散化は、大規模なモデルをスケールする上での課題を導入している。
本稿では,従来のモデルスケーリング体験をフェデレートした学習シナリオに一般化するための洞察を提供する。
論文 参考訳(メタデータ) (2025-11-15T12:41:25Z) - Compute-Optimal Scaling for Value-Based Deep RL [99.680827753493]
オンライン価値ベースディープRLの計算スケーリングについて検討する。
解析の結果,モデルサイズ,バッチサイズ,UTD間の微妙な相互作用が明らかになった。
この現象を理解するためのメンタルモデルを提供し、バッチサイズとUTDを選択するためのガイドラインを構築します。
論文 参考訳(メタデータ) (2025-08-20T17:54:21Z) - Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models [62.3458061002951]
本稿では,新たなスケール法であるFarseerを紹介した。
モデル損失曲面 $L(N,D)$ を体系的に構築することにより、Farseer は以前の法則よりも経験的データに非常によく適合する。
我々の手法は正確で頑健で、非常に一般化可能な予測をもたらし、優れた外挿能力を示す。
論文 参考訳(メタデータ) (2025-06-12T17:59:23Z) - Scaling Inference-Efficient Language Models [3.271571137474847]
モデルアーキテクチャは推論レイテンシに影響を与えており、同じサイズのモデルでは最大3.5倍のレイテンシの差が生じる可能性がある。
我々は、モデルパラメータ数、トレーニングトークンの数、モデルアーキテクチャを共最適化するために、Chinchillaスケーリングの法則を変更します。
下流タスクの精度を維持しつつ、推論遅延を1.8倍改善するMorph-1Bモデルをリリースする。
論文 参考訳(メタデータ) (2025-01-30T03:16:44Z) - Towards Precise Scaling Laws for Video Diffusion Transformers [43.6690970187664]
ビデオ拡散変換器のスケーリング法則を解析し,任意のモデルサイズと計算予算に対して新しいスケーリング法則を提案する。
これらの最適設定の下では、従来のスケーリング手法と比較して、同等のパフォーマンスを実現し、推論コストを40.1%削減する。
論文 参考訳(メタデータ) (2024-11-25T18:59:04Z) - More Compute Is What You Need [3.184416958830696]
モデル性能はトランスフォーマーモデルに費やされる計算量に大きく依存することを示す新しいスケーリング法則を提案する。
a)推論効率、トレーニングは、より小さなモデルサイズとより大きなトレーニングデータセットを優先すべきであり、(b)利用可能なWebデータセットの枯渇を前提として、モデルサイズをスケールすることが、モデルパフォーマンスをさらに改善するための唯一の方法である、と予測する。
論文 参考訳(メタデータ) (2024-04-30T12:05:48Z) - FreeSeg-Diff: Training-Free Open-Vocabulary Segmentation with Diffusion Models [49.80911683739506]
我々は,閉鎖語彙データセットのトレーニングモデルによって伝統的に解決されるイメージセグメンテーションの課題に焦点をあてる。
我々は、ゼロショットのオープン語彙セグメンテーションのために、異なる、比較的小さなオープンソース基盤モデルを活用している。
当社のアプローチ(別名FreeSeg-Diff)は、トレーニングに依存しないもので、Pascal VOCとCOCOデータセットの両方で多くのトレーニングベースのアプローチより優れています。
論文 参考訳(メタデータ) (2024-03-29T10:38:25Z) - Joint Adaptive Representations for Image-Language Learning [59.40890927221377]
画像言語学習のためのレシピを提案し、より大きくて高価なものよりも優れたモデルを作成し、しばしば桁違いに大きなデータセットで訓練する。
我々の重要な発見は、適応的かつ反復的にマルチモーダルな特徴を融合させる、コンパクトな視覚と言語表現の連成学習である。
たった4000万のトレーニング例と39のGFLOPで、私たちの軽量モデルは、2~20倍以上のFLOPの最先端モデルで、さらに大きなデータセットを使用して、1B近くのトレーニング例で何倍もパフォーマンスを上げています。
論文 参考訳(メタデータ) (2023-05-31T15:02:02Z) - Ensembling Off-the-shelf Models for GAN Training [55.34705213104182]
事前学習されたコンピュータビジョンモデルは、識別器のアンサンブルで使用する場合、性能を著しく向上させることができる。
本研究では,事前学習したモデル埋め込みにおける実検体と偽検体間の線形分離性を検証し,効率的な選択機構を提案する。
本手法は, 限られたデータと大規模設定の両方において, GAN トレーニングを改善することができる。
論文 参考訳(メタデータ) (2021-12-16T18:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。