論文の概要: How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models
- arxiv url: http://arxiv.org/abs/2608.28404v1
- Date: Fri, 28 Aug 2026 14:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.372369
- Title: How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models
- Title(参考訳): 運転時間は5500時間? ビデオ拡散モデルのスケーリング法則解析
- Abstract要約: 自動運転のためのビデオ生成は、プライバシ要件に縛られ、収集に費用がかかるため、自由にスクラップすることはできません。
本稿では,スクラッチから学習した映像拡散モデルのスケーリング法則について述べる。
我々は、スクラッチからトレーニングされた最大のビデオ拡散モデルをトレーニングし、ビデオ生成を駆動するための新たなオープンソース状態を設定する。
- 参考スコア(独自算出の注目度): 57.34034448977433
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video generation for autonomous driving cannot follow the web-scale route: driving data is expensive to collect, bound by privacy requirements, and cannot be scraped at will, so models must make the most of a fixed corpus. We present a systematic scaling-law study of video diffusion models trained from scratch on driving data: a family of models from 1M to 9B parameters, trained at different exposures on up to 5,500 hours of driving. Validation loss follows consistent power laws in both model size and training exposure, answering the questions that shape a training budget: whether compute is better spent on longer training or on a larger model, and whether more data is needed. Loss improves much faster with training exposure than with model size, making longer training the most effective way to improve a fixed model under limited compute. However, larger models continue to achieve lower asymptotic loss, so compute-optimal scaling still favors increasing model size when sufficient compute and data are available. Guided by these laws, we train a 9B-parameter model, to our knowledge the largest video diffusion model trained from scratch on driving data: it sets a new open-source state of the art for driving video generation, as measured on nuScenes. Our code and pretrained models are available at https://github.com/valeoai/VATIX. NATIX is separately releasing the underlying driving data in stages.
- Abstract(参考訳): 自動走行のためのビデオ生成は、Webスケールの経路を辿ることができない: 運転データは収集し、プライバシー要件に縛られ、自由にスクラップできないため、モデルは固定されたコーパスを最大限に活用しなければならない。
1Mから9Bパラメータのモデル群を最大5,500時間の走行で異なる露光で訓練した。
検証の損失は、モデルのサイズとトレーニングの露出の両方において一貫した力の法則に従い、トレーニング予算を形成する質問に答える。
損失はトレーニング露出でモデルサイズよりもはるかに高速に改善されるため、限られた計算下での固定モデルを改善する上で、より長いトレーニングを最も効果的に行うことができる。
しかし、より大きなモデルでは漸近的損失が小さくなり続けており、計算-最適スケーリングは十分な計算とデータが利用できる場合にモデルのサイズが大きくなることを好んでいる。
nuScenesで測定されたように、これらの法則に則って、私たちは9Bパラメーターモデルをトレーニングし、運転データに基づいて訓練された最大のビデオ拡散モデルについて知識を得る。
私たちのコードと事前訓練されたモデルはhttps://github.com/valeoai/VATIX.comで公開されています。
NATIXは、基盤となるドライビングデータを段階的に別々にリリースしている。
関連論文リスト
- Abra: Scaling Diffusion Image Training [19.77608057281383]
本稿では,テキスト・画像拡散モデルのための体系的スケーリング法則について述べる。
拡散モデルは言語モデルと同等にスケールするが、最適なトレーニングを行うにははるかに多くのデータが必要であることを示す。
言語モデルとは異なり、拡散モデルはオーバートレーニングに対して堅牢であり、実践者はより大きなモデルではなく、より多くのデータ側で学習すべきである。
論文 参考訳(メタデータ) (2026-08-18T02:36:25Z) - Compute-Optimal Scaling for Value-Based Deep RL [99.680827753493]
オンライン価値ベースディープRLの計算スケーリングについて検討する。
解析の結果,モデルサイズ,バッチサイズ,UTD間の微妙な相互作用が明らかになった。
この現象を理解するためのメンタルモデルを提供し、バッチサイズとUTDを選択するためのガイドラインを構築します。
論文 参考訳(メタデータ) (2025-08-20T17:54:21Z) - Training and Inference Efficiency of Encoder-Decoder Speech Models [25.031622057759492]
我々は効率角に焦点を合わせ、これらの音声モデルを効率的に訓練しているかどうかを問う。
ミニバッチサンプリングにおける無視は、パディングに50%以上費やされていることを示す。
モデルアーキテクチャを調整してデコーダからエンコーダにモデルパラメータを転送すると、3倍の推論速度が得られます。
論文 参考訳(メタデータ) (2025-03-07T20:57:43Z) - Scaling Inference-Efficient Language Models [3.271571137474847]
モデルアーキテクチャは推論レイテンシに影響を与えており、同じサイズのモデルでは最大3.5倍のレイテンシの差が生じる可能性がある。
我々は、モデルパラメータ数、トレーニングトークンの数、モデルアーキテクチャを共最適化するために、Chinchillaスケーリングの法則を変更します。
下流タスクの精度を維持しつつ、推論遅延を1.8倍改善するMorph-1Bモデルをリリースする。
論文 参考訳(メタデータ) (2025-01-30T03:16:44Z) - A Hitchhiker's Guide to Scaling Law Estimation [56.06982415792523]
スケーリング法則は、より少ないパラメータやより少ないトレーニングセットで訓練が容易なモデルから外挿することで、ターゲットとなる機械学習モデルの損失を予測する。
我々は1000以上のスケーリング法則を推定し、新しいモデルファミリーにおけるスケーリング法則を推定するためのベストプラクティスを導出する。
論文 参考訳(メタデータ) (2024-10-15T17:59:10Z) - A Dynamical Model of Neural Scaling Laws [79.59705237659547]
ネットワークトレーニングと一般化の解決可能なモデルとして,勾配降下で訓練されたランダムな特徴モデルを分析する。
我々の理論は、データの繰り返し再利用により、トレーニングとテスト損失のギャップが徐々に増大することを示している。
論文 参考訳(メタデータ) (2024-02-02T01:41:38Z) - AI Model Disgorgement: Methods and Choices [127.54319351058167]
本稿では,現代の機械学習システムに適用可能な分類法を紹介する。
学習モデルにおけるデータ「効果の除去」の意味を,スクラッチからリトレーニングする必要のない方法で検討する。
論文 参考訳(メタデータ) (2023-04-07T08:50:18Z) - On Data Scaling in Masked Image Modeling [36.00347416479826]
マスク付き画像モデリング(MIM)は、大きなデータの恩恵を受けられないと疑われている。
ImageNet-1Kの10%から完全なImageNet-22Kまで、モデルサイズは4900万から10億まで、トレーニング期間は125万から5万まで。
事前トレーニングにおけるバリデーションの損失は、複数のタスクの微調整においてモデルがどれだけうまく機能するかを測定するのに良い指標である。
論文 参考訳(メタデータ) (2022-06-09T17:58:24Z) - Train Large, Then Compress: Rethinking Model Size for Efficient Training
and Inference of Transformers [94.43313684188819]
本研究では,計算によって制限されたNLPタスクのトランスフォーマーモデルに着目し,モデルサイズの影響について検討する。
まず最初に、より小さなTransformerモデルがイテレーション毎に高速に実行されているにもかかわらず、より広いモデルとより深いモデルがはるかに少ないステップで収束していることを示します。
これは、大きなTransformerモデルのトレーニング効率と小さなTransformerモデルの推論効率との間に明らかなトレードオフをもたらす。
論文 参考訳(メタデータ) (2020-02-26T21:17:13Z) - Scaling Laws for Neural Language Models [14.472857826717613]
クロスエントロピー損失に対する言語モデル性能のスケーリング法則について検討する。
損失は、モデルサイズ、データセットサイズ、トレーニングに使用される計算量など、パワーローとしてスケールする。
論文 参考訳(メタデータ) (2020-01-23T03:59:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。