論文の概要: Explaining Data Mixing Scaling Laws
- arxiv url: http://arxiv.org/abs/2606.08167v1
- Date: Sat, 06 Jun 2026 13:31:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.888892
- Title: Explaining Data Mixing Scaling Laws
- Title(参考訳): データ混合スケーリング法則の解説
- Authors: Rui Dai, Shuran Zheng,
- Abstract要約: データミキシングの基礎となる力学を説明する統一的なフレームワークを提案する。
異なるデータ混合物で訓練されたモデルのドメイン損失を管理する2つの重要な要因を同定する。
我々のモデルは、大規模で目に見えないスケールで非常に効果的な混合物を予測し、スケールをまたいだ外挿に成功している。
- 参考スコア(独自算出の注目度): 2.1378946778058796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent research has established empirical scaling laws to predict model performance on multi-domain data mixtures. However, a theoretical understanding of these model loss behaviors remains absent. In this work, we propose a unified framework to explain the underlying mechanics of data mixing. Our approach extends theoretical perspectives originally developed for standard neural scaling laws (e.g., Kaplan and Chinchilla) to the multi-domain setting. Based on the distributional assumption that domains overlap on fundamental skills while diverging on specialized skills, we identify two key factors that govern the domain losses of models trained on different data mixtures: \textit{Capacity Competition}, where the allocation of finite model capacity couples domain losses globally, and \textit{Noise Reduction}, where optimal weights shift toward harder-to-learn domains to minimize overall noise. Empirical evaluations show that our framework outperforms existing baselines by fitting the loss landscape with a lower Mean Relative Error and identifying higher-performing training mixtures. Most importantly, our model successfully extrapolates across scales, predicting highly effective mixtures for large, unseen scales using parameters fitted on smaller ones. In addition, our model achieves these results using significantly fewer parameters compared to previous empirical laws. Our code is available at https://github.com/meiqwq/Explaining-Data-Mixing-Scaling-Laws.
- Abstract(参考訳): 近年の研究では、マルチドメインデータ混合物のモデル性能を予測するための経験的スケーリング法則が確立されている。
しかし、これらのモデル損失挙動に関する理論的理解はいまだに残っていない。
本研究では,データミキシングの基礎となる力学を説明する統一的なフレームワークを提案する。
提案手法は,従来のニューラルスケーリング法則(例えば,Kaplan,Chinchilla)をマルチドメイン設定に拡張する。
専門的なスキルを分散しながらドメインが基本的スキルに重なるという分布的仮定に基づいて、異なるデータ混合に基づいてトレーニングされたモデルのドメイン損失を管理する2つの重要な要因を同定する。
実験により, 損失景観を低い平均相対誤差に適合させ, 高い性能のトレーニング混合物を同定することにより, 既存のベースラインよりも優れた性能を示すことが示された。
最も重要なことは、我々のモデルはスケールをまたいだ外挿に成功し、より小さなスケールに収まるパラメータを用いて、大規模で目に見えないスケールで非常に効果的な混合を予測したことである。
さらに,本モデルでは,従来の経験則に比べてパラメータが大幅に少ないことから,これらの結果が得られる。
私たちのコードはhttps://github.com/meiqwq/Explaining-Data-Mixing-Scaling-Lawsで利用可能です。
関連論文リスト
- Mixture-of-Experts Models in Vision: Routing, Optimization, and Generalization [0.0]
画像分類設定におけるMoEの挙動について検討し、予測性能、専門家の活用、一般化に着目した。
我々は、CIFAR10データセット上の密度、SoftMoE、SparseMoE分類器を、同等のモデルキャパシティで比較する。
どちらのMoE変種も、正規化によるバランスの取れた専門家の利用を維持しながら、密度の高いベースラインよりもわずかに高い検証精度を達成する。
DenseとSparseMoEは、全てのモデルが同等の一般化性能を達成しているにもかかわらず、同様の曲率状態にあるのに対して、SoftMoEはこれらの指標によってよりシャープさを示す。
論文 参考訳(メタデータ) (2026-01-21T14:22:25Z) - Nonparametric Data Attribution for Diffusion Models [57.820618036556084]
生成モデルのデータ属性は、個々のトレーニング例がモデル出力に与える影響を定量化する。
生成画像とトレーニング画像のパッチレベルの類似性によって影響を測定する非パラメトリック属性法を提案する。
論文 参考訳(メタデータ) (2025-10-16T03:37:16Z) - Scaling Laws for Optimal Data Mixtures [36.161727115217964]
スケーリング法則を用いて、任意の対象領域に対して最適なデータ混合を決定するための体系的手法を提案する。
我々は,これらのスケーリング法則の普遍性を,その予測力を3つの異なる大規模設定で示すことによって検証する。
論文 参考訳(メタデータ) (2025-07-12T21:16:08Z) - BiMix: A Bivariate Data Mixing Law for Language Model Pretraining [47.77701041534746]
事前学習データ構成がモデル性能に与える影響はいまだよく分かっていない。
$textbfBiMix$は、データの混合を理解し、最適化するための体系的なフレームワークを提供する。
我々の研究は、データミキシングの力学に関する理論的知見と、LLMトレーニング効率を向上させるための実践的なツールの両方に貢献する。
論文 参考訳(メタデータ) (2024-05-23T09:44:02Z) - Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance [55.872926690722714]
本研究では,関数形式の混合比に関するモデル性能の予測可能性について検討する。
トレーニングステップのスケーリング法則,モデルサイズ,データ混合法則のネスト利用を提案する。
提案手法は,RedPajamaにおける100Bトークンをトレーニングした1Bモデルのトレーニング混合物を効果的に最適化する。
論文 参考訳(メタデータ) (2024-03-25T17:14:00Z) - Impact of Noisy Supervision in Foundation Model Learning [91.56591923244943]
本論文は、事前学習データセットにおけるノイズの性質を包括的に理解し分析する最初の研究である。
雑音の悪影響を緩和し、一般化を改善するため、特徴空間に適応するチューニング法(NMTune)を提案する。
論文 参考訳(メタデータ) (2024-03-11T16:22:41Z) - Compound Batch Normalization for Long-tailed Image Classification [77.42829178064807]
本稿では,ガウス混合に基づく複合バッチ正規化法を提案する。
機能空間をより包括的にモデル化し、ヘッドクラスの優位性を減らすことができる。
提案手法は,画像分類における既存の手法よりも優れている。
論文 参考訳(メタデータ) (2022-12-02T07:31:39Z) - MixKD: Towards Efficient Distillation of Large-scale Language Models [129.73786264834894]
データに依存しない蒸留フレームワークであるMixKDを提案する。
妥当な条件下では、MixKDは誤差と経験的誤差の間のギャップを小さくする。
限定的なデータ設定とアブレーションによる実験は、提案手法の利点をさらに証明している。
論文 参考訳(メタデータ) (2020-11-01T18:47:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。