論文の概要: Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining
- arxiv url: http://arxiv.org/abs/2608.23922v1
- Date: Mon, 24 Aug 2026 23:56:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.666419
- Title: Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining
- Title(参考訳): 混合実験としてのデータ混合:大規模言語モデル事前学習のための応答曲面法と最適設計
- Authors: Yicheng Mao, Hongru Du,
- Abstract要約: プロキシベースの手法を用いた古典的混合実験の構造を示す。
データドメインは混合コンポーネント、トークン共有はコンポーネント比率、プロキシトレーニング実行は実験的な設計ポイント、バリデーション損失は確率単純度上の応答面を定義する。
実験的なケーススタディとしてRegMixを用いて、観測された混合応答を解釈し、より効率的なプロキシ実験を設計する方法を実証する。
- 参考スコア(独自算出の注目度): 1.0312968200748118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data mixing is a central design problem in large language model pretraining: given a fixed token budget, practitioners must decide how much data to allocate to each domain. Recent proxy-based methods address this problem by training small models on candidate mixtures, fitting a response model, and using the response to select mixtures for larger-scale training. We show that this workflow has the structure of a classical mixture experiment. Under this view, data domains are mixture components, token shares are component proportions, proxy-training runs are experimental design points, and validation loss defines a response surface over the probability simplex. We develop this formulation using sparse second-order Scheffé response-surface models and construct model-robust $\mathcal{I}$-optimal designs for proxy data-mixing experiments. Using RegMix as an empirical case study, we demonstrate how the framework can both interpret observed mixture responses and design more efficient proxy experiments. The Scheffé analysis shows that domain value is strongly relational: several domains that are weak under additive effects become favourable through pairwise interactions, especially through combinations with web-derived text. The sparse Scheffé model preserves mixture rankings across model scales and remains competitive with a flexible machine-learning predictor while providing an explicit decomposition of additive and interaction effects. In a simulation study calibrated to observed proxy-training responses, model-robust $\mathcal{I}$-optimal designs recover the relevant mixture ordering after removing about 25\% of the original proxy runs. These results suggest that LLM data mixing should be treated not only as a prediction problem, but also as an experimental-design problem in which the proxy mixtures themselves can be chosen to improve statistical efficiency.
- Abstract(参考訳): データミキシングは、大きな言語モデルの事前トレーニングにおける中心的な設計問題である。固定トークンの予算が与えられた場合、各ドメインに割り当てられるデータ量を決定する必要がある。
最近のプロキシベースの手法では、候補混合物の小さなモデルを訓練し、応答モデルに適合させ、より大規模な訓練のために選択した混合物に対する応答を使用することで、この問題に対処している。
このワークフローは古典的な混合実験の構造を持つことを示す。
この観点では、データドメインは混合コンポーネント、トークン共有はコンポーネント比率、プロキシトレーニング実行は実験的な設計ポイント、バリデーション損失は確率単純度上の応答面を定義する。
この定式化はスパースな2次Scheffé応答曲面モデルを用いて開発し、プロキシデータ混合実験のためのモデルロバスト $\mathcal{I}$-最適化設計を行う。
実験的なケーススタディとしてRegMixを用いて、観測された混合応答を解釈し、より効率的なプロキシ実験を設計する方法を実証する。
加法効果の下で弱いいくつかの領域は、ペアの相互作用、特にWebから派生したテキストの組み合わせによって有利になる。
スパース・シェッフェ・モデルはモデルスケールの混合ランキングを保持し、フレキシブルな機械学習予測器と競合する一方で、加法効果と相互作用効果の明確な分解を提供する。
観測されたプロキシトレーニング応答を調整したシミュレーションスタディでは、モデルのrobust $\mathcal{I}$-optimal designは、元のプロキシ実行の約25%を削除した後、関連する混合順序を回復する。
これらの結果から, LLMデータ混合は, 予測問題だけでなく, 統計的効率を向上させるために, プロキシ混合物自体を選択可能な実験設計問題として扱われるべきであることが示唆された。
関連論文リスト
- CausalMix: Data Mixture as Causal Inference for Language Model Training [25.091228095854415]
大規模言語モデル(LLM)トレーニングでは、データミキシングはモデルの性能を決定する上で重要な役割を果たす。
最近の手法では、プロキシモデルによる混合重み付けを最適化しているが、静的なデータ分布の仮定に依存している。
本稿では、因果推論問題としてデータ混合最適化をキャストすることで、この制限に対処するCausalMixを提案する。
論文 参考訳(メタデータ) (2026-07-01T15:56:11Z) - FastMix: Fast Data Mixture Optimization via Gradient Descent [55.109758242985556]
Fastmixは、単一のプロキシモデルのみをトレーニングしながら、データミックスの検出を自動化する新しいフレームワークである。
混合比の最適化は、均一なソースサンプリングの下で、ソース当たりの損失重みを割り当てることと数学的に等価であることを示す。
FASTmixはベースラインを上回り、事前トレーニングや後トレーニングで検索コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-06-12T21:46:57Z) - Data Mixing for Large Language Models Pretraining: A Survey and Outlook [52.66761353708619]
大規模言語モデル(LLM)は、大規模で不均一なコーパスの事前訓練に依存している。
サンプルレベルのデータ選択とは異なり、データミキシングはドメインレベルのサンプリング重量を最適化し、限られた予算をより効率的に割り当てる。
本稿では,LLM事前学習におけるデータ混合の総合的な検討について述べる。
論文 参考訳(メタデータ) (2026-03-25T13:30:40Z) - Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training [16.022416196267937]
本稿では,モデルマージを利用して最適なデータ比を推定する新しいフレームワークであるDeouple Searching from Training Mix (DeMix)を提案する。
DeMixは,検索効率,精度,効率のトレードオフを破り,検索コストの低いベンチマーク性能と最適混合が得られることを示す。
論文 参考訳(メタデータ) (2026-01-31T14:27:46Z) - Amortized Bayesian Mixture Models [1.3976439685325095]
本稿では,混合モデルに適したABI(Amortized Bayesian Inference)の拡張について紹介する。
我々は、後部をパラメータの分布と(カテゴリー的な)混合指標の分布に分解し、生成ニューラルネットワークの組み合わせを利用できるようにする。
提案フレームワークは、独立混合モデルと依存混合モデルの両方に対応し、フィルタリングと平滑化を可能にする。
論文 参考訳(メタデータ) (2025-01-17T14:51:03Z) - Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance [55.872926690722714]
本研究では,関数形式の混合比に関するモデル性能の予測可能性について検討する。
トレーニングステップのスケーリング法則,モデルサイズ,データ混合法則のネスト利用を提案する。
提案手法は,RedPajamaにおける100Bトークンをトレーニングした1Bモデルのトレーニング混合物を効果的に最適化する。
論文 参考訳(メタデータ) (2024-03-25T17:14:00Z) - Harnessing Hard Mixed Samples with Decoupled Regularizer [69.98746081734441]
Mixupは、決定境界を混合データで滑らかにすることで、ニューラルネットワークの一般化を改善する効率的なデータ拡張アプローチである。
本稿では,非結合型正規化器(Decoupled Mixup, DM)を用いた効率的な混合目標関数を提案する。
DMは、ミキシングの本来の滑らかさを損なうことなく、硬質混合試料を適応的に利用して識別特性をマイニングすることができる。
論文 参考訳(メタデータ) (2022-03-21T07:12:18Z) - Robust Finite Mixture Regression for Heterogeneous Targets [70.19798470463378]
本稿では,サンプルクラスタの探索と,複数の不完全な混合型ターゲットを同時にモデル化するFMRモデルを提案する。
我々は、高次元の学習フレームワークの下で、無症状のオラクルのパフォーマンス境界をモデルに提供します。
その結果,我々のモデルは最先端の性能を達成できることがわかった。
論文 参考訳(メタデータ) (2020-10-12T03:27:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。