論文の概要: CausalMix: Data Mixture as Causal Inference for Language Model Training
- arxiv url: http://arxiv.org/abs/2607.01104v1
- Date: Wed, 01 Jul 2026 15:56:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.975853
- Title: CausalMix: Data Mixture as Causal Inference for Language Model Training
- Title(参考訳): CausalMix: 言語モデルトレーニングのための因果推論としてのデータ混合
- Abstract要約: 大規模言語モデル(LLM)トレーニングでは、データミキシングはモデルの性能を決定する上で重要な役割を果たす。
最近の手法では、プロキシモデルによる混合重み付けを最適化しているが、静的なデータ分布の仮定に依存している。
本稿では、因果推論問題としてデータ混合最適化をキャストすることで、この制限に対処するCausalMixを提案する。
- 参考スコア(独自算出の注目度): 25.091228095854415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Large Language Model (LLM) training, data mixing plays a pivotal role in determining model performance. Recent methods optimize mixture weights via proxy models, but they rely on the assumption of static data distributions. As a result, when the underlying data pool shifts, these methods require costly retraining from scratch. This limitation restricts their ability to scale seamlessly from small settings to larger data pools and model sizes. In this paper, we propose CausalMix to address this limitation by casting data mixture optimization as a causal inference problem. We formulate the statistical features of the data pool as covariates and the domain mixture as the treatment. After fitting a causal model on 512 runs of Qwen2.5-0.5B to estimate the Conditional Average Treatment Effect (CATE), we extrapolate the optimal mixture for an 800K data pool and apply it to train a 7B model. Furthermore, we successfully generalize the framework to long chain-of-thought data on Qwen3-4B-Base. By leveraging causal modeling to isolate confounding biases, CausalMix dynamically infers state-dependent optimal data mixtures. Extensive experiments show that the mixture guided by CausalMix consistently improves performance across multiple downstream tasks, outperforming RegMix and other baselines. In addition, we use the CATE Interpreter to provide visual analysis of the learned mixing strategy. Overall, CausalMix offers a causal and interpretable framework for optimizing LLM data mixtures.
- Abstract(参考訳): 大規模言語モデル(LLM)トレーニングでは、データミキシングはモデルの性能を決定する上で重要な役割を果たす。
最近の手法では、プロキシモデルによる混合重み付けを最適化しているが、静的なデータ分布の仮定に依存している。
その結果、基盤となるデータプールがシフトすると、これらの手法はスクラッチからコストのかかる再トレーニングを必要とします。
この制限により、小さな設定からより大きなデータプールやモデルサイズへのシームレスなスケーリングが制限される。
本稿では、因果推論問題としてデータ混合最適化をキャストすることで、この制限に対処するCausalMixを提案する。
データプールの統計的特徴を共変量として定式化し,その処理として領域混合を定式化する。
条件平均処理効果(CATE)を推定するために,Qwen2.5-0.5Bの512ランに因果モデルを適用した後,800Kデータプールの最適混合物を外挿し,それを7Bモデルのトレーニングに適用する。
さらに,フレームワークをQwen3-4B-Base上での長いチェーンデータに一般化することに成功した。
CausalMixは因果モデリングを利用して境界バイアスを分離することで、状態依存の最適なデータ混合を動的に推論する。
大規模な実験によると、CausalMixによってガイドされた混合は、複数のダウンストリームタスクのパフォーマンスを継続的に改善し、RegMixや他のベースラインを上回っている。
さらに,CATEインタープリタを用いて学習した混合戦略の視覚的分析を行う。
全体として、CausalMixはLLMデータの混合を最適化するための因果的かつ解釈可能なフレームワークを提供する。
関連論文リスト
- Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining [1.0312968200748118]
プロキシベースの手法を用いた古典的混合実験の構造を示す。
データドメインは混合コンポーネント、トークン共有はコンポーネント比率、プロキシトレーニング実行は実験的な設計ポイント、バリデーション損失は確率単純度上の応答面を定義する。
実験的なケーススタディとしてRegMixを用いて、観測された混合応答を解釈し、より効率的なプロキシ実験を設計する方法を実証する。
論文 参考訳(メタデータ) (2026-08-24T23:56:38Z) - FastMix: Fast Data Mixture Optimization via Gradient Descent [55.109758242985556]
Fastmixは、単一のプロキシモデルのみをトレーニングしながら、データミックスの検出を自動化する新しいフレームワークである。
混合比の最適化は、均一なソースサンプリングの下で、ソース当たりの損失重みを割り当てることと数学的に等価であることを示す。
FASTmixはベースラインを上回り、事前トレーニングや後トレーニングで検索コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-06-12T21:46:57Z) - Capacity-Aware Mixture Law Enables Efficient LLM Data Optimization [20.220685778194156]
データ混合スケーリングのための計算効率の高いパイプラインを導入する。
まず、検証損失をモデル化するキャパシティ対応混合法則CAMELを提案する。
また,検証損失からベンチマーク精度を推定する損益予測法を導入する。
論文 参考訳(メタデータ) (2026-03-09T06:58:00Z) - MergeMix: Optimizing Mid-Training Data Mixtures via Learnable Model Merging [72.00014675808228]
textbfMixは、重みをマージするモデルを高忠実で低コストなパフォーマンスプロキシとして再利用することで、最適なデータ混合比を決定する。
8B と 16B のパラメータを持つモデルの実験では、MergeMix が完全なマニュアルチューニングに匹敵するパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-01-25T14:31:57Z) - CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training [63.07024608399447]
本稿では,事前学習環境でデータ混合物を発見し,評価し,精製する自動フレームワークを提案する。
ClimbLabは、20のクラスタを研究用グラウンドとして、フィルタされた1.2トリリオントーケンコーパスであり、ClimbMixはコンパクトだが強力な400ビリオントーケンデータセットである。
論文 参考訳(メタデータ) (2025-04-17T17:58:13Z) - Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models [24.396525123797073]
本稿では,各候補混合物に対応するクロスエントロピー損失の効率的な近似により,データ混合の事前学習を最適化する手法を提案する。
我々はこの近似を回帰モデルにおける付加的な特徴の源として用い、少数の混合物に対するモデル損失の観測から訓練した。
論文 参考訳(メタデータ) (2025-02-21T21:27:48Z) - RegMix: Data Mixture as Regression for Language Model Pre-training [40.45464495981735]
本稿では,レグレッションタスクとして定式化することで,ハイパフォーマンスなデータ混合物を自動的に識別するRegMixを提案する。
RegMixは、様々なデータ混合物で多くの小さなモデルを訓練し、回帰を使って目に見えない混合物のパフォーマンスを予測し、予測された最良の混合を適用して、桁違いの計算量で大規模モデルを訓練する。
論文 参考訳(メタデータ) (2024-07-01T17:31:03Z) - BiMix: A Bivariate Data Mixing Law for Language Model Pretraining [47.77701041534746]
事前学習データ構成がモデル性能に与える影響はいまだよく分かっていない。
$textbfBiMix$は、データの混合を理解し、最適化するための体系的なフレームワークを提供する。
我々の研究は、データミキシングの力学に関する理論的知見と、LLMトレーニング効率を向上させるための実践的なツールの両方に貢献する。
論文 参考訳(メタデータ) (2024-05-23T09:44:02Z) - Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance [55.872926690722714]
本研究では,関数形式の混合比に関するモデル性能の予測可能性について検討する。
トレーニングステップのスケーリング法則,モデルサイズ,データ混合法則のネスト利用を提案する。
提案手法は,RedPajamaにおける100Bトークンをトレーニングした1Bモデルのトレーニング混合物を効果的に最適化する。
論文 参考訳(メタデータ) (2024-03-25T17:14:00Z) - Efficient Online Data Mixing For Language Model Pre-Training [101.45242332613944]
既存のデータ選択方法は、遅くて計算コストのかかるプロセスに悩まされる。
一方、データミキシングは、データポイントをまとめることで、データ選択の複雑さを低減する。
我々は,データ選択とデータ混合の両要素を組み合わせたオンラインデータ混合(ODM)の効率的なアルゴリズムを開発した。
論文 参考訳(メタデータ) (2023-12-05T00:42:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。