論文の概要: DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning
- arxiv url: http://arxiv.org/abs/2607.22769v1
- Date: Fri, 24 Jul 2026 03:54:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.872031
- Title: DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning
- Title(参考訳): DomainPilot: 効率的な言語モデルファインチューニングのためのドメインレベルのロスガイド付き2段階データ混合最適化
- Authors: He Zhang,
- Abstract要約: DomainPilotはドメインレベルの損失誘導型2段階データ混合最適化フレームワークである。
DomainPilotは、高価なデータ選択や混合最適化のための補助モデルトレーニングに代わる、効果的で軽量な代替手段を提供する。
- 参考スコア(独自算出の注目度): 7.628568362560024
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The training efficacy of large language models (LLMs) is fundamentally constrained by the quality and composition of training data. Existing dynamic data scheduling methods face critical limitations in industrial-scale pretraining and supervised fine-tuning (SFT): data selection incurs prohibitive O(N) costs on terabyte-scale corpora, mixture optimization schemes introduce severe I/O bottlenecks or require training auxiliary reference models, and sample-level reweighting strategies rely on loss signals that conflate noise, difficulty, and novelty. We present DomainPilot, a domain-level loss-guided two-stage data mixture optimization framework. DomainPilot introduces token-level domain loss monitoring to capture per-domain learning dynamics during training without halting the data pipeline. Building on these signals, we propose a Scaling Law guided coarse optimization stage that fits domain-specific convergence curves and derives a principled prior for mixture adjustment. A subsequent Mixing Law guided fine optimization stage refines the mixture by modeling cross-domain interaction effects through controlled sweep experiments. The entire mechanism is realized via a patch-based architecture that injects domain-aware loss computation into existing training frameworks (e.g., MindSpeed/Megatron-LM) with only ~30 lines of framework-specific adapter code. We validate DomainPilot on the Qwen3-1.7B model during SFT. Compared to the original data mixture, our optimized mixture achieves improvements of +2% on MMLU-Redux, +1.8% on AIME24, +3.8% on LiveCodeBench v5, and +3.6% on BFCL v3, without increasing total data volume or training cost. These results demonstrate that domain-level training signals provide an effective, lightweight alternative to expensive data selection or auxiliary model training for mixture optimization.
- Abstract(参考訳): 大規模言語モデル(LLM)の訓練効果は,訓練データの品質と構成に大きく制約されている。
既存の動的データスケジューリング手法は、産業規模での事前訓練と教師付き微調整(SFT)において重要な制限に直面している。データ選択はテラバイト規模のコーパスで禁忌なO(N)コストを発生させ、混合最適化スキームは厳しいI/Oボトルネックを発生させるか、訓練補助参照モデルを必要とする。
ドメインレベルの損失誘導型2段階データ混合最適化フレームワークであるDomainPilotを提案する。
DomainPilotでは、データパイプラインを停止することなく、トレーニング中のドメイン単位の学習ダイナミクスをキャプチャする、トークンレベルのドメイン損失監視が導入されている。
これらの信号に基づいて、領域固有の収束曲線に適合し、混合調整に先立つ原理を導出するスケーリング法則を導出した粗い最適化段階を提案する。
その後の混合法則は、制御されたスイープ実験を通じてドメイン間相互作用効果をモデル化することにより、混合を洗練させる。
このメカニズムは、既存のトレーニングフレームワーク(MindSpeed/Megatron-LMなど)に、フレームワーク固有のアダプタコードで30行程度でドメイン認識損失計算を注入するパッチベースのアーキテクチャによって実現されている。
SFT中にQwen3-1.7Bモデル上でDomainPilotを検証する。
AIME24では+1.8%、LiveCodeBench v5では+3.8%、BFCL v3では+3.6%、合計データ量やトレーニングコストは増加しない。
これらの結果から、ドメインレベルのトレーニング信号は、高価なデータ選択や混合最適化のための補助モデルトレーニングに、効果的で軽量な代替手段を提供することが示された。
関連論文リスト
- A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning [2.436631469537453]
我々は,2段階の堅牢なUDAフレームワークである textbfSFT+RL を提案し,Supervised Fine Tuning と Reinforcement Learning を統合した。
textbfSFT+RLは、清潔な精度で textbf10.2% を平均的に改善し、textbf15.8% を3つのデータセットで比較した。
論文 参考訳(メタデータ) (2026-07-03T20:56:12Z) - DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models [51.48564522455171]
LLaMA-Factory上に構築されたデータ中心の動的トレーニングフレームワークであるDataFlexを紹介します。
DataFlexは、サンプル選択、ドメイン混合調整調整、データ再重み付けという、動的なデータ最適化の3つの主要なパラダイムをサポートします。
トレーナーの抽象化とモジュールコンポーネントを提供し、標準のLLMトレーニングをドロップインで置き換えることを可能にする。
論文 参考訳(メタデータ) (2026-03-27T08:28:02Z) - Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning [71.30276778807068]
サンプルプルーニングとトークンプルーニングを戦略的に協調する統合フレームワークを提案する。
Q-Tuningは、トレーニングデータの12.5%しか使用せず、全データSFTベースラインに対する平均38%の改善を実現している。
論文 参考訳(メタデータ) (2025-09-28T13:27:38Z) - Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models [5.626695215498112]
最適化問題としてデータミキシングを枠組み化し,検証損失を最小限に抑える新しい手法を提案する。
提案手法は, 効率的なデータ転送をモデル化し, スケール法則を微調整に活用することにより, 損失をパラメタライズする。
提案アルゴリズムは,全領域にわたる総合的,個人的パフォーマンスに優れることを示す。
論文 参考訳(メタデータ) (2025-08-16T07:28:39Z) - A Scalable Pretraining Framework for Link Prediction with Efficient Adaptation [16.82426251068573]
リンク予測(LP)は、グラフ機械学習において重要なタスクである。
既存の手法は、疎結合性からの限られた監督を含む重要な課題に直面している。
これらの課題に対処するためのソリューションとして,事前学習について検討する。
論文 参考訳(メタデータ) (2025-08-06T17:10:31Z) - DIDS: Domain Impact-aware Data Sampling for Large Language Model Training [61.10643823069603]
大規模言語モデルに対するドメインインパクト対応データサンプリング(DIDS)を提案する。
学習効果に基づくDIDSグループトレーニングデータでは、プロキシ言語モデルと次元削減が使用される。
同等のトレーニング効率を維持しながら平均パフォーマンスを3.4%向上させる。
論文 参考訳(メタデータ) (2025-04-17T13:09:38Z) - Dataset Distillation as Pushforward Optimal Quantization [2.5892916589735457]
そこで本研究では,実データ上での学習に類似した性能を,桁違いに少ない計算量で実現した合成トレーニングセットを提案する。
特に、既存の非絡み合ったデータセット蒸留法を古典的最適量子化とワッサーシュタインのバリセンタ問題にリンクする。
我々は,ImageNet-1Kデータセットの性能向上とモデル間一般化を,より簡単な追加計算で実現し,より高階のイメージ・パー・クラス・セッティングにおけるSOTA性能を向上する。
論文 参考訳(メタデータ) (2025-01-13T20:41:52Z) - Semi-Federated Learning: Convergence Analysis and Optimization of A
Hybrid Learning Framework [70.83511997272457]
本稿では,ベースステーション(BS)とデバイスの両方を活用するセミフェデレーション学習(SemiFL)パラダイムを提案し,中央集権学習(CL)とFLのハイブリッド実装を提案する。
我々はこの難解な問題を解くための2段階のアルゴリズムを提案し、ビームフォーマに閉形式解を提供する。
論文 参考訳(メタデータ) (2023-10-04T03:32:39Z) - Acceleration of Federated Learning with Alleviated Forgetting in Local
Training [61.231021417674235]
フェデレートラーニング(FL)は、プライバシを保護しながら機械学習モデルの分散最適化を可能にする。
我々は,FedRegを提案する。FedRegは,局所的な訓練段階において,知識を忘れることなくFLを加速するアルゴリズムである。
我々の実験は、FedRegはFLの収束率を著しく改善するだけでなく、特にニューラルネットワークアーキテクチャが深い場合にも改善することを示した。
論文 参考訳(メタデータ) (2022-03-05T02:31:32Z) - Dynamic Attention-based Communication-Efficient Federated Learning [85.18941440826309]
フェデレートラーニング(FL)は、グローバル機械学習モデルをトレーニングするためのソリューションを提供する。
FLは、クライアントデータの分散が非IIDであるときに性能劣化に悩まされる。
本稿では,この劣化に対処するために,新しい適応トレーニングアルゴリズムであるtextttAdaFL$を提案する。
論文 参考訳(メタデータ) (2021-08-12T14:18:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。