論文の概要: OptiSelect: How does the Optimizer Shape Data Curriculum?
- arxiv url: http://arxiv.org/abs/2610.03432v1
- Date: Fri, 02 Oct 2026 15:13:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.437828
- Title: OptiSelect: How does the Optimizer Shape Data Curriculum?
- Title(参考訳): OptiSelect: Optimizer Shape Data Curriculumはどうか?
- Abstract要約: 原理選択パラダイムをOptiSelectとして定式化し、データ選択の形状に関する最初の体系的研究を示す。
我々の理論は、オンライン選択の利点がユーティリティスコアの識別可能性によって支配される選択ゲイン原理を確立している。
- 参考スコア(独自算出の注目度): 41.6441421088298
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online data selection has demonstrated substantial efficiency gains for LLM pretraining by training on the most valuable candidates within each batch. Since a candidate's value is realized through its effective model update, principled selection should account for the optimizer step, which reshapes the raw gradient before it updates model parameters. We formalize this optimizer-aware selection paradigm as OptiSelect and present the first systematic study of how the optimizer shapes data selection. Our theory establishes a selection gain principle in which the advantage of online selection is governed by the discriminability of the optimizer-induced utility scores. We prove that sign-based and polar-tangential preconditioners of Lion and Muon would suffer from a discriminability collapse which caps attainable gains from OptiSelect, whereas diagonal-adaptive optimizers such as AdamW and Sophia admit strictly better upper bounds. The proposed principle also yields a quantitative derivation of the optimal candidate oversampling ratio. Pretraining experiments on 124M and 720M models are consistent with our theoretical analysis and show that AdamW's diagonal-adaptive scoring geometry remains the strongest scoring geometry even with Muon as optimizer. We further demonstrate that OptiSelect retains its benefits under data rephrasing, a technique used in modern data processing pipelines. Our findings provide theoretical foundations and practical guidance for co-designing optimizers and data selection in LLM pretraining.
- Abstract(参考訳): オンラインデータ選択は、各バッチ内でもっとも価値のある候補のトレーニングによって、LLM事前トレーニングにおいて、かなりの効率向上を示した。
候補の値は有効なモデル更新によって実現されるので、モデルパラメータを更新する前に生の勾配を再評価する最適化ステップを原則として選択する必要がある。
我々は、このオプティマイザ対応選択パラダイムをOptiSelectとして形式化し、オプティマイザがデータ選択をどのように形作るかに関する最初の体系的研究を示す。
我々の理論は、オンライン選択の利点がオプティマイザによるユーティリティスコアの識別性によって支配される選択ゲイン原理を確立している。
我々は,Lion と Muon の符号ベースおよび極接型プリコンディショナーが OptiSelect の利得を達成できる識別性崩壊に悩まされるのに対し,AdamW や Sophia のような対角適応最適化器は,上界が厳密に良いことを認めている。
提案した原理は、最適候補オーバーサンプリング比を定量的に導出する。
124Mモデルと720Mモデルの事前学習実験は、我々の理論解析と一致しており、AdamWの対角的適応的なスコアリング幾何は、ムオンがオプティマイザであるにもかかわらず、最強のスコアリング幾何であることを示す。
さらに、OptiSelectは、現代のデータ処理パイプラインで使用される技術であるデータ言い換えの下で、その利点を保っていることを実証する。
本研究は,LLM事前学習におけるオプティマイザの協調設計とデータ選択に関する理論的基礎と実践的ガイダンスを提供する。
関連論文リスト
- From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification [2.115174610040722]
本稿では,統合型メンタルヘルス分類課題における最適化経路の体系的比較研究について述べる。
まず、古典的および参照を定式化し、次にLoRA/QLoRAを用いてパラメータ効率の高い微調整を行う。
DPO,ORPO,KTOによる嗜好に基づく最適化の評価を行った。
論文 参考訳(メタデータ) (2026-04-01T11:36:12Z) - Two-Stage Optimizer-Aware Online Data Selection for Large Language Models [49.576993784867035]
我々は,大規模言語モデルの微調整において,勾配に基づくオンラインデータ選択と重み付けのための原則付きフレームワークを提案する。
私たちのキーとなる考え方は、オンライン選択を静的なサンプルランキングではなく、次のターゲット指向のアップデートを州の下で形作ることです。
実験の結果,本手法は既存のオンラインデータ選択ベースラインに対するコンバージェンスとダウンストリームのパフォーマンスを,同じデータ予算下で一貫して改善することが示された。
論文 参考訳(メタデータ) (2026-03-08T21:46:16Z) - Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization [14.50339880957898]
我々は、嗜好データ生成と正規化の訓練技術について、より深く検討することで、嗜好最適化パイプラインの改善を目指している。
選好データ生成のために、ペアワイズ比較信号を用いて完了の選好ランキングを導出する反復的なペアワイズランキング機構を提案する。
正規化のトレーニングでは、LLMが好むサンプルの確率をわずかに減少させると、好みの最適化がよりよく収束する傾向が観察される。
論文 参考訳(メタデータ) (2024-11-07T23:03:11Z) - Data Selection via Optimal Control for Language Models [134.67665351539725]
本研究は,大規模コーパスから高品質な事前学習データを選択することにより,下流利用におけるLMの能力を向上させることを目的とする。
PMP条件を解くことで最適なデータ選択を近似するフレームワークであるPMPベースのデータ選択(PDS)を導入する。
PDSの利点は、スケーリング法則に従ってテスト損失曲線の外挿によって証明されたように、10Tトークンでトレーニングされた400Bモデルにまで拡張される。
論文 参考訳(メタデータ) (2024-10-09T17:06:57Z) - AIPO: Improving Training Objective for Iterative Preference Optimization [34.24211649396053]
合成データを用いた反復選好最適化について検討する。
我々は,反復選好最適化,すなわち合意対応反復選好最適化(AIPO)のための学習目標を提案する。
論文 参考訳(メタデータ) (2024-09-13T14:03:49Z) - Adaptive Preference Scaling for Reinforcement Learning with Human Feedback [103.36048042664768]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の価値を合わせるための一般的なアプローチである。
本稿では,分散ロバスト最適化(DRO)に基づく適応的優先損失を提案する。
提案手法は多用途であり,様々な選好最適化フレームワークに容易に適用可能である。
論文 参考訳(メタデータ) (2024-06-04T20:33:22Z) - Optimizer's Information Criterion: Dissecting and Correcting Bias in Data-Driven Optimization [16.57676001669012]
データ駆動最適化では、得られた決定のサンプル性能は通常、真の性能に対して楽観的なバイアスを生じさせる。
クロスバリデーションのような、このバイアスを修正するための一般的なテクニックは、追加の最適化問題を繰り返し解決する必要があるため、コストがかかる。
我々は一階偏差を直接近似する一般バイアス補正手法を開発し、追加の最適化問題を解く必要はない。
論文 参考訳(メタデータ) (2023-06-16T07:07:58Z) - Data-Driven Offline Decision-Making via Invariant Representation
Learning [97.49309949598505]
オフラインのデータ駆動意思決定は、アクティブなインタラクションなしで最適化された決定を合成する。
オフラインデータからトレーニングされたモデルへの入力に関して最適化する場合、誤って良いように見えるアウト・オブ・ディストリビューション(OOD)インプットを生成するのは簡単です。
本稿では、オフラインデータ駆動意思決定をドメイン適応として定式化し、最適化された決定値の正確な予測を行うことを目標とする。
論文 参考訳(メタデータ) (2022-11-21T11:01:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。