論文の概要: SDO: Structure-Aware Data Organization for Efficient LLM Post-Training
- arxiv url: http://arxiv.org/abs/2607.27273v1
- Date: Wed, 29 Jul 2026 12:17:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.278518
- Title: SDO: Structure-Aware Data Organization for Efficient LLM Post-Training
- Title(参考訳): SDO: 効率的なLCM後トレーニングのための構造対応データ組織
- Authors: Jinliang Gao, Ning Yang, Hai Wang, Baili Xiao, Pin Lyu,
- Abstract要約: 本稿では,SDO(Structure-Aware Data Organization)を提案する。
SFT、DPO、GRPO全体で、SDOは、トレーニングサンプルを永久に除外することなく、よりコヒーレントな勾配と、質問タイプ間のバランスの取れた精度を生成する。
- 参考スコア(独自算出の注目度): 5.596047617181513
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-training of large language models is expensive, and existing efficiency improvements mainly focus on selecting informative samples or designing training schedules. However, data organization itself is usually treated as a static preprocessing step: embedding-based grouping methods construct fixed partitions before training and cannot adapt to the evolving sample exposure during optimization. As a result, all samples receive similar exposure despite their different optimization needs, leading to redundant updates for some samples while leaving others under-optimized. To address this problem, we propose SDO (Structure-Aware Data Organization), a plug-and-play data organization framework with an exposure-driven feedback mechanism that organizes mini-batch composition and sample exposure according to representation-space structure. SDO operates epoch by epoch on frozen external embeddings, avoiding model warm-up training overhead: within each epoch, locality-aware batching forms coherent mini-batches via KNN neighborhood traversal; across epochs, exposure-balanced scheduling records per-sample participation and reduces the sampling probability of over-exposed samples to preserve long-term coverage. Across SFT, DPO, and GRPO, SDO accelerates convergence, with the largest gains observed in the early-to-mid phase, producing more coherent gradients and more balanced accuracy across question types without permanently excluding training samples.
- Abstract(参考訳): 大規模言語モデルのポストトレーニングは高価であり、既存の効率改善は主に情報サンプルの選択やトレーニングスケジュールの設計に重点を置いている。
しかし、データ組織自体は、通常静的な前処理ステップとして扱われる:埋め込みベースのグルーピングメソッドは、トレーニング前に固定パーティションを構築し、最適化中に進化するサンプル露光に適応できない。
その結果、全てのサンプルは、異なる最適化ニーズにもかかわらず同様の露光を受け、いくつかのサンプルに対して冗長な更新をし、他のサンプルは過度に最適化される。
この問題に対処するために,ミニバッチ合成とサンプル露光を表現空間構造に従って整理する露光駆動型フィードバック機構を備えた,プラグアンドプレイデータ組織フレームワークであるSDO(Structure-Aware Data Organization)を提案する。
SDOは、凍結した外部埋め込みをエポック的に実行し、モデルウォームアップトレーニングのオーバーヘッドを回避する: 各エポック内で、局所性を考慮したバッチ処理は、KNN地区トラバーサルを介してコヒーレントなミニバッチを形成する。
SFT, DPO, GRPO全体でSDOは収束を加速し, 早期から中期の段階で観測された最大の利得は, 恒常的にトレーニングサンプルを除外することなく, よりコヒーレントな勾配とよりバランスの取れた精度をもたらす。
関連論文リスト
- Integration Matters: Rollout-Based Training for Constrained Diffusion Models [16.46255955344152]
制約付き生成モデルは、データ分布に忠実なまま、複雑な実現可能性制約を満たすサンプルを作成することを目的としている。
既存の制約付き生成法は、トレーニング時間最適化またはサンプリング時間補正によって制約を強制する。
オンラインのロールアウトを通じて得られた制約ガイダンスをトレーニングプロセスに組み込んだ微調整フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T22:25:59Z) - From Atoms to Entropy: Optimal Noise Allocation for Diffusion Training in the Convex Regime [52.459513910242485]
拡散訓練における最適な雑音レベルアロケーションを研究するための一般統計フレームワークを開発する。
最適化されたトレーニングスケジュールは、有限個のノイズレベルに集中した原子最小値を持つことを示す。
次に,大規模実験におけるエントロピック・スケジュールの評価を行った。
論文 参考訳(メタデータ) (2026-07-10T20:59:06Z) - Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling [22.66917124518062]
既存の生成的アプローチは、サンプリング中にコストのかかるポストホック処理に依存したり、トレーニング中に慎重にキュレートされたデータセットを必要とする場合が多い。
構造制約下での拡散型分子生成に適した強化学習ファインチューニングフレームワークであるFTDiffを提案する。
FTDiffは、コストのかかるポストホック最適化や複雑なデータエンジニアリングを必要とせず、従来手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-05-31T13:11:48Z) - Few-Step Diffusion Sampling Through Instance-Aware Discretizations [16.93105640007355]
正規あるいは微分方程式(ODEs/SDEs)で定義される経路をシミュレートして拡散・流れマッチングモデルにより高忠実度データを生成する
本稿では、入力依存の事前情報に基づいてタイムステップアロケーションを適応させることを学習する、インスタンス対応の離散化フレームワークを提案する。
提案手法は,トレーニングや無視可能な推論オーバーヘッドと比較して,限界チューニングコストで生成品質を継続的に向上する。
論文 参考訳(メタデータ) (2026-03-18T12:49:38Z) - Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling [69.7108839028336]
条件付きフローマッチング(CFM)は、連続正規化フローをトレーニングするためのシミュレーション不要な手法である。
LOOM-CFMは、トレーニング時間内にミニバッチ間でこれらの割り当てを保存し、最適化することにより、ミニバッチ最適輸送(OT)の範囲を拡大する新しい手法である。
提案手法は,複数のデータセット間の速度品質トレードオフのサンプリングにおける一貫した改善を示す。
論文 参考訳(メタデータ) (2026-03-16T13:42:28Z) - OASIS: Online Sample Selection for Continual Visual Instruction Tuning [55.92362550389058]
連続的インストラクションチューニング(CIT)のシナリオでは、新しいインストラクションチューニングデータがオンラインストリーミング形式で連続的に到着する。
データの選択はこのオーバーヘッドを軽減することができるが、既存の戦略はしばしば事前訓練された参照モデルに依存している。
最近の参照モデルなしオンラインサンプル選択手法はこれに対処するが、典型的にはバッチ毎に一定の数のサンプルを選択する。
論文 参考訳(メタデータ) (2025-05-27T20:32:43Z) - Score-Optimal Diffusion Schedules [29.062842062257918]
高品質なサンプルを得るためには、適切な離散化スケジュールが不可欠である。
本稿では,最適な離散化スケジュールを適応的に選択するための新しいアルゴリズムを提案する。
学習したスケジュールは、これまで手動検索でのみ発見されていたパフォーマンススケジュールを復元する。
論文 参考訳(メタデータ) (2024-12-10T19:26:51Z) - Align Your Steps: Optimizing Sampling Schedules in Diffusion Models [63.927438959502226]
拡散モデル(DM)は、視覚領域以降における最先端の生成モデリングアプローチとして確立されている。
DMの重大な欠点は、サンプリング速度の遅いことであり、大規模なニューラルネットワークによる多くのシーケンシャルな関数評価に依存している。
本稿では,DMのサンプリングスケジュールを高品質な出力に最適化する汎用的,原理的な手法を提案する。
論文 参考訳(メタデータ) (2024-04-22T18:18:41Z) - Take the Bull by the Horns: Hard Sample-Reweighted Continual Training
Improves LLM Generalization [165.98557106089777]
大きな言語モデル(LLM)の能力を高めることが大きな課題だ。
本研究は,従来の事前学習データセットを用いたLCMの光連続訓練に関する実証的戦略から始まった。
次に、この戦略をインスタンス重み付け分散ロバスト最適化の原則化されたフレームワークに定式化します。
論文 参考訳(メタデータ) (2024-02-22T04:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。