論文の概要: UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing
- arxiv url: http://arxiv.org/abs/2607.08646v1
- Date: Thu, 09 Jul 2026 16:18:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.59196
- Title: UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing
- Title(参考訳): UltraX: 適応型プログラム編集による大規模事前学習データの精錬
- Authors: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu,
- Abstract要約: UltraXは、大規模な事前トレーニングデータのための関数呼び出しリファインメントフレームワークである。
削除と修正に加えて挿入を導入することで、編集機能空間を完成させる。
実験の結果,UltraXは全コーパスで最高の平均性能を示した。
- 参考スコア(独自算出の注目度): 33.19471537533819
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As available training data approaches its physical limit, gains from Scaling Laws have begun to diminish. Consequently, improving Large Language Models (LLMs) now depends less on data expansion and more on higher-quality data utilization. However, in the context of large-scale corpora, existing refinement methodologies face significant limitations in quality, efficiency, and reliability: Rule-based approaches are constrained by fixed heuristics and struggle with instance-level variations; LLM-based approaches improve quality but fail to meet the efficiency and reliability requirements of large-scale data processing. To address these challenges, we propose UltraX, a function-calling refinement framework for large-scale pre-training data that completes the editing function space by introducing insertion in addition to deletion and modification, enabling fine-grained instance-level editing. Specifically, UltraX builds a reliable program-supervision generation pipeline. In this pipeline, dataset-adaptive prompt optimization first guides an expert LLM to produce high-quality end-to-end refined texts, and Line Alignment Mapping and Dynamic Context Replacement then convert original-refined text pairs into structured program supervision. Meanwhile, UltraX improves supervision quality and stabilizes the training distribution with low-confidence example filtering and ratio-controlled sampling by operation combination. During inference and execution, it normalizes and validates model outputs through sliding-window prediction, global operation aggregation, and systematic post-processing, improving the stability and reliability of large-scale execution. Experiments show that UltraX achieves the highest average performance across all corpora and also matches or surpasses baselines with fewer training tokens, demonstrating stronger data efficiency and refinement reliability.
- Abstract(参考訳): 利用可能なトレーニングデータが物理的な限界に近づくにつれ、Scaling Lawsからの利益は減少し始めている。
その結果、LLM(Large Language Models)の改善は、データ拡張よりも、高品質なデータ利用に依存している。
しかし、大規模コーパスの文脈では、既存の洗練手法は、品質、効率、信頼性の重大な制限に直面している: ルールベースのアプローチは、固定されたヒューリスティックによって制約され、インスタンスレベルのバリエーションと競合する; LLMベースのアプローチは、品質を改善するが、大規模データ処理の効率と信頼性の要求を満たすことができない。
これらの課題に対処するため,大規模な事前学習データのための関数呼び出し改善フレームワークであるUltraXを提案する。
具体的には、UltraXは信頼性の高いプログラムスーパービジョン生成パイプラインを構築する。
このパイプラインでは、データセット適応的なプロンプト最適化が、まず専門家のLCMをガイドし、高品質なエンドツーエンドの洗練されたテキストを生成し、Line Alignment MappingとDynamic Context Replacementを使用して、元の修正されたテキストペアを構造化されたプログラムの監視に変換する。
一方、UltraXは監視品質を改善し、低信頼例フィルタリングと演算組み合わせによる比制御サンプリングによりトレーニング分布を安定化する。
推論と実行中に、スライディングウインドウ予測、大域的操作集約、系統的後処理を通じてモデル出力を正規化し、検証し、大規模実行の安定性と信頼性を向上させる。
実験の結果、UltraXは全コーパスで最高の平均パフォーマンスを達成し、トレーニングトークンの少ないベースラインにマッチまたは超え、データ効率と信頼性の向上を実証している。
関連論文リスト
- VIP-COP: Context Optimization for Tabular Foundation Models [23.854424850102273]
VIP-COPは、トレーニング例の予測における重要度の価値と、TFMのハードコンテキスト最適化の特徴を推定する。
その明示的な選択メカニズムはノイズを抑制し、影響力のあるデータを分離する。
VIP-COP は (i) 高速で、最適化の数分以内に性能を向上する; (ii) 予算に気付き、いつでも、追加のテスト時間計算で改善する; (iii) モデルに気付き、完全にブラックボックスで、モデル内部へのアクセスを必要としない; (iv) 解釈可能で、離散的な重要な予測者の(サンプル)を識別する。
論文 参考訳(メタデータ) (2026-05-13T02:28:31Z) - Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation [25.08795071237411]
フィーチャートランスフォーメーション(Feature Transformation)は、機能空間の品質を改善して予測パフォーマンスを向上する、データ中心のAIタスクである。
既存のソリューションは、個別の検索や潜伏生成に依存しているが、サンプルの非効率性、無効な候補、カバー範囲の制限のある冗長な世代によって、しばしば制限される。
閉ループにおける軌道レベルの経験を進化させることにより,LLM駆動型FTの文脈データを最適化するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-13T01:12:41Z) - Fine-tuning Done Right in Model Editing [83.79661791576103]
大規模な言語モデルを適応するための基礎的な手法であるファインチューニングは、長い間モデル編集には有効ではないと考えられてきた。
ミニバッチ最適化により、標準的な幅優先パイプライン(エポックベース)に微調整を復元する。
我々は、復元された微調整フレームワーク上に構築された、シンプルで効果的なローカライズド編集手法であるLocFT-BFを導出する。
論文 参考訳(メタデータ) (2025-09-26T08:53:13Z) - RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs [76.3459242819381]
RefineXは、プログラムによる編集タスクを通じて、トレーニング済みデータの大規模かつ外科的な洗練を行うための新しいフレームワークである。
RefineXのコアとなる強みは、高品質で専門家が指導するエンドツーエンドの精錬結果を最小限の編集ベースの削除プログラムに蒸留することにある。
RefineXを複数のモデルスケールで事前学習し、生データ、フィルタリングデータ、または代替データでトレーニングされたモデルより一貫して優れています。
論文 参考訳(メタデータ) (2025-07-04T02:19:58Z) - Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models [12.500777267361102]
我々は,新しいtextbfpreference-textbforiented 教師付き textbffine-textbftuning アプローチ,すなわち PoFT を導入する。
直感的には、SFTを特定の嗜好を与えることによって強化することであり、同じSFTデータ上で、整列 LLM 上でターゲットモデルをテキストフォバリングする。
PoFTは、さまざまなトレーニングデータセットとベースモデルにわたるSFTベースラインに対して、安定的で一貫した改善を実現している。
論文 参考訳(メタデータ) (2024-12-17T12:49:14Z) - Constrain Alignment with Sparse Autoencoders [45.131670081186]
特徴レベルの制約付き優先度最適化は、安定性を確保しつつアライメントプロセスを簡素化するために設計された新しい手法である。
提案手法は、訓練されたスパースオートエンコーダで活性化されるスパース機能と、逐次KL分散の品質を用いて効率を向上する。
論文 参考訳(メタデータ) (2024-11-12T07:54:13Z) - In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement [71.60563181678323]
大規模言語モデル(LLM)は様々なタスクで大きな成功を収めており、生成品質をさらに向上させるためには微調整が必要である場合もある。
これらの課題に対処する直接的な解決策は、教師なしの下流タスクから高信頼のデータを生成することである。
本稿では,プロンプトと全体的な擬似スーパービジョンを両立させる新しい手法,擬似教師付きデモアライメント・アライメント・アライメント・プロンプト・最適化(PAPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-04T03:39:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。