論文の概要: PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning
- arxiv url: http://arxiv.org/abs/2607.18199v1
- Date: Mon, 20 Jul 2026 17:38:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.724316
- Title: PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning
- Title(参考訳): PPL-Factory:言語モデリングから推論へのタスク・アウェアと予算・アウェアデータ選択
- Authors: Hang Zhang, Warren J. Gross,
- Abstract要約: 単純かつ解釈可能なデータ選択フレームワークであるPPL-Factoryを提案する。
GSM8Kの実験では、PPL-Factoryは他の最先端のデータ選択方法よりも優れていた。
- 参考スコア(独自算出の注目度): 6.950650586528147
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Not all training samples contribute equally to large language model fine-tuning. Selecting informative training samples can reduce the computational cost while preserving downstream performance. Many existing data selection methods rely on indirect heuristics, such as data quality, diversity or reasoning trace length. However, the effectiveness of these fixed criteria is task-dependent and difficult to generalize across diverse downstream tasks. Perplexity-based data selection provides a simple and model-aware solution to estimate the sample difficulty, but existing approaches typically score the entire training sequence and ignore the difference in learning objectives of language modeling and reasoning tasks. In this paper, we propose PPL-Factory, a simple and interpretable data selection framework that combines task-aware perplexity-based scores and data budget-aware selection criteria. Experiments on GSM8K demonstrate that PPL-Factory outperforms other state-of-the-art data selection methods using only $1\%$ of the training set. With $10\%$ of the data, PPL-Factory exceeds full-data fine-tuning accuracy by 0.9 on GSM8K and 4.8 on MATH. Overall, our results demonstrate that task-aware and budget-aware perplexity-based selection provides an effective and applicable approach for efficient fine-tuning.
- Abstract(参考訳): すべてのトレーニングサンプルが、大きな言語モデルの微調整に等しく貢献するわけではない。
情報的トレーニングサンプルの選択は、下流のパフォーマンスを維持しながら計算コストを削減できる。
既存のデータ選択法の多くは、データ品質、多様性、トレース長の推論など、間接的なヒューリスティックに依存している。
しかし、これらの固定基準の有効性はタスク依存であり、下流の様々なタスクにまたがる一般化が困難である。
複雑度に基づくデータ選択は、サンプルの難易度を推定するための単純でモデル対応のソリューションを提供するが、既存のアプローチは通常、トレーニングシーケンス全体をスコアし、言語モデリングと推論タスクの学習目標の違いを無視する。
本稿では,PPL-Factoryを提案する。PPL-Factoryは,タスク対応の難易度に基づくスコアとデータ予算対応の選択基準を組み合わせた,シンプルかつ解釈可能なデータ選択フレームワークである。
GSM8Kの実験では、PPL-Factoryはトレーニングセットのわずか1.5%で、他の最先端のデータ選択方法よりも優れていた。
PPL-FactoryはGSM8Kで0.9ドル、MATHで4.8ドルを超えている。
全体として,タスク認識と予算認識の難易度に基づく選択が,効率的な微調整に有効かつ有効であることを示す。
関連論文リスト
- Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies [50.39041754816285]
本稿では、下流タスクと特定のモデルの両方にデータ選択を併用する多変数重み学習フレームワークを提案する。
提案手法は,GSM8Kのトレーニングサンプルの30%しか使用せず,フルデータセットチューニングに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2026-05-10T17:30:16Z) - T-SHIRT: Token-Selective Hierarchical Data Selection for Instruction Tuning [5.963754140027611]
Token-Selective HIeRarchical Data Selection for Instruction Tuning (T-SHIRT)は、新しいデータ選択フレームワークである。
我々は、キュレートされたデータセットでチューニングされたモデルが、大規模データセット全体においてトレーニングされたモデルよりも優れていることを実証した。
論文 参考訳(メタデータ) (2025-06-02T04:59:17Z) - Compute-Constrained Data Selection [77.06528009072967]
多くの強力なデータ選択手法は、ほとんど計算に最適ではないことが分かりました。
計算最適トレーニングでは、パープレキシティと勾配データ選択は、それぞれ5xと10xのトレーニング-選択モデルサイズ比を必要とする。
論文 参考訳(メタデータ) (2024-10-21T17:11:21Z) - Uncertainty Aware Learning for Language Model Alignment [97.36361196793929]
異なるタスクシナリオのモデルアライメントを改善するために,不確実性認識学習(UAL)を提案する。
トレーニングのラベルの平滑化値を個々のサンプルの不確実性に応じて適応的に設定する。
広く使われているベンチマーク実験では、我々のUALは標準教師あり微調整よりも著しく優れています。
論文 参考訳(メタデータ) (2024-06-07T11:37:45Z) - How to Train Data-Efficient LLMs [56.41105687693619]
事前学習言語モデル(LLM)に対するデータ効率のアプローチについて検討する。
Ask-LLMと密度サンプリングがそれぞれのカテゴリで最適であることがわかった。
何百もの評価タスクと事前学習作業を含む19個のサンプルを比較したところ,Ask-LLMと密度がそれぞれのカテゴリで最適な方法であることが判明した。
論文 参考訳(メタデータ) (2024-02-15T02:27:57Z) - DsDm: Model-Aware Dataset Selection with Datamodels [81.01744199870043]
標準的なプラクティスは、データ品質という人間の考え方にマッチする例をフィルタリングすることです。
質の高い"データソースとの類似性に応じた選択は、ランダムに選択するデータに比べてパフォーマンスが向上しない(さらに傷つく)可能性がある。
我々のフレームワークは、データ品質に関する手作業による概念を回避し、学習プロセスがターゲットタスクの予測にデータポイントをトレーニングする方法を明確にモデル化する。
論文 参考訳(メタデータ) (2024-01-23T17:22:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。