論文の概要: From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
- arxiv url: http://arxiv.org/abs/2605.12944v1
- Date: Wed, 13 May 2026 03:27:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.785498
- Title: From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
- Title(参考訳): 修正ファインチューニングのためのインスタンス選択から固定プールデータレシピ検索へ
- Abstract要約: Supervised Fine-tuning (SFT) データ選択は、一般的にインスタンスランキングとして定式化される。
効果的なSFTトレーニングサブセットは、しばしば順序づけられたキュレーションレシピによって生成される。
キャッシュされたタスク、データ、モデル側信号に基づいて、固定プールの実体化を分離する2層解法であるAutoSelectionを導入する。
- 参考スコア(独自算出の注目度): 19.659110958894335
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Supervised fine-tuning (SFT) data selection is commonly formulated as instance ranking: score each example and retain a top-$k$ subset. However, effective SFT training subsets are often produced through ordered curation recipes, where filtering, mixing, and deduplication operators jointly shape the final data distribution. We formulate this problem as fixed-pool data recipe search: given a raw instruction pool and a library of grounded operators, the goal is to discover an executable recipe that constructs a high-quality selected subset under a limited budget of full SFT evaluations, without generating, rewriting, or augmenting training samples. We introduce AutoSelection, a two-layer solver that decouples fixed-pool materialization based on cached task-, data-, and model-side signals from expensive full evaluation, using warmup probes, realized subset states, local recipe edits, Gaussian-process-assisted ranking, and stagnation-triggered reseeding. Experiments on a 90K instruction pool show that AutoSelection achieves the strongest in-distribution reasoning average across three base models, outperforming full-data training, random recipe search, random top-$k$, and single-operator selectors. Additional Out-of-distribution graph-reasoning results, search-stability analyses, structural ablations, and 1.5B-to-7B transfer checks further show that recipe structure matters beyond individual selection operators. Code is available at https://github.com/w253/AutoSelection.
- Abstract(参考訳): Supervised Fine-tuning (SFT) データ選択は、一般的にインスタンスランキングとして定式化される。
しかし、効率的なSFTトレーニングサブセットは、フィルター、ミキシング、復号演算子が最終的なデータ分布を共同で形作る順序付きキュレーションレシピによって作られることが多い。
そこで我々は,この問題を固定プールデータレシピ検索として定式化し,生の命令プールと接地演算子のライブラリが与えられた場合,学習サンプルの生成,書き換え,増補を行なわずに,SFT評価の予算で高品質な選択されたサブセットを構築する実行可能なレシピを見つけることを目的とする。
本稿では,キャッシュされたタスク,データ,モデル側の信号から,高価なフル評価から,ウォームアッププローブ,サブセット状態の実現,ローカルレシピ編集,ガウシアンプロセス支援ランキング,スタトネーショントリガー付きリシーディングを分離する2層解法AutoSelectionを紹介する。
90Kの命令プールでの実験では、AutoSelectionは3つのベースモデルで最強の分散推論を達成し、全データトレーニング、ランダムレシピ検索、ランダムのトップ-$k$、シングルオペレータセレクタを上回った。
追加のアウト・オブ・ディストリビューショングラフ推論結果、検索安定性解析、構造改善、1.5B-to-7B転送チェックは、レシピ構造が個々の選択演算子を超えて重要であることを示している。
コードはhttps://github.com/w253/AutoSelectionで入手できる。
関連論文リスト
- One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning [19.504724272527515]
Cold-Start Active Learning (CSAL)は、事前の知識や人的支援なしにラベルのないプールから価値のあるサブセットを選択することを目的としている。
真の課題は、もう1つの選択を設計することではなく、CSALを手元にあるデータやタスクに自動的に適応させることである、と私たちは主張する。
我々は、Sinkhornベースの新しいCSALアルゴリズムを、$-Adaptive Selection($-AS)と呼ぶ。
論文 参考訳(メタデータ) (2026-08-04T07:21:39Z) - Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation [1.1965825585921974]
単一定式化は、需要集中、在庫不均衡、補充スケール、サービス制約、予測ボラティリティによって誘導される不均一なインスタンスレベルのレギュレーションと一貫して一致しない。
本稿では,この課題を,各割り当てインスタンスを候補OR専門家ライブラリから解法実行可能な定式化に割り当てる,インスタンスワイドオペレーション研究(OR)の定式化選択として検討する。
本稿では,OR の定式化選択のための解法誘導型大言語モデル (LLM) フレームワークを提案し,各 OR 専門家が異なるアロケーション優先度を符号化した MIP の定式化に対応する。
論文 参考訳(メタデータ) (2026-07-28T16:41:54Z) - Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning [49.04912820721943]
Supervised Fine-tuning (SFT) は計算コストが高く、時にはオーバーフィットやバイアス増幅に悩まされる。
本研究は、トレーニングプロセス中にサンプルを動的にスコア付け、フィルタリングするオンラインバッチ選択ファミリについて研究する。
SFTにおける効率的なオンラインバッチ選択のためのフレームワークである textbfUDS (Utility-Diversity Sampling) を開発した。
論文 参考訳(メタデータ) (2025-10-19T15:32:01Z) - OASIS: Online Sample Selection for Continual Visual Instruction Tuning [55.92362550389058]
連続的インストラクションチューニング(CIT)のシナリオでは、新しいインストラクションチューニングデータがオンラインストリーミング形式で連続的に到着する。
データの選択はこのオーバーヘッドを軽減することができるが、既存の戦略はしばしば事前訓練された参照モデルに依存している。
最近の参照モデルなしオンラインサンプル選択手法はこれに対処するが、典型的にはバッチ毎に一定の数のサンプルを選択する。
論文 参考訳(メタデータ) (2025-05-27T20:32:43Z) - Efficient MCMC Sampling with Expensive-to-Compute and Irregular Likelihoods [2.299872239734834]
計算オーバーヘッドを低減するためにサブセット評価を利用するサンプリングアルゴリズムをいくつか検討する。
我々はTaylor拡張の代わりにデータ駆動プロキシを導入し、新しい低コスト対応コントローラを定義する。
適応型提案とデータ駆動型プロキシを併用した改良版"Importance with Nested Training Samples"(HINTS)は、固定された計算予算で最高のサンプリングエラーを得る。
論文 参考訳(メタデータ) (2025-05-15T16:06:44Z) - Add-One-In: Incremental Sample Selection for Large Language Models via a Choice-Based Greedy Paradigm [50.492124556982674]
本稿では,新しい選択型サンプル選択フレームワークを提案する。
個々のサンプル品質の評価から、異なるサンプルのコントリビューション値の比較へと焦点をシフトする。
われわれのアプローチをより大きな医療データセットで検証し、現実の応用における実用性を強調した。
論文 参考訳(メタデータ) (2025-03-04T07:32:41Z) - Optimized Conformal Selection: Powerful Selective Inference After Conformity Score Optimization [4.984656106595651]
本稿では、フレキシブルなデータ駆動モデル最適化後に有効な統計的テスト(選択)を可能にするOptCSを提案する。
我々は,データ再利用が十分であるにもかかわらず,OptCSが正則なp-値を構成する一般的な条件を紹介する。
モデルごとに異なる最適化を行うFDR制御手順を3つ提案する。
論文 参考訳(メタデータ) (2024-11-27T01:40:50Z) - Adapt-$\infty$: Scalable Continual Multimodal Instruction Tuning via Dynamic Data Selection [89.42023974249122]
Adapt-$infty$は、生涯のインストラクションチューニングのための、新しいマルチウェイおよびアダプティブなデータ選択アプローチである。
勾配に基づくサンプルベクトルをグループ化して擬似スキルクラスタを構築する。
セレクタエキスパートのプールから各スキルクラスタの最高のパフォーマンスデータセレクタを選択する。
このデータセレクタは、トレーニングのために各スキルクラスタから最も重要なサンプルのサブセットをサンプリングする。
論文 参考訳(メタデータ) (2024-10-14T15:48:09Z) - BWS: Best Window Selection Based on Sample Scores for Data Pruning across Broad Ranges [12.248397169100784]
データサブセットの選択は、フルデータセットのトレーニングを近似できる大規模なデータセットの、小さくても情報に富むサブセットを見つけることを目的としている。
難易度スコアに基づいて順序付けされたサンプルから最適なウィンドウサブセットを選択する方法を提案することにより、普遍的で効率的なデータサブセット選択法であるBest Window Selection(BWS)を導入する。
論文 参考訳(メタデータ) (2024-06-05T08:33:09Z) - Double-Bounded Optimal Transport for Advanced Clustering and
Classification [58.237576976486544]
本稿では,2つの境界内での目標分布の制限を前提としたDB-OT(Douubly bounded Optimal Transport)を提案する。
提案手法は,テスト段階における改良された推論方式により,良好な結果が得られることを示す。
論文 参考訳(メタデータ) (2024-01-21T07:43:01Z) - Towards Free Data Selection with General-Purpose Models [71.92151210413374]
望ましいデータ選択アルゴリズムは、限られたアノテーション予算の有用性を最大化するために、最も情報性の高いサンプルを効率的に選択することができる。
アクティブな学習手法で表現された現在のアプローチは、通常、時間を要するモデルのトレーニングとバッチデータ選択を繰り返し繰り返す、面倒なパイプラインに従う。
FreeSelは重いバッチ選択プロセスをバイパスし、効率を大幅に改善し、既存のアクティブラーニングメソッドよりも530倍高速である。
論文 参考訳(メタデータ) (2023-09-29T15:50:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。