論文の概要: Post-Training Science for Supervised Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.01244v1
- Date: Tue, 01 Sep 2026 13:44:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.689909
- Title: Post-Training Science for Supervised Fine-Tuning
- Title(参考訳): 監督されたファインチューニングのためのポストトレーニング科学
- Authors: Charles O'Neill, Mudith Jayasekara, Harry Partridge,
- Abstract要約: この機器は、実世界の4つの顧客SFTデータセット上の2つのファミリー(Qwen3とLlama)で、密集したおよび混合されたエキスパートモデルにまたがる。
各タスクは、顧客によって構築された評価を持ち、そのトレーニングデータは、反復的教師による微調整によって生成される。
我々は、モデルスケール、家族、データとともに最適な学習率とバッチサイズがどう動くか、そして1つの選択規則がそれら間で転送されるかどうかを問う。
- 参考スコア(独自算出の注目度): 0.08739101659113156
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Every supervised fine-tuning run forces the same chain of decisions, such as learning rate, batch size, LoRA or full fine-tuning, how many epochs, which optimiser, and what data to feed the model. Each of these is typically rediscovered from scratch for every new model and dataset. Here we measure them under one instrument: a sweep that varies one lever at a time, and spans dense and mixture-of-experts models in two families (Qwen3 and Llama), on four real-world customer SFT datasets, for both LoRA and full fine-tuning. These datasets give a controlled testbed: each task carries an evaluation built with the customer, and its training data is produced by iterative supervised fine-tuning that refines model outputs until they pass that evaluation, so the supervised target is internally consistent and the task judge we report against is the criterion the data was built to satisfy. We ask how the optimal learning rate and batch size move with model scale, family, and data, and whether one selection rule transfers across them; what LoRA trades against full fine-tuning, and how its rank and alpha set what the adapter can learn; whether validation loss (or other metrics, such as loss landscape flatness) faithfully ranks downstream quality; whether post-training gains scale with model size and data volume, on a model ladder extended through mixtures-of-experts to 235B parameters; how many epochs to train before general instruction-following erodes; and whether a geometry-aware optimiser improves on AdamW. Each recommendation is paired with a measure of its uncertainty.
- Abstract(参考訳): 教師付き微調整の実行はすべて、学習率、バッチサイズ、LoRAまたはフル微調整、最適なエポック数、モデルのフィードデータなど、同じ一連の決定を強制します。
これらのそれぞれは、通常、新しいモデルとデータセットごとにスクラッチから再発見される。
ここでは、一度に1つのレバーが変化し、2つのファミリー(Qwen3とLlama)の密集した実験モデルにまたがるスイープを、LoRAとフル微調整の両方の4つの現実世界の顧客SFTデータセットで測定する。
これらのデータセットは、制御されたテストベッドを提供します。各タスクは、顧客によって構築された評価を担い、そのトレーニングデータは、反復的教師による微調整によって生成され、その評価が通過するまでモデル出力を洗練します。
モデルスケール、家族、データとともに最適な学習率とバッチサイズがどう動くのか、また、1つの選択ルールがそれら間で転送されるのか、LoRAがフル微調整とどう交換するのか、アダプタが何を学べるか、検証損失(または損失ランドスケープ平坦性など他の指標)が下流品質を忠実にランク付けしているか、モデルサイズとデータボリュームとともにスケールするかどうか、モデルのラダーを235Bパラメータに拡張するか、一般的な命令追従エローダよりもトレーニングするエポックの数、幾何学的認識がAdamWに最適化されるかどうか、などについて尋ねる。
各レコメンデーションはその不確実性の尺度と組み合わせられる。
関連論文リスト
- Extracting alignment data in open models [50.81383232591576]
訓練後モデルから大量のアライメントトレーニングデータを抽出できることが示唆された。
このデータは、長期コンテキスト推論、安全性、命令追従、数学などの特定の機能を改善するためにモデルを操縦するのに有用である。
SFT や RL のような後トレーニングフェーズで使用されたトレーニングデータを,モデルが容易に再学習できることが判明した。
論文 参考訳(メタデータ) (2025-10-21T12:06:00Z) - FedAWA: Adaptive Optimization of Aggregation Weights in Federated Learning Using Client Vectors [50.131271229165165]
Federated Learning (FL)は、分散機械学習のための有望なフレームワークとして登場した。
ユーザの行動、好み、デバイス特性の相違から生じるデータの異質性は、連合学習にとって重要な課題である。
本稿では,学習過程におけるクライアントベクトルに基づくアダプティブ重み付けを適応的に調整する手法であるAdaptive Weight Aggregation (FedAWA)を提案する。
論文 参考訳(メタデータ) (2025-03-20T04:49:40Z) - Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models [79.2162092822111]
我々は,一連のナビゲーションタスクにおいて,強化学習(RL)と制御に基づく手法を体系的に評価する。
我々は、JEPA(Joint Embedding Predictive Architecture)を使用して、潜在ダイナミクスモデルを使用し、それを計画に使用します。
その結果,モデルベースプランニングではレイアウトが不明瞭になるのに対して,モデルフリーのRLは高品質なデータから恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2025-02-20T18:39:41Z) - Large Pre-Training Datasets Don't Always Guarantee Robustness after Fine-Tuning [29.69990405081772]
我々は、微調整モデルにおけるロバストネスの保存性を評価するために、ロバストネス継承ベンチマーク(ImageNet-RIB)を提案する。
微調整は事前訓練されたモデル間の堅牢性を低下させる。
最大および最も多様なデータセットで事前訓練されたモデルは、小さなデータセットを微調整した後、より大きなロバスト性損失と低い絶対ロバスト性の両方を示す。
論文 参考訳(メタデータ) (2024-10-28T22:33:22Z) - LoRA vs Full Fine-tuning: An Illusion of Equivalence [73.5303340531806]
我々は,Low-Rank Adaptation (LoRA) とフルファインタニングによる事前学習モデルについて検討する。
特異値分解が全く異なる構造を示すLoRAおよび完全微調整収量行列が得られた。
我々は、LoRAが完全な微調整を忘れてはならないという発見を拡張し、その忘れ物は侵入者次元に大きく局所化されていることを発見した。
論文 参考訳(メタデータ) (2024-10-28T17:14:01Z) - Fantastic Gains and Where to Find Them: On the Existence and Prospect of
General Knowledge Transfer between Any Pretrained Model [74.62272538148245]
事前訓練されたモデルの任意のペアリングに対して、一方のモデルは他方では利用できない重要なデータコンテキストを抽出する。
このような「補的」な知識を,性能劣化を伴わずに,あるモデルから別のモデルへ伝達できるかどうかを検討する。
論文 参考訳(メタデータ) (2023-10-26T17:59:46Z) - Robust Disentanglement of a Few Factors at a Time [5.156484100374058]
変分オートエンコーダ(VAE)の整合性向上のための人口ベーストレーニング(PBT)を導入する。
PBT-VAEトレーニングでは、教師なしのモデルスコアとしてUnsupervised Disentanglement Ranking (UDR)を使用し、この方法でトレーニングされたモデルが、生成因子のサブセットのみを一貫して切り離す傾向を示す。
複数のデータセットとメトリクスをまたいで、最先端の教師なしのアンハンジメント性能とロバストネスを著しく改善したことを示す。
論文 参考訳(メタデータ) (2020-10-26T12:34:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。