論文の概要: RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting
- arxiv url: http://arxiv.org/abs/2606.00147v1
- Date: Fri, 29 May 2026 03:06:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.064225
- Title: RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting
- Title(参考訳): RAFT:ドメインファインチューニングにおけるデータリファイン化と適応蒸留
- Abstract要約: ドメイン固有の教師付き微調整は、モデルの一般的な能力を劣化させるコストで、ドメイン内のパフォーマンスを改善する。
本稿では,RAFT(Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting)という2段階のフレームワークを提案する。
RAFTは標準SFTよりも平均領域精度を23.2%向上させ、MS-BenchとIFEvalでSFTが引き起こした劣化の一部を回復させた。
- 参考スコア(独自算出の注目度): 3.5614189131580463
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Domain-specific supervised fine-tuning (SFT) often improves in-domain performance at the cost of degrading a model's general capabilities. We view this degradation through two practical gaps in domain SFT: a supervision-compatibility gap, where domain targets differ in style and reasoning format from the original model's natural responses, and a trajectory-preservation gap, where teacher-forced SFT optimizes fixed target tokens without constraining the model's behavior on its own generated prefixes. This process fails to preserve the model's original behavior. We propose RAFT (Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting), a two-stage framework that addresses both factors. First, RAFT constructs model-compatible supervision through self-conditioned rewriting, semantic filtering, and answer fusion. Second, RAFT performs Answer-Conditioned On-Policy Distillation, where the original instruction-tuned model provides soft targets on student-generated trajectories while being conditioned on the fused answer as helpful context. We further introduce top-K temperature distillation and EMA-based adaptive loss balancing to stabilize the domain-general trade-off. Across three instruction-tuned backbones and five domains, RAFT improves average domain accuracy by 23.2% over standard SFT, while recovering part of the SFT-induced degradation on MS-Bench and IFEval, with relative improvements of 18.2% and 10.2%, respectively. These results show that coupling data refinement with trajectory-level preservation provides an effective recipe for domain fine-tuning with alleviated forgetting.
- Abstract(参考訳): ドメイン固有の教師付き微調整(SFT)は、しばしばモデルの一般的な能力を劣化させるコストで、ドメイン内のパフォーマンスを改善する。
本稿では、ドメインSFTにおける2つの実践的ギャップを通して、ドメインのターゲットが原モデルの自然な応答とスタイルや推論形式が異なるような監視・互換性のギャップと、教師力SFTがモデルが生成したプレフィックス上での振る舞いを制約することなく、固定されたターゲットトークンを最適化する軌道保存ギャップを考察する。
このプロセスはモデルの本来の振舞いを保存するのに失敗する。
本稿では,RAFT(Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting)という2段階のフレームワークを提案する。
まず、RAFTは自己条件の書き換え、セマンティックフィルタリング、解答融合を通じてモデル互換の監視を構築する。
第二に、RAFT は Answer-Conditioned On-Policy Distillation を実行する。
さらに,ドメイン一般トレードオフの安定化を図るため,トップK温度蒸留とEMAに基づく適応損失バランスを導入する。
3つの命令で調整されたバックボーンと5つのドメインで、RAFTは標準のSFTよりも平均的なドメイン精度を23.2%改善し、SFTが引き起こしたMS-BenchとIFEvalの劣化の一部を回復し、それぞれ18.2%と10.2%が相対的に改善した。
これらの結果から, トラジェクトリレベルの保存とデータリファインメントの結合は, ドメインの微調整に有効であることがわかった。
関連論文リスト
- LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure [16.743783987674842]
Supervised Fine-tuning (SFT) は、事前訓練された言語モデルを下流ドメインに適応するための標準的なアプローチである。
我々は,この固有エントロピー構造を明示的に保護するために,局所保存型スーパーバイザード・ファイン・チューニングの目的であるLP-SFTを提案する。
論文 参考訳(メタデータ) (2026-07-06T07:14:22Z) - A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning [2.436631469537453]
我々は,2段階の堅牢なUDAフレームワークである textbfSFT+RL を提案し,Supervised Fine Tuning と Reinforcement Learning を統合した。
textbfSFT+RLは、清潔な精度で textbf10.2% を平均的に改善し、textbf15.8% を3つのデータセットで比較した。
論文 参考訳(メタデータ) (2026-07-03T20:56:12Z) - MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation [65.068801413044]
連続的なテスト時間適応は、非定常な未ラベルのターゲットストリームにソース予測モデルを適用する。
ドメインに依存しない構造をドメイン固有のテクスチャから切り離す。
論文 参考訳(メタデータ) (2026-05-18T01:52:12Z) - FedSQ: Optimized Weight Averaging via Fixed Gating [1.2058208023553034]
フェデレーション学習は、生データを共有することなく、組織間で協調的なトレーニングを可能にする。
本稿では、DualCopyに基づくトランスファードニューラルフェデレーションであるFedSQ(Federated Structure-Quantitative Learning)を提案する。
ゲーティングの固定は、学習を不均一な分割下での凝集を安定化するアフィン内部の精製に還元する。
論文 参考訳(メタデータ) (2026-04-03T11:54:23Z) - Function-Space Decoupled Diffusion for Forward and Inverse Modeling in Carbon Capture and Storage [65.51149575007149]
本稿では,Fun-DDPSについて述べる。Fun-DDPSは,関数空間拡散モデルと微分可能なニューラル演算子サロゲートを結合した生成フレームワークである。
Fun-DDPSは、ジョイントステートベースラインで観察される高周波アーティファクトから、物理的に一貫した実現をもたらす。
論文 参考訳(メタデータ) (2026-02-12T18:58:12Z) - Gradual Fine-Tuning for Flow Matching Models [5.549222664526887]
Gradual Fine-Tuning (GFT) は、フローベース生成モデルを微調整するための原則的なフレームワークである。
流れについて、GFTは、事前訓練されたドリフトと目標ドリフトの間を円滑に介在する中間目標の温度制御配列を定義している。
GFTは収束安定性を改善し、確率パスを短縮し、推論を高速化し、標準の微調整に匹敵する生成品質を維持する。
論文 参考訳(メタデータ) (2026-01-30T03:07:47Z) - Domain Adaptation via Feature Refinement [0.3867363075280543]
本稿では,分散シフト下での非教師付きドメイン適応のための簡易かつ効果的なフレームワークであるDAFR(Domain Adaptation via Feature Refinement)を提案する。
提案手法は, ラベルなし対象データを用いたバッチ正規化統計の適応, ソース学習モデルからの特徴蒸留, 仮説伝達の3つの重要な要素を組み合わせた。
論文 参考訳(メタデータ) (2025-08-22T06:32:19Z) - Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation [48.52666201053625]
Minifinetuningは、低データ設定におけるオーバーフィッティングによるデジェネレーションの効果を低減する。
MFTは標準的な微調整よりも2~10倍の専門化・一般化比を示す。
論文 参考訳(メタデータ) (2025-05-30T01:54:12Z) - Let Synthetic Data Shine: Domain Reassembly and Soft-Fusion for Single Domain Generalization [68.41367635546183]
単一ドメインの一般化は、単一のソースからのデータを使用して、さまざまなシナリオで一貫したパフォーマンスでモデルをトレーニングすることを目的としている。
モデル一般化を改善するために合成データを活用した学習フレームワークDRSFを提案する。
論文 参考訳(メタデータ) (2025-03-17T18:08:03Z) - AutoFT: Learning an Objective for Robust Fine-Tuning [60.641186718253735]
ファンデーションモデルは、微調整によって下流タスクに適応できるリッチな表現をエンコードする。
手作り正則化技術を用いた頑健な微調整への最近のアプローチ
我々は、堅牢な微調整のためのデータ駆動型アプローチであるAutoFTを提案する。
論文 参考訳(メタデータ) (2024-01-18T18:58:49Z) - Disentangled Federated Learning for Tackling Attributes Skew via
Invariant Aggregation and Diversity Transferring [104.19414150171472]
属性は、クライアント間の一貫した最適化方向から、現在の連邦学習(FL)フレームワークを歪めます。
本稿では,ドメイン固有属性とクロス不変属性を2つの補足枝に分離するために,非絡み付きフェデレーション学習(DFL)を提案する。
実験により、DFLはSOTA FL法と比較して高い性能、より良い解釈可能性、より高速な収束率でFLを促進することが確認された。
論文 参考訳(メタデータ) (2022-06-14T13:12:12Z) - TDACNN: Target-domain-free Domain Adaptation Convolutional Neural
Network for Drift Compensation in Gas Sensors [6.451060076703026]
本稿では,ターゲットドメインレスドメイン適応畳み込みニューラルネットワーク(TDACNN)に基づくディープラーニングを提案する。
主な概念は、CNNがサンプルのドメイン固有の特徴を抽出するだけでなく、ソースドメインとターゲットドメインの両方の基礎となるドメイン不変の特徴も抽出することである。
異なる設定下でドリフトする2つのデータセットの実験は、いくつかの最先端手法と比較してTDACNNの優位性を示している。
論文 参考訳(メタデータ) (2021-10-14T16:30:17Z) - Bi-Directional Generation for Unsupervised Domain Adaptation [61.73001005378002]
教師なしのドメイン適応は、確立されたソースドメイン情報に依存するラベルなしのターゲットドメインを促進する。
従来の手法では、潜在空間におけるドメインの不一致を強制的に低減することで、本質的なデータ構造が破壊される。
本稿では、2つの中間領域をブリッジソースとターゲットドメインに補間する一貫した分類器を用いた双方向生成ドメイン適応モデルを提案する。
論文 参考訳(メタデータ) (2020-02-12T09:45:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。