論文の概要: Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport
- arxiv url: http://arxiv.org/abs/2608.11342v1
- Date: Tue, 11 Aug 2026 18:49:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.338114
- Title: Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport
- Title(参考訳): 軽量微調整:ロジット空間輸送によるLCMのパーソナライズ
- Authors: Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon,
- Abstract要約: Weightless Fine-Tuning (WFT) は、教師付き適応の分布効果を更新なしで近似する訓練なし復号時間法である。
WFTはデータセット間で最高の平均パフォーマンスを達成し、個々のタスクでSFTにマッチまたは超過し、他の軽量ベースラインを平均で上回る。
- 参考スコア(独自算出の注目度): 35.12591387008241
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Supervised fine-tuning (SFT) is a standard approach for adapting LLMs to a target distribution, but in settings such as personalization, where each author requires separate weight access, optimization, storage, and retraining, its costs become prohibitive. We propose Weightless Fine-Tuning (WFT), a training-free decoding-time method that approximates the distributional effect of SFT without weight updates. WFT computes supervised residuals on an author's training sequence and transports them to the current prompt through a cross-prefix transport operator estimated from dropout-induced cross-covariance. The operator captures how a perturbation at one context propagates to predictions at another, replacing gradient-based parameter updates with logit-space corrections. On three LaMP personalization benchmarks, WFT achieves the best average performance across datasets, matches or exceeds SFT on individual tasks, and outperforms other lightweight baselines on average. In a budget-controlled comparison, WFT approaches SFT performance using less than 7% of the effective computation. Logit-level analysis shows a cosine similarity of 0.875 between the logit shifts induced by WFT and SFT over 95% of the next-token probability mass, suggesting that WFT captures the distributional effect of supervised adaptation without modifying model weights.
- Abstract(参考訳): Supervised Fine-tuning (SFT) は LLM を対象の分布に適応させる標準的な手法であるが、パーソナライゼーション(パーソナライズ)のような設定では、各著者が個別のウェイトアクセス、最適化、ストレージ、再トレーニングを必要とする場合、そのコストは禁じられる。
Weightless Fine-Tuning (WFT) は、重み更新なしでSFTの分布効果を近似する訓練不要な復号時間法である。
WFTは、著者のトレーニングシーケンスの教師付き残差を計算し、ドロップアウト誘起のクロス共分散から推定されるクロスプレフィックストランスポートオペレータを介して、それらを現在のプロンプトに転送する。
オペレータは、あるコンテキストでの摂動が別のコンテキストでの予測にどのように伝播するかをキャプチャし、勾配ベースのパラメータ更新をロジト空間の修正に置き換える。
3つのLaMPパーソナライゼーションベンチマークにおいて、WFTはデータセット間での最高の平均パフォーマンス、個々のタスクにおけるSFTの一致または超過、および他の軽量ベースラインを平均で上回るパフォーマンスを達成する。
予算管理された比較において、WFTは有効計算の7%未満を用いてSFTの性能にアプローチする。
ロージットレベル解析は、WFTとSFTが引き起こしたロジットシフトの95%以上で0.875のコサイン類似性を示し、WFTがモデル重みを変更することなく教師付き適応の分布効果を捉えることを示唆している。
関連論文リスト
- PreFT: Prefill-only finetuning for efficient inference [54.58291801311547]
我々は,vLLM推論エンジン上で,プリフィルのみのPEFTであるLoRAとReFTの効率的な実装を開発し,リリースする。
Llama 3.1 70Bで512ドルのアダプタを提供する場合のスループットは,従来のPEFTよりも効率的であることを示す。
論文 参考訳(メタデータ) (2026-05-14T00:19:41Z) - An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models [1.7559669963238091]
GPT-2スケールデコーダでは,SFT-only,DPO-only,SFT-to-DPOトレーニングとFFT(Full Fine-tuning)とLoRAを比較した。
DPOは、強いSFTよりも小さく、タスク依存的な利得を得られ、温かいスタートをせずに競合SFTの精度と一致させることができる。
論文 参考訳(メタデータ) (2026-03-20T16:27:03Z) - Trust-Region Adaptive Policy Optimization [82.09255251747818]
後学習法は,大規模言語モデル(LLM)の複雑な推論能力の向上に重要な役割を果たしている。
トレーニングインスタンス毎に,Fun-Tuning(SFT)とReinforcement Learning(RL)をインターリーブするフレームワークであるTRAPOを紹介する。
5つの数学的推論ベンチマークの実験は、TRAPOが標準SFT、RL、SFT-then-RLパイプラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-19T14:37:07Z) - Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data [73.04828796123581]
Supervised Fine-tuning (SFT) は、事前訓練された大規模言語モデル (LLM) を整列するための重要なステップとなっている。
本稿では,SFTの改良版であるDFT(Driminative Fine-Tuning)を紹介する。
i) 入力された全ての可能な出力のうち、解答の判別可能性を明示的にモデル化することにより、微調整LDMの判別確率フレームワーク、(ii) この判別可能性を最適化するための効率的なアルゴリズム、(iii) DFTの有効性を実証する広範な実験を含む。
論文 参考訳(メタデータ) (2025-02-25T22:38:55Z) - UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function [18.54945183526789]
SFTとアライメントを単一のトレーニングステージに統合するUnified Fine-Tuning(UFT)を導入する。
実験結果から,UFTは命令調整データのみにおいて,SFTよりも優れていることが示された。
命令チューニングデータとアライメントデータを組み合わせることで、UFTは破滅的な忘れを効果的に防止する。
論文 参考訳(メタデータ) (2024-10-28T18:34:25Z) - Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single Process [19.986235452236272]
Supervised Fine-Tuning (SFT) と Preference Optimization (PO) は、言語モデル(LM)を事前学習後の人間の好みに合わせるための重要なプロセスである。
Intuitive Fine-Tuning (IFT)を導入し,SFTとPOをひとつのプロセスに統合する。
IFT は SFT やいくつかの典型的な PO メソッドと相容れないか、それ以上に優れている。
論文 参考訳(メタデータ) (2024-05-20T08:23:28Z) - Sparse is Enough in Fine-tuning Pre-trained Large Language Models [98.46493578509039]
我々はSparse Increment Fine-Tuning (SIFT) という勾配に基づくスパース微調整アルゴリズムを提案する。
GLUE Benchmark や Instruction-tuning などのタスクで有効性を検証する。
論文 参考訳(メタデータ) (2023-12-19T06:06:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。