論文の概要: PreFT: Prefill-only finetuning for efficient inference
- arxiv url: http://arxiv.org/abs/2605.14217v1
- Date: Thu, 14 May 2026 00:19:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.549617
- Title: PreFT: Prefill-only finetuning for efficient inference
- Title(参考訳): PreFT:効率的な推論のためのプリフィルのみの微調整
- Abstract要約: 我々は,vLLM推論エンジン上で,プリフィルのみのPEFTであるLoRAとReFTの効率的な実装を開発し,リリースする。
Llama 3.1 70Bで512ドルのアダプタを提供する場合のスループットは,従来のPEFTよりも効率的であることを示す。
- 参考スコア(独自算出の注目度): 54.58291801311547
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models can now be personalised efficiently at scale using parameter efficient finetuning methods (PEFTs), but serving user-specific PEFTs harms throughput, even with specialised kernels and memory management techniques. This is because, theoretically and empirically, a mismatch exists between prefill (processing a large number of tokens at once) and decode (generating a single token autoregressively): the latter has far lower throughput when serving multiple adapters. Rather than optimising performance relative to parameter count, for efficient multi-adapter serving, we instead ought to optimise performance relative to serving throughput. We therefore propose PreFT (Prefill-only Finetuning), wherein we only apply the adapter to prefill tokens and discard it afterwards. PreFT significantly increases throughput with minimal effect on performance. We develop and release an efficient implementation of two prefill-only PEFTs, LoRA and ReFT, on the vLLM inference engine. We first show that serving multi-user PreFTs is more efficient than traditional PEFTs ($1.9\times$ the throughput when serving $512$ adapters on Llama 3.1 70B). Then, we compare the performance of prefill-only vs. all-token adapters on a variety of supervised finetuning and reinforcement learning tasks with LMs at varying scales. On SFT, we observe that the evaluation loss of PreFTs is higher than PEFTs, but can be compensated by increasing rank with nearly no reduction in throughput. On RL, we consistently find that PreFTs approach parity with standard PEFTs. Together, this work validates prefill-only adaptation of LLMs as a more favourable accuracy-throughput tradeoff than existing PEFTs for personalised serving.
- Abstract(参考訳): 大規模言語モデルは、パラメータ効率の良い微調整法(PEFT)を用いて、大規模に効率よくパーソナライズできるようになったが、ユーザ固有のPEFTは、特別なカーネルやメモリ管理技術であってもスループットを損なう。
これは理論上、実証上、プリフィル(大量のトークンを一度に処理する)とデコード(単一トークンを自動回帰的に生成する)の間にミスマッチが存在するためである。
パラメータ数に対する性能を最適化する代わりに、効率的なマルチアダプタサービスを実現するために、スループットに対する性能を最適化するべきです。
そこで我々は,PreFT(Prefill-only Finetuning)を提案する。
PreFTはパフォーマンスに最小限の影響でスループットを著しく向上させる。
我々は,vLLM推論エンジン上で,プリフィルのみのPEFTであるLoRAとReFTの効率的な実装を開発し,リリースする。
最初に、マルチユーザPreFTは従来のPEFT(Llama 3.1 70Bで512ドルのアダプタを提供する場合のスループットが1.9\times$)よりも効率的であることを示す。
次に,各種教師付きファインタニングおよび強化学習タスクにおけるプリフィルオンリーとオールトーケンアダプタの性能を,様々なスケールで比較した。
SFTでは、PreFTの評価損失はPEFTよりも高いが、スループットをほぼ低下させることなく、ランクの上昇によって補償することができる。
RL 上では、PreFTs が標準 PEFT と同等に近づく。
この研究は、LLMのプリフィルオンリー適応を、個人化されたサービスのための既存のPEFTよりも好ましい精度とスループットのトレードオフとして検証する。
関連論文リスト
- Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models [24.62337386603331]
大規模マルチモーダルモデル(LMM)は、機械が世界と対話する方法に革命をもたらしている。
下流タスクにLMMを適用するために,パラメータ効率細調整(PEFT)が普及している。
本稿では,各チューニング戦略の長所と短所に着目し,これらのアプローチに典型的な効率性から焦点を移す。
論文 参考訳(メタデータ) (2024-10-29T07:55:50Z) - Lessons and Insights from a Unifying Study of Parameter-Efficient Fine-Tuning (PEFT) in Visual Recognition [36.031972728327894]
視覚変換器を用いた代表PEFT手法の統一実験を行った。
VTAB-1Kでは,異なるPEFT法で類似の精度が得られた。
類似した精度にもかかわらず、PEFT法は、異なる帰納バイアスのために、異なる誤りと高い信頼率の予測を行う。
論文 参考訳(メタデータ) (2024-09-24T19:57:40Z) - Forecast-PEFT: Parameter-Efficient Fine-Tuning for Pre-trained Motion Forecasting Models [68.23649978697027]
Forecast-PEFTは、モデルのパラメータの大部分を凍結し、新しく導入されたプロンプトとアダプタの調整に集中する微調整戦略である。
実験の結果,Forecast-PEFTは動作予測タスクにおいて従来のフルチューニング手法よりも優れていた。
Forecast-FTは予測性能をさらに改善し、従来のベースライン法よりも最大9.6%向上した。
論文 参考訳(メタデータ) (2024-07-28T19:18:59Z) - IISAN: Efficiently Adapting Multimodal Representation for Sequential Recommendation with Decoupled PEFT [45.95678408227546]
IISAN(Intra- and Inter-modal Side Adapted Network for Multimodal Representation)は、シーケンシャルなレコメンデーションシステムのためのプラグイン・アンド・プレイアーキテクチャである。
IISANはフルファインチューニング(FFT)と最先端PEFTのパフォーマンスにマッチする。
マルチモーダルシーケンシャルレコメンデーションタスクでは、47GBからわずか3GBへと大幅に削減される。
論文 参考訳(メタデータ) (2024-04-02T15:58:36Z) - Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation [67.13876021157887]
動的チューニング(DyT)は、ViT適応のためのパラメータと推論効率を改善するための新しいアプローチである。
DyTは既存のPEFT法に比べて性能が優れており、VTAB-1KベンチマークではFLOPの71%しか呼び出されていない。
論文 参考訳(メタデータ) (2024-03-18T14:05:52Z) - LoRETTA: Low-Rank Economic Tensor-Train Adaptation for
Ultra-Low-Parameter Fine-Tuning of Large Language Models [20.5908375260123]
モデル性能を維持しながら計算効率のよい微調整を実現するために,様々なパラメータ効率の微調整技術が提案されている。
テンソル-トレイン分解によりトレーニング可能なパラメータを大幅に削減するフレームワークであるLoRETTAを提案する。
LoRETTAは、LLaMA-2-7Bモデルで最大100倍のパラメータで、最も広く使われているPEFT法よりも同等または優れた性能を実現している。
論文 参考訳(メタデータ) (2024-02-18T01:20:00Z) - From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers [52.199303258423306]
本稿では,事前学習したモデルにおいて,高い活性化空間性を促進する新しい密度損失を提案する。
提案手法である textbfDEFT は,RoBERTa$_mathrmLarge$ で textbf44.94% ,Flan-T5$_mathrmXXL$ で textbf53.19% (エンコーダ密度) と textbf90.60% (デコーダ密度) で常に活性化密度を減少させることができる。
論文 参考訳(メタデータ) (2024-02-02T21:25:46Z) - WeGeFT: Weight-Generative Fine-Tuning for Multi-Faceted Efficient Adaptation of Large Models [8.481707805559589]
WeGeFT(Weight-Generative Fine-Tuning)は、トレーニング済みの重みから直接微調整重みを生成することを学習する新しい手法である。
この設計は、パラメータ、表現、計算、メモリの多面的効率を実現し、LoRAとその変種の性能を維持したり、超えたりしている。
論文 参考訳(メタデータ) (2023-12-01T16:33:57Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z) - Sensitivity-Aware Visual Parameter-Efficient Fine-Tuning [91.5113227694443]
私たちは新しいビジュアルを提案します。
Sensuous-Aware Fine-Tuning (SPT) スキーム。
SPTはタスク固有の重要な位置にトレーニング可能なパラメータを割り当てる。
ダウンストリーム認識タスクの幅広い実験により,SPTは既存のPEFT法と相補的であることが示された。
論文 参考訳(メタデータ) (2023-03-15T12:34:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。