論文の概要: Techniques for Peak Memory Reduction for LoRA Fine-tuning of LLMs on Edge Devices
- arxiv url: http://arxiv.org/abs/2606.19528v1
- Date: Wed, 17 Jun 2026 19:20:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.499374
- Title: Techniques for Peak Memory Reduction for LoRA Fine-tuning of LLMs on Edge Devices
- Title(参考訳): エッジデバイス上でのLLMのLORA微調整におけるピークメモリ削減技術
- Authors: Hassan Dbouk, Matthias Reisser, Prathamesh Mandke, Likhita Arun Navali, Christos Louizos,
- Abstract要約: エンドユーザのデータに対するLLM(Large Language Models)の微調整は、データをプライベートに保ちながらパーソナライズされたエクスペリエンスを提供する。
本稿では,モデル品質を犠牲にすることなくメモリフットプリントを削減するための相補的手法を紹介する。
Llama-3.2 3BとQwen-2.5 3Bの実験では、ピークメモリの最大値が26Times$と28times$に下げられている。
- 参考スコア(独自算出の注目度): 13.58362631516482
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Fine-tuning of Large Language Models (LLMs) using Low-Rank Adaptation (LoRA) on an end-user's data offers personalized experiences while keeping data private, but faces severe memory constraints on consumer hardware. Peak memory during fine-tuning often exceeds device limits, especially for models with billions of parameters and long-context training data. This paper introduces a suite of complementary techniques to reduce memory footprint without sacrificing model quality: (1) base model quantization with on-the-fly dequantization, (2) memory-efficient checkpointing combining selective activation caching and disk offloading, (3) softmax approximation using semantically relevant token subsets, and (4) logits masking. Experiments on Llama-3.2 3B and Qwen-2.5 3B demonstrate up to $26\times$ and $28\times$ reduction in peak memory, enabling fine-tuning on resource-constrained devices.
- Abstract(参考訳): Low-Rank Adaptation(LoRA)を使用したLLM(Large Language Models)をエンドユーザのデータに微調整することで、パーソナライズされたエクスペリエンスを提供すると同時に、データをプライベートに保ちながら、コンシューマハードウェアに厳しいメモリ制約に直面します。
微調整時のピークメモリはデバイス限界を超え、特に数十億のパラメータと長いコンテキストのトレーニングデータを持つモデルの場合である。
本稿では,(1)オンザフライ復調によるベースモデル量子化,(2)選択的アクティベーションキャッシュとディスクオフロードを組み合わせたメモリ効率チェックポイント,(3)意味論的に関連するトークンサブセットを用いたソフトマックス近似,(4)ロジットマスキングなど,モデル品質を犠牲にすることなくメモリフットプリントを削減するための相補的手法を紹介する。
Llama-3.2 3BとQwen-2.5 3Bの実験では、最大26\times$と28\times$のピークメモリが減少し、リソースに制約のあるデバイスの微調整が可能になった。
関連論文リスト
- Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation [1.2559585990041289]
LARS(Low-Memory Activation-Rank Subspace)は、シーケンス長からメモリ消費を分離する新しい適応フレームワークである。
LARSは、推論、理解、長文データセットにわたるLoRAと比較して、GPUで平均33.54%、CPUで51.95%のメモリフットプリントを削減している。
論文 参考訳(メタデータ) (2026-04-03T17:05:33Z) - Memory-Efficient Structured Backpropagation for On-Device LLM Fine-Tuning [10.913120072779193]
デバイス上での微調整により、大きな言語モデルのプライバシ保護によるパーソナライズが可能になる。
モバイルデバイスは、すべてのワークロード間で共有される6~12GBの厳しいメモリ制約を課す。
メモリ効率のよい構造化バックプロパゲーション(MeSP)を提案する。
MeSPはピークメモリを361MBから136MBのQwen2.5-0.5Bに減らし、これまで不可能だった微調整シナリオを実現する。
論文 参考訳(メタデータ) (2026-02-13T16:24:33Z) - On-Device Fine-Tuning via Backprop-Free Zeroth-Order Optimization [27.237134457089194]
メモリ効率のゼロオーダー最適化(MeZO)はこのボトルネックを軽減する。
本稿ではまず,BPおよびMeZOトレーニングで適用可能な相対モデルサイズを理論的に推定する。
次に,メモリ上の制約下で,MeZOが精度上の優位性を示すことを示す。
論文 参考訳(メタデータ) (2025-11-14T14:46:29Z) - CARVQ: Corrective Adaptor with Group Residual Vector Quantization for LLM Embedding Compression [0.4104352271917982]
大規模言語モデル(LLM)はトークンの埋め込みに多数のパラメータを依存しているため、かなりのストレージ要件とメモリフットプリントに繋がる。
本稿では, グループ残差ベクトル量子化を併用したポストトレーニング小説Corrective AdaptorであるCARVQを紹介する。
CarVQは、低ビットストレージをサポートするための特別なハードウェアを必要とせず、約1.6ビットまで圧縮するためにオリジナルのモデルを模倣している。
論文 参考訳(メタデータ) (2025-10-14T17:00:13Z) - Memory Layers at Scale [67.00854080570979]
この研究はメモリ層を概念実証以上のものにし、現代の規模でその有用性を証明している。
ダウンストリームタスクでは、改善されたメモリ層で強化された言語モデルは、予算の2倍以上の高密度モデルよりも優れており、計算とパラメータの両方にマッチする場合の熟練モデルの混合も優れている。
最大128Bのメモリパラメータを持つスケーリング法則を1兆トークンまで事前訓練し,最大8Bパラメータを持つベースモデルと比較した,完全な並列化可能なメモリレイヤの実装を提供する。
論文 参考訳(メタデータ) (2024-12-12T23:56:57Z) - Fast Matrix Multiplications for Lookup Table-Quantized LLMs [58.11584672945781]
FLUTEはLUT量子化LLM用のフレキシブルなルックアップテーブルエンジンである。
バッチサイズ32と量子化グループサイズ128では、FLUTEカーネルは既存のGEMMカーネルよりも2〜4倍高速である。
論文 参考訳(メタデータ) (2024-07-15T17:55:42Z) - DPZero: Private Fine-Tuning of Language Models without Backpropagation [49.365749361283704]
DPZeroは、ほぼ次元に依存しない新しいゼロオーダーアルゴリズムである。
DPZeroのメモリ効率は、いくつかの下流タスクでプライベートに微調整されたRoBERTaとOPTで実証される。
論文 参考訳(メタデータ) (2023-10-14T18:42:56Z) - Semantically Constrained Memory Allocation (SCMA) for Embedding in
Efficient Recommendation Systems [27.419109620575313]
ディープラーニングモデルの重要な課題は、数百万のカテゴリクラスやトークンを扱うことだ。
本稿では,記憶の共有を意味情報の重なりに比例して共有する,新しいメモリ共有埋め込み方式を提案する。
性能を維持しながらメモリフットプリントの大幅な削減を示す。
論文 参考訳(メタデータ) (2021-02-24T19:55:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。