論文の概要: Energy- and Memory-Efficient PEFT Methods for Personalized On-Device SLMs on Consumer GPUs
- arxiv url: http://arxiv.org/abs/2608.04488v1
- Date: Wed, 05 Aug 2026 06:20:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.738657
- Title: Energy- and Memory-Efficient PEFT Methods for Personalized On-Device SLMs on Consumer GPUs
- Title(参考訳): コンシューマGPU上での個人化オンデバイスSLMのためのエネルギー・メモリ効率のPEFT法
- Authors: Kuanysh Akhmetzhanov, Jurn-Gyu Park,
- Abstract要約: 小言語モデル(SLM)は、大きな言語モデル(LLM)に代わる有望な選択肢を提供する。
変換器ベース: TinyLlama-1.1B, Qwen3-1.7B, SSMベース: Mamba-1.4B, Mamba-1.3B)の4種類のSLM上でのファインチューニング手法(Full Fine-Tuning, LoRA, LoRA+, QLoRA, BitFit)を比較した。
LoRA+は24構成中19のNetScore-Eで、24構成中13のNetScore-Mで最高であり、選択された方法である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite rapid advances in large language models (LLMs), deploying and personalizing them on resource-constrained devices remains impractical due to high VRAM, time, and energy costs. Parameter-Efficient Fine-Tuning (PEFT) of Small Language Models (SLMs) offers a promising alternative, yet few studies compare PEFT methods across architectures using both general and personalization benchmarks while accounting for energy consumption. We compare five fine-tuning approaches (Full Fine-Tuning, LoRA, LoRA+, QLoRA, and BitFit) on four SLMs from two families (Transformer-based: TinyLlama-1.1B, Qwen3-1.7B; SSM-based: Mamba-1.4B, Mamba-2-1.3B) across three GLUE tasks (SST-2, QNLI, STS-B) and three LaMP personalization tasks (LaMP-1, LaMP-2, LaMP-3). Each configuration is evaluated with the energy-focused NetScore-E and the memory-focused NetScore-M, the two variants that reflect the constraints binding on-device deployment. Methods are selected with a strict energy-first rule (highest NetScore-E, ties broken by NetScore#). LoRA+ achieves the highest NetScore-E in 19 of 24 configurations and the highest NetScore-M in 13 of 24, and is the selected method in 18 of 24. QLoRA, available only for the Transformer models, cuts peak finetuning VRAM by up to 3.9x relative to LoRA and therefore takes the best NetScore-M in 5 of the 12 Transformer configurations, although its de-quantization overhead leaves it selected in only one of them once energy decides. BitFit and full fine-tuning are almost never competitive on either variant, and TinyLlama-1.1B leads the energy-focused NetScore-E on five of the six benchmarks and the memory-focused NetScore-M on four. These results show that compact SLMs paired with PEFT provide a practical, energy-aware path to personalized on-device deployment, with the optimal method set by the dominant constraint: LoRA+ for energy and QLoRA for memory.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な進歩にもかかわらず、資源に制約のあるデバイスへの展開とパーソナライズは、高いVRAM、時間、エネルギーコストのために実現不可能なままである。
小言語モデル(SLM)のパラメータ効率の良いファインチューニング(PEFT)は、有望な代替手段を提供するが、エネルギー消費を考慮しつつ、一般およびパーソナライズベンチマークを用いてアーキテクチャ間のPEFT手法を比較する研究はほとんどない。
我々は,3つのGLUEタスク(SST-2, QNLI, STS-B)と3つのLaMPパーソナライズタスク(LaMP-1, LaMP-2, LaMP-3)の2つのファミリー(Transformer-based: TinyLlama-1.1B, Qwen3-1.7B, SSM-based: Mamba-1.4B, Mamba-2-1.3B)のSLM上の5つのファインチューニングアプローチ(Full Fine-Tuning, LoRA+, QLoRA, BitFit)と3つのLaMPパーソナライズタスク(LaMP-1, LaMP-2, LaMP-3)を比較した。
各構成は、エネルギー中心のNetScore-Eとメモリ中心のNetScore-Mで評価される。
メソッドは厳格なエネルギ優先ルール(NetScore-E、NetScore#で破られたコネクション)で選択される。
LoRA+は24構成中19のNetScore-E、24構成中13のNetScore-M、24の18の選択方法である。
QLoRAはトランスフォーマーモデルでのみ利用可能であり、ピーク微調整VRAMをLoRAと比較して最大3.9倍に削減し、12のトランスフォーマー構成のうち5つでベストのNetScore-Mを取る。
BitFitとフル微調整はどちらも競合することはないが、TinyLlama-1.1Bは6つのベンチマークのうち5つでエネルギー中心のNetScore-E、メモリ中心のNetScore-Mを4つでリードしている。
これらの結果から,PEFT と組み合わせたコンパクト SLM は,デバイス上でのパーソナライズを行うための実用的かつエネルギに配慮した経路を提供し,支配的制約である LoRA+ とメモリ用 QLoRA を最適に設定した。
関連論文リスト
- Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs [0.0]
本稿では,Transformers- (ViT-Small, TinyViT) と Mamba-based vision backbones (Vim-Small, MambaVision-T) の5つのパラメータ効率細調整法を比較した。
ゼロショットコントラスト型視覚言語モデル(OpenCLIP, SigLIP)、軽量評価プロトコルを用いた自己監督型視覚バックボーン(DINOv2)、プロンプトベース分類のための自己回帰型VLM(PaliGemma, MobileVLM, SmolVLM)の3つのファミリーを評価した。
CIFAR-100とDTDの実験
論文 参考訳(メタデータ) (2026-07-02T13:31:29Z) - EdgeCIM: A Hardware-Software Co-Design for CIM-Based Acceleration of Small Language Models [2.0160582186611733]
We present EdgeCIM, a hardware-ware co-design framework that rethinks accelerate design for end-to-end decoder-only inference。
NVIDIA Orin Nanoと比較すると、EdgeCIMは最大7.3倍のスループットと49.59倍のエネルギー効率を実現している。
論文 参考訳(メタデータ) (2026-04-13T14:16:20Z) - MC#: Mixture Compressor for Mixture-of-Experts Large Models [86.64315380917827]
Mixture-of-Experts (MoE)は、大きな言語モデル(LLM)と視覚言語モデル(VLM)をスパースアクティベーションによって拡張することで効果的にスケールする。
静的量子化と動的エキスパートプルーニングを組み合わせたフレームワークであるMC#(Mixture-Compressor-sharp)を提案する。
論文 参考訳(メタデータ) (2025-10-13T03:12:46Z) - EfficientLLM: Efficiency in Large Language Models [64.3537131208038]
大規模言語モデル(LLM)は大きな進歩を導いてきたが、その増加とコンテキストウィンドウは計算、エネルギー、金銭的コストを禁止している。
本稿では,新しいベンチマークであるEfficientLLMを紹介する。
論文 参考訳(メタデータ) (2025-05-20T02:27:08Z) - LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits [1.4311970001759078]
LowRAは、LoRAの微調整を可能にする最初のフレームワークである。
我々は,LowRAが2ビット以上の性能精度のトレードオフを達成し,最大1.15ビットまで精度を保ち,メモリ使用量を最大50%削減することを示した。
論文 参考訳(メタデータ) (2025-02-12T05:48:26Z) - Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity [56.0251572416922]
状態空間モデル(SSM)は、シーケンシャルモデリングのためのトランスフォーマーの効率的な代替手段として登場した。
本稿では,Mambaブロックのモダリティ特異的パラメータ化により,モダリティを意識した疎結合を実現する新しいSSMアーキテクチャを提案する。
マルチモーダル事前学習環境におけるMixture-of-Mambaの評価を行った。
論文 参考訳(メタデータ) (2025-01-27T18:35:05Z) - Prompting Large Language Models for Clinical Temporal Relation Extraction [5.403858596195122]
本研究は臨床時間的関係抽出(CTRE)に4つの大言語モデル(LLM)を用いる。
We developed full (FFT) and parameter-efficient (PEFT) fine-tuning strategy and the these strategy on the 2012 i2b2 CTRE task。
論文 参考訳(メタデータ) (2024-12-04T18:35:28Z) - LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization [78.93425154518705]
低ランク適応 (LoRA) は、メモリ要求を低減し、LLMのパラメータ効率の高い微調整法である。
本稿では,LoRA最適化のための適応行列プレコンディショニング手法であるLoRA-RITEを紹介する。
論文 参考訳(メタデータ) (2024-10-27T22:57:12Z) - Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of Modules [96.21649779507831]
そこで我々は,Mix-of-modules (MoM) と呼ばれる新しいアーキテクチャを提案する。
MoMは、任意の層がその位置に関係なくトークンを計算することができるという直感によって動機付けられている。
MoMはトランスフォーマーのための統一されたフレームワークを提供するだけでなく、冗長性を減らすための柔軟で学習可能なアプローチを提供する。
論文 参考訳(メタデータ) (2024-07-09T08:50:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。