論文の概要: Energy-Efficient GPU DVFS for Fine-Tuning of SLMs on Resource-constrained Embedded Devices
- arxiv url: http://arxiv.org/abs/2607.05933v1
- Date: Tue, 07 Jul 2026 07:34:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.432221
- Title: Energy-Efficient GPU DVFS for Fine-Tuning of SLMs on Resource-constrained Embedded Devices
- Title(参考訳): 資源制約埋込デバイス上でのSLMの微細調整のための高効率GPU DVFS
- Abstract要約: エネルギー効率の良い小言語モデル(SLM)の微調整には動的電圧周波数スケーリング(DVFS)が不可欠である。
本稿では,資源制約のある組込みプラットフォーム上でのエネルギー最適化GPU DVFS設定を選択する,シンプルで効果的なMLベースモデル選択を提案する。
NVIDIA Jetson AGX Orinの結果は、MAXNモード0よりも平均13.11%(最大26.73%)の省エネ効果を示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dynamic Voltage Frequency Scaling (DVFS) on resource-constrained embedded GPU platforms is essential for energy-efficient small language model (SLM) fine-tuning, as privacy- and personalization-driven adaptation increasingly requires local execution and involves repeated forward-backward optimization over many mini-batches, making it substantially more time- and energy-intensive than single-pass inference. To this end, 1) we first characterize the fine-tuning behavior of representative encoder-only SLMs of BERT variants, and autoregressive decoder-only SLMs of Pythia variants on GLUE benchmarks. In addition to the characterizations, 2) we propose a simple yet effective ML-based model selection that selects energy-optimal GPU DVFS settings on resource-constrained embedded platforms. Our results on NVIDIA Jetson AGX Orin demonstrate average 13.11% energy savings (up to 26.73%) over MAXN Mode 0, which has no explicit power cap.
- Abstract(参考訳): リソース制約された組み込みGPUプラットフォーム上での動的電圧周波数スケーリング(DVFS)は、プライバシとパーソナライゼーションを駆動する適応が局所的な実行を必要とするため、エネルギー効率のよい小型言語モデル(SLM)の微調整には不可欠である。
この目的のために。
1) BERT 変種の代表エンコーダのみの SLM と Pythia 変種の自己回帰デコーダのみの SLM をGLUE ベンチマークで評価した。
特徴に加え、
2) 資源制約のある組込みプラットフォーム上でのエネルギー最適化GPU DVFS設定を選択するためのMLモデル選択法を提案する。
NVIDIA Jetson AGX Orinの結果は、MAXNモード0よりも平均13.11%(最大26.73%)の省エネ効果を示した。
関連論文リスト
- PELM: Power Efficient On-Device LLM Inference with Speculative Decoding and Dynamic Voltage Frequency Scaling [0.42015796373418257]
大規模言語モデル(LLM)は、エッジのモバイルプラットフォームに直接デプロイすることができる。
LLMには、リソース制約のあるモバイルプラットフォームやエッジプラットフォームが満たすのが困難である、重い計算要件がある。
我々は、従来のDVFSプロセッサの周波数調整を2つの追加のワークロード固有のノブで強化するソリューションであるPELMを提案する。
論文 参考訳(メタデータ) (2026-09-09T03:27:51Z) - Convex Optimization for Alignment and Preference Learning on a Single GPU [52.997197698288936]
人間の好みに合わせて微調整された大きな言語モデルは、GeminiやChatGPTといったシステムの成功を導いた。
DPO(Direct Preference Optimization)は、よりシンプルな代替手段を提供するが、一貫性のないランキング精度やGPUリソースへの高い依存といった制限がある。
本稿では,理論的保証の強い新しい軽量戦略であるConvex Optimization for Alignment and Preference Learning Algorithm (COALA)を提案する。
論文 参考訳(メタデータ) (2026-05-22T05:25:00Z) - EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization [5.093812479614167]
EnergyLensは、LLM(Energy-Aware Large Language Model)推論最適化のためのエンドツーエンドフレームワークである。
融合、並列性、計算通信の重複を含むLCM仕様を、負荷不均衡を意識したMoEモデリングと組み合わせて取得する。
テンソルパラレルおよびエキスパートパラレル構成におけるLlama3およびQwen3-MoE上のEnergyLensを検証する。
我々のエネルギー駆動探査では、プリフィルとデコードで構成されたエネルギーの最大1.47倍と52.9倍のエネルギー変化が示され、分散サービスへの動機付けがなされている。
論文 参考訳(メタデータ) (2026-05-14T01:37:26Z) - POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation [57.57816409869894]
大規模言語モデルをトレーニングするためのスケーラブルでメモリ効率のよい変種であるPOET-Xを紹介する。
PoET-Xは、スループットとメモリ効率を大幅に改善しながら、PoETの一般化と安定性の利点を維持している。
論文 参考訳(メタデータ) (2026-03-05T18:59:23Z) - ZeroDVFS: Zero-Shot LLM-Guided Core and Frequency Allocation for Embedded Platforms [7.633618497843279]
マルチコアプラットフォーム上での熱・エネルギーを考慮したスケジューリングのためのモデルベース階層型マルチエージェント強化学習(MARL)フレームワークを提案する。
第一決定レイテンシはテーブルベースのプロファイリングよりも8,300倍高速で、動的組み込みシステムに実用的なデプロイを可能にする。
論文 参考訳(メタデータ) (2026-01-13T02:56:06Z) - Runtime Tunable Tsetlin Machines for Edge Inference on eFPGAs [0.2294388534633318]
eFPGAはエッジ機械学習(ML)アプリケーションのハードウェアアクセラレータを低消費電力で設計することができる。
限られたeFPGA論理とメモリは計算能力とモデルサイズを著しく制限した。
提案するeFPGAアクセラレータは、リソース使用量の最小化と、スループットに対するオンフィールドリカバリの柔軟性の実現に重点を置いている。
論文 参考訳(メタデータ) (2025-02-10T12:49:22Z) - Sparse Gradient Compression for Fine-Tuning Large Language Models [58.44973963468691]
ダウンストリームタスクのための微調整された大型言語モデル(LLM)は、広く利用されていることと、オープンソースモデルの利用が増加しているために、ますます重要になっている。
微調整に伴う高メモリコストは、特にモデルのサイズが大きくなるにつれて大きな課題である。
これらの制約に対処するためにスパース圧縮勾配(SGC)を提案する。
論文 参考訳(メタデータ) (2025-02-01T04:18:28Z) - Optimizing Foundation Model Inference on a Many-tiny-core Open-source RISC-V Platform [13.326025546527784]
本稿では,オープンソースのマルチティニーコアRISC-Vプラットフォーム上で,トランスフォーマーモデルの最初のエンドツーエンド推論結果を示す。
エンコーダのみのモデルでは、最も最適化された実装とベースラインバージョンの間の最大12.8倍のスピードアップを示す。
デコーダのみのトポロジでは、非自己回帰(NAR)モードで16.1倍、オート回帰(AR)モードで最大35.6倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2024-05-29T17:16:59Z) - QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources [35.16907522675046]
大規模言語モデル(LLM)は、さまざまな自然言語処理タスクに顕著な影響を与えている。
下流データセットでトレーニング済みのモデルを微調整することで、大幅なパフォーマンス向上を実現している。
このプロセスは通常、大量の高価なハイエンドGPUを必要とする。
トレーニング状態の量子化と格納を行う量子化フルパラメータチューニングフレームワークであるQFTを提案する。
論文 参考訳(メタデータ) (2023-10-11T02:47:40Z) - Energy-efficient Task Adaptation for NLP Edge Inference Leveraging
Heterogeneous Memory Architectures [68.91874045918112]
Adapter-ALBERTは、様々なタスクにわたる最大データ再利用のための効率的なモデル最適化である。
検証されたNLPエッジアクセラレータ上でシミュレーションを行うことにより、モデルを不均一なオンチップメモリアーキテクチャにマッピングする利点を実証する。
論文 参考訳(メタデータ) (2023-03-25T14:40:59Z) - Federated Learning for Energy-limited Wireless Networks: A Partial Model
Aggregation Approach [79.59560136273917]
デバイス間の限られた通信資源、帯域幅とエネルギー、およびデータ不均一性は、連邦学習(FL)の主要なボトルネックである
まず、部分モデルアグリゲーション(PMA)を用いた新しいFLフレームワークを考案する。
提案されたPMA-FLは、2つの典型的な異種データセットにおいて2.72%と11.6%の精度を改善する。
論文 参考訳(メタデータ) (2022-04-20T19:09:52Z) - Pruning Self-attentions into Convolutional Layers in Single Path [89.55361659622305]
ビジョントランスフォーマー(ViT)は、様々なコンピュータビジョンタスクに対して印象的なパフォーマンスを実現している。
トレーニング済みのViTを効率よく自動圧縮するSPViT(Single-Path Vision Transformer pruning)を提案する。
われわれのSPViTはDeiT-Bで52.0%のFLOPをトリミングできる。
論文 参考訳(メタデータ) (2021-11-23T11:35:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。