論文の概要: LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference
- arxiv url: http://arxiv.org/abs/2604.27032v1
- Date: Wed, 29 Apr 2026 15:10:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.728636
- Title: LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference
- Title(参考訳): エネルギー効率の良いモデル推論のためのLLM誘導実行時パラメータ最適化
- Authors: Katelyn Crumpacker, Dimitrios Nikolopoulos,
- Abstract要約: 大規模言語モデル(LLM)は大量のエネルギーを消費し、これらのツールの需要の規模において大きな関心事となる。
人間による特定のフィードバック促進手法により、チャットベースのLLMは、従来の検索手法よりも高速にエネルギー効率の高い推論パラメータを反復的に見つけることができる。
強化されたプロンプトテンプレートは平均3.4プロンプトで閾値以下に収束し、ベースラインは平均5.2プロンプトで収束した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have become an integral part of many real-world workflows. However, LLMs consume a lot of energy, which becomes a large concern in the scale of the demand for these tools. As LLMs become integrated into different workflows, different applications have arisen to deal with the challenge of running inference for these tools. This raises another issue of choosing the runtime parameter values for these services in order to minimize the energy consumption. Oftentimes this requires deep knowledge of the application or traditional optimization methods that can take days to find optimal values. In this work, we created a human-in-the-loop flow with LLM-assisted runtime parameter optimization in order to solve this issue. With human-created, specific feedback prompting methods, chat-based LLMs can iteratively find energy-efficient inference parameters faster than traditional search methods. LLMs can also tailor their solutions to different hardware setups and easily take into account other system constraints. The enhanced prompt template was able to converge below the threshold at an average of 3.4 prompts compared to the baseline, which converged in an average of 5.2 prompts, and consistently achieved lower final energy per token. The enhanced prompt template also outperformed Sobol sampling in convergence speed.
- Abstract(参考訳): 大規模言語モデル(LLM)は多くの現実世界のワークフローの不可欠な部分となっている。
しかし、LSMは大量のエネルギーを消費しており、これらのツールの需要規模に大きな関心を抱いている。
LLMがさまざまなワークフローに統合されるにつれて、これらのツールで推論を実行するという課題に対処するために、さまざまなアプリケーションが生まれてきた。
これにより、エネルギー消費を最小限に抑えるために、これらのサービスの実行時パラメータ値を選択するという別の問題が発生する。
多くの場合、最適な値を見つけるのに数日かかるアプリケーションや従来の最適化手法の深い知識が必要です。
本研究では,この問題を解決するために,LLMを用いた実行時パラメータ最適化を用いたループ内フローを構築した。
人間による特定のフィードバック促進手法により、チャットベースのLLMは、従来の検索手法よりも高速にエネルギー効率の高い推論パラメータを反復的に見つけることができる。
LLMはまた、ソリューションを異なるハードウェア設定に合わせて調整し、他のシステムの制約を考慮に入れやすい。
改良されたプロンプトテンプレートは平均3.4プロンプトでしきい値以下に収束し、平均5.2プロンプトで収束し、トークン当たりの最終エネルギーは一貫して低下した。
改良されたプロンプトテンプレートは、収束速度でSobolサンプリングよりも優れていた。
関連論文リスト
- Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models? [65.18157595903124]
本研究では任意のプロンプトの反復的近似評価について検討する。
Model Predictive Prompt Selection (MoPPS)はベイズにおけるリスク予測フレームワークである。
MoPPSは迅速な困難を確実に予測し、ロールアウトを大幅に削減したトレーニングを加速する。
論文 参考訳(メタデータ) (2025-07-07T03:20:52Z) - Optuna vs Code Llama: Are LLMs a New Paradigm for Hyperparameter Tuning? [45.58422897857411]
この研究は、LoRAを用いてパラメータ効率の良いCode Llamaを微調整することで、ハイパーパラメータ最適化のための大規模言語モデル(LLM)の使用について検討する。
提案手法は,計算オーバーヘッドを大幅に削減しつつ,競合的あるいは優れたRoot Mean Square Error(RMSE)を実現する。
その結果,LLMに基づく最適化によって,木構造型パーゼンエミュレータ (TPE) のようなベイズ的手法が確立されただけでなく,知覚品質と低レイテンシ処理を必要とする実世界のアプリケーションへのチューニングが高速化された。
論文 参考訳(メタデータ) (2025-04-08T13:15:47Z) - In-the-loop Hyper-Parameter Optimization for LLM-Based Automated Design of Heuristics [0.020482269513546456]
大規模言語モデル(LLM)は、(メタ)ヒューリスティックを自動的に生成し最適化する大きな可能性を示している。
本稿では,オープンソースのLLaMEAフレームワークとハイパー進化最適化(HPO)手法を統合した新しいハイブリッドアプローチであるLLaMEA-HPOを提案する。
論文 参考訳(メタデータ) (2024-10-07T14:04:31Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z) - QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning [58.767866109043055]
クエリ依存型プロンプト最適化(QPO)を導入し、入力クエリに合わせて最適なプロンプトを生成するために、小さな事前訓練された言語モデルを反復的に微調整する。
我々は、オープンソースのタスクに様々なプロンプトをベンチマークする副産物として、すでに大量に存在するオフラインのプロンプトデータから洞察を得る。
様々なLLMスケールと多様なNLPおよび数学タスクの実験は、ゼロショットと少数ショットの両方のシナリオにおいて、我々の手法の有効性とコスト効率を実証している。
論文 参考訳(メタデータ) (2024-08-20T03:06:48Z) - Scaling Sparse Fine-Tuning to Large Language Models [67.59697720719672]
大きな言語モデル(LLM)は、パラメータの数が多いため、完全な微調整が難しい。
本研究では,パラメータの配列とパラメータのデルタを事前学習した値に対して保持する新しいスパース微調整法SpIELを提案する。
提案手法は,LoRAのようなパラメータ効率の高い微調整法よりも性能が優れ,実行時間も同等であることを示す。
論文 参考訳(メタデータ) (2024-01-29T18:43:49Z) - Response Length Perception and Sequence Scheduling: An LLM-Empowered LLM
Inference Pipeline [22.08897444328099]
大規模言語モデル(LLM)はAIの分野に革命をもたらし、様々なタスクで前例のない能力を示している。
本稿では,LLMのパワーを利用する効率的なLLM推論パイプラインを提案する。
論文 参考訳(メタデータ) (2023-05-22T15:36:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。