論文の概要: Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations
- arxiv url: http://arxiv.org/abs/2607.09172v1
- Date: Fri, 10 Jul 2026 08:04:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.808644
- Title: Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations
- Title(参考訳): 詳細への注意: vLLM 構成全体でのエネルギー、性能、精度のトレードオフを評価する
- Authors: Nada Zine, Tristan Coignion, Vincenzo Stoico, Clément Quinton, Romain Rouvoy, Patricia Lago,
- Abstract要約: 本研究では, 推論エンジンの構成がエネルギー消費, 性能, 出力品質に及ぼす影響について検討した。
本稿では、注目カーネルタイプ、プレフィックスキャッシュ、チャンクプリフィルの3つの選択されたvLLM構成オプションについて、大規模な制御を行った。
本研究の結果から,検討した構成オプションは,主に注意型と接頭辞キャッシングによるエネルギーと性能に大きく影響し,チャンクプリフィルは限定的な効果を示した。
- 参考スコア(独自算出の注目度): 3.1580269196873267
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large Language Models are reshaping how software is developed and maintained. They are typically deployed in production using inference engines such as vLLM, which can efficiently serve pre-trained, highly configurable models. While prior work has focused on model architectures and hardware acceleration, the impact of inference engine configuration on energy consumption, performance, and output quality remains poorly understood. In this paper, we present a large-scale controlled study of three selected vLLM configuration options: attention kernel type, prefix caching, and chunked prefill. We evaluate all combinations of these configurations across 5 open-weight LLMs and 5 diverse inference tasks, totaling $9,000$ runs and $93,600$ measures. We analyze energy consumption, latency, and accuracy, and examine both main effects and interaction effects between configuration options and tasks. Our results show that the studied configuration options significantly impact energy and performance, mainly driven by attention type and prefix caching, while chunked prefill has a limited effect under the default vLLM serving configuration and evaluated workloads. These effects are highly model- and workload-dependent, and no configuration is universally optimal. We further show that model choice dominates global trade-offs, while configuration tuning provides local improvements along the Pareto frontier. Unexpectedly, inference options can also affect model accuracy.
- Abstract(参考訳): 大規模言語モデルは、ソフトウェアの開発とメンテナンスの方法を変えつつある。
通常はvLLMのような推論エンジンを使用して本番環境にデプロイされる。
これまではモデルアーキテクチャやハードウェアアクセラレーションに重点を置いてきたが、推論エンジンの構成がエネルギー消費、性能、出力品質に与える影響はよく分かっていない。
本稿では,アテンションカーネルタイプ,プレフィックスキャッシュ,チャンクプリフィルという3つの選択されたvLLM構成オプションについて,大規模に制御した検討を行った。
5つのオープンウェイトLCMと5つの多様な推論タスクにまたがって、これらの構成のすべての組み合わせを評価します。
我々は、エネルギー消費、レイテンシ、精度を分析し、構成オプションとタスクの主な効果と相互作用効果について検討する。
その結果,検討した構成オプションは,主にアテンションタイプとプレフィックスキャッシングによるエネルギーとパフォーマンスに大きく影響し,チャンクプリフィルはデフォルトのvLLMサービス構成と評価ワークロード下では限定的な効果を示した。
これらの効果はモデルに依存し、ワークロードに依存しており、構成が普遍的に最適ではない。
さらに、モデル選択がグローバルなトレードオフを支配し、構成調整がParetoフロンティアに沿った局所的な改善を提供することを示す。
予想外の推論オプションは、モデルの精度にも影響を及ぼす。
関連論文リスト
- ConfigSpec: Profiling-Based Configuration Selection for Distributed Edge--Cloud Speculative LLM Serving [5.390941065727373]
投機的復号化により、クラウドとエッジをまたいだ協調的なLarge Language Model (LLM)推論が可能になる。
本稿では,分散投機LSMサービスのための構成選択フレームワークであるConfigSpecを提案する。
論文 参考訳(メタデータ) (2026-04-08T21:54:41Z) - Pimp My LLM: Leveraging Variability Modeling to Tune Inference Hyperparameters [0.3186130813218338]
大規模言語モデル(LLM)は、幅広いタスクでますます使われています。
彼らの相当な計算要求は、トレーニングと推論の両方のエネルギー効率と持続可能性に関する懸念を提起する。
最近の研究は、最適化手法を探求し、構成選択がエネルギー消費にどのように影響するかを分析している。
論文 参考訳(メタデータ) (2026-02-06T16:18:22Z) - AIConfigurator: Lightning-Fast Configuration Optimization for Multi-Framework LLM Serving [16.664502126572856]
AIConfiguratorは、Large Language Model(LLM)推論のための統一されたパフォーマンスモデリングシステムである。
GPUベースのプロファイリングを必要とせずに、迅速なフレームワークベースの構成検索を可能にする。
これは、高密度モデルのパフォーマンスを最大40%向上させる優れたサービス構成を特定する。
論文 参考訳(メタデータ) (2026-01-09T20:03:57Z) - Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression [53.39128997308138]
テキスト圧縮性能に基づくモデル効率の指標である情報容量を導入する。
主流のオープンソースモデルに対する実証的な評価は、シリーズ内のさまざまなサイズのモデルが一貫した情報容量を示すことを示している。
情報容量の特徴的な特徴は、入力と出力の両方のトークン数に影響を与えるトークン化効率が組み込まれていることである。
論文 参考訳(メタデータ) (2025-11-11T10:07:32Z) - Towards a Comprehensive Scaling Law of Mixture-of-Experts [54.117786590884776]
本論文では,すべての重要な要因を考慮に入れた総合的かつ正確なMoEスケーリング法を提案する。
我々の結果は、$G$と$S$の最適設定が、モデルアーキテクチャとデータサイズの両方に依存しないことを示しています。
提案したMoEスケーリング法則は,将来のMoEモデル設計およびトレーニングを促進するための,正確かつ洞察に富んだガイダンスとして機能する可能性がある。
論文 参考訳(メタデータ) (2025-09-28T06:35:34Z) - Inference Compute-Optimal Video Vision Language Models [43.58391312563079]
本研究では,ビデオビジョン言語モデルにおける3つの主要なスケーリング要因間の推論計算の最適割り当てについて検討する。
我々の実験では、タスクパフォーマンスがスケーリングの要因やデータサイズの微調整にどのように依存するか、そしてデータサイズの変化が計算-最適フロンティアをどのようにシフトするかを明らかにした。
論文 参考訳(メタデータ) (2025-05-24T20:09:04Z) - Data Scaling Laws for End-to-End Autonomous Driving [83.85463296830743]
16時間から8192時間に及ぶ内部駆動データセット上での簡易エンド・ツー・エンド駆動アーキテクチャの性能評価を行った。
具体的には、目標の性能向上を達成するために、どの程度のトレーニングデータが必要かを調査する。
論文 参考訳(メタデータ) (2025-04-06T03:23:48Z) - Pruning-Based TinyML Optimization of Machine Learning Models for Anomaly Detection in Electric Vehicle Charging Infrastructure [8.29566258132752]
本稿では,EVCIを対象とする資源制約環境における異常検出のためのプルーニング手法について検討する。
最適化されたモデルは、モデルのサイズと推論時間の大幅な削減を実現しました。
特に,EVCIでは,プルーニングとFSが重要な異常検出能力を保ちながら,計算効率を向上させることが示唆された。
論文 参考訳(メタデータ) (2025-03-19T00:18:37Z) - Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity
Tracking [53.66999416757543]
本研究では,微調整が言語モデルに実装された内部メカニズムに与える影響について検討する。
微調整はモデルの機械的操作を変えるのではなく、強化する。
論文 参考訳(メタデータ) (2024-02-22T18:59:24Z) - Green AI: A Preliminary Empirical Study on Energy Consumption in DL
Models Across Different Runtime Infrastructures [56.200335252600354]
トレーニング済みのモデルを、ネイティブな開発環境とは異なる環境にデプロイするのは、一般的なプラクティスです。
これにより、インフラを含むONNXや標準フォーマットとして機能するONNXなどの交換フォーマットが導入された。
論文 参考訳(メタデータ) (2024-02-21T09:18:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。