論文の概要: Toward Sustainable Distributed LLM Inference: A Systems Synthesis and Research Agenda for an Energy-, Carbon-, and Cache-Aware llm-d Control Plane
- arxiv url: http://arxiv.org/abs/2609.05565v1
- Date: Thu, 03 Sep 2026 21:56:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.094242
- Title: Toward Sustainable Distributed LLM Inference: A Systems Synthesis and Research Agenda for an Energy-, Carbon-, and Cache-Aware llm-d Control Plane
- Title(参考訳): 持続可能な分散LLM推論に向けて:エネルギー・炭素・キャッシュを考慮したllm-d制御のためのシステム合成と研究アジェンダ
- Abstract要約: 本稿では,lm-dのような分散推論制御平面が決定点である場合,何を意味するのかという,実践的な工学的疑問を提起する。
私は、文献を繰り返しデザインパターンに分類し、それらのパターンを使って、sustainable Inference Control Plane (SICP)をllm-dのためにスケッチします。
提案した制御プレーンは、TTFT/TPOT SLOを厳しい制約として保ちながら、レイテンシ、エネルギー、炭素、キャッシュ再利用、サービスコスト、ルーティングおよびスケーリング時の品質を検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) sustainability is increasingly a serving-systems problem, not only a training problem. In production, energy and carbon impact depend on more than model size: workload shape, batching, key-value (KV) cache reuse, prefill/decode placement, model and accelerator choice, power state, geographic carbon intensity, and service-level objectives (SLOs) all matter. Recent systems papers study many of these factors separately. This paper connects those results and asks a practical engineering question: what do they imply when the decision point is a distributed inference control plane such as llm-d? The contribution here is synthesis, not a new set of benchmark results. Reported performance, energy, carbon, and cost improvements remain the results of the cited papers and systems. I group the literature into recurring design patterns and use those patterns to sketch a Sustainable Inference Control Plane (SICP) for llm-d. The proposed control plane would consider latency, energy, carbon, cache reuse, serving cost, and quality when routing and scaling, while keeping TTFT/TPOT SLOs as hard constraints. I also outline an evaluation framework based on SLO-satisfied goodput per joule and per gram CO2e, together with a reproducible experimental plan. The main observation from connecting the literature is that sustainable LLM inference is unlikely to come from one "green" model or one accelerator; it is more naturally treated as a control problem across model, phase, cache, hardware, replica, region, and time.
- Abstract(参考訳): 大規模言語モデル(LLM)の持続性は、トレーニングの問題だけでなく、サービスシステムの問題もますます多くなっている。
生産では、エネルギーと炭素の影響は、ワークロードの形状、バッチ化、キーバリュー(KV)キャッシュの再利用、プリフィル/デコード配置、モデルとアクセラレーションの選択、電力状態、地理的炭素強度、サービスレベルの目的(SLO)など、モデルサイズ以上のものに依存します。
近年のシステム研究はこれらの要因の多くを別々に研究している。
本稿では,これらの結果を結合し,実用工学的な疑問を呈する: 決定点が llm-d のような分散推論制御平面である場合,それは何を意味するのか?
ここでの貢献は、新しいベンチマーク結果ではなく、合成である。
報告された性能、エネルギー、炭素、コストの改善は、引用された論文やシステムの結果のままである。
私は、文献を繰り返しデザインパターンに分類し、それらのパターンを使って、sustainable Inference Control Plane (SICP)をllm-dのためにスケッチします。
提案した制御プレーンは、TTFT/TPOT SLOを厳しい制約として保ちながら、レイテンシ、エネルギー、炭素、キャッシュ再利用、サービスコスト、ルーティングおよびスケーリング時の品質を検討する。
また,1ジュールあたりのSLO満足度と1グラムあたりのCO2eに基づく評価フレームワークと再現可能な実験計画について概説する。
文献を繋ぐことによる主な観察は、持続可能なLSM推論は、1つの「グリーン」モデルまたは1つの加速器から来ることはありそうになく、より自然にモデル、フェーズ、キャッシュ、ハードウェア、レプリカ、リージョン、時間にわたって制御問題として扱われる。
関連論文リスト
- InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers [0.15999407512883507]
InFactPlanner(インファクトプランナー)は、持続可能なAIデータセンターの配置を分析するためのトレース駆動の意思決定支援フレームワークである。
InFactPlannerは、クエリトレース、ハードウェアモデルプロファイル、候補サイト構成、PUE/WUEパラメータ、再生可能生成モデル、時間変化のグリッドカーボン強度を組み合わせて、電力、エネルギー、二酸化炭素排出量、水利用、レイテンシ、サーバー利用を推定する。
論文 参考訳(メタデータ) (2026-08-13T07:57:22Z) - How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms [8.304081609008119]
本稿では,テキスト数値生成,テンポラルトケン生成,連続テンポラルデコーディングの3つの主要なVTG出力パラダイムを比較した。
その結果, モデルスケールによらず, 出力定式化の選択は基礎的精度と計算コストの両方に大きく影響することがわかった。
これらの知見は, 効率よく展開可能なVTGシステムを設計するための客観的な実証的ガイドラインを提供する。
論文 参考訳(メタデータ) (2026-04-10T05:10:15Z) - Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation [2.2165845825140695]
本稿では,サステナビリティ・ファクターとともにコード生成の精度に異なるエンジニアリング・ストラテジーがどう影響するかを,最初の系統的な実証的研究を行った。
我々は,HumanEval+ベンチマークとMBPP+ベンチマークを用いて,11個のオープンソースモデル(1Bから34Bパラメータ)にまたがる6つの顕著なプロンプト戦略を評価した。
以上の結果から,より単純なプロンプト技術であるChain-of-Thoughtは,推理能力とエネルギー効率のほぼ最適バランスを実現できることが示唆された。
論文 参考訳(メタデータ) (2026-04-03T06:37:51Z) - Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs [49.66344956133349]
推論能力は、大規模な(ビジョン)言語モデルのための推論時間性能と強化学習(RL)トレーニングの両方を形作る。
本稿では,戦略的文脈化のための潜在変数をモデルに付与する新しい潜在変調フレームワークであるReasoning Paletteを提案する。
論文 参考訳(メタデータ) (2025-12-19T03:32:53Z) - A Collaborative Platform for Soil Organic Carbon Inference Based on Spatiotemporal Remote Sensing Data [3.9589674165097897]
WALGREENは、現在のアプリケーションの制限を克服することで、SOC推論を強化するプラットフォームである。
WALGREENは、過去の公開データとプライベートデータを使って予測モデルを生成する。
研究者、政策立案者、土地管理者が炭素データにアクセスし、トレンドを分析し、エビデンスベースの意思決定をサポートするために、ユーザーフレンドリーなインターフェースを提供する。
論文 参考訳(メタデータ) (2025-04-17T04:50:18Z) - GreenDFL: a Framework for Assessing the Sustainability of Decentralized Federated Learning Systems [13.15941655109666]
Decentralized Federated Learning(DFL)は、集中的なデータやモデルアグリゲーションなしに協調的なモデルトレーニングを可能にする新興パラダイムである。
本研究の目的は、DFLシステムの持続可能性を評価するための総合的かつ運用的なフレームワークを開発することである。
提案したGreenDFLは、DFLシステムの持続可能性を評価するための包括的で実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2025-02-27T16:27:42Z) - Learning from Reward-Free Offline Data: A Case for Planning with Latent Dynamics Models [79.2162092822111]
我々は,一連のナビゲーションタスクにおいて,強化学習(RL)と制御に基づく手法を体系的に評価する。
我々は、JEPA(Joint Embedding Predictive Architecture)を使用して、潜在ダイナミクスモデルを使用し、それを計画に使用します。
その結果,モデルベースプランニングではレイアウトが不明瞭になるのに対して,モデルフリーのRLは高品質なデータから恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2025-02-20T18:39:41Z) - Power Hungry Processing: Watts Driving the Cost of AI Deployment? [74.19749699665216]
生成された多目的AIシステムは、機械学習(ML)モデルをテクノロジに構築するための統一的なアプローチを約束する。
この「一般性」の野心は、これらのシステムが必要とするエネルギー量と放出する炭素量を考えると、環境に急激なコストがかかる。
これらのモデルを用いて,代表的なベンチマークデータセット上で1,000の推論を行うのに必要なエネルギーと炭素の量として,デプロイメントコストを測定した。
本稿は、多目的MLシステムの展開動向に関する議論から締めくくり、エネルギーと排出の面でコストの増大に対して、その実用性はより意図的に重み付けされるべきである、と警告する。
論文 参考訳(メタデータ) (2023-11-28T15:09:36Z) - A Carbon Tracking Model for Federated Learning: Impact of Quantization and Sparsification [5.341266334051207]
フェデレートラーニング(FL)手法は効率的なコミュニケーション技術を採用し、エッジデバイスに機械学習タスクを分散させる。
本稿では,FLシステムのエネルギーおよび炭素フットプリントへの影響をリアルタイムにモニタリングするためのフレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-12T07:20:03Z) - ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language
Models [70.45441031021291]
LVLM(Large Vision-Language Models)は、様々なモダリティから豊富な情報を統合することで、世界を包括的に理解することができる。
LVLMは計算/エネルギーの膨大なコストと炭素消費のためにしばしば問題となる。
本稿では,LVLMの2段間粗大な重み付け法であるECoFLaP(Efficient Coarse-to-Fine LayerWise Pruning)を提案する。
論文 参考訳(メタデータ) (2023-10-04T17:34:00Z) - Counting Carbon: A Survey of Factors Influencing the Emissions of
Machine Learning [77.62876532784759]
機械学習(ML)は、モデルトレーニングプロセス中に計算を実行するためにエネルギーを使用する必要がある。
このエネルギーの生成には、使用量やエネルギー源によって、温室効果ガスの排出という観点からの環境コストが伴う。
本稿では,自然言語処理とコンピュータビジョンにおいて,95のMLモデルの炭素排出量の時間的および異なるタスクに関する調査を行う。
論文 参考訳(メタデータ) (2023-02-16T18:35:00Z) - A Framework for Energy and Carbon Footprint Analysis of Distributed and
Federated Edge Learning [48.63610479916003]
本稿では,分散学習政策の環境フットプリントに影響を与える要因を概説し,分析する。
バニラとコンセンサスによって駆動される分散FLポリシーの両方をモデル化する。
その結果、flは低ビット/ジュール効率を特徴とするワイヤレスシステムにおいて、顕著なエンドツーエンドの省エネ(30%-40%)が可能となった。
論文 参考訳(メタデータ) (2021-03-18T16:04:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。