論文の概要: Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs
- arxiv url: http://arxiv.org/abs/2605.04357v1
- Date: Tue, 05 May 2026 23:25:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.578621
- Title: Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs
- Title(参考訳): Coral: 異種クラウドGPU上で動く費用効率のよいマルチLLM
- Authors: Yixuan Mei, Zikun Li, Zixuan Chen, Shiqi Pan, Mengdi Wu, Xupeng Miao, Zhihao Jia, K. V. Rashmi,
- Abstract要約: 大規模言語モデル(LLM)は断片化が進み、単一のモデルが支配的になることはなかった。
一方、クラウドプロバイダは、より優れた可用性を享受する幅広い中間層と古い世代のGPUを提供する。
適応型ヘテロジニアス対応多LLMサービスシステムであるCoralを紹介する。
- 参考スコア(独自算出の注目度): 29.86484984062191
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The usage of large language models (LLMs) has grown increasingly fragmented, with no single model dominating. Meanwhile, cloud providers offer a wide range of mid-tier and older-generation GPUs that enjoy better availability and deliver comparable performance per dollar to top-tier hardware. To efficiently harness these heterogeneous resources for serving multiple LLMs concurrently, we introduce Coral, an adaptive heterogeneity-aware multi-LLM serving system. The key idea behind Coral is to jointly optimize resource allocation and the serving strategy of each model replica across all models. To keep pace with shifting throughput demand and resource availability, Coral applies a lossless two-stage decomposition that preserves joint optimality while cutting online solve time from hours to tens of seconds. Our evaluation across 6 models and 20 GPU configurations shows that Coral reduces serving cost by up to 2.79$\times$ over the best baseline, and delivers up to 2.39$\times$ higher goodput under scarce resource availability.
- Abstract(参考訳): 大規模言語モデル (LLMs) の利用はますます断片化され、単一のモデルが支配的になってはいない。
一方、クラウドプロバイダーは、より優れた可用性を享受し、上位層のハードウェアに1ドル当たり同等のパフォーマンスを提供する、幅広い中型および古い世代のGPUを提供している。
複数のLLMを同時に提供するために、これらの異種資源を効率的に活用するために、適応的な異種対応マルチLLMサービスシステムであるCoralを導入する。
Coralの背景にある重要なアイデアは、リソース割り当てと、すべてのモデルにまたがる各モデルのレプリカの提供戦略を共同で最適化することである。
スループットの需要のシフトとリソースの可用性のペースを維持するために、Coral氏は、オンライン解決時間を数時間から数秒に短縮しながら、共同最適化を保ちながら、損失のない2段階の分解を適用している。
6つのモデルと20のGPU構成で評価したところ、Coralは最高のベースラインでサービスコストを2.79$\times$に削減し、リソースの可用性が低い場合に最大2.39$\times$高出力を提供する。
関連論文リスト
- Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems [11.584593298674688]
Low-Rank Adaptation (LoRA)は,大規模言語モデル(LLM)のパラメータ効率向上のためのデファクト手法となった。
プロダクションでは、LoRAベースのモデルが大規模に提供され、数百のアダプタがベースモデルを共有するマルチテナント環境を生成する。
作業負荷を考慮した動的アダプタ配置とルーティングフレームワークであるLoRAServeについて述べる。
論文 参考訳(メタデータ) (2025-11-28T05:04:02Z) - RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs [48.94639777633359]
RLBoostは、プリエンプティブルGPUリソースを抽出するコスト効率のよいRLトレーニングのための体系的なソリューションである。
RLBoostはトレーニングのスループットを1.51x-1.97x向上し、オンデマンドGPUリソースのみを使用する場合に比べてコスト効率は28%-49%向上した。
論文 参考訳(メタデータ) (2025-10-22T04:19:37Z) - dInfer: An Efficient Inference Framework for Diffusion Language Models [54.80918957287927]
拡散に基づく大規模言語モデル (dLLM) は自己回帰(AR) LLM に代わる有望な代替品として登場した。
本稿では、dLLM推論のための効率的かつ効率的なフレームワークであるdInferについて述べる。
論文 参考訳(メタデータ) (2025-10-09T16:19:42Z) - Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving [28.19296680865433]
大規模ワークロード(LLM)の実現は、特に言語モデルをホストするプロバイダにとって、コストがかかる。
モデルとその共有による長いアイドル期間の長期的人気は、このタスクに新たな機会と課題を生み出します。
本稿では、GPU共有の可能性を解き放ち、効率とSLO達成を両立させるシステムであるPrismを提案する。
論文 参考訳(メタデータ) (2025-05-06T23:38:33Z) - StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。
StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。
実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文 参考訳(メタデータ) (2025-04-22T14:19:06Z) - On Optimal Caching and Model Multiplexing for Large Model Inference [66.50550915522551]
大きな言語モデル(LLM)や他の大きな基盤モデルは注目すべき成功を収めているが、そのサイズは既存のリソース消費とレイテンシーの問題を悪化させている。
キャッシュを用いて以前のクエリを格納し、モデルの多重化を学習し、クエリ処理のためのモデルの集合から選択する。
論文 参考訳(メタデータ) (2023-06-03T05:01:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。