論文の概要: ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB
- arxiv url: http://arxiv.org/abs/2608.07945v1
- Date: Sat, 08 Aug 2026 06:10:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.578322
- Title: ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB
- Title(参考訳): ScaleSense: Alibaba AnalyticDBの学習リソース推定によるコストインテリジェントスケーリングフレームワーク
- Abstract要約: クラウドネイティブなサーバレスデータウェアハウスは、計算からストレージを分離することで、きめ細かい弾力性を達成する。
しかし、高度にヘテロジニアスなアドホッククエリに対する最適なリソース割り当てを決定することは、深刻な産業上の課題である。
プロアクティブでクエリレベルのリソーススケーリングフレームワークであるScaleSenseを提案する。
- 参考スコア(独自算出の注目度): 59.708423132520515
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Cloud-native serverless data warehouses achieve fine-grained elasticity by decoupling storage from compute, yet determining the optimal resource allocation for highly heterogeneous ad-hoc queries remains a formidable industrial challenge. Our analysis of production workloads in Alibaba AnalyticDB exposes a costly ``provisioning trap'': the fear of catastrophic resource depletion drives users to blindly over-provision resources, wasting immense monetary budgets without alleviating non-CPU bottlenecks (e.g., I/O saturation). To break this impasse, we propose ScaleSense, a proactive, query-level resource scaling framework. Specifically, it features a multi-faceted query encoder that jointly models plan topologies and hardware specifications. Crucially, a quantile-based resource predictor estimates multi-dimensional physical footprints, acting as a reliable safety net for optimal resource scaling. An auto-scaling controller then navigates the performance-cost Pareto frontier, dynamically tailoring allocations to specific business priorities without requiring model retraining. Evaluations on over 1.36 million production queries show that ScaleSense achieves state-of-the-art prediction accuracy with good prediction interval coverage. By achieving a 76.7% relative improvement in optimal resource configuration selection over the best baseline, this approach addresses the critical performance-cost trade-off while maintaining low-overhead inference latency, confirming its practical performance in production deployments. Under the performance-optimization policy, ScaleSense satisfies user-defined performance requirements while reducing monetary cost by up to 5.22x.
- Abstract(参考訳): クラウドネイティブなサーバレスデータウェアハウスは、計算からストレージを分離することで、きめ細かな弾力性を達成するが、高度に異質なアドホッククエリに対する最適なリソース割り当ては、依然として厳しい産業上の課題である。
破滅的なリソース枯渇の恐れは、ユーザが盲目的に過剰なリソースを供給し、CPU以外のボトルネック(例えば、I/O飽和)を緩和することなく、膨大な金銭的予算を浪費する。
この障害を解消するために、私たちは、積極的にクエリレベルのリソーススケーリングフレームワークであるScaleSenseを提案します。
具体的には、トポロジとハードウェア仕様を共同でモデル化するマルチフェイスクエリエンコーダを備えている。
重要なことは、Quantileベースのリソース予測器は、最適なリソーススケーリングのための信頼性の高い安全ネットとして機能し、多次元物理フットプリントを推定する。
自動スケーリングコントローラは、パフォーマンスコストのかかるParetoフロンティアをナビゲートし、モデルの再トレーニングを必要とせずに、特定のビジネス優先度への割り当てを動的に調整する。
1.36万以上の製品クエリに対する評価は、ScaleSenseが予測間隔のカバレッジが良好で最先端の予測精度を達成していることを示している。
最適なリソース構成の選択を最適基準に対して76.7%向上させることで、低オーバーヘッドの推論遅延を維持しながら、重要なパフォーマンスコストのトレードオフに対処し、運用運用における実際のパフォーマンスを確認する。
パフォーマンス最適化ポリシーの下では、ScaleSenseはユーザ定義のパフォーマンス要件を満たすと同時に、金銭的コストを最大5.22倍に削減する。
関連論文リスト
- A Two-Stage Forecasting System for CPU Workload Prediction in Private Clouds [0.4202074945058886]
本研究では、顧客サービス要求を最初に予測することで、この依存性を明示的にモデル化する2段階統合予測モデルを提案する。
提案手法は,10のアプリケーションからなるプライベートクラウド環境から収集した実世界のトレースを用いて評価した。
論文 参考訳(メタデータ) (2026-09-03T07:15:44Z) - Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation [64.51088225051959]
不均一なAIシステムは、最低コストで最も効果的に答えられる専門家にクエリをルーティングすることで、品質と効率を向上させることができる。
我々はこのトレードオフをPandoraのBoxの例として定式化した。
ガウス信号モデルの下では、得られたポリシーは、各専門家とインプットに対して、その価値見積の精算がそのコストに値するかどうかを決定する、クローズドフォームな情報表現を持つ。
論文 参考訳(メタデータ) (2026-08-20T17:54:37Z) - From Prediction to Incrementality: Causal Optimization for Large-Scale Targeting and Recommendation [1.8192758370546824]
グローバル制約下での因果効果を最適化する,意思決定中心のフレームワークを提案する。
我々は、パブリックバンディットデータセット上でのオフラインシミュレーション、ターゲットアーキテクチャアブリケーション、LinkedIn Feedのマーケティングトラフィック上でのオンラインA/Bテストでこれを評価した。
エンドツーエンドの処理ポリシーは、統計学的に有意な$+7.20%のリフトを主要な長期値の指標として提供した。
論文 参考訳(メタデータ) (2026-08-10T19:54:08Z) - An Auto-Scaling Approach for Serverless Environments Based on a Multi-Expert Consensus Mechanism [0.3058685580689604]
依存性対応自動スケーリングフレームワークは、グラフベースのボトルネック識別、短期的なワークロード予測、マルチモデルコンセンサス、コスト対応制御を統合する。
Controllerはコールドスタートの認識とコスト比較を取り入れて、スケールアップ、スケールダウン、ホールドアクションを選択する。
論文 参考訳(メタデータ) (2026-07-16T23:48:37Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - Artificial Intelligence for Cost-Aware Resource Prediction in Big Data Pipelines [0.0]
過剰なプロビジョンは不要なコストをもたらし、過剰なプロビジョンはパフォーマンス劣化とSLA違反のリスクを負う。
本研究では,ランダムフォレスト回帰を用いたビッグデータパイプラインの資源利用予測手法を提案する。
論文 参考訳(メタデータ) (2025-09-30T20:01:12Z) - Network Resource Optimization for ML-Based UAV Condition Monitoring with Vibration Analysis [54.550658461477106]
条件監視(CM)は機械学習(ML)モデルを使用して異常および異常な条件を識別する。
本研究では,MLベースのUAV CMフレームワークにおけるネットワークリソースの最適化について検討する。
次元削減技術を活用することで、ネットワークリソース消費の99.9%が削減される。
論文 参考訳(メタデータ) (2025-02-21T14:36:12Z) - Reward-Guided Speculative Decoding for Efficient LLM Reasoning [80.55186052123196]
Reward-Guided Speculative Decoding (RSD)は,大規模言語モデル(LLM)における推論の効率向上を目的とした新しいフレームワークである。
RSDは、厳密な偏りを強制する既存の投機的復号法とは対照的に、制御されたバイアスをハイリワード出力の優先順位付けに取り入れている。
RSDは,対象モデルのみでの復号化に対して,高い効率向上を実現し,並列復号法よりも高い精度を実現している。
論文 参考訳(メタデータ) (2025-01-31T17:19:57Z) - Reconciling High Accuracy, Cost-Efficiency, and Low Latency of Inference
Serving Systems [0.0]
InfAdapterは、レイテンシSLOを満たすために、リソース割り当てでMLモデルの一連の変種を積極的に選択する。
SLO違反を減らし、業界で人気のオートスケーラと比較して、それぞれ65%と33%に値下げする。
論文 参考訳(メタデータ) (2023-04-21T11:19:49Z) - Optimal Resource Allocation for Serverless Queries [8.59568779761598]
以前の作業では、リソース割り当てと実行時の積極的なトレードオフを無視しながら、ピークアロケーションの予測に重点を置いていた。
本稿では,新しいクエリと過去のクエリの両方に対して,アグレッシブなトレードオフでパフォーマンスを予測できる最適なリソース割り当てシステムを提案する。
論文 参考訳(メタデータ) (2021-07-19T02:55:48Z) - A Predictive Autoscaler for Elastic Batch Jobs [8.354712625979776]
Deep Learning、HPC、Sparkといった大規模なバッチジョブは、従来のオンラインサービスよりもはるかに多くの計算リソースとコストを必要とします。
顧客とオーバプロビジョンインスタンスに対して,柔軟なインターフェースを提供するための予測オートスケーラを提案する。
論文 参考訳(メタデータ) (2020-10-10T17:35:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。