論文の概要: Learning Burst-Aware Early Warning Models for Capacity Stress under AI Workload Surges in Hyperscale Data Centers
- arxiv url: http://arxiv.org/abs/2606.21130v1
- Date: Fri, 19 Jun 2026 06:15:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 08:04:36.727607
- Title: Learning Burst-Aware Early Warning Models for Capacity Stress under AI Workload Surges in Hyperscale Data Centers
- Title(参考訳): ハイパースケールデータセンターにおけるAIワークロードサージによるバースト対応早期警戒モデル学習
- Authors: Zihan Yu, Xianling Zeng, Zhiming Xue, Yalun Qi, Sichen Zhao,
- Abstract要約: 本稿では,AIワークロードの急増下での能動的キャパシティストレス予測のための,デプロイ指向でバースト対応の早期警告フレームワークを提案する。
提案フレームワークは、負荷強度、時間変動、システム圧力信号を統合し、高不均衡環境下での非線形相互作用を捉えるために、軽量なツリーベース学習モデルを用いる。
本研究は,高リコール,学習に基づく早期警告システムにより,レジリエントで適応的なデータセンター運用を実現することの実用的価値を強調した。
- 参考スコア(独自算出の注目度): 4.230025065044209
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid growth of large-scale AI workloads, particularly Large Language Model (LLM) training and inference, is fundamentally reshaping the operational dynamics of hyperscale data centers. Unlike traditional cloud workloads, AI-driven jobs exhibit bursty, high-intensity, and rapidly shifting resource demands, often leading to sudden capacity stress that cannot be effectively handled by reactive threshold-based mechanisms. In this paper, we propose a deployment-oriented, burst-aware early warning framework for proactive capacity stress prediction under AI workload surges. We formulate the problem as a high-recall forecasting task over multivariate telemetry windows, with the explicit goal of enabling operational intervention before system degradation occurs. The proposed framework integrates workload intensity, temporal variation, and system pressure signals, and employs a lightweight tree-based learning model to capture nonlinear interactions in highly imbalanced environments. To evaluate the system under realistic conditions, we introduce an AI workload surge injection methodology that simulates burst-driven demand patterns observed in large-scale AI systems. Our XGBoost-based model achieves an ROC AUC of 0.697 and an AP of 0.670, significantly outperforming baseline methods. Under deployment-oriented threshold selection, the framework achieves a Recall of 0.914, enabling the detection of the majority of stress-prone periods with acceptable false-alarm cost. Beyond predictive performance, we show how the proposed framework can be integrated into operational control loops to support proactive actions such as workload throttling and resource scaling. Our results highlight the practical value of high-recall, learning-based early warning systems in enabling resilient and adaptive data center operations in the era of AI-driven workloads.
- Abstract(参考訳): 大規模AIワークロードの急速な成長、特にLarge Language Model(LLM)トレーニングと推論は、ハイパースケールデータセンターの運用ダイナミクスを根本的に変えています。
従来のクラウドワークロードとは異なり、AI駆動のジョブは突発的で、高強度で、リソース要求の急激なシフトを示し、しばしば、リアクティブなしきい値ベースのメカニズムで効果的に処理できない突然のキャパシティストレスを引き起こす。
本稿では,AIワークロードの急上昇下での能動的キャパシティストレス予測のための,デプロイ指向でバースト対応の早期警告フレームワークを提案する。
多変量テレメトリウィンドウ上でのハイリコール予測タスクとしてこの問題を定式化し、システム劣化が起こる前に運用上の介入を可能にすることを目的としている。
提案フレームワークは,作業負荷強度,時間変動,システム圧力信号を統合し,高不均衡環境下での非線形相互作用を捉えるために,軽量なツリーベース学習モデルを用いる。
現実的な条件下でシステムを評価するために,大規模AIシステムで観測されるバースト駆動需要パターンをシミュレートするAIワークロードサージインジェクション手法を提案する。
我々のXGBoostモデルでは、OC AUCが0.697、APが0.670で、ベースライン法よりも大幅に優れています。
デプロイメント指向のしきい値選択の下で、このフレームワークは0.914のリコールを達成し、許容される偽アラームコストで、ほとんどのストレスが発生しやすい期間を検出することができる。
予測性能以外にも、ワークロードの絞り込みやリソーススケーリングといった積極的なアクションをサポートするために、提案したフレームワークを運用制御ループに統合する方法を示す。
我々の結果は、AI駆動ワークロードの時代において、レジリエントで適応的なデータセンター操作を可能にするために、ハイリコール、学習ベースの早期警告システムの実用的価値を強調した。
関連論文リスト
- On Predicting the Post-training Potential of Pre-trained LLMs [60.07459271263409]
本稿では,ポストトレーニング前のベースモデルの性能予測という,ポストトレーニング後の潜在能力を予測するための新しいタスクを紹介する。
本稿では,応答判別を活用することで,ベースモデルの生成ギャップを回避できる統一フレームワークであるRuDEを提案する。
実験では、トレーニング後のパフォーマンスと90%以上の相関を示す。
論文 参考訳(メタデータ) (2026-05-12T11:33:49Z) - A Queueing-Theoretic Framework for Dynamic Attack Surfaces: Data-Integrated Risk Analysis and Adaptive Defense [3.752638810747504]
我々はサイバー攻撃面の時間的進化をモデル化する待ち行列理論フレームワークを開発した。
我々は、AI増幅因子を導入し、到着、エクスプロイト、パッチのレートを拡大することで、自動化が攻撃と防御のダイナミクスにどのように影響するかを研究する。
提案したRLベースの防衛方針は,既存の防衛手法と比較して,ソフトウェアサプライチェーンにおけるアクティブな脆弱性の平均数を90%以上削減することを示す。
論文 参考訳(メタデータ) (2026-04-12T02:52:24Z) - A Graph Foundation Model for Wireless Resource Allocation [37.503398874234094]
本稿では、事前学習および微調整のパラダイムに基づく資源配分のためのグラフ基盤モデルを提案し、統一表現を抽出する。
具体的には、干渉トポロジをグローバルアテンション機構に注入するバイアスプロジェクタを備えた干渉対応トランスフォーマーアーキテクチャを提案する。
実験により,提案するフレームワークは,モデルキャパシティを向上して,最先端のパフォーマンスを実現し,効果的にスケールできることが示されている。
論文 参考訳(メタデータ) (2026-04-08T06:07:28Z) - RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation [68.7948300643741]
ロボットの異常検出と介入をリアルタイムに監視するロボット・コンディションド・ノーマライゼーション・フロー(RC-NF)を提案する。
RC-NFは、正規化フロー内のタスク認識ロボットとオブジェクト状態の処理を分離する。
従来のロボットタスクの監視方法と比較して、あらゆる異常なタイプで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T10:14:37Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots [68.29056647487519]
Embodied AIは、高忠実度シミュレーションと大規模データ収集によって実現されている。
しかし、このスケーリング能力は、労働集約的な手作業の監視に依存しているため、いまだにボトルネックになっている。
実装ポリシーを自律的に構築するための LLM エージェントの能力を評価するベンチマークである textscEmboCoach-Bench を紹介する。
論文 参考訳(メタデータ) (2026-01-29T11:33:49Z) - STARec: An Efficient Agent Framework for Recommender Systems via Autonomous Deliberate Reasoning [54.28691219536054]
我々は、自律的な熟考的推論機能を備えたレコメンデータシステムを支援する、ゆっくり考えられた拡張エージェントフレームワークSTARecを紹介する。
我々は,先進的推論モデルと嗜好整合型報酬形成から構造化知識の蒸留を組み合わせた2段階のパラダイムであるアンカー強化訓練を開発する。
MovieLens 1MとAmazon CDsベンチマークの実験では、STARecは最先端のベースラインと比較して、大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-08-26T08:47:58Z) - Online Ensemble Transformer for Accurate Cloud Workload Forecasting in Predictive Auto-Scaling [9.687789919349523]
大規模自動スケーリングにおけるオンラインワークロード予測のための新しいオンラインアンサンブルモデルであるE3Formerを提案する。
我々のモデルは、単一モデルアプローチの限界を克服するために、マルチワークの予測能力を相乗化します。
本手法はByteDanceのIntelligent Horizontal Pod Auto-scaling (IHPA)プラットフォームに実装されている。
論文 参考訳(メタデータ) (2025-08-18T09:48:12Z) - KAT-V1: Kwai-AutoThink Technical Report [50.84483585850113]
Kwaipilot-AutoThink (KAT) はオープンソースの40B大言語モデルであり、推論集約タスクにおける過大な問題に対処するために開発された。
KATはタスクの複雑さに基づいて推論モードと非推論モードを動的に切り替える。
また、GRPOフレームワークに中間管理を組み込んだ強化学習アルゴリズムであるStep-SRPOを提案する。
論文 参考訳(メタデータ) (2025-07-11T04:07:10Z) - OptScaler: A Collaborative Framework for Robust Autoscaling in the Cloud [10.97507717758812]
最適化モジュールを通じてプロアクティブおよびリアクティブモジュールを統合する,協調的な自動スケーリングフレームワークであるOpsScalerを提案する。
数値計算の結果,ワークロード予測モデルと協調フレームワークの優位性が示された。
論文 参考訳(メタデータ) (2023-10-26T04:38:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。