論文の概要: Intelligent Cloud Orchestration: A Hybrid Predictive and Heuristic Framework for Cost Optimization
- arxiv url: http://arxiv.org/abs/2604.02131v1
- Date: Thu, 02 Apr 2026 15:04:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:10.870494
- Title: Intelligent Cloud Orchestration: A Hybrid Predictive and Heuristic Framework for Cost Optimization
- Title(参考訳): Intelligent Cloud Orchestration: コスト最適化のためのハイブリッド予測とヒューリスティックフレームワーク
- Abstract要約: 本稿では,LSTMに基づく予測スケーリングとタスク割り当てを組み合わせたハイブリッドオーケストレーションフレームワークを提案する。
その結果,MLモデルに近いインフラコストを削減できることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cloud computing allows scalable resource provisioning, but dynamic workload changes often lead to higher costs due to over-provisioning. Machine learning (ML) approaches, such as Long Short-Term Memory (LSTM) networks, are effective for predicting workload patterns at a higher level, but they can introduce delays during sudden traffic spikes. In contrast, mathematical heuristics like Game Theory provide fast and reliable scheduling decisions, but they do not account for future workload changes. To address this trade-off, this paper proposes a hybrid orchestration framework that combines LSTM-based predictive scaling with heuristic task allocation. The results show that this approach reduces infrastructure costs close to ML-based models while maintaining fast response times similar to heuristic methods. This work presents a practical approach for improving cost efficiency in cloud resource management.
- Abstract(参考訳): クラウドコンピューティングは、スケーラブルなリソースプロビジョニングを可能にするが、動的ワークロードの変更は、過剰なプロビジョニングによるコスト上昇につながることが多い。
LSTM(Long Short-Term Memory)ネットワークのような機械学習(ML)アプローチは、ワークロードパターンをより高いレベルで予測するのに有効だが、突然のトラフィックスパイク時に遅延を導入することができる。
対照的に、ゲーム理論のような数学的ヒューリスティックスは、高速で信頼性の高いスケジューリング決定を提供するが、将来のワークロードの変化を考慮しない。
このトレードオフに対処するために,LSTMに基づく予測スケーリングとヒューリスティックなタスク割り当てを組み合わせたハイブリッドオーケストレーションフレームワークを提案する。
提案手法は,MLモデルに近いインフラコストを低減しつつ,ヒューリスティック手法と同様の高速応答時間を維持できることが示唆された。
本研究は,クラウドリソース管理におけるコスト効率向上のための実践的アプローチを提案する。
関連論文リスト
- An Auto-Scaling Approach for Serverless Environments Based on a Multi-Expert Consensus Mechanism [0.3058685580689604]
依存性対応自動スケーリングフレームワークは、グラフベースのボトルネック識別、短期的なワークロード予測、マルチモデルコンセンサス、コスト対応制御を統合する。
Controllerはコールドスタートの認識とコスト比較を取り入れて、スケールアップ、スケールダウン、ホールドアクションを選択する。
論文 参考訳(メタデータ) (2026-07-16T23:48:37Z) - Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - LeJOT: An Intelligent Job Cost Orchestration Solution for Databricks Platform [28.16213013287002]
私たちは、DatabricksジョブのためのインテリジェントなジョブコストオーケストレーションフレームワークであるLeJOTを紹介します。
LeJOTは、ワークロードの要求を積極的に予測し、動的にコンピューティングリソースを割り当て、コストを最小化する。
我々は,1分間のスケジューリング時間内で,LJOTが平均20%のクラウドコンピューティングコスト削減を実現していることを示す。
論文 参考訳(メタデータ) (2025-12-20T08:09:58Z) - Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models [97.55009021098554]
本研究の目的は、SLMのリアルタイムレイテンシの主要な決定要因を特定し、SLMの設計とトレーニングのための一般化可能な原則と方法論を提供することである。
我々はNemotron-Flashと呼ばれるハイブリッドSLMの新たなファミリーを導入し、最先端SLMの精度・効率のフロンティアを大幅に向上させる。
論文 参考訳(メタデータ) (2025-11-24T08:46:36Z) - Dynamic Speculative Agent Planning [57.630218933994534]
大規模な言語モデルベースのエージェントは、遅延の禁止と推論コストのために、重要なデプロイメント課題に直面している。
本稿では,オンライン強化学習フレームワークである動的投機計画(Dynamic Speculative Planning, DSP)を紹介する。
2つの標準エージェントベンチマークの実験では、DSPは高速加速法に匹敵する効率を達成し、総コストを30%削減し、不要コストを60%まで削減している。
論文 参考訳(メタデータ) (2025-09-02T03:34:36Z) - CSGO: Generalized Optimization for Cold Start in Wireless Collaborative Edge LLM Systems [62.24576366776727]
本稿では,全体の推論遅延を最小限に抑えるために,遅延を考慮したスケジューリングフレームワークを提案する。
提案手法は,ベースライン戦略と比較して,コールドスタート遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-08-15T07:49:22Z) - Scalability Optimization in Cloud-Based AI Inference Services: Strategies for Real-Time Load Balancing and Automated Scaling [1.3689475854650441]
本研究では,クラウドAI推論サービスのための拡張性最適化フレームワークを提案する。
提案モデルは,適応負荷分布に対する強化学習と,正確な需要予測のためのディープニューラルネットワークを組み合わせたハイブリッドアプローチである。
実験の結果,提案モデルでは負荷分散効率を35倍に向上し,応答遅延を28。
論文 参考訳(メタデータ) (2025-04-16T04:00:04Z) - OmniRouter: Budget and Performance Controllable Multi-LLM Routing [31.60019342381251]
大規模言語モデル(LLM)は優れた性能を提供するが、かなりの計算資源を必要とし、比較的低効率で運用する。
マルチLLMサービスのための制御可能なルーティングフレームワークであるOmniを紹介する。
実験の結果、Omniは応答精度を最大6.30%改善し、同時に計算コストを少なくとも10.15%削減した。
論文 参考訳(メタデータ) (2025-02-27T22:35:31Z) - CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing [74.14816777318033]
Token-lEvel Routing(CITER)との協調推論は、小規模および大規模言語モデルの効率的な協調を可能にするフレームワークである。
ルータの学習をポリシー最適化として定式化し、予測の質と生成の推論コストの両方に基づいて報酬を受け取る。
実験の結果,CITERは高品質な生成を保ちながら推論コストを低減し,リアルタイムおよびリソース制約のあるアプリケーションに対して有望なソリューションを提供することがわかった。
論文 参考訳(メタデータ) (2025-02-04T03:36:44Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - MCDS: AI Augmented Workflow Scheduling in Mobile Edge Cloud Computing
Systems [12.215537834860699]
近年,エッジコンピューティングプラットフォームの低応答時間を利用してアプリケーション品質・オブ・サービス(QoS)を最適化するスケジューリング手法が提案されている。
本稿では,Deep Surrogate Models を用いたモンテカルロ学習を用いて,モバイルエッジクラウドコンピューティングシステムにおけるワークフローアプリケーションを効率的にスケジューリングする手法を提案する。
論文 参考訳(メタデータ) (2021-12-14T10:00:01Z) - A Predictive Autoscaler for Elastic Batch Jobs [8.354712625979776]
Deep Learning、HPC、Sparkといった大規模なバッチジョブは、従来のオンラインサービスよりもはるかに多くの計算リソースとコストを必要とします。
顧客とオーバプロビジョンインスタンスに対して,柔軟なインターフェースを提供するための予測オートスケーラを提案する。
論文 参考訳(メタデータ) (2020-10-10T17:35:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。