論文の概要: ARGOS: Reinforcement Learning-Driven Multidimensional Elasticity for Service Orchestration in the Computing Continuum
- arxiv url: http://arxiv.org/abs/2609.37085v2
- Date: Fri, 02 Oct 2026 13:44:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.948337
- Title: ARGOS: Reinforcement Learning-Driven Multidimensional Elasticity for Service Orchestration in the Computing Continuum
- Title(参考訳): ARGOS: コンピューティング連続体におけるサービスオーケストレーションのための強化学習駆動多次元弾性
- Abstract要約: この記事では、オーケストレーションサービスのためのAdaptive Reinforcement Learning-Driven GovernanceであるARGOSを紹介します。
解析品質とクラスタ圧力に対するマルコフの要求毎の決定プロセスとして多次元弾性を定式化する。
ARGOSは、制御されたワークロードと、異種クラスタ上での時間変化によるマルチテナント到着に基づいて評価される。
- 参考スコア(独自算出の注目度): 5.995933666300655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data-intensive services in the Computing Continuum must balance analytics quality, resource usage, and cost across heterogeneous nodes with limited and uneven capacity. This balance becomes especially difficult when resource scaling reaches capacity limits, because changes in demand and cluster pressure must then be absorbed without violating client-defined quality ranges. Existing orchestrators mainly adapt resources, placements, or replicas, while analytics requirements such as coverage, sample, and freshness remain fixed. This article presents ARGOS, the Adaptive Reinforcement Learning-Driven Governance for Orchestrated Services, an end-to-end controller that formulates multidimensional elasticity as a per-request Markov decision process over analytics quality and cluster pressure, supported by capacity-aware admission. ARGOS is evaluated under controlled workloads and time-varying multi-tenant arrivals on a heterogeneous cluster. Across the controlled scenarios, the deep reinforcement learning policies consistently outperform the non-learning baselines and approach the independently tuned best-fixed reference. A separate live evaluation reports improvements over the static midpoint under realistic and saturated arrivals, with no recorded CPU or memory violations but remaining coverage violations. These results support deep reinforcement learning as an adaptive mechanism for multidimensional elasticity when resource scaling alone is insufficient.
- Abstract(参考訳): Computing Continuumのデータ集約型サービスは、分析品質、リソース使用量、コストのバランスをとる必要がある。
リソースのスケーリングがキャパシティの限界に達すると、このバランスは特に難しくなります。
既存のオーケストレータは、主にリソース、配置、レプリカを適応するが、カバレッジ、サンプル、鮮度などの分析要件は固定されている。
この記事では、分析品質とクラスタプレッシャに対する要求ごとのマルコフ決定プロセスとして多次元弾性を定式化するエンドツーエンドのコントローラで、キャパシティ・アウェア・インセプションによってサポートされている、Adaptive Reinforcement Learning-Driven Governance for Orchestrated ServicesであるARGOSを紹介します。
ARGOSは、制御されたワークロードと、異種クラスタ上での時間変化によるマルチテナント到着に基づいて評価される。
制御されたシナリオ全体にわたって、深い強化学習ポリシーは、非学習ベースラインを一貫して上回り、独立に調整された最良の参照にアプローチする。
別のライブ評価では、現実的で飽和した到着時の静的中間点よりも改善が報告されており、CPUやメモリ違反は記録されていないが、カバレッジ違反は残る。
これらの結果は,資源スケーリングだけでは不十分な場合の多次元弾性の適応メカニズムとして,深層強化学習を支援する。
関連論文リスト
- Resilience Beyond Stationary Client Unavailability: Unlocking Efficient and Unbiased Federated Learning [34.33292907685135]
本稿では,不均一かつ非定常なクライアントの可用性に確実に回復できる効率的なフェデレーション学習アルゴリズムを開発することを目的とする。
標準のFedSWEモデルと比較して、FedSWEは軽い追加メモリとオーバーヘッドを導入している。
論文 参考訳(メタデータ) (2026-09-04T05:49:21Z) - ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning [15.445619998280243]
Federated Continual Multimodal Learning (FedCMM)は、フェデレート最適化ループに継続的学習セーフガードを組み込むフレームワークである。
FedCMMは、精度と後方転送の最近のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-13T19:40:30Z) - MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation [65.068801413044]
連続的なテスト時間適応は、非定常な未ラベルのターゲットストリームにソース予測モデルを適用する。
ドメインに依存しない構造をドメイン固有のテクスチャから切り離す。
論文 参考訳(メタデータ) (2026-05-18T01:52:12Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation [0.5199807441687141]
本稿では,復号化を逐次決定として扱う強化学習型サンプルシステムを導入し,テスト時にサンプリングパラメータを調整するための軽量なポリシーを学習する。
本研究は,BookSum,arXiv,WikiHowなどの要約データセットを評価する。
論文 参考訳(メタデータ) (2026-03-19T02:44:42Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Adaptive Dual-Weighting Framework for Federated Learning via Out-of-Distribution Detection [53.45696787935487]
Federated Learning (FL)は、大規模分散サービスノード間の協調的なモデルトレーニングを可能にする。
実世界のサービス指向デプロイメントでは、異種ユーザ、デバイス、アプリケーションシナリオによって生成されたデータは本質的にIIDではない。
FLoodは、オフ・オブ・ディストリビューション(OOD)検出にインスパイアされた新しいFLフレームワークである。
論文 参考訳(メタデータ) (2026-02-01T05:54:59Z) - Bio-inspired Agentic Self-healing Framework for Resilient Distributed Computing Continuum Systems [4.003029907200818]
ReCiStは、分散コンピューティング継続システム(DCCS)のレジリエンスを実現するために設計された、バイオインスパイアされたエージェントによる自己修復フレームワークである。
ReCiStは、止血、炎症、増殖、再生の生物学的フェーズを、DCCSの包含、診断、メタ認知、知識の計算層に再構築する。
これら4つのレイヤは、自律的な障害分離、因果診断、適応的回復、言語モデル(LM)を利用した長期的な知識統合を行う。
論文 参考訳(メタデータ) (2026-01-01T13:30:38Z) - A Mathematical Framework for AI Singularity: Conditions, Bounds, and Control of Recursive Improvement [1.932555230783329]
我々は、自己改善のための分析フレームワークを開発し、能力向上とリソースのビルトアウトとデプロイメントポリシを結びつける。
我々は、可観測級数から脱走と非特異な振る舞いの証明をYes/Noにマッピングする決定ルールを導出する。
このフレームワークは、現在のレベルに対して、高速な改善がいかに加速するかに基づいて、偽造可能なテストを生成する。
論文 参考訳(メタデータ) (2025-11-08T21:25:38Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。