論文の概要: Heterogeneous Multi-Agent Reinforcement Learning for Radio Resource Management under Coupled Finite-Horizon Constraints
- arxiv url: http://arxiv.org/abs/2608.01745v1
- Date: Mon, 03 Aug 2026 06:11:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.348253
- Title: Heterogeneous Multi-Agent Reinforcement Learning for Radio Resource Management under Coupled Finite-Horizon Constraints
- Title(参考訳): 連成有限次元制約下における無線資源管理のための不均一なマルチエージェント強化学習
- Abstract要約: HeLyMARL は Lyapunov 組み込みヘテロジニアス MARL フレームワークで、有限水平予算の制約を解決する。
HeLyMARLは、水平線全体にわたって未中断のサービスとともにスループットとフェアネスのバランスを維持する唯一の方法である。
- 参考スコア(独自算出の注目度): 12.58203406442855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Maximizing throughput under proportional fairness in dense wireless networks requires jointly managing user association, scheduling, base station (BS) activation, and handover control under hard finite-horizon energy and handover budgets, which induces a fundamental tension between BS-side energy management and user-side handover regulation. While multi-agent reinforcement learning (MARL) is a natural framework for such distributed sequential control, its application here faces two difficulties: finite-horizon budget constraints cannot be evaluated at each time slot, and the nonlinear proportional fairness utility admits no principled per-slot decomposition. We propose HeLyMARL, a Lyapunov-embedded heterogeneous MARL framework that resolves both via drift-plus-penalty decomposition with virtual queues. The energy and handover constraint pressures are internalized directly into a unified per-slot reward, converting the constrained finite-horizon problem into an unconstrained MARL problem. Comparison against two Lagrangian-based alternatives reveals a timescale separation: Lagrangian relaxation regulates constraints only across training episodes, whereas the virtual queues of HeLyMARL bound cumulative budget consumption at every partial horizon within an episode, a pacing guarantee beyond the reach of greedy Lyapunov-based control. Simulations show that HeLyMARL is the only method that sustains the throughput-fairness balance together with uninterrupted service throughout the horizon, outperforming conventional MARL, Lyapunov-based, and constrained MARL benchmarks without premature budget exhaustion.
- Abstract(参考訳): 密集無線ネットワークにおける比例フェアネスによるスループットの最大化には、ユーザアソシエーション、スケジューリング、ベースステーション(BS)アクティベーション、およびハード有限水平エネルギーとハンドオーバ予算によるハンドオーバ制御を共同で管理する必要がある。
マルチエージェント強化学習(MARL)はこのような分散逐次制御の自然なフレームワークであるが、その応用には2つの困難がある: 有限水平予算制約は各タイムスロットで評価できない。
本稿では,リアプノフを組み込んだヘテロジニアスMARLフレームワークであるHeLyMARLを提案する。
エネルギーとハンドオーバの制約圧力は、直接的にスロット毎の報酬に内部化され、制約された有限水平問題を制約のないMARL問題に変換する。
ラグランジアン緩和(Lagrangian relaxation)は、トレーニングエピソード間でのみ制約を規制するのに対し、HeLyMARLの仮想キューは、エピソード内のすべての部分的な水平線で累積的な予算消費を制限し、グレディ・リャプノフ(英語版)ベースのコントロールの範囲を超えたペーシングを保証する。
シミュレーションにより,HeLyMARLは水平線全体にわたって不断のサービスとスループット・フェアネスバランスを維持できる唯一の手法であり,従来型のMARL,リアプノフベース,制約付きMARLベンチマークよりも優れた性能を示した。
関連論文リスト
- Constraint-Aware Aggregation for Federated Reinforcement Learning in Microgrid Energy Coordination [1.675857332621569]
フェデレート強化学習(Federated Reinforcement Learning, FedRL)は、生のローカルデータを共有せずに、分散エネルギー資源の調整を可能にする。
FedAvgのような標準的なアグリゲーションメソッドは、システムレベルの制約を考慮せず、多くの場合、安全でないグローバルな振る舞いを引き起こす。
ローカル性能と推定制約違反の両方をサーバ側の更新に組み込んだアグリゲーションルールを提案する。
論文 参考訳(メタデータ) (2026-07-14T13:33:25Z) - Feasibility-driven QAOA with penalty scheduling [1.4519462317941787]
ほとんどの量子アルゴリズムは、制約をQUBOの定式化の中でソフトペナルティ項として扱うことにより、制約付き最適化問題に対処する。
複数の不均一な制約を持つ問題に適した標準線形ランプQAOAの2つの拡張を導入する。
回路の深さやシステムサイズにおいて、QAOAがlr-QAOAと$-lr-QAOAより一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-06-23T19:44:00Z) - Structured Quantum Optimal Control under Bandwidth and Smoothness Constraints-An Inexact Proximal-ADMM Approach for Low-Complexity Pulse Synthesis [0.0]
ゲート不整合性,全変分正則化,明示的帯域制限射影,ボックス制約を1ループで組み合わせた非コンパクトなプロキシADMMフレームワークについて検討する。
GRAPE、標準のKrotov、L-BFGS-Bに対して、シングルキュービットの$X$ゲート、リークが発生しやすいクォートタスク、2キュービットのエンタングゲートでベンチマークされる。
コントリビューションは、直ちに展開可能な高忠実度ゲートへの完了ルートとしてではなく、制約パルス合成のための数値的枠組みとして読み取るべきである。
論文 参考訳(メタデータ) (2026-03-13T14:27:40Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Non-Stationary Restless Multi-Armed Bandits with Provable Guarantee [14.201646000111868]
オンラインレスレス・マルチアーム・バンディット(RMAB)は、各アームが固定状態遷移と報酬を持った静止マルコフ決定プロセス(MDP)に従うと仮定している。
医療やレコメンデーションシステムのような現実世界のアプリケーションでは、これらの仮定は静止しないダイナミクスによって壊れることが多い。
提案手法は,スライディングウィンドウ強化学習(RL)と上位信頼境界(UCB)機構を統合し,遷移力学とその変動を同時に学習する。
論文 参考訳(メタデータ) (2025-08-14T16:26:00Z) - Offline Multi-agent Reinforcement Learning via Score Decomposition [51.23590397383217]
オフライン協調型マルチエージェント強化学習(MARL)は、分散シフトによる固有の課題に直面している。
この作業は、オフラインとオンラインのMARL間の分散ギャップを明示的に解決する最初の作業である。
論文 参考訳(メタデータ) (2025-05-09T11:42:31Z) - AlberDICE: Addressing Out-Of-Distribution Joint Actions in Offline
Multi-Agent RL via Alternating Stationary Distribution Correction Estimation [65.4532392602682]
オフライン強化学習(RL)の主な課題の1つは、データ収集ポリシーから逸脱した学習ポリシーから生じる分散シフトである。
これはしばしば、政策改善中のアウト・オブ・ディストリビューション(OOD)アクションを避けることで対処される。
本稿では,定常分布最適化に基づく個別エージェントの集中学習を行うオフラインMARLアルゴリズムAlberDICEを紹介する。
論文 参考訳(メタデータ) (2023-11-03T18:56:48Z) - Client Orchestration and Cost-Efficient Joint Optimization for
NOMA-Enabled Hierarchical Federated Learning [55.49099125128281]
半同期クラウドモデルアグリゲーションの下で非直交多重アクセス(NOMA)を実現するHFLシステムを提案する。
提案手法は,HFLの性能改善と総コスト削減に関するベンチマークよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-11-03T13:34:44Z) - Greedy UnMixing for Q-Learning in Multi-Agent Reinforcement Learning [8.883885464358737]
本稿では,協調型マルチエージェント強化学習(MARL)のためのGreedy UnMix(GUM)を紹介する。
これは、MARL法が大きな共同状態-作用空間の一部として値の過大評価によって失敗するシナリオを避けることを目的としている。
我々は,既存のQ-learning MARL手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2021-09-19T00:35:18Z) - Low-Latency Federated Learning over Wireless Channels with Differential
Privacy [142.5983499872664]
フェデレートラーニング(FL)では、モデルトレーニングはクライアントに分散し、ローカルモデルは中央サーバによって集約される。
本稿では,各クライアントの差分プライバシ(DP)要件だけでなく,全体としてのトレーニング性能に制約された無線チャネル上でのFLトレーニング遅延を最小限に抑えることを目的とする。
論文 参考訳(メタデータ) (2021-06-20T13:51:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。