論文の概要: From Prior-Guided Heuristics to Deployable Agents: Accelerating Demonstration-Driven Reinforcement Learning for Deadline-Constrained Network Control
- arxiv url: http://arxiv.org/abs/2609.03590v1
- Date: Thu, 03 Sep 2026 09:36:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.004638
- Title: From Prior-Guided Heuristics to Deployable Agents: Accelerating Demonstration-Driven Reinforcement Learning for Deadline-Constrained Network Control
- Title(参考訳): 事前指導型ヒューリスティックからデプロイ可能なエージェント: デッドライン制約ネットワーク制御のためのデモ駆動強化学習の高速化
- Abstract要約: 本稿では、両方の障害に対処するデプロイメント中心のネットワーク制御フレームワークを提案する。
まず,パケットの緊急性によってインターフェースの混雑を定量化する,期限対応メトリックファミリーであるEffective Congestion(EC)を提案する。
第2に,既存の政策学習パラダイムを一般化する統一的な学習目標を導入する。
- 参考スコア(独自算出の注目度): 17.40703988810448
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Timely delivery of delay-sensitive information over dynamic, heterogeneous networks is essential for NextG interactive applications, yet providing strict End-to-End (E2E) peak latency guarantees remains an open challenge. Two obstacles limit the adoption of learning-based network control in this setting: traditional volume-based routing metrics, while highly effective for general traffic management, are not designed to capture traffic urgency; and Deep Reinforcement Learning (DRL) controllers trained from scratch suffer from sample inefficiency, long training times, and early-stage exploration volatility. This paper introduces a deployment-focused network control framework that addresses both obstacles. First, we present Effective Congestion (EC), a deadline-aware metric family that quantifies interface congestion by packet urgency and proactively filters non-viable traffic, coupled with a Uniform Path Grouping (UPG) distribution heuristic promoting robust load-balancing; the resulting policies are embedded into Multi-Agent Deep Reinforcement Learning Effective Congestion ($p^*$) (MADRL EC ($p^*$)), a hybrid architecture combining a distributed scheduler with a centralized RL-based router. Second, we introduce a unified training objective that generalizes existing policy-learning paradigms---behavioral cloning, offline Reinforcement Learning (RL), online RL, and offline-to-online schemes---as special cases, combining a live-reward term, a pre-collected-reward term, and a policy-imitation term. From this objective, we derive the Model-Guided Annealed Reinforcement Learning (MGA-RL) protocol, instantiated on a Deep Deterministic Policy Gradient (DDPG) backbone: a deployment-oriented, demonstration-driven training approach that generalizes conventional Offline-to-Online (O2O) schemes, in which trajectories from a lightweight [...]
- Abstract(参考訳): 動的でヘテロジニアスなネットワーク上で遅延に敏感な情報をタイムリーに配信することは、NextGインタラクティブなアプリケーションには不可欠だが、厳格なEnd-to-End(E2E)ピークレイテンシ保証は依然としてオープンな課題である。
従来のボリュームベースのルーティングメトリクスは、一般的なトラフィック管理に非常に効果的だが、トラフィックの緊急性を捉えるように設計されていない。
本稿では、両方の障害に対処するデプロイメント中心のネットワーク制御フレームワークを提案する。
まず,パケット緊急性によってインタフェースの混雑を定量化し,不活性なトラフィックを積極的にフィルタするデッドライン対応メトリックファミリーであるEffective Congestion (EC)と,一様パスグループ(UPG)分布のヒューリスティックなロバストなロードバランシングを推進し,結果のポリシを分散スケジューラと集中RLベースのルータを組み合わせたハイブリッドアーキテクチャであるMulti-Agent Deep Reinforcement Learning Effective Congestion (p^*$) (MADRL EC(p^*$))に組み込む。
第2に,既存の政策学習パラダイムを一般化する統一的な学習目標 – 行動的クローン,オフライン強化学習(RL),オンラインRL,オフライン-オンラインスキーム – を導入する。
この目的から,従来のオフライン・トゥ・オンライン(O2O)スキームを一般化したデプロイメント指向の実証駆動型トレーニングアプローチであるDDPGバックボーンをベースとしたMGA-RLプロトコルを導出する。
関連論文リスト
- MA-HEAD-Net: Adaptive Rule-Guided Multi-Agent DRL for AoI Minimization in UAV-Assisted Emergency Networks [71.01350912967922]
事故後のシナリオでは、無人航空機(UAV)が緊急通信ネットワークを確立する上で重要である。
本稿では,UAV支援緊急通信における情報量(AoI)の最小化について検討する。
適応型ルール誘導多エージェント深層強化学習フレームワークMA-HEAD-Netを開発した。
論文 参考訳(メタデータ) (2026-08-02T10:05:50Z) - HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving [51.268878540511054]
我々は階層的拡散政策を備えたエンドツーエンドの計画フレームワークであるHADを提案する。
我々は,NAVSIMとHUGSIMの両方でHADが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-04T04:12:47Z) - Cluster-Aware Attention-Based Deep Reinforcement Learning for Pickup and Delivery Problems [6.977990610183958]
emphCAADRL (Cluster-Aware Attention-based Deep Reinforcement Learning)は、PDPインスタンスのマルチスケール構造を利用するDRLフレームワークである。
提案手法は, ニューラルネットワークを用いた探索ベースラインよりも, 推論時間を大幅に短縮する。
論文 参考訳(メタデータ) (2026-03-09T17:31:34Z) - Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning [55.83415345423854]
批判的オブジェクト指向(CO)推論と強化学習(RL)を統合した新しいエンドツーエンド駆動フレームワークCOVLM-RLを提案する。
CARLAシミュレータで行った実験により、COVLM-RLはトレーニング運転環境における成功率を30%向上することが示された。
論文 参考訳(メタデータ) (2025-12-10T06:18:16Z) - A Flexible Multi-Agent Deep Reinforcement Learning Framework for Dynamic Routing and Scheduling of Latency-Critical Services [18.675072317045466]
既存のネットワーク制御ソリューションの多くは平均遅延性能のみを目標としており、厳格なEnd-to-End(E2E)ピークレイテンシ保証を提供していない。
本稿では,MA-DRL(Multi-Agent Deep Reinforcement Learning)の最近の進歩を生かして,適用期限内にパケットを確実に届けることの課題に対処する。
本稿では,集中型ルーティングと分散スケジューリングアーキテクチャを活用したMA-DRLネットワーク制御フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T15:38:10Z) - Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning [0.0]
そこで本研究では,中間フローサンプルから直接完了ベクトルを予測するために,フローマッチングを改良した生成ポリシーを提案する。
我々の手法はオフライン、オフライン、オンラインのRL設定に効果的にスケールし、スピードと適応性を大幅に向上させる。
我々はSSCPをゴール条件付きRLに拡張し、フラットポリシーが明確な階層的推論なしでサブゴナル構造を活用できるようにする。
論文 参考訳(メタデータ) (2025-06-26T16:09:53Z) - Toward Dependency Dynamics in Multi-Agent Reinforcement Learning for Traffic Signal Control [8.312659530314937]
適応的な信号制御のためのデータ駆動型アプローチとして強化学習(RL)が出現する。
本稿では,DQN-DPUS(Deep Q-Network)のための動的強化更新戦略を提案する。
提案手法は最適探索を犠牲にすることなく収束速度を向上できることを示す。
論文 参考訳(メタデータ) (2025-02-23T15:29:12Z) - Closed-form congestion control via deep symbolic regression [1.5961908901525192]
強化学習(RL)アルゴリズムは、超低レイテンシおよび高スループットシナリオにおける課題を処理することができる。
実際のデプロイメントにおけるニューラルネットワークモデルの採用は、リアルタイムの推論と解釈可能性に関して、依然としていくつかの課題を提起している。
本稿では,性能と一般化能力を維持しつつ,このような課題に対処する方法論を提案する。
論文 参考訳(メタデータ) (2024-03-28T14:31:37Z) - Efficient Parallel Split Learning over Resource-constrained Wireless
Edge Networks [44.37047471448793]
本稿では,エッジコンピューティングパラダイムと並列分割学習(PSL)の統合を提唱する。
そこで本研究では,モデル学習を高速化するために,効率的な並列分割学習(EPSL)という革新的なPSLフレームワークを提案する。
提案するEPSLフレームワークは,目標精度を達成するために必要なトレーニング遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2023-03-26T16:09:48Z) - Semantic-Aware Collaborative Deep Reinforcement Learning Over Wireless
Cellular Networks [82.02891936174221]
複数のエージェントが無線ネットワーク上で協調できるコラボレーティブディープ強化学習(CDRL)アルゴリズムは有望なアプローチである。
本稿では,リソース制約のある無線セルネットワーク上で,意味的にリンクされたDRLタスクを持つ未学習エージェントのグループを効率的に協調させる,新しい意味認識型CDRL手法を提案する。
論文 参考訳(メタデータ) (2021-11-23T18:24:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。