論文の概要: LOLLA: Deep Reinforcement Learning for Closed-Loop Link Adaptation Towards a GPU-Accelerated AI-RAN
- arxiv url: http://arxiv.org/abs/2606.23110v1
- Date: Mon, 22 Jun 2026 09:53:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 00:05:45.973728
- Title: LOLLA: Deep Reinforcement Learning for Closed-Loop Link Adaptation Towards a GPU-Accelerated AI-RAN
- Title(参考訳): LOLLA: GPUアクセラレーションAI-RANに向けたクローズドループリンク適応のための深層強化学習
- Authors: Rui Wang, Linchao Zhang, Qiang Liu, Kun Yang,
- Abstract要約: 外部ループリンク適応(OLLA)は、チャネルの変動を追跡するために5G NRに広く展開されている。
本稿では,従来の OLLA 階段を学習連続SINR オフセットに置き換える強化学習フレームワーク LOLLA を提案する。
このフレームワークは、GPUアクセラレーションされた5G NRスタック上で、最初のクローズループAIネイティブ制御dAppとして実現されている。
- 参考スコア(独自算出の注目度): 11.757392351799728
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Outer-loop link adaptation (OLLA) is widely deployed in 5G NR to track channel variations, yet its reliance on first-order, single-bit feedback degrades performance significantly under high-mobility and fast-varying channels. This paper presents LOLLA (Learned Outer-Loop Link Adaptation), a deep reinforcement learning framework that replaces the conventional OLLA staircase with a learned, continuous SINR offset conditioned on rich PHY/MAC telemetry inaccessible to OLLA. The offset modulates the SINR-to-MCS lookup table, preserving 3GPP-compliant MCS selection and provably subsuming the conventional OLLA update rule. A Proximal Policy Optimization (PPO) policy trained under a Lagrangian block error rate (BLER) constraint automatically enforces tunable reliability targets from 1% to 15% without manual penalty calibration. The framework is realized as the first closed-loop AI-native control dApp on a GPU-accelerated 5G NR stack, achieving end-to-end control latencies under 500 microseconds. Evaluations under 3GPP TDL channel models demonstrate 15% to 92% throughput gains over OLLA across Doppler frequencies up to 400 Hz, while attaining a Pareto frontier that strictly dominates OLLA across all evaluated reliability targets. The learned policy generalizes to unseen channel models and scales to eight concurrent UEs under shared-resource scheduling. In the uplink formulation, the gNB directly observes decoding outcomes, enabling simulation-to-deployment parity.
- Abstract(参考訳): 外部ループリンク適応(OLLA)は、チャネルの変動を追跡するために5G NRで広く展開されているが、一階のシングルビットフィードバックに依存しているため、高いモビリティと高速なチャネルでは性能が著しく低下する。
本稿では,従来の OLLA 階段を,豊富な PHY/MAC テレメトリを前提とした,学習された連続SINR オフセットに置き換える深層強化学習フレームワークである LOLLA (Learned Outer-Loop Link Adaptation) を提案する。
オフセットはSINR-to-MCSルックアップテーブルを変調し、3GPP準拠のMCS選択を保持し、従来のOLLA更新ルールを確実に仮定する。
ラグランジアンブロックエラーレート(BLER)制約の下で訓練されたPPOポリシーは、手動のペナルティ校正なしで、調整可能な信頼性目標を1%から15%に自動的に強制する。
このフレームワークは、GPUアクセラレーションされた5G NRスタック上の最初のクローズループAIネイティブ制御dAppとして実現され、500マイクロ秒以下のエンドツーエンド制御レイテンシを実現する。
3GPP TDLチャネルモデルに基づく評価では、最大400Hzのドップラー周波数でOLLAよりも15%から92%のスループットが向上し、評価されたすべての信頼性目標に対してOLLAを厳密に支配するParetoフロンティアが達成された。
学習されたポリシーは、共有リソーススケジューリングの下で、見つからないチャネルモデルと8つの同時UEに一般化される。
アップリンクの定式化では、gNBはデコード結果を直接観察し、シミュレーションからデプロイまでのパリティを可能にする。
関連論文リスト
- Baseline-Free Policy Optimization for Neural Combinatorial Optimization [1.2891210250935148]
グループ相対ポリシー最適化は、サンプリングされた軌道群内の利点を正規化することによって、ベースラインを完全に排除する。
GRPOは、強力なAMベースのマルチスタートベースラインであるPOMOの2%以内で、外部ベースラインを必要としないソリューション品質を実現する。
これらの結果から,GRPO は NCO の有望なベースラインフリー代替品であり,特にベースライン依存トレーニングが脆弱な環境では有効であると考えられた。
論文 参考訳(メタデータ) (2026-06-09T02:18:30Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization [58.03221830946145]
我々は、純粋なCL、純粋なFL、ハイブリッドCL-FLトレーニングモードを融合する統合フレームワークであるOmniISRを提案する。
我々は,OmniISRが集中型パラダイムとフェデレーション型パラダイムの両方において,モデル性能を一貫して改善していることを示す。
論文 参考訳(メタデータ) (2026-05-19T04:13:27Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling [1.0152838128195467]
衛星スケジューリングにおける深い強化学習のための適応的な報酬設計は、レギュラーアウェアの報酬重みが静的なよりも優れているという直感によって動機付けられている。
PPOは値関数収束のために定常的な報酬信号を必要とするため、ほぼ安定な報酬重み(342.1 Mbps)は慎重に調整された動的重み(103.396.8 Mbps)より優れていることを示す。
論文 参考訳(メタデータ) (2026-04-04T03:04:53Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - LLM Assisted Alpha Fairness for 6 GHz WiFi and NR_U Coexistence: An Agentic Orchestrator for Throughput, Energy, and SLA [6.508485899860138]
Wi-Fiと5G NR-Uはリス・バイ・トーク(LBT)ルールの下で同じチャンネルで競合する。
ポリシーと実行を分離するエージェントコントローラを提案する。
2つの160MHzチャネルと混合Wi-Fi/NR-Uユーザーを持つ6GHzシミュレータでは、LDMアシストポリシーは強力なルールベースラインとのスループットを保ちながら、エネルギー効率を一貫して改善する。
論文 参考訳(メタデータ) (2025-09-26T15:34:45Z) - GDP: Stabilized Neural Network Pruning via Gates with Differentiable
Polarization [84.57695474130273]
ゲートベースまたは重要度に基づくプルーニング手法は、重要度が最小のチャネルを削除することを目的としている。
GDPは、各チャネルのオン・アンド・オフを制御するために、ベルやホイッスルのない畳み込み層の前に接続することができる。
CIFAR-10とImageNetデータセットを用いて行った実験は、提案したGDPが最先端のパフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2021-09-06T03:17:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。