論文の概要: ADORN: Adaptive Drift handling for Open RAN using Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.08443v1
- Date: Thu, 09 Jul 2026 13:05:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.54295
- Title: ADORN: Adaptive Drift handling for Open RAN using Reinforcement Learning
- Title(参考訳): ADORN: 強化学習を用いたオープンRANの適応ドリフト処理
- Abstract要約: Open Radio Access Networks (O-RAN) の動的トラフィック変動はドリフトにつながる。
従来のリトレーニング手法では予測精度は維持されるが、計算コストが高い。
本研究は,マルコフ決定過程として再学習決定を定式化するQラーニングに基づく適応的再学習手法を提案する。
- 参考スコア(独自算出の注目度): 0.9577207941409713
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Dynamic traffic variations in Open Radio Access Networks (O-RAN) lead to drift, which degrades the performance of Artificial Intelligence/Machine Learning (AI/ML) models. Traditional retraining approaches maintain forecasting accuracy but incur high computational cost and may lead to violations of Service Level Agreements (SLAs). This work proposes a Q-learning-based adaptive retraining approach that formulates the retraining decision as a Markov Decision Process (MDP), where a Reinforcement Learning (RL) agent learns a policy that balances forecasting accuracy and retraining cost. The proposed approach incorporates a multi-expert Long Short-Term Memory (LSTM) ensemble to mitigate catastrophic forgetting and improve robustness across diverse traffic conditions. Experimental results show that the proposed approach effectively reduces retraining overhead compared to greedy and random baselines, while maintaining system performance within predefined limits.
- Abstract(参考訳): Open Radio Access Networks(O-RAN)の動的トラフィック変動は、人工知能/機械学習(AI/ML)モデルの性能を低下させるドリフトにつながる。
従来のリトレーニングアプローチでは予測精度は維持されるが、高い計算コストがかかり、SLA(Service Level Agreements)違反につながる可能性がある。
本研究は,RLエージェントが予測精度と再学習コストのバランスをとる政策を学習するマルコフ決定プロセス(MDP)として,再学習決定を定式化するQラーニングに基づく適応的再学習手法を提案する。
提案手法は,多目的Long Short-Term Memory(LSTM)アンサンブルを組み込んで,破滅的な忘れを軽減し,多様な交通条件における堅牢性を向上させる。
実験結果から,提案手法は,事前定義された限界内でのシステム性能を維持しつつ,グリードやランダムなベースラインに比べてトレーニングのオーバーヘッドを効果的に低減することを示した。
関連論文リスト
- Koopman-based surrogate modeling for reinforcement-learning-control of Rayleigh-Benard convection [0.8594140167290097]
線形リカレントオートエンコーダネットワーク(LRAN)を用いて2次元レイリー・ベナード対流のRL制御を高速化する。
我々は、ランダムな行動によって生成された事前計算データに基づいて訓練されたサロゲートと、進化するポリシーから収集されたデータを用いて反復的に訓練されたポリシー対応サロゲートの2つのトレーニング戦略を評価する。
以上の結果から,サロゲートのみのトレーニングが制御性能の低下につながる一方で,サロゲートとDNSを併用することで,トレーニング時間を40%以上削減しつつ,最先端のパフォーマンスを回復できることがわかった。
論文 参考訳(メタデータ) (2026-03-30T06:23:03Z) - AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering [52.67783579040657]
AceGRPOは、エージェントの学習フロンティアにおけるタスクを優先順位付けして学習効率を最大化する機械学習システムである。
我々のトレーニングされたAce-30Bモデルは、MLE-Bench-Lite上で100%有効な応募率を実現し、プロプライエタリなフロンティアモデルの性能にアプローチし、より大きなオープンソースベースラインを上回ります。
論文 参考訳(メタデータ) (2026-02-08T10:55:03Z) - RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation [7.500999283386335]
残留フローステアリング(Residual Flow Steering、RFS)は、事前訓練された生成ポリシーを適用するためのデータ効率の強化学習フレームワークである。
RFSは、残留動作と潜時雑音分布を協調的に最適化することにより、事前訓練されたフローマッチングポリシーを操る。
シミュレーションと実世界の両方の設定において, RFS が効率よく微調整できることを示す。
論文 参考訳(メタデータ) (2026-02-02T08:11:57Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Fast and Stable Diffusion Planning through Variational Adaptive Weighting [3.745003761050674]
拡散モデルは、最近オフラインRLで有望であることが示されている。
これらの手法は、しばしば高い訓練コストと緩やかな収束に悩まされる。
本稿では,フローベース生成モデルに基づくオンライン推定のためのクローズドフォーム近似手法を提案する。
Maze2D タスクと Kitchen タスクの実験結果から,本手法は最大10倍のトレーニングステップで競争性能を達成できることが示された。
論文 参考訳(メタデータ) (2025-06-20T02:12:04Z) - Dynamic Learning Rate for Deep Reinforcement Learning: A Bandit Approach [2.743898388459522]
深層強化学習(RL)では、学習速度は安定性と性能の両方に重大な影響を及ぼすが、環境と政策が進化するにつれて、トレーニング中に最適な価値がシフトする。
標準崩壊スケジューラは単調収束を仮定し、しばしばこれらのダイナミクスと不一致し、早めまたは遅れた調整をもたらす。
LRRLは、学習手順ではなく、政策性能に基づいて動的に学習率を選択するメタ学習手法である。
論文 参考訳(メタデータ) (2024-10-16T14:15:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。