論文の概要: Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense
- arxiv url: http://arxiv.org/abs/2604.01127v1
- Date: Wed, 01 Apr 2026 16:48:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:32.096652
- Title: Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense
- Title(参考訳): SDN-IoTディフェンスにおける安全な2時間強化学習のためのマルチエージェントLLMガバナンス
- Authors: Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa,
- Abstract要約: Software-Defined Networking (SDN)は、IoT(Internet-of-Things)ネットワークのセキュア化にますます採用されている。
緩和アクションは、コントローラのワークロード、キューのダイナミクス、ルールのインストール遅延、将来のトラフィック観測に影響を与える。
本稿では、緩やかな政策ガバナンスから高速な緩和を分離した自己回帰的な2時間スケールのソリューションを提案する。
- 参考スコア(独自算出の注目度): 5.351146356849584
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Software-Defined Networking (SDN) is increasingly adopted to secure Internet-of-Things (IoT) networks due to its centralized control and programmable forwarding. However, SDN-IoT defense is inherently a closed-loop control problem in which mitigation actions impact controller workload, queue dynamics, rule-installation delay, and future traffic observations. Aggressive mitigation may destabilize the control plane, degrade Quality of Service (QoS), and amplify systemic risk. Existing learning-based approaches prioritize detection accuracy while neglecting controller coupling and short-horizon Reinforcement Learning (RL) optimization without structured, auditable policy evolution. This paper introduces a self-reflective two-timescale SDN-IoT defense solution separating fast mitigation from slow policy governance. At the fast timescale, per-switch Proximal Policy Optimization (PPO) agents perform controller-aware mitigation under safety constraints and action masking. At the slow timescale, a multi-agent Large Language Model (LLM) governance engine generates machine-parsable updates to the global policy constitution Pi, which encodes admissible actions, safety thresholds, and reward priorities. Updates (Delta Pi) are validated through stress testing and deployed only with non-regression and safety guarantees, ensuring an auditable evolution without retraining RL agents. Evaluation under heterogeneous IoT traffic and adversarial stress shows improvements of 9.1% Macro-F1 over PPO and 15.4% over static baselines. Worst-case degradation drops by 36.8%, controller backlog peaks by 42.7%, and RTT p95 inflation remains below 5.8% under high-intensity attacks. Policy evolution converges within five cycles, reducing catastrophic overload from 11.6% to 2.3%.
- Abstract(参考訳): Software-Defined Networking (SDN)は、集中管理とプログラム可能な転送のため、IoT(Internet-of-Things)ネットワークのセキュア化にますます採用されている。
しかし、SDN-IoTディフェンスは本質的には、コントローラのワークロード、キューのダイナミクス、ルールのインストール遅延、将来のトラフィック監視に影響を与える、クローズドループ制御の問題である。
攻撃的緩和は、制御面を不安定化し、品質・オブ・サービス(QoS)を低下させ、システム的リスクを増幅する。
既存の学習ベースのアプローチは、構造化された監査可能なポリシーの進化を伴わずに、コントローラ結合と短距離強化学習(RL)最適化を無視しながら、検出精度を優先する。
本稿では、低速なポリシーガバナンスから高速な緩和を分離した、自己反射型2時間スケールSDN-IoTディフェンスソリューションを提案する。
高速な時間スケールでは、Switch Proximal Policy Optimization (PPO)エージェントが安全制約とアクションマスキングの下でコントローラ認識の緩和を行う。
遅い時間スケールでは、マルチエージェントのLarge Language Model(LLM)ガバナンスエンジンが、許容可能なアクション、安全性しきい値、報酬の優先順位をエンコードするグローバルポリシーコンスティチューションPiのマシンパーサブルアップデートを生成する。
更新(Delta Pi)はストレステストを通じて検証され、非回帰と安全保証のみでデプロイされ、RLエージェントを再訓練することなく監査可能な進化が保証される。
不均一なIoTトラフィックと対向ストレスによる評価は、PPOよりも9.1%のマクロF1、静的ベースラインより15.4%の改善を示している。
最悪の劣化は36.8%減少し、コントローラバックログのピークは42.7%減少し、RTT p95インフレーションは高強度攻撃で5.8%を下回ったままである。
政策の進化は5サイクル以内に収束し、壊滅的な過負荷を11.6%から2.3%に減少させる。
関連論文リスト
- A Safety-Constrained Reinforcement Learning Framework for Reliable Wireless Autonomy [1.5469452301122173]
本稿では,実証搬送制御とエンパワーメント予算(EB)適用を統合した,積極的な安全制約付きRLフレームワークを提案する。
本手法は, 性能劣化を最小限に抑え, 証明可能な安全保証を実現する。
その結果,将来の6Gネットワークにおける信頼性の高い無線自律性を実現するために,プロアクティブな安全制約付きRLの可能性を浮き彫りにした。
論文 参考訳(メタデータ) (2026-01-12T02:02:52Z) - Proactive DDoS Detection and Mitigation in Decentralized Software-Defined Networking via Port-Level Monitoring and Zero-Training Large Language Models [3.6260109722491465]
Software-Defined Networking (cSDN)は、柔軟でプログラム可能なネットワーク制御を提供するが、スケーラビリティと信頼性の問題に悩まされている。
分散化されたSDN(dSDN) 複数のローカルコントローラ間で制御を分散することで、これらの懸念を緩和する。
このアーキテクチャは、Denial-of-Service(DDoS)攻撃に対して非常に脆弱である。
本稿では,dSDN環境に適した新しい検出・緩和フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-01T08:57:29Z) - GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping [63.33669214116784]
GRPO-Guardは、既存のGRPOフレームワークのシンプルで効果的な拡張である。
PPOクリッピングが有害な更新を適切に制限することを保証するため、バランスとステップ一貫性の重要度を回復する。
重いKL正則化に頼ることなく、暗黙の過最適化を実質的に緩和する。
論文 参考訳(メタデータ) (2025-10-25T14:51:17Z) - Agentic Entropy-Balanced Policy Optimization [114.90524574220764]
エージェント強化学習(Agentic RL)は,Webエージェントの多ターン,長期ツール利用能力の活性化に大きく貢献している。
RLアルゴリズムはエントロピーの誘導の下で、高不確実性ツールコールステップを自律的に探索するが、エントロピー信号への過度な依存は、さらなる制約を課す可能性がある。
本稿では,エージェント・エントロピー・バランサード・ポリシー最適化(AEPO, Agentic Entropy-Balanced Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2025-10-16T10:40:52Z) - Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning [45.51804571136028]
強化学習(RL)は、大規模言語モデル(LLM)における推論の強化の中心となっている。
Slow-Fast Policy Optimization (SFPO)は,各ステップを3段階に分解することで,これらの制限に対処する,シンプルかつ効率的なフレームワークである。
SFPOは安定性を継続的に改善し、ロールアウトを低減し、推論RLトレーニングの収束を加速する。
論文 参考訳(メタデータ) (2025-10-05T07:22:54Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Robust Deep Reinforcement Learning against Adversarial Perturbations on
State Observations [88.94162416324505]
深部強化学習(DRL)エージェントは、自然な測定誤差や対向雑音を含む観測を通して、その状態を観察する。
観測は真の状態から逸脱するので、エージェントを誤解させ、準最適行動を起こすことができる。
本研究は, 従来の手法を, 対人訓練などの分類タスクの堅牢性向上に応用することは, 多くのRLタスクには有効でないことを示す。
論文 参考訳(メタデータ) (2020-03-19T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。