論文の概要: UC-PSRO: Utility-Conditioned Policy-Space Response Oracles with a Communication-Dropout Curriculum for Game-Theoretic Course-of-Action Generation in Adversarial Swarms
- arxiv url: http://arxiv.org/abs/2608.15372v1
- Date: Sat, 15 Aug 2026 18:52:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.278575
- Title: UC-PSRO: Utility-Conditioned Policy-Space Response Oracles with a Communication-Dropout Curriculum for Game-Theoretic Course-of-Action Generation in Adversarial Swarms
- Title(参考訳): UC-PSRO: 対人スワムにおけるゲーム理論コース・オブ・アクション生成のためのコミュニケーション・ドロップアウト・カリキュラムを用いた実用性を考慮した政策空間対応オラクル
- Abstract要約: 通信劣化環境において,ブルーUASスワムに対するゲーム理論的に最適化されたアクションコースを生成する。
コミュニケーション・ドロップアウトのカリキュラムだけでは、どんな学習方法でも最強で、最も堅牢なミッション・コンプリート・レートが得られます。
本報告では, コンバージェンスコストが, 1 つのメソッドを支配的として過大評価するのではなく, 実証された利益によってまだ相殺されていないことを正直に報告し, N=200 エージェントを1 桁の1 ステップで1 桁のGPU上で完全にベクトル化, オープン環境のトレーニングを行う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study generating game-theoretically optimized Courses of Action (COAs) for a Blue UAS swarm against an adaptive Red adversary in a communication-degraded environment, motivated by (but not derived from) a public U.S. Air Force SBIR solicitation. We propose UC-PSRO (Utility-Conditioned Policy-Space Response Oracles with a Communication-Dropout Curriculum), combining three mechanisms: (i) PSRO self-play, so Blue and Red policies train as approximate best responses to each other rather than one side against a fixed scripted opponent; (ii) FiLM conditioning of the Blue policy on a Commander's-Intent weight vector, sampled from a Dirichlet distribution during training, so one trained policy is re-steerable at execution time without retraining; and (iii) a curriculum annealing communication-graph edge dropout during training, so the swarm learns decentralized, peer-to-peer fallback instead of depending on full connectivity. We evaluate on a synthetic, unclassified stand-in for the solicitation's maritime scenario, with 5 seeds at N=25 Blue agents and a scalability sweep to N=200. We find a genuine trade-off, not a uniform win: the communication-dropout curriculum alone gives the strongest, most robust mission-completion rates of any learned method, improving counter-intuitively as denial increases (35% to 62% success as dropout rises from 0 to 0.75); adding utility-conditioning and PSRO self-play substantially slows convergence within a fixed budget, and we find no reliable exploitability advantage for self-play over a fixed-opponent policy, both statistically indistinguishable from a small, near-zero gap. We report this honestly as a convergence cost not yet offset by a demonstrated robustness benefit, rather than overstating one method as dominant, and provide a fully vectorized, open environment training at N=200 agents in single-digit milliseconds per step on a single consumer GPU.
- Abstract(参考訳): 我々は,ブルーUASスワムに対するゲーム理論的に最適化された行動コース(COA)を,公共のアメリカ空軍のSBIR勧誘に動機づけられた通信劣化環境において,適応的な赤敵に対して生成することを検討した。
UC-PSRO (Utility-Conditioned Policy-Space Response Oracles with a Communication-Dropout Curriculum) を提案する。
(i)PSROセルフプレイのため、青と赤のポリシーは、固定されたスクリプト化された相手に対して一方よりも互いに最も近い反応として訓練する。
二 訓練中にディリクレ分布から採取した指令量ベクトルに対するブルーポリシーのFiLM条件付けにより、再訓練することなく、実行時に1つの訓練された方針が再調整可能であること。
三 訓練中に通信グラフのエッジドロップアウトをアニールするカリキュラムのため、スワムは完全な接続に依存するのではなく、分散化されたピアツーピアのフォールバックを学習する。
我々は,N=25ブルーエージェントで5種,N=200までの拡張性を有する,人工的,未分類の海事シナリオに対するスタンドインの評価を行った。
コミュニケーション・ドロップアウトのカリキュラムだけでは、学習方法の最も強力で堅牢なミッション・コンプリート・レートが得られ、デニアルが0から0.75に上昇すると35%から62%の成功率が向上し、ユーティリティ・コンディショニングとPSROの自己プレイは、固定予算内での収束を著しく遅くする。
コンバージェンスコストは, 1 つの手法を支配的とするよりも, 実証されたロバスト性メリットによってまだ相殺されていないことを正直に報告し, 単一のコンシューマ GPU 上で N=200 エージェントを1 桁当たり1 ミリ秒で完全にベクトル化したオープン環境トレーニングを提供する。
関連論文リスト
- Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning [1.96243636752331]
実際のロボットのためのHIL(Human-in-the-loop)オンライン強化学習は、人間の介入を素早く吸収し、人間の先行性を超えて改善し続けなければならない。
本稿では,この2つのコンポーネントをベースとしたトレーニング手法を提案する。
emphMC Q-chunk 批判者は、モンテカルロへのチャンクレベルのアクション値をリプレイバッファから返します。
emphmax-Qの選択的な模倣は、各状態において、現在のポリシーアクションとバッファサンプルの間の高額なQ$アクションを模倣することでアクターを更新する。
論文 参考訳(メタデータ) (2026-08-15T07:13:59Z) - Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition [16.480150894507908]
集中型トレーニングと分散実行(CTDE)とハイブリッドリワードアーキテクチャ(HRA)を組み合わせた統合フレームワークを導入する。
実験の結果,提案フレームワークはサンプル効率と政策性能の両方を大幅に改善することがわかった。
本手法は,最先端のベースラインと比較して,テニスボールのピック・アンド・プレイスにおける成功率を60%から80%に向上させる。
論文 参考訳(メタデータ) (2026-08-10T15:54:25Z) - The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning [65.72688364382331]
強化学習(RL)は、大規模言語モデル(LLM)の訓練後に注目を集めているが、RLトレーニングは脆弱であり、不安定や崩壊に悩まされる可能性がある。
LLMは別個の推論とトレーニングエンジンを採用して、生成効率とトレーニング精度を高めている。
2段階のLLM RLフレームワークであるMonotonic Inference Policy Update (MIPU)を導入し、サンプル参照候補更新を構築し、同期候補を選択的に受け入れる。
論文 参考訳(メタデータ) (2026-06-28T17:40:02Z) - Post-Hoc Robustness for Model-Based Reinforcement Learning [1.4072254177584387]
本研究は, 深部RL剤の加熱後強固化を推察時に導入する。
目標は、ニューラルネットワークのさらなるトレーニングを必要とせずに、堅牢性を改善することだ。
論文 参考訳(メタデータ) (2026-06-02T11:43:13Z) - Near-Future Policy Optimization [51.760544033045726]
検証可能な報酬(RLVR)による強化学習は、学習後の中核的なレシピとなっている。
textbfNear-Future textbfPolicy textbfOptimization (textbfNPO)を提案する。
論文 参考訳(メタデータ) (2026-04-22T16:20:41Z) - ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving [63.980630608984605]
本稿では、ゼロサムマルコフゲームとして、駆動ポリシー(ディフェンダー)と敵エージェント(アタックラー)の相互作用を扱うクローズドループのmin-max最適化フレームワークであるADV-0を提案する。
これを実現するため,我々は動的敵の進化を反復的な選好学習とし,この最適性を効率的に近似し,アルゴリズムに依存しない解をゲームに提供する。
実験により、多様な安全クリティカルな障害を効果的に露呈し、学習方針と運動プランナーの両方の一般化可能性を大幅に向上させることが示されている。
論文 参考訳(メタデータ) (2026-03-16T12:58:31Z) - A Minimaximalist Approach to Reinforcement Learning from Human Feedback [49.45285664482369]
人間のフィードバックから強化学習を行うアルゴリズムとして,SPO(Self-Play Preference Optimization)を提案する。
我々のアプローチは、報酬モデルや不安定な敵の訓練を必要としないという点で最小主義である。
我々は,一連の継続的制御タスクにおいて,報酬モデルに基づくアプローチよりもはるかに効率的に学習できることを実証した。
論文 参考訳(メタデータ) (2024-01-08T17:55:02Z) - Combating Exacerbated Heterogeneity for Robust Models in Federated
Learning [91.88122934924435]
対人訓練と連合学習の組み合わせは、望ましくない頑丈さの劣化につながる可能性がある。
我々は、Slack Federated Adversarial Training (SFAT)と呼ばれる新しいフレームワークを提案する。
各種ベンチマークおよび実世界のデータセットに対するSFATの合理性と有効性を検証する。
論文 参考訳(メタデータ) (2023-03-01T06:16:15Z) - School of hard knocks: Curriculum analysis for Pommerman with a fixed
computational budget [4.726777092009554]
Pommermanはハイブリッドな協調/逆のマルチエージェント環境です。
これは強化学習アプローチにとって難しい環境である。
制約付き計算予算10万ゲームにおいて、堅牢で有望なポリシーを学習するためのカリキュラムを開発する。
論文 参考訳(メタデータ) (2021-02-23T15:43:09Z) - Robust Reinforcement Learning using Adversarial Populations [118.73193330231163]
強化学習(Reinforcement Learning, RL)は、コントローラ設計に有効なツールであるが、堅牢性の問題に対処できる。
一つの逆数を使うことは、逆数の標準的なパラメトリゼーションの下での動的変動に一貫して堅牢性をもたらすわけではないことを示す。
本稿では,ロバスト RL の定式化に対する人口ベース増進法を提案する。
論文 参考訳(メタデータ) (2020-08-04T20:57:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。