論文の概要: Decentralized Safe Multi-Agent Reinforcement Learning via Predictive Shielding
- arxiv url: http://arxiv.org/abs/2609.07618v1
- Date: Mon, 07 Sep 2026 15:22:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.456136
- Title: Decentralized Safe Multi-Agent Reinforcement Learning via Predictive Shielding
- Title(参考訳): 予測シールドによる分散型マルチエージェント強化学習
- Abstract要約: モデルに基づく有限地平線Q-ラーニングと予測遮蔽を統合した分散フレームワークを提案する。
このアプローチにより、エージェントはデプロイ中にトレーニング済みのポリシーを安全に適用できる。
- 参考スコア(独自算出の注目度): 0.5461938536945722
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Environments are increasingly populated by multiple robots performing independent tasks with limited prior knowledge of each other. Deploying such multi-agent systems presents significant challenges. Specifically, shifts in deployment states compared to training data can lead to poor policy performance and compromised safety. While safety shields exist to mitigate these risks, they are typically reactive, which degrades performance near unseen obstacles,and centralized, limiting their scalability. To address this, we propose a decentralized framework that integrates predictive shielding with model-based finite horizon Q-learning. This approach allows agents to safely adapt their pre-trained policies during deployment. Furthermore, to mitigate livelocks in symmetric scenarios, we introduce a communication- free protocol for conflict resolution
- Abstract(参考訳): 環境は、互いに事前の知識が限られている独立したタスクを実行する複数のロボットによって人口密度が増している。
このようなマルチエージェントシステムのデプロイには大きな課題があります。
具体的には、トレーニングデータに対するデプロイメント状態の変化によって、ポリシのパフォーマンスが低下し、安全性が損なわれる可能性がある。
安全シールドはこれらのリスクを軽減するために存在しますが、一般的にはリアクティブで、目に見えない障害の近くでパフォーマンスを低下させ、そのスケーラビリティを制限します。
そこで本研究では,予測遮蔽とモデルに基づく有限地平線Q-ラーニングを統合した分散フレームワークを提案する。
このアプローチにより、エージェントはデプロイ中にトレーニング済みのポリシーを安全に適用できる。
さらに、対称シナリオにおけるライブロックを緩和するために、競合解決のための通信自由プロトコルを導入する。
関連論文リスト
- AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - Decentralized Contingency MPC based on Safe Sets for Nonlinear Multi-agent Collision Avoidance [1.5856188608650232]
本稿では,非線形力学を持つマルチエージェントシステムのための分散並列MPCフレームワークを開発する。
状態のみの情報パターンの下では、各エージェントは同じ合意的ルールセットに従い、コミュニケーションなしで安全な分散計画を可能にする。
シミュレーションの結果はスパース環境と密集型マルチエージェント環境の両方で性能を示す。
論文 参考訳(メタデータ) (2026-05-11T15:40:36Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage [59.3826294523924]
オーケストレータ設定として知られる,一般的なマルチエージェントパターンのセキュリティ脆弱性について検討する。
本報告では,フロンティアモデルの攻撃カテゴリに対する感受性を報告し,推論モデルと非推論モデルの両方が脆弱であることが確認された。
論文 参考訳(メタデータ) (2026-02-13T21:32:32Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - MAD-PINN: A Decentralized Physics-Informed Machine Learning Framework for Safe and Optimal Multi-Agent Control [13.531665564516155]
大規模マルチエージェントシステムにおける安全性とパフォーマンスの最適化は、依然として根本的な課題である。
マルチエージェント状態制約最適制御問題を解くための分散機械学習フレームワークMAD-PINNを提案する。
マルチエージェントナビゲーションタスクの実験では、MAD-PINNは優れた安全性と性能のトレードオフを実現し、エージェントの数が増えるにつれてスケーラビリティを維持し、常に最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-09-28T16:31:22Z) - Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security [63.41350337821108]
マルチモーダル大規模言語モデル(MLLM)のセキュリティを高めるために,Secure Tug-of-War(SecTOW)を提案する。
SecTOWは2つのモジュールで構成される:ディフェンダーと補助攻撃者。どちらも強化学習(GRPO)を使用して反復的に訓練される。
SecTOWは、一般的な性能を維持しながら、セキュリティを大幅に改善することを示す。
論文 参考訳(メタデータ) (2025-07-29T17:39:48Z) - Compositional Shielding and Reinforcement Learning for Multi-Agent Systems [1.124958340749622]
高度な強化学習は、高性能なポリシーを得るための強力なツールとして登場した。
安全を保証するための有望なパラダイムの1つは、安全でない行動からポリシーを守るシールドである。
本研究では,マルチエージェント遮蔽のための新しい手法を提案する。
論文 参考訳(メタデータ) (2024-10-14T12:52:48Z) - Safety Correction from Baseline: Towards the Risk-aware Policy in
Robotics via Dual-agent Reinforcement Learning [64.11013095004786]
本稿では,ベースラインと安全エージェントからなる二重エージェント型安全強化学習戦略を提案する。
このような分離されたフレームワークは、RLベースの制御に対して高い柔軟性、データ効率、リスク認識を可能にする。
提案手法は,難易度の高いロボットの移動・操作作業において,最先端の安全RLアルゴリズムより優れる。
論文 参考訳(メタデータ) (2022-12-14T03:11:25Z) - Safe Reinforcement Learning via Shielding for POMDPs [29.058332307331785]
安全クリティカルな環境での強化学習(RL)は、破滅的な結果の決定を避けるためにエージェントを必要とする。
我々は,PMDPと最先端の深部RLアルゴリズムの密結合性について検討し,徹底的に評価する。
我々は、シールドを用いたRLエージェントが安全であるだけでなく、期待される報酬のより高い値に収束することを実証的に実証した。
論文 参考訳(メタデータ) (2022-04-02T03:51:55Z) - Learning Safe Multi-Agent Control with Decentralized Neural Barrier
Certificates [19.261536710315028]
エージェントが静的な障害物や衝突に対する衝突を避けて目標を達成すべきマルチエージェント安全制御問題について検討する。
私達の中心の考えは安全証明書として制御障壁機能を学ぶことと複数のエージェント制御方針を共同で学ぶことです。
本稿では,特定の関数クラスに対して一般化を保証し,分散的に実装可能な新しい共同学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-01-14T03:17:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。