論文の概要: Graph-Based Safe Reinforcement Learning for Multi-Agent Systems with Time-Varying Topology
- arxiv url: http://arxiv.org/abs/2609.08802v1
- Date: Tue, 08 Sep 2026 14:30:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 15:41:25.935814
- Title: Graph-Based Safe Reinforcement Learning for Multi-Agent Systems with Time-Varying Topology
- Title(参考訳): 時間変化トポロジを持つマルチエージェントシステムのためのグラフベース安全強化学習
- Abstract要約: 本稿では、時間変化トポロジを用いた協調ナビゲーションのためのグラフベースの安全なマルチエージェント強化学習(MARL)フレームワークを提案する。
センサ制約のある環境における安全確保という重要な課題に対処するため,安全分離機構を導入している。
この安全基盤に基づいて、注意に基づくアクターとグラフ注意ネットワーク(GAT)を統合した統合構造アーキテクチャが提案されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents a graph-based safe multi-agent reinforcement learning (MARL) framework for cooperative navigation with time-varying topology. To address the critical challenge of ensuring safety in environments with sensing constraints, a safety-decoupled mechanism is introduced through a Control Barrier-Like Function (CBLF) action screening layer. This mechanism bridges the gap between discrete LiDAR perception and continuous safety constraints, ensuring that physical safety constraints are strictly satisfied regardless of the learning progress. Building upon this safety foundation, a unified structural architecture is proposed, integrating a attention-based actor and a Graph Attention Network (GAT) centralized critic. The actor utilizes a value vector reconstruction mechanism that explicitly encodes relative geometric relations through a collaborative tracking error matrix, enabling scale-insensitive policy learning under time-varying communication topologies. Meanwhile, the GAT-based critic models evolving interaction structures for accurate global value estimation. The proposed framework is validated on real differential-drive robot platforms, and experimental results demonstrate superior stability and safety in dynamic scenarios with limited fields-of-view.
- Abstract(参考訳): 本稿では、時間変化トポロジを用いた協調ナビゲーションのためのグラフベースの安全なマルチエージェント強化学習(MARL)フレームワークを提案する。
センサ制約のある環境における安全確保という重要な課題に対処するため,CBLF(Control Barrier-Like Function)アクションスクリーニング層を通じて安全分離機構を導入する。
このメカニズムは、個別のLiDAR知覚と継続的な安全制約のギャップを埋め、学習の進捗にかかわらず、物理的な安全制約が厳密に満たされることを保証する。
この安全基盤に基づいて、注意に基づくアクターとグラフ注意ネットワーク(GAT)を統合した統合構造アーキテクチャが提案されている。
アクターは、相対幾何学的関係を協調的な追従誤差行列を通じて明示的に符号化する値ベクトル再構成機構を用いて、時間変化通信トポロジの下でのスケール不感なポリシー学習を可能にする。
一方、GATベースの批評家は、正確なグローバルな価値推定のために相互作用構造を進化させるモデルである。
提案手法は実微分駆動型ロボットプラットフォーム上で検証され, 視野が限定された動的シナリオにおいて, 安定性と安全性が良好であることを示す実験結果が得られた。
関連論文リスト
- Defending against Model Extraction for GNNs with Model Reprogramming [57.82196268649236]
グラフニューラルネットワーク(GNN)は、ML(Machine-Learning-as-a-Service)における高スループットアプリケーションのバックボーンとして機能する。
それでも、ブラックボックスのデプロイメントは、モデル抽出(ME)攻撃に晒される。
既存の防衛は「ユークリッドバイアス」に苦しむ
セキュリティのためにモデル再プログラミングを再利用するプロアクティブディフェンスフレームワークであるGraphRPを提案する。
論文 参考訳(メタデータ) (2026-08-11T23:20:15Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence [17.13365683218245]
本稿では,マルチAUVアドホックネットワークのためのシーン適応型エンボディインテリジェンス(EI)アーキテクチャを提案する。
EIは、知覚、意思決定、身体的実行を統一された認知ループに統合することで、AUVを具現化された実体として再考する。
論文 参考訳(メタデータ) (2026-03-28T08:48:22Z) - HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task [42.665798473119516]
CG-CoT(Context-Guided Chain-of-Thought)を特徴とするアーキテクチャ非依存型セーフガードを提案する。
CG-CoTは、リスクアセスメントをアクティブな知覚に分解し、相互作用対象や関連する空間近傍への注意を順次固定する。
実験により、我々のモデルであるHomeGuardは安全性を大幅に向上し、ベースモデルと比較してリスクマッチ率を30%以上改善することが示された。
論文 参考訳(メタデータ) (2026-03-15T13:09:43Z) - BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems [29.385460126069386]
我々は、キュレートされたデータセットと認知駆動型質問応答アノテーションを統合した新しいベンチマーク、CogRailを紹介した。
このベンチマークに基づいて、我々は最先端のビジュアル言語モデルの体系的な評価を行う。
本稿では,3つの中核的タスク,位置知覚,移動予測,脅威分析を統合したファインチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-14T16:36:26Z) - Explainable Neural Inverse Kinematics for Obstacle-Aware Robotic Manipulation: A Comparative Analysis of IKNet Variants [0.28544513613730205]
ディープニューラルネットワークは、低コストのマニピュレータが複雑な軌道をリアルタイムで実行できる地点まで、逆運動学(IK)推論を加速させた。
本研究では,Shapley値属性と物理に基づく障害物回避評価を統合した説明可能性中心ワークフローを提案する。
論文 参考訳(メタデータ) (2025-12-29T09:02:02Z) - A Dynamical Systems Framework for Reinforcement Learning Safety and Robustness Verification [1.104960878651584]
本稿では,学習方針の堅牢性と安全性を検証するための形式的手法の欠如に対処する新しい枠組みを提案する。
動的システム理論からツールを活用することで、システムの振る舞いを管理する隠れた「骨格」として機能するラグランジアンコヒーレント構造(LCS)を特定し視覚化する。
この枠組みは政策行動の包括的かつ解釈可能な評価を提供し、報酬のみに基づいて成功しているように見える政策の重大な欠陥の特定に成功していることを示す。
論文 参考訳(メタデータ) (2025-08-21T14:00:26Z) - Verification of Visual Controllers via Compositional Geometric Transformations [49.81690518952909]
到達可能な集合の外部近似を生成できる知覚ベースのコントローラのための新しい検証フレームワークを提案する。
提案手法の音質を理論的に保証し,ベンチマーク制御環境における有効性を示す。
論文 参考訳(メタデータ) (2025-07-06T20:22:58Z) - Designing Control Barrier Function via Probabilistic Enumeration for Safe Reinforcement Learning Navigation [55.02966123945644]
本稿では,ニューラルネットワーク検証技術を利用して制御障壁関数(CBF)とポリシー修正機構の設計を行う階層型制御フレームワークを提案する。
提案手法は,安全なCBFベースの制御層を構築するために使用される,安全でない操作領域を特定するための確率的列挙に依存する。
これらの実験は、効率的なナビゲーション動作を維持しながら、安全でない動作を補正する提案手法の能力を実証するものである。
論文 参考訳(メタデータ) (2025-04-30T13:47:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。