論文の概要: Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm
- arxiv url: http://arxiv.org/abs/2608.09258v1
- Date: Mon, 10 Aug 2026 08:14:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.14294
- Title: Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm
- Title(参考訳): 強化学習によるタスク指向形成決定:攻撃する群れのハーディング
- Authors: Zhaozong Wang, Guibin Sun, Jinyong Chen, Rui Zhou,
- Abstract要約: 課題指向の形成決定問題について,本研究の課題に焦点をあてて検討する。
この作業は、攻撃者の優れた操作性とその未知の戦略のために困難である。
生成パラメータを制御するための強化学習に基づくポリシーを開発する。
- 参考スコア(独自算出の注目度): 6.909014979961266
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Multi-robot systems can accomplish tasks that are difficult for a single robot by organizing into task-specific formations. Different from existing studies on multi-robot shape formation, we here study the task-oriented formation decision problem, with a focus on the herding task. This task is challenging due to the attackers' superior maneuverability and their unknown strategies. To address these challenges, we propose the following novel results. First, we encode the formation shape using a low-dimensional parameter vector. This parametric representation reformulates the formation decision as a parameter optimization problem, thereby resolving the limited flexibility of predefined shapes. By optimizing these formation parameters, the defenders' maneuverability disadvantage is mitigated through a formation shape that continuously adapts to task requirements. Second, we develop a reinforcement learning-based policy to regulate the formation parameters. Trained offline in simulations covering diverse attacking strategies, the learned policy can effectively handle adversarial unpredictability during online deployment. Comparative simulations against three baselines demonstrate that our method can successfully accomplish challenging herding tasks. Additional scalability simulations further verify its applicability to simulated scenarios involving dozens of robots. We also validate the practical feasibility of our method on a physical robotic platform with 3 attackers and 7 defenders.
- Abstract(参考訳): マルチロボットシステムは、タスク固有の構成を組織化することで、単一のロボットにとって困難なタスクを達成できる。
マルチロボット形状形成に関する既存の研究とは違って,本研究では,タスク指向の形成決定問題について,シーディングタスクに焦点をあてて検討する。
この作業は、攻撃者の優れた操作性とその未知の戦略のために困難である。
これらの課題に対処するために、以下の新しい結果を提案する。
まず、低次元パラメータベクトルを用いて形成形状を符号化する。
このパラメトリック表現は、パラメータ最適化問題として生成決定を再構成し、予め定義された形状の限られた柔軟性を解消する。
これらの生成パラメータを最適化することにより、防御者の操作性不利は、タスク要求に継続的に適応する形成形態によって軽減される。
第2に、生成パラメータを制御するための強化学習に基づくポリシーを開発する。
多様な攻撃戦略をカバーするシミュレーションでオフラインでトレーニングされたこの学習ポリシーは、オンライン展開中の敵の予測不能を効果的に処理することができる。
3つの基準値との比較シミュレーションにより,本手法が課題の解決に有効であることを実証した。
追加のスケーラビリティシミュレーションは、数十のロボットを含むシミュレーションシナリオへの適用性をさらに検証する。
また,攻撃者3名と守備者7名による物理ロボットプラットフォーム上での本手法の有効性を検証した。
関連論文リスト
- Dynamic Manipulation of Deformable Objects in 3D: Simulation, Benchmark and Learning Strategy [88.8665000676562]
従来の手法は、しばしば問題を低速または2D設定に単純化し、現実の3Dタスクに適用性を制限する。
データ不足を軽減するため、新しいシミュレーションフレームワークと、低次ダイナミクスに基づくベンチマークを導入する。
本研究では,シミュレーション前トレーニングと物理インフォームドテスト時間適応を統合するフレームワークであるDynamics Informed Diffusion Policy (DIDP)を提案する。
論文 参考訳(メタデータ) (2025-05-23T03:28:25Z) - Solving Multi-Goal Robotic Tasks with Decision Transformer [0.0]
ロボット工学におけるオフラインマルチゴール強化学習のための決定変換器アーキテクチャの新しい適応法を提案する。
われわれのアプローチでは、ゴール固有の情報を意思決定変換器に統合し、オフライン環境で複雑なタスクを処理できる。
論文 参考訳(メタデータ) (2024-10-08T20:35:30Z) - P2DT: Mitigating Forgetting in task-incremental Learning with progressive prompt Decision Transformer [49.716834343064015]
破滅的な忘れ物は、大きなモデルによって制御される知的エージェントを管理する上で大きな課題となる。
P2DT(Progressive Prompt Decision Transformer)を提案する。
この手法は,新しいタスクトレーニング中に動的に決定トークンを付加することにより,トランスフォーマーベースのモデルを強化し,タスク固有のポリシーを育成する。
論文 参考訳(メタデータ) (2024-01-22T02:58:53Z) - Co-learning Planning and Control Policies Constrained by Differentiable
Logic Specifications [4.12484724941528]
本稿では,高次元ロボットナビゲーションタスクを解くための新しい強化学習手法を提案する。
既存の強化学習アルゴリズムと比較して、より少ないサンプルで高品質なポリシーを訓練する。
提案手法は,高次元制御と政策アライメントによる準最適政策の回避にも有効である。
論文 参考訳(メタデータ) (2023-03-02T15:24:24Z) - Leveraging Sequentiality in Reinforcement Learning from a Single
Demonstration [68.94506047556412]
本稿では,複雑なロボットタスクの制御ポリシーを1つの実演で学習するために,シーケンシャルなバイアスを活用することを提案する。
本研究は, ヒューマノイド移動やスタンドアップなど, 模擬課題のいくつかを, 前例のないサンプル効率で解くことができることを示す。
論文 参考訳(メタデータ) (2022-11-09T10:28:40Z) - Training and Evaluation of Deep Policies using Reinforcement Learning
and Generative Models [67.78935378952146]
GenRLはシーケンシャルな意思決定問題を解決するためのフレームワークである。
強化学習と潜在変数生成モデルの組み合わせを利用する。
最終方針訓練の性能に最も影響を与える生成モデルの特徴を実験的に決定する。
論文 参考訳(メタデータ) (2022-04-18T22:02:32Z) - Robust Reinforcement Learning under model misspecification [8.607994365031175]
強化学習は近年,幅広いタスクにおいて顕著な成果を上げている。
そのうちの1つはモデルミス仕様化であり、エージェントが異なる遷移ダイナミクスを持つ環境でトレーニングされ、デプロイされる状況である。
このジレンマに対処するために,歴史軌跡と部分可観測マルコフ決定過程モデルを用いた新しい枠組みを提案する。
論文 参考訳(メタデータ) (2021-03-29T06:48:26Z) - Adversarial Training is Not Ready for Robot Learning [55.493354071227174]
対人訓練は,ノルム有界摂動に耐性のあるディープラーニングモデルを訓練する有効な方法である。
敵訓練により得られたニューラルコントローラが3種類の欠陥を受けることを理論的および実験的に示す。
この結果から, ロボット学習にはまだ対応できていないことが示唆された。
論文 参考訳(メタデータ) (2021-03-15T07:51:31Z) - Bayesian Meta-Learning for Few-Shot Policy Adaptation Across Robotic
Platforms [60.59764170868101]
強化学習手法は、重要な性能を達成できるが、同じロボットプラットフォームで収集される大量のトレーニングデータを必要とする。
私たちはそれを、さまざまなロボットプラットフォームで共有される共通の構造を捉えるモデルを見つけることを目標とする、数ショットのメタラーニング問題として定式化します。
我々は,400個のロボットを用いて,実ロボットピッキング作業とシミュレーションリーチの枠組みを実験的に評価した。
論文 参考訳(メタデータ) (2021-03-05T14:16:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。