論文の概要: Decision-making with Imaginary Opponent Models
- arxiv url: http://arxiv.org/abs/2211.11940v1
- Date: Tue, 22 Nov 2022 01:29:47 GMT
- ステータス: 処理完了
- システム内更新日: 2022-11-23 17:18:13.062071
- Title: Decision-making with Imaginary Opponent Models
- Title(参考訳): Imaginary Opponent Modelによる意思決定
- Authors: Jing Sun, Shuo chen, Cong Zhang, Jie Zhang
- Abstract要約: 対向モデリングは、他のエージェントのモデルを構築することによって、制御されたエージェントの意思決定の恩恵を受けている。
そこで本研究では,局所的な情報を用いた仮想的相手モデルを実現するための,マルチエージェント分布型アクター批判アルゴリズムを提案する。
- 参考スコア(独自算出の注目度): 10.506536874850887
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Opponent modeling has benefited a controlled agent's decision-making by
constructing models of other agents. Existing methods commonly assume access to
opponents' observations and actions, which is infeasible when opponents'
behaviors are unobservable or hard to obtain. We propose a novel multi-agent
distributional actor-critic algorithm to achieve imaginary opponent modeling
with purely local information (i.e., the controlled agent's observations,
actions, and rewards). Specifically, the actor maintains a speculated belief of
the opponents, which we call the \textit{imaginary opponent models}, to predict
opponents' actions using local observations and makes decisions accordingly.
Further, the distributional critic models the return distribution of the
policy. It reflects the quality of the actor and thus can guide the training of
the imaginary opponent model that the actor relies on. Extensive experiments
confirm that our method successfully models opponents' behaviors without their
data and delivers superior performance against baseline methods with a faster
convergence speed.
- Abstract(参考訳): 反対モデリングは、他のエージェントのモデルを構築することによって、制御エージェントの意思決定の恩恵を受けている。
既存の手法では、相手の観察や行動へのアクセスを前提としており、相手の行動が観察できない場合や入手が難しい場合は不可能である。
本稿では,局所的な情報(エージェントの観察,行動,報酬など)を用いた仮想的相手モデリングを実現するための,新しいマルチエージェント分布型アクター批判アルゴリズムを提案する。
具体的には,「textit{imaginary opponent model}」とよばれる,相手の行動を局所的な観察で予測し,それに応じて決定する,相手の推測的信念を維持している。
さらに、分布批評家はポリシーの戻り分布をモデル化する。
役者の質を反映しており、役者が依存する想像上の相手モデルの訓練を導くことができる。
広範な実験により,本手法はデータ無しで相手の行動のモデル化に成功し,より高速な収束速度でベースライン法に対して優れた性能をもたらすことを確認した。
関連論文リスト
- A Minimaximalist Approach to Reinforcement Learning from Human Feedback [49.45285664482369]
人間のフィードバックから強化学習を行うアルゴリズムとして,SPO(Self-Play Preference Optimization)を提案する。
我々のアプローチは、報酬モデルや不安定な敵の訓練を必要としないという点で最小主義である。
我々は,一連の継続的制御タスクにおいて,報酬モデルに基づくアプローチよりもはるかに効率的に学習できることを実証した。
論文 参考訳(メタデータ) (2024-01-08T17:55:02Z) - ShuttleSHAP: A Turn-Based Feature Attribution Approach for Analyzing
Forecasting Models in Badminton [52.21869064818728]
バドミントンにおけるプレイヤー戦術予測のための深層学習アプローチは、部分的にはラリープレイヤの相互作用に関する効果的な推論に起因する有望なパフォーマンスを示している。
本稿では,Shapley値の変量に基づいてバドミントンにおける予測モデルを解析するためのターンベース特徴属性手法であるShuttleSHAPを提案する。
論文 参考訳(メタデータ) (2023-12-18T05:37:51Z) - Malicious Agent Detection for Robust Multi-Agent Collaborative Perception [52.261231738242266]
多エージェント協調(MAC)知覚は、単エージェント認識よりも敵攻撃に対して脆弱である。
MAC知覚に特異的な反応防御であるMADE(Malicious Agent Detection)を提案する。
我々は、ベンチマーク3DデータセットV2X-simとリアルタイムデータセットDAIR-V2Xで包括的な評価を行う。
論文 参考訳(メタデータ) (2023-10-18T11:36:42Z) - Mimicking To Dominate: Imitation Learning Strategies for Success in
Multiagent Competitive Games [13.060023718506917]
我々は、対戦者の次の動きを予測するための新しいマルチエージェント模倣学習モデルを開発する。
また、模倣学習モデルとポリシートレーニングを組み合わせた、新しいマルチエージェント強化学習アルゴリズムを1つのトレーニングプロセスに導入する。
実験結果から,本手法は既存のマルチエージェントRLアルゴリズムと比較して性能が優れていることがわかった。
論文 参考訳(メタデータ) (2023-08-20T07:30:13Z) - Multi-agent Actor-Critic with Time Dynamical Opponent Model [16.820873906787906]
多エージェント強化学習では、複数のエージェントが共通の環境と相互作用しながら同時に学習する。
本稿では,TDOM(textitTime Dynamical Opponent Model)を提案する。
我々は,テスト期間中にTDOMが優れた対向行動予測を達成できることを実証的に示す。
論文 参考訳(メタデータ) (2022-04-12T07:16:15Z) - Training Meta-Surrogate Model for Transferable Adversarial Attack [98.13178217557193]
クエリーを許可しない場合、ブラックボックスモデルに対する逆攻撃を考える。
この設定では、多くの手法が代理モデルを直接攻撃し、得られた敵の例をターゲットモデルを騙すために転送する。
メタサロゲートモデル(Meta-Surrogate Model:MSM)は,このモデルに対する攻撃が,他のモデルに容易に転送できることを示す。
論文 参考訳(メタデータ) (2021-09-05T03:27:46Z) - Moody Learners -- Explaining Competitive Behaviour of Reinforcement
Learning Agents [65.2200847818153]
競合シナリオでは、エージェントは動的環境を持つだけでなく、相手の行動に直接影響される。
エージェントのQ値の観察は通常、その振る舞いを説明する方法であるが、選択されたアクション間の時間的関係は示さない。
論文 参考訳(メタデータ) (2020-07-30T11:30:42Z) - Agent Modelling under Partial Observability for Deep Reinforcement
Learning [12.903487594031276]
エージェントモデリングの既存の方法は、実行中にローカルな観察とモデル化されたエージェントの選択されたアクションの知識を仮定する。
制御されたエージェントの局所的な観察に基づいて,モデル化されたエージェントの表現を抽出することを学ぶ。
これらの表現は、深い強化学習を通じて訓練された制御エージェントの決定ポリシーを強化するために使用される。
論文 参考訳(メタデータ) (2020-06-16T18:43:42Z) - Learning to Model Opponent Learning [11.61673411387596]
マルチエージェント強化学習(MARL: Multi-Agent Reinforcement Learning)は、一組の共存エージェントが相互とその環境と相互作用する設定を考える。
これは、通常、収束が定常環境の仮定に依存する値関数ベースのアルゴリズムにとって大きな課題となる。
我々は、モデルポンポント学習(LeMOL)と呼ばれる、対戦者の学習力学をモデル化するための新しいアプローチを開発する。
論文 参考訳(メタデータ) (2020-06-06T17:19:04Z) - Regularizers for Single-step Adversarial Training [49.65499307547198]
本稿では,1ステップの対数学習手法を用いて,ロバストモデル学習を支援する3種類の正則化器を提案する。
正規化器は、ロバストモデルと擬ロバストモデルとを区別する特性を利用することにより、勾配マスキングの効果を緩和する。
論文 参考訳(メタデータ) (2020-02-03T09:21:04Z) - Variational Autoencoders for Opponent Modeling in Multi-Agent Systems [9.405879323049659]
マルチエージェントシステムは、共有環境における複数のエージェントの相互作用から生じる複雑な振る舞いを示す。
本研究は,マルチエージェントシステムにおけるエージェントの制御に関心を持ち,ポリシーを定めているエージェントとのインタラクションをうまく学習する。
他のエージェント(反対者)の振る舞いをモデル化することは、システム内のエージェントの相互作用を理解するのに不可欠である。
論文 参考訳(メタデータ) (2020-01-29T13:38:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。