論文の概要: Co-design Gym: A Unified Benchmark for Embodiment-Policy Co-optimization
- arxiv url: http://arxiv.org/abs/2610.02366v1
- Date: Thu, 01 Oct 2026 18:42:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.048764
- Title: Co-design Gym: A Unified Benchmark for Embodiment-Policy Co-optimization
- Title(参考訳): Co-Design Gym:Embodiment-Policy共最適化のための統一ベンチマーク
- Abstract要約: 共同設計のGymは、実施とポリシーを共同で最適化するためのベンチマーク環境のスイートである。
私たちの環境は、ロボット操作や移動、マルチロボット協調、変形可能なソフトダイナミクス、ビデオゲーム、電力網、無線ネットワーク、F1レース、マルチエージェント倉庫、最適制御といった領域にまたがっています。
- 参考スコア(独自算出の注目度): 4.661985759041012
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Finding an optimal behaviour policy within a given environment is a widely studied problem in domains as diverse as games, robotics, energy infrastructure, communication networks, and multi-agent systems. Numerous benchmarks have been developed to support such research, but the vast majority assume that the agent's embodiment (design) is fixed, focusing instead on policy learning alone. Lifting this assumption gives rise to a broader class of problems in which optimizing embodiment and policy separately is highly suboptimal. An agent's embodiment strongly shapes which control policies can be discovered, while the optimal embodiment is in turn defined by the policies it admits. To help the research community study this class of problems explicitly and systematically, we introduce Co-Design Gym - a suite of benchmark environments for jointly optimizing embodiment and policy. Our environments span domains such as robotic manipulation and locomotion, multi-robot cooperation, deformable and soft dynamics, video games, electricity grids, wireless networks, F1 racing, multi-agent warehouses, and optimal control, offering 20 environment families (domains), with over 85 distinct co-design presets in total. We further contribute a systematic evaluation of representative co-design algorithms, characterizing the current state of the art. Together, these contributions lay the groundwork for cumulative, comparable progress in co-design.
- Abstract(参考訳): 与えられた環境内で最適な行動ポリシーを見つけることは、ゲーム、ロボット工学、エネルギーインフラ、通信ネットワーク、マルチエージェントシステムといった分野において広く研究されている問題である。
このような研究を支援するために多くのベンチマークが開発されているが、大多数はエージェントの実施形態(設計)が固定されており、政策学習のみに焦点を当てていると仮定している。
この仮定をリフティングすることは、実施と政策を個別に最適化することが非常に最適である、より広範な種類の問題を引き起こす。
エージェントの実施形態は、コントロールポリシーを発見できるように強く形成し、最適な実施形態は、それが認めるポリシーによって定義される。
研究コミュニティがこの問題を明確かつ体系的に研究するのを助けるために,我々は,共同で実施と政策を最適化するためのベンチマーク環境であるCo-Design Gymを紹介した。
私たちの環境は、ロボット操作や移動、マルチロボット協調、変形可能なソフトダイナミクス、ビデオゲーム、電力網、無線ネットワーク、F1レース、マルチエージェント倉庫、最適制御といった領域に及びます。
さらに,現状を特徴付ける代表的共同設計アルゴリズムの体系的評価に貢献する。
これらの貢献によって、累積的かつ同等な共同設計の進展の基礎を築いた。
関連論文リスト
- Scaling Multi-Agent Environment Co-Design with Diffusion Models [15.05916455401006]
エージェント環境共同設計は, エージェントポリシーと環境設定を協調的に最適化し, システム性能の向上を図ることを目的としている。
現在の共同設計手法は, 高次元環境設計空間下でのスケール, 崩壊に苦慮し, サンプル不効率に悩まされている。
我々は,大規模でサンプル効率のよい共同設計フレームワークを開発し,共同設計を実用的に関係のある環境に向けて進める。
提案手法は, 常に最先端の手法を超え, 66%のシミュレーションサンプルで, 倉庫環境において39%の報奨を達成している。
論文 参考訳(メタデータ) (2025-11-05T01:09:40Z) - Hypernetwork-based approach for optimal composition design in partially controlled multi-agent systems [5.860363407227059]
部分的に制御されたマルチエージェントシステム(PCMAS)は、システムデザイナが管理する制御可能なエージェントと、自律的に動作する制御不能エージェントで構成されている。
本研究は,PCMASにおける最適構成設計問題に対処し,システム設計者の問題,制御不能エージェントの最適数とポリシー,制御不能エージェントの問題について検討する。
本稿では,システムの構成とエージェントポリシーを協調的に最適化する,新しいハイパーネットワークベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-18T07:35:24Z) - Efficient Adaptation in Mixed-Motive Environments via Hierarchical Opponent Modeling and Planning [51.52387511006586]
本稿では,HOP(Hierarchical Opponent Modeling and Planning)を提案する。
HOPは階層的に2つのモジュールから構成される: 相手の目標を推論し、対応する目標条件のポリシーを学ぶ、反対モデリングモジュール。
HOPは、さまざまな未確認エージェントと相互作用する際、優れた少数ショット適応能力を示し、セルフプレイのシナリオで優れている。
論文 参考訳(メタデータ) (2024-06-12T08:48:06Z) - Co-Optimizing Reconfigurable Environments and Policies for Decentralized Multi-Agent Navigation [14.533605727697775]
本研究は,マルチエージェントシステムとその周辺環境を,一方の行動が他方に影響を与える共進化システムとみなす。
マルチエージェントナビゲーションと環境最適化という2つのサブオブジェクトを導入することで,エージェントの協調最適化問題を提案する。
論文 参考訳(メタデータ) (2024-03-21T17:37:43Z) - Benchmarking PtO and PnO Methods in the Predictive Combinatorial Optimization Regime [59.27851754647913]
予測最適化(英: Predictive optimization)は、エネルギーコストを意識したスケジューリングや広告予算配分など、多くの現実世界のアプリケーションの正確なモデリングである。
我々は,広告のための新しい産業データセットを含む8つの問題に対して,既存のPtO/PnOメソッド11をベンチマークするモジュラーフレームワークを開発した。
本研究は,8ベンチマーク中7ベンチマークにおいて,PnOアプローチがPtOよりも優れていることを示すが,PnOの設計選択に銀の弾丸は見つからない。
論文 参考訳(メタデータ) (2023-11-13T13:19:34Z) - CAMEO: Curiosity Augmented Metropolis for Exploratory Optimal Policies [62.39667564455059]
最適政策の分布を考察し研究する。
実験シミュレーションでは、CAMEOは古典的な制御問題を全て解決するポリシーを実際に得ることを示した。
さらに,本論文では,異なるリスクプロファイルを示す異なるポリシーを,解釈可能性に関する興味深い実践的応用に対応して提示する。
論文 参考訳(メタデータ) (2022-05-19T09:48:56Z) - Fast Model-based Policy Search for Universal Policy Networks [45.44896435487879]
エージェントの振る舞いを新しい環境に適応させることは、物理学に基づく強化学習の主要な焦点の1つとなっている。
本稿では,以前に見つからなかった環境に移行した場合のポリシーの性能を推定する,ガウス過程に基づく事前学習手法を提案する。
本研究は,ベイズ最適化に基づく政策探索プロセスと先行して統合し,普遍的な政策ネットワークから最も適切な政策を識別する効率を向上させる。
論文 参考訳(メタデータ) (2022-02-11T18:08:02Z) - Decentralized MCTS via Learned Teammate Models [89.24858306636816]
本稿では,モンテカルロ木探索に基づくトレーニング可能なオンライン分散計画アルゴリズムを提案する。
深層学習と畳み込みニューラルネットワークを用いて正確なポリシー近似を作成可能であることを示す。
論文 参考訳(メタデータ) (2020-03-19T13:10:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。