論文の概要: CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination
- arxiv url: http://arxiv.org/abs/2607.09587v1
- Date: Fri, 10 Jul 2026 16:36:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.456828
- Title: CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination
- Title(参考訳): CoDiMAD:コミュニケーションフリー多ロボットコーディネートのための拡散型プリビリード蒸留
- Authors: Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang,
- Abstract要約: CoDiMADは、MAPPOで特権を持つ神託を訓練し、神託を分散された学生に蒸留するフレームワークである。
3つの協調作業の実験では、CoDiMADは直接局所的なMARLと決定論的蒸留ベースラインより一貫して優れていた。
- 参考スコア(独自算出の注目度): 2.17870369215002
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decentralized multi-robot coordination under partial observability remains challenging, especially in communication-free settings where agents must act solely from local sensor observations. Privileged policy distillation provides a promising approach by transferring knowledge from a globally informed oracle to sensor-constrained students. However, in multi-agent systems, the same local observation may correspond to multiple global configurations requiring qualitatively different cooperative actions, making the conditional action distribution inherently multi-modal. Standard deterministic distillation collapses these modes to their mean, often yielding invalid or hesitant actions. To address this issue, we propose CoDiMAD, a three-stage framework that trains a privileged oracle with MAPPO, constructs an offline dataset of local-observation-oracle-action pairs, and distills the oracle into decentralized students parameterized as conditional denoising diffusion probabilistic models. By approximating the conditional oracle-action distribution through the diffusion reverse process, CoDiMAD samples decisive actions from coherent coordination modes rather than averaging across them. Theoretical analysis characterizes the mode-averaging failure of deterministic distillation and the distributional recovery property of diffusion-based distillation. Experiments on three cooperative tasks show that CoDiMAD consistently outperforms direct local MARL and deterministic distillation baselines. The source code will be made publicly available upon acceptance.
- Abstract(参考訳): 部分観測可能性下での分散マルチロボット協調は、特にエージェントが局所的なセンサー観測からのみ行動しなければならない通信不要な環境では、依然として困難である。
プライヴィレグド・ポリシー・蒸留(Privleged Policy distillation)は、世界的な知恵を持つ神託からセンサに拘束された学生に知識を移すことによって、有望なアプローチを提供する。
しかし、マルチエージェントシステムでは、同じ局所的な観測は、質的に異なる協調行動を必要とする複数のグローバルな構成に対応し、条件付き行動分布は本質的にマルチモーダルである。
標準的な決定論的蒸留は、これらのモードを平均まで崩壊させ、しばしば無効な行動または過度な行動を引き起こす。
この問題を解決するために,MAPPOを用いた特権託宣訓練を行う3段階フレームワークであるCoDiMADを提案する。
CoDiMADは拡散逆過程を通じて条件付きオラクル-作用分布を近似することにより、それらの平均化ではなくコヒーレント調整モードから決定的な作用をサンプリングする。
理論解析は, 決定論的蒸留のモード改善失敗と拡散に基づく蒸留の分布回復特性を特徴づける。
3つの協調作業の実験では、CoDiMADは直接局所的なMARLと決定論的蒸留ベースラインより一貫して優れていた。
ソースコードは受理時に公開されます。
関連論文リスト
- Structural Equivalence and Learning Dynamics in Delayed MARL [2.2302915692528367]
我々は,協調的に観測可能なマルチエージェントシステムにおいて,観測遅延(OD)と行動遅延(AD)の等価性を確立する。
両システムは同一の許容可能連立政治集合を生成し,その状態-作用-観測軌道は分布において同一であることを示す。
これは、既存の無限水平単エージェント結果を、任意の水平部分観測可能な協調多エージェント問題に正式に一般化する。
論文 参考訳(メタデータ) (2026-05-05T23:07:09Z) - Distillation of Discrete Diffusion by Exact Conditional Distribution Matching [9.460409527892345]
本稿では, 空調分布マッチングに基づく簡易かつ原理的な蒸留法を提案する。
我々は,この構造を利用して,事前学習した教師と低NFE学生の条件分布を直接一致させる蒸留目標を定義する。
論文 参考訳(メタデータ) (2025-12-15T00:16:10Z) - Locality Preserving Markovian Transition for Instance Retrieval [59.16243976912006]
局所保存マルコフ遷移(LPMT)フレームワークは,複数状態の長期熱力学的遷移プロセスを用いて正確な多様体距離測定を行う。
提案するLPMTは,BCD(Bidirectional Collaborative Diffusion)を用いて,各グラフ間の拡散過程を統合することにより,強い類似性関係を確立する。
その後、Locality State Embedding (LSE)は各インスタンスを分散にエンコードし、ローカル一貫性を向上する。
これらの分布は熱力学的マルコフ遷移(TMT)プロセスを介して相互接続され、局所的な有効性を維持しながら効率的な大域的探索を可能にする。
論文 参考訳(メタデータ) (2025-06-05T16:07:31Z) - Collaborative Value Function Estimation Under Model Mismatch: A Federated Temporal Difference Analysis [55.13545823385091]
フェデレーション強化学習(FedRL)は、エージェント間のデータ交換を防止し、データのプライバシを維持しながら協調学習を可能にする。
現実世界のアプリケーションでは、各エージェントは若干異なる遷移ダイナミクスを経験し、固有のモデルミスマッチを引き起こす。
情報共有の適度なレベルでさえ、環境固有のエラーを著しく軽減することを示す。
論文 参考訳(メタデータ) (2025-03-21T18:06:28Z) - Counterfactual Realizability [52.85109506684737]
本稿では, 正規化可能性の定義, 分布からサンプルを抽出する能力を導入し, 任意の反事実分布が実現可能であるかどうかを判定する完全アルゴリズムを開発する。
本稿では、因果的公正さと因果的強化学習のモチベーション例を用いて、この新たな反ファクト的データ収集フレームワークの意義を説明する。
論文 参考訳(メタデータ) (2025-03-14T20:54:27Z) - On Diffusion Models for Multi-Agent Partial Observability: Shared Attractors, Error Bounds, and Composite Flow [37.433470342139685]
拡散モデルを用いたDEC-POMDPにおける局所的な行動観測履歴からのグローバルな状態の再構築について検討する。
深層学習近似誤差では、固定点が真の状態から逸脱し、偏差はヤコビアンランクと負の相関を持つ。
論文 参考訳(メタデータ) (2024-10-17T18:23:33Z) - Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers [49.97755400231656]
一般のスコアミスマッチ拡散サンプリング器に対する明示的な次元依存性を持つ最初の性能保証を示す。
その結果, スコアミスマッチは, 目標分布とサンプリング分布の分布バイアスとなり, 目標分布とトレーニング分布の累積ミスマッチに比例することがわかった。
この結果は、測定ノイズに関係なく、任意の条件モデルに対するゼロショット条件付きサンプリングに直接適用することができる。
論文 参考訳(メタデータ) (2024-10-17T16:42:12Z) - Decentralized Local Stochastic Extra-Gradient for Variational
Inequalities [125.62877849447729]
我々は、不均一(非IID)で多くのデバイスに分散する問題データを持つ領域上での分散変分不等式(VIs)を考察する。
我々は、完全に分散化された計算の設定を網羅する計算ネットワークについて、非常に一般的な仮定を行う。
理論的には, モノトン, モノトンおよび非モノトンセッティングにおける収束速度を理論的に解析する。
論文 参考訳(メタデータ) (2021-06-15T17:45:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。