論文の概要: HiComm: Hierarchical Communication for Multi-agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.29126v2
- Date: Wed, 01 Jul 2026 12:24:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.059841
- Title: HiComm: Hierarchical Communication for Multi-agent Reinforcement Learning
- Title(参考訳): HiComm: マルチエージェント強化学習のための階層的コミュニケーション
- Authors: Runze Zhao, Dongruo Zhou, Sumit Kumar Jha, Nathaniel D. Bastian, Ankit Shah,
- Abstract要約: 我々は,送信者の階層的な観察にメッセージを置くプラグイン通信モジュールであるtextscHiCommを提案する。
textscHiCommはレシーバ駆動であり、階層は3段階の復号プロセスによって解決される。
実験によると、textscHiCommは、各エピソードの受信者あたりの通信容量を最大2,3倍に減らしながら、学習したコミュニケーションのベースラインにマッチし、より優れています。
- 参考スコア(独自算出の注目度): 27.564924459355424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cooperative multi-agent reinforcement learning (MARL) often relies on communication to mitigate partial observability, yet most existing protocols treat messages as flat dense vectors detached from the structure of the observations they summarize. This design overlooks an important source of inductive bias in many cooperative environments, where observations naturally follow a hierarchy such as groups and entities. We propose \textsc{HiComm}, a plug-in communication module that grounds messages in the sender's hierarchical observation. \textsc{HiComm} is receiver-driven: the receiver issues a query, and the hierarchy is resolved through a three-stage decoding process that first selects a group, then a sender, and then an entity within that group, returning the corresponding feature slice as the message. This converts communication from unstructured vector transmission into structured information retrieval over the sender's observation hierarchy. We instantiate this mechanism with Straight-Through Gumbel-Softmax for differentiable discrete selection and a lightweight shared projection design that attaches to standard MARL pipelines. Experiments across cooperative MARL tasks with different observation structures and coordination demands show that \textsc{HiComm} matches or outperforms representative learned communication baselines while reducing communication volume by up to $23\times$ per receiver per episode.
- Abstract(参考訳): 協調型マルチエージェント強化学習(MARL)は、部分的な可観測性を緩和するために通信に依存することが多いが、既存のプロトコルの多くは、メッセージが要約された観測の構造から分離された平坦な高密度ベクトルとして扱う。
この設計は、観測が自然にグループやエンティティのような階層に従う多くの協調環境において、誘導バイアスの重要な源を見落としている。
本稿では,送信者の階層的観測にメッセージを置くプラグイン通信モジュールである‘textsc{HiComm} を提案する。
受信者はクエリを発行し、階層は3段階のデコードプロセスを通じて解決され、最初にグループを選択し、次に送信者、それからそのグループ内のエンティティを選択し、対応するフィーチャースライスをメッセージとして返します。
これにより、非構造化ベクトル伝送からの通信を、送信者の観察階層上の構造化情報検索に変換する。
我々は、このメカニズムをStraight-Through Gumbel-Softmaxを用いて、微分可能な離散選択と標準MARLパイプラインにアタッチする軽量な共有投影設計でインスタンス化する。
協調的なMARLタスクの異なる観察構造と調整要求による実験により, コミュニケーション量を最大23\times$/1エピソードあたり最大23\times$で削減しつつ, 代表的学習コミュニケーションベースラインにマッチするか, あるいは上回る結果が得られた。
関連論文リスト
- Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems [0.65268245109828]
大規模言語モデル(LLM)上に構築されたマルチエージェントシステムは、複雑な推論、計画、ツール使用タスクに対処するための主要なパラダイムとなっている。
このようなシステムにおける主要な通信プロトコルは自然言語である: エージェントはメッセージのトークン・バイ・トークンを交換し、同僚が読み、検証し、応答できるように内部の推論を口述する。
エージェントは、テキスト生成のボトルネックを回避して、連続的な表現を直接交換する。
本稿では,潜時コミュニケーションの急速な発展をめざした文献を整理するための統一的な枠組みを提案する。
論文 参考訳(メタデータ) (2026-06-04T05:10:20Z) - MOC: Multi-Order Communication in LLM-based Multi-Agent Systems [7.468643378553509]
本稿では,マルチホップ依存を捕捉するためにエージェント間通信を再構築するマルチオーダ通信方式を提案する。
具体的には、構造化された多階エビデンスストリームを構築するための通信機構を形式化し、トークン制約のセマンティック・トポロジカルマージアルゴリズムを設計し、トークン制約内の意味的忠実度を最適化する。
論文 参考訳(メタデータ) (2026-06-01T15:06:38Z) - SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models [63.28435103335999]
セマンティックオブジェクト対応のための新しいベンチマークであるSOCOを紹介する。
視覚基盤のバックボーンは強い意味構造をエンコードするが、関連するカテゴリ間での伝達対応は不十分であることを示す。
また,LVLMは画像マッチングよりもテキストプロンプト部分のローカライゼーションが優れていることを示す。
論文 参考訳(メタデータ) (2026-05-29T17:58:48Z) - GoAgent: Group-of-Agents Communication Topology Generation for LLM-based Multi-Agent Systems [55.12339141172908]
GoAgentは、協調グループをMAS構築の原子単位として明示的に扱う通信トポロジ生成手法である。
6つのベンチマークの実験では、GoAgentの最先端のパフォーマンスを93.84%の平均精度で証明し、トークン消費を約17%削減した。
論文 参考訳(メタデータ) (2026-03-20T06:21:32Z) - DyTopo: Dynamic Topology Routing for Multi-Agent Reasoning via Semantic Matching [15.07152520738373]
我々は,各ラウンドでスパース指向の通信グラフを再構成するマネージャ誘導型マルチエージェントフレームワークであるDyTopoを紹介する。
マネージャのラウンドゴールに基づいて、各エージェントは軽量な自然言語クエリ(need)とキー(offer)ディスクリプタを出力する。
DyTopoはこれらの記述子を組み込み、セマンティックマッチングを実行し、誘導されたエッジに沿ってのみプライベートメッセージをルーティングする。
論文 参考訳(メタデータ) (2026-02-05T18:59:51Z) - AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction [77.62279834617475]
本稿では,グラフ構造ではなくシーケンシャル構造を用いて,マルチエージェント協調を再考するフレームワークを提案する。
提案手法は,(1)各ステップで最も適したエージェントロールを選択するNext-Agent Predictionと,(2)各エージェントが前ステップから関連する情報にアクセスできるようにするNext-Context Selectionの2つの重要な方向に焦点を当てる。
論文 参考訳(メタデータ) (2025-06-21T18:34:43Z) - Semantic-Native Communication: A Simplicial Complex Perspective [50.099494681671224]
トポロジカル空間の観点から意味コミュニケーションを研究する。
送信機はまずデータを$k$の単純複素数にマッピングし、その高次相関を学習する。
受信機は構造を復号し、行方不明または歪んだデータを推測する。
論文 参考訳(メタデータ) (2022-10-30T22:33:44Z) - Learning Structured Communication for Multi-agent Reinforcement Learning [104.64584573546524]
本研究では,マルチエージェント強化学習(MARL)環境下での大規模マルチエージェント通信機構について検討する。
本稿では、より柔軟で効率的な通信トポロジを用いて、LSC(Learning Structured Communication)と呼ばれる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2020-02-11T07:19:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。