論文の概要: Emergence, Not Bandwidth: Physical Coupling and the Limits of Learned Multi-Agent Communication
- arxiv url: http://arxiv.org/abs/2609.34373v2
- Date: Tue, 29 Sep 2026 05:39:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.732578
- Title: Emergence, Not Bandwidth: Physical Coupling and the Limits of Learned Multi-Agent Communication
- Title(参考訳): バンド幅ではなく創発性: 物理的結合と学習されたマルチエージェントコミュニケーションの限界
- Abstract要約: 利率制限されたマルチエージェントチームは、創発的なコミュニケーション文学が経験的にのみ答えた3つの質問を提起する。
我々の定理は、どんな学習者とも独立して達成可能なものを修正するので、エンジニアと学習した送信者の間のギャップは、最適化事実である。
- 参考スコア(独自算出の注目度): 13.111603252422356
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rate-limited multi-agent teams raise three questions the emergent-communication literature has answered only empirically: what an optimal message should encode, what compression costs over a horizon, and when a learned protocol is unique enough for a teammate to read. We answer them for rate-limited Dec-POMDPs, then measure how far reinforcement learning falls short of the optimum. Our theorems fix what is achievable independently of any learner, so a gap between an engineered and a learned sender at the same bit budget is an optimization fact, not an information-theoretic one. We instantiate this on three MuJoCo arenas spanning zero, partial and rigid physical coupling, charging every condition exactly 2 bits per decision, and create the discriminating regime by closing a physical side channel within one arena, holding bodies, task and reward fixed. Communication value is governed by coupling: under rigid coupling through a shared object, no channel beats silence (+0.001 +/- 0.001, p = 0.982, n = 25), since proprioception already carries that information; without coupling, every condition solves the task; under partial coupling, the engineered 2-bit sender reaches an interquartile mean of 1.000 but the learned one reaches 0.482, indistinguishable from silence (p = 0.400, n = 25). With a shared alphabet, bandwidth cannot explain the gap. Warm-starting from an engineered receiver localizes the failure: the same channel reaches 0.857 versus 0.562 cold-started (p < 0.001), so it is neither representational nor one of maintenance; reinforcement learning fails to discover the protocol. Cross-play shows learned protocols are individually meaningful but mutually unintelligible: self-play 0.980 collapses to 0.144 across seeds, and our best constructed alignment leaves at least 77% of that gap. All headline results use 25 seeds per arena and seven published baselines at matched rate.
- Abstract(参考訳): レート制限されたマルチエージェントチームは、3つの質問を提起する 創発的なコミュニケーションの文献が答えたのは、何が最適なメッセージをエンコードするか、水平線上での圧縮コスト、学習されたプロトコルがチームメイトが読むのに十分ユニークなときである。
レート限定のDec-POMDPについて回答し、次に、強化学習が最適値に届かないかを測定する。
我々の定理は、どんな学習者とも独立して達成可能なものを修正するので、技術者と学習者の間の差は、情報理論ではなく最適化事実である。
これをゼロ、部分的、厳密な物理的結合にまたがる3つのMuJoCoアリーナでインスタンス化し、1つのアリーナ内で物理側チャネルを閉じ、体、タスク、報酬を固定することで、すべての条件を正確に2ビットずつ充電する。
共有オブジェクトを経由した厳密な結合の下では、チャネルがサイレンス(+0.001 +/- 0.001, p = 0.982, n = 25)に打ち勝つことはない。
共有アルファベットでは、帯域幅はギャップを説明できない。
エンジニアリングされた受信機からのウォームスタートは障害をローカライズする:同じチャネルが0.857に到達し、0.562にコールドスタートする(p < 0.001)。
自己プレイ0.980は種子間で0.144に崩壊し、我々の最も構築されたアライメントは、少なくともそのギャップの77%を残している。
すべての見出しは、アリーナ当たり25の種と、マッチレートで発行された7つのベースラインを使用する。
関連論文リスト
- DreamingGoose: Staged Distillation from Autoregressive Transformers to Bidirectional Recurrent Diffusion Language Models [41.99844472131922]
我々はQwen3の教師を1.7Bと8Bで3段階に分けて、注意なし、双方向、ゲート・デルタ・ルール拡散学習者に変換する。
言語モデリングは部分的および非分配のみを転送する。
検索を学習するすべてのモデルは、検索エピソードに現れないトークンに対して0.000のスコアを獲得します。
論文 参考訳(メタデータ) (2026-09-28T03:57:11Z) - Agora: Git as Shared Memory for Collective AutoResearch [54.31992252587096]
別々のセッションで作業する調査エージェントは、他の人が試したことと、構築可能な結果を知る必要がある。
各コミットは結果、洞察、仮説、検証、報告を記録し、それを以前の作業とリンクする。
約12日間に渡り,13人の言語モデル労働者がアゴラを重み移動問題の解決に利用したことを報告した。
論文 参考訳(メタデータ) (2026-09-16T04:00:54Z) - Shortcut Before Circuit: Document Statistics Time In-Context Conflict Resolution [0.0]
我々は、電流と希薄度が正確に一致した合成言語でトランスフォーマーを訓練する。
私たちはこれらを最小限の因果編集で分離し、真実、トークン数、答え位置を固定しながら1つのキューを反転させます。
論文 参考訳(メタデータ) (2026-08-25T12:09:19Z) - In-Cell Learning: Deployed Language Models Can Learn New Knowledge Without Changing a Single Stored Bit [4.726337413307433]
4ビットのリリースでは、各重みを整数コードと共有スケールとして格納し、格納された値の間に量子化器が捨てる間隔を残していることを示す。
私たちは、新しい知識をそのインターバルに書き込むパラダイムを、インセルラーニングと呼ぶ。
CellFillは、内部の低ランクの位置をベンダー自身の4ビットリリースでトレーニングすることで、構築によってパラダイムを実現する。
論文 参考訳(メタデータ) (2026-08-21T08:49:07Z) - What You Can't See Is What You Learn: Slot-Selective Evidence Masking Favors Compositional Generalization in Shared-Genome Language-Model Societies [0.0]
我々は、アテンションマスクを除いて、10個のマッチした制限付き/グロバルペアを訓練する。
制限された視認性社会は、両深度で少なくとも20ポイント以上の視認性双生児を上回っている。
ホック選択後の6つの制限された社会では、正しく答えられた保留エピソードに対するパケットの介入は、およそ値インデクシングされたリレー状態と一致している。
論文 参考訳(メタデータ) (2026-08-20T13:51:45Z) - The Free-Recipe Limit: Every Recipe Effect Measures Which Premise of an Idealised Learner Broke [14.867869624585886]
本研究は,12モデル(0.5B-14B,3つの事前学習家族)で761個の微調整を施したレシピ検索壁を試作した。
固定体積の1つのコヒーレント領域内において、3つの古典的自由度は0.019階に対して0.010-0.021の平均となる。
公立のスコアカードは、事前登録された26のクレームを全て評価する: 18の支持、5の失敗、2の未試験、1の混合。
論文 参考訳(メタデータ) (2026-08-09T03:01:10Z) - Stream Learning: Partition-Fair Gossip Learning Without Tokens [42.360058202775626]
ゴシップ学習では、ノードのネットワークは、ローカルモデルの一部を何度も交換することによって、中央コーディネータなしで、共有モデルを協調的に訓練する。
The State-of-the-art Protocol, Partitioned Token Gossip Learning (PTGL) of Hegeds et al.は、ウェイトマトリックスをS固定パーティションに分割し、近隣のメタデータ交換と結合したトークンベースのフェアネスメカニズムを用いてそれらを分散する。
我々の主な発見は、これらのプロトコルの最も単純なものは、局所的に最小に訓練されたパーティションを一様ランダムな隣人(Ri)に送信し、トークンカウンタも必要とせず、PTGLとフォールトフリーワークロードを一致させることである。
論文 参考訳(メタデータ) (2026-08-07T08:22:37Z) - LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging [41.99844472131922]
コミュニケーションは分散学習における大きなボトルネックである。
このコストを削減する3つの方法は、通信圧縮、ローカルトレーニング、通信-計算オーバーラップである。
本稿では,サブセットモデル座標のみを通信するローカルサブセットであるLOSCAR-SGDを提案する。
論文 参考訳(メタデータ) (2026-05-20T08:01:45Z) - Differential error feedback for communication-efficient decentralized learning [48.924131251745266]
本稿では,差分量子化と誤りフィードバックをブレンドする分散通信効率学習手法を提案する。
その結果,平均二乗誤差と平均ビットレートの両面において通信効率が安定であることが示唆された。
その結果、小さなステップサイズで有限ビットの場合には、圧縮がない場合に達成可能な性能が得られることが判明した。
論文 参考訳(メタデータ) (2024-06-26T15:11:26Z) - Can Quantum Computers Do Nothing? [44.99833362998488]
アイリングキュービットでは、情報は近隣のキュービットに'リーク'し、非局所分布となり、最終的にはアクセス不能となる。
内部力学による情報損失を定量化する情報理論プロトコルは存在しない。
我々はこのプロトコルを、IBMのFalcon 5.11シリーズの全プロセッサで4ヶ月にわたって実施された3500以上の実験で実装した。
論文 参考訳(メタデータ) (2024-06-24T17:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。