論文の概要: Evolutionary Stability Does Not Guarantee Learning Accessibility: A Multi-Agent Reinforcement Learning Perspective on Cooperation Emergence
- arxiv url: http://arxiv.org/abs/2609.27664v1
- Date: Wed, 23 Sep 2026 10:35:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.977726
- Title: Evolutionary Stability Does Not Guarantee Learning Accessibility: A Multi-Agent Reinforcement Learning Perspective on Cooperation Emergence
- Title(参考訳): 進化的安定性はアクセシビリティを保証しない:協力創発に関するマルチエージェント強化学習の視点
- Abstract要約: 分散エージェントは、他者の振る舞いの変化に適応しながら調整する必要があるため、多エージェントシステムでは、協調の出現が中心的な問題である。
我々は、政府、プラットフォーム会社、ユーザを含む透明な3つのエージェントによるガバナンスモチベーションを持つゲームにおいて、この区別について研究する。
- 参考スコア(独自算出の注目度): 6.194659687806015
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Cooperation emergence is a central problem in multi-agent systems because decentralized agents must coordinate while adapting to the changing behavior of others. Evolutionary game theory identifies strategically stable outcomes, but stability under a population adjustment dynamic need not imply that finite-sample learning agents can reach the same outcome through local reward feedback. We study this distinction in a transparent three-agent governance-motivated game involving a government, a platform firm, and users. We derive replicator dynamics for the fixed stage-game incentives, evaluate the cooperative evolutionary basin on a symmetric initial-condition grid, and compare it with learning-basin estimates for three decentralized value-based learners. The learning analysis uses independent Q-learning with $\varepsilon$-greedy action selection, scaled Boltzmann exploration, and SA--EA BQL under the same payoff environment and outcome criterion. The evolutionary basin has volume $V_E=1.00$ on the sampled grid. The empirical learning basin is $0.88$ for $\varepsilon$-IQL and $0.00$ for both scaled Boltzmann and SA--EA BQL. Diagnostic traces show that broader action diversity and nonzero value separation can coexist with failure to sustain the cooperative joint action in this fixed configuration. These results indicate that evolutionary stability and learning accessibility are distinct properties of a coupled game--learning system. The shared-bike setting is a motivating application; the broader contribution is a framework for comparing population-level stability with the finite-sample accessibility of cooperation under specified multi-agent learning dynamics.
- Abstract(参考訳): 分散エージェントは、他者の振る舞いの変化に適応しながら調整する必要があるため、多エージェントシステムでは、協調の出現が中心的な問題である。
進化ゲーム理論は戦略的に安定な結果を特定するが、人口調整のダイナミックな条件下での安定性は、有限サンプル学習エージェントが局所的な報酬フィードバックによって同じ結果に達することを示唆するものではない。
我々は、政府、プラットフォーム会社、ユーザを含む透明な3つのエージェントによるガバナンスモチベーションを持つゲームにおいて、この区別について研究する。
固定ステージゲームインセンティブのための複製子ダイナミクスを導出し、対称な初期条件グリッド上での協調的進化盆地を評価し、3つの分散値ベース学習者の学習ベース推定と比較する。
学習分析では、$\varepsilon$-greedyアクションセレクション、スケールされたボルツマン探索、SA--EA BQLを同じペイオフ環境と結果基準で使用する。
進化盆地は、サンプルグリッド上に体積$V_E=1.00$を有する。
経験的学習盆地は、スケールしたボルツマンとSA-EA BQLの両方に対して$0.88$と$0.00$である。診断的トレースは、より広範なアクション多様性と非ゼロ値分離が、この固定された構成において協調的なアクションを持続する失敗と共存可能であることを示している。これらの結果は、進化的安定性と学習アクセシビリティが、複合ゲーム学習システムの異なる性質であることを示している。
より広範な貢献は、人口レベルの安定性と、特定マルチエージェント学習力学の下での協調の有限サンプルアクセシビリティを比較するためのフレームワークである。
関連論文リスト
- Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria [3.061219970798378]
現実世界のマルチエージェントシステムは、個々のインセンティブが集団福祉と矛盾する一般的なサムゲームとしてモデル化されることが多い。
標準深層マルチエージェント強化学習法(MARL)はこの問題に対処する。
提案する$-Actor-Critic($-AC)は,スワップリミスの最小化を利用して,高次相関均衡に向けて学習を行うフレームワークである。
論文 参考訳(メタデータ) (2026-06-09T16:40:26Z) - SEAL: Synergistic Co-Evolution of Agents and Learning Environments [11.720414165425256]
大きな言語モデル(LLM)エージェントは、インタラクションによってますます改善されている。
ほとんどの自己進化的手法は、政策または学習環境を独立に適応させる。
対話型ツール利用エージェントのためのクローズドループ共進化フレームワークSEALを提案する。
論文 参考訳(メタデータ) (2026-05-23T06:41:31Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution [82.31558282651811]
複雑な対人相互作用をナビゲートするソーシャルインテリジェンスは、言語エージェントに根本的な課題を提示する。
既存のアプローチでは、言語モデルを直接使用してエピソードレベルの報酬を分配する。
協調ゲーム理論に基づく新しい原理的枠組みであるSAVOIRを提案する。
論文 参考訳(メタデータ) (2026-04-21T02:08:25Z) - Socially-Weighted Alignment: A Game-Theoretic Framework for Multi-Agent LLM Systems [17.658093330392052]
本稿では,エージェントの個人目的と集団福祉の推定を補間することにより,推論時間決定の修正を行うゲーム理論フレームワークを提案する。
以上の結果から, SWAは, 過負荷下での需要増加のために, エージェントがもはや限界的なインセンティブを持たない, 臨界しきい値$*=(n-)/(n-1)$を誘導することを示した。
論文 参考訳(メタデータ) (2026-02-16T05:17:58Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Stackelberg Coupling of Online Representation Learning and Reinforcement Learning [45.70357546589222]
SCORERは,表現とQラーニングを階層型ゲームにおける2つの戦略エージェントとみなす,価値に基づくRLのためのフレームワークである。
提案するSCORERフレームワークは, 2時間スケールのアルゴリズムで解を近似する二段階最適化問題に導かれる。
論文 参考訳(メタデータ) (2025-08-10T18:36:54Z) - A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning [53.83345471268163]
非定常マルチエージェントシステムにおける平衡の学習について検討する。
単エージェント学習へのブラックボックス還元による様々な平衡の検証方法を示す。
論文 参考訳(メタデータ) (2023-06-12T23:48:24Z) - Efficient Model-based Multi-agent Reinforcement Learning via Optimistic
Equilibrium Computation [93.52573037053449]
H-MARL (Hallucinated Multi-Agent Reinforcement Learning) は,環境と数回交流した後の平衡政策を学習する。
自律運転シミュレーションベンチマークにおいて,本手法を実験的に実証した。
論文 参考訳(メタデータ) (2022-03-14T17:24:03Z) - Is Independent Learning All You Need in the StarCraft Multi-Agent
Challenge? [100.48692829396778]
独立PPO (Independent PPO) は独立学習の一種であり、各エージェントはその局所値関数を単純に推定する。
IPPOの強い性能は、ある種の非定常性に対する堅牢性に起因する可能性がある。
論文 参考訳(メタデータ) (2020-11-18T20:29:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。