論文の概要: Who Bears the Burden? Learning Responsibility for Shared Constraints in Multi-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.07491v1
- Date: Mon, 05 Oct 2026 22:53:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.699939
- Title: Who Bears the Burden? Learning Responsibility for Shared Constraints in Multi-Agent Reinforcement Learning
- Title(参考訳): バーデンは誰か? 多エージェント強化学習における共有制約の学習責任
- Abstract要約: ラグランジアン責任割当 (Lagrangian Responsibility Allocation, LiRA) は、各エージェントの共通乗算器のシェアを学習する。
LiRAは、一様およびエージェント固有の乗算器ベースラインに対して、平均的な社会福祉を最大29%改善する。
- 参考スコア(独自算出の注目度): 44.73532752486941
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When multiple agents share a cost budget, a common Lagrange multiplier can enforce the aggregate constraint but does not determine how its penalty should be allocated across agents. Uniform penalties ignore heterogeneity in the rewards agents sacrifice, while agent-specific multipliers may still rely on the same aggregate cost signal. We introduce Lagrangian Responsibility Allocation (LiRA), which learns each agent's share of a common multiplier by optimizing social welfare over a finite training horizon. The multiplier enforces the aggregate budget, while responsibility shares redistribute its influence without modifying the original rewards or constraints. For convex games under standard regularity conditions, varying these shares induces a smooth family of normalized generalized Nash equilibria in which active constraints remain at their budgets while welfare varies. To optimize responsibility before convergence, we derive a welfare gradient that accounts for both learning updates and the induced change in data distribution. Across CityLearn, MABIM, Harvest, and MetaDrive, spanning 3 to 400 agents, LiRA improves average social welfare by up to 29% over uniform and agent-specific multiplier baselines. Grid and driving costs remain within budget, inventory violations decrease, and Harvest makes more effective use of available budget.
- Abstract(参考訳): 複数のエージェントがコスト予算を共有する場合、共通のラグランジュ乗算器は集約的制約を強制することができるが、エージェント間でそのペナルティをどのように割り当てるかは決定しない。
一様罰は報酬エージェントの犠牲となる不均一性を無視するが、エージェント固有の乗算器は依然として同じ総コスト信号に依存している。
ラグランジアン・レスポンシビリティ・アロケーション(LiRA)を導入し、有限トレーニング地平線上での社会福祉を最適化することにより、各エージェントの共通乗数シェアを学習する。
乗算器は総予算を強制し、責任共有は元の報酬や制約を変更することなくその影響を再分配する。
標準正規化条件下での凸ゲームでは、これらの共有は正常化された一般化されたナッシュ均衡のスムーズなファミリーを誘導する。
収束前の責任を最適化するために、学習更新とデータ分散の誘導的変化の両方を考慮に入れた福祉勾配を導出する。
CityLearn、MABIM、Harvest、MetaDriveの3から400のエージェントにまたがるLiRAは、一様およびエージェント固有の乗算器ベースラインに対して、平均的な社会福祉を29%改善する。
グリッドと運転費は予算内に留まり、在庫違反は減少し、ハーベストは利用可能な予算をより効果的に活用する。
関連論文リスト
- SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning [47.874792904138154]
有限ロールアウト予算の下では、MaxRLが使用する推定器はその成功確率とロールアウト数に依存する因子によって各プロンプトの確率勾配を減衰する。
均一なロールアウトアロケーションの下では、共通のロールアウトカウントは成功に依存した減衰を補うことができず、低リスクはより強く減衰し、期待される集約勾配への相対的な寄与を歪ませる。
本稿では、これらの有限ロールアウトスケーリング係数をほぼ等化するために、固定ロールアウト予算を再編成するSERAを紹介する。
論文 参考訳(メタデータ) (2026-09-29T02:40:52Z) - Learning to Harvest Without Collapse in a Regenerative Commons: A Lagrangian Framework [2.000890150701116]
我々は,再生コモンズを制約付きマルコフゲームや,デザイナー指定の枯渇予算による制約付きマルチエージェントMDPとして定式化し,明確な要件を整備する。
我々は、制約のないゲームや協調制御問題の解からポリシーシーケンスを構築する非定常ラグランジアンフレームワークを開発する。
ゴードン=シェーファー漁業における拘束型IPPOとMAPPOを用いた実験は、枯渇予算が在庫維持、収穫報酬、価格適応をどのように形成するかを検証した。
論文 参考訳(メタデータ) (2026-09-29T01:37:20Z) - Stable and Budget-Feasible Coalition Formation for Clustered Federated Learning: A Hedonic Potential-Game Approach [0.23689955632456086]
クラスタ化された学習は、異質な参加者を連立特化モデルを訓練する連立組織にまとめることの恩恵を受ける。
我々は,学習効果,システムコスト,参加者コスト,金銭的移転を分離した移動可能余剰モデルを開発した。
論文 参考訳(メタデータ) (2026-07-29T11:29:45Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - Phase Transition for Budgeted Multi-Agent Synergy [41.486076708302456]
マルチエージェントシステムは信頼性を向上させることができるが、固定された推論予算の下では、しばしば役立つか、飽和するか、崩壊するかさえある。
我々は、現代のエージェントスタックの3つの束縛制約からこれらの状態を予測する最小限の校正可能な理論を開発する。
論文 参考訳(メタデータ) (2026-01-24T05:32:50Z) - Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning [60.00161035836637]
グループ相対政策最適化は、推論タスクのための有望な批判のない強化学習パラダイムとして登場した。
我々は,各トークンがモデルの最終回答にどの程度影響するかに基づいて,利益を再分配する,きめ細かい信用割当機構であるOutcome-grounded Advantage Reshaping (OAR)を紹介した。
OAR-Gは計算オーバーヘッドを無視して同等のゲインを達成し、どちらも強力なGRPOベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2026-01-12T10:48:02Z) - Robust Allocations with Diversity Constraints [65.3799850959513]
エージェント値の積を最大化するナッシュ福祉規則は,多様性の制約が導入されたとき,一意にロバストな位置にあることを示す。
また, ナッシュ・ウェルズによる保証は, 広く研究されているアロケーション・ルールのクラスにおいて, ほぼ最適であることを示す。
論文 参考訳(メタデータ) (2021-09-30T11:09:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。