論文の概要: Multi-Agent Reinforcement Learning via Agent-Specific Preference
- arxiv url: http://arxiv.org/abs/2608.08604v1
- Date: Sun, 09 Aug 2026 09:38:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.881073
- Title: Multi-Agent Reinforcement Learning via Agent-Specific Preference
- Title(参考訳): エージェント特化選好によるマルチエージェント強化学習
- Authors: Ni Mu, Yao Luan, Yiqin Yang, Qing-Shan Jia,
- Abstract要約: マルチエージェント強化学習は、明確に定義されたグローバル報酬関数に大きく依存する。
我々はエージェント固有の選好モデルを用いてこれらの課題に対処するMulti-AGent Preference-Integrated lEarning(MAGPIE)を紹介する。
我々は,MAGPIEが報酬工学的ベースラインに匹敵する性能を達成することを示す。
- 参考スコア(独自算出の注目度): 13.390117775984798
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Multi-agent reinforcement learning (MARL) is a powerful framework for solving complex collaborative tasks, but it relies heavily on well-defined global reward functions. Designing such rewards is challenging, especially in systems with heterogeneous agents, where a single scalar objective may fail to capture diverse behaviors. In this paper, we introduce Multi-AGent Preference-Integrated lEarning (MAGPIE), which addresses these challenges through agent-specific preference modeling. Each agent is evaluated by a dedicated expert through preference signals, eliminating the need for global evaluation. We theoretically prove that optimizing these decentralized preferences converges to a Nash equilibrium policy. To integrate local preferences into a coherent global objective, we construct agent-specific reward models from preference data and combine them via a monotonic aggregation mechanism. We further prove that optimizing this aggregate reward model is equivalent to training the Nash equilibrium policy. Extensive experiments on benchmark multi-agent tasks and a sequential production line task show that MAGPIE achieves performance comparable to reward-engineered baselines, demonstrating its potential to facilitate policy learning in scenarios where precise reward engineering is impractical.
- Abstract(参考訳): マルチエージェント強化学習(MARL)は、複雑な協調作業を解決するための強力なフレームワークであるが、十分に定義されたグローバル報酬関数に大きく依存している。
このような報酬を設計することは、特に異種エージェントを持つシステムでは、単一のスカラー目的が多様な振る舞いを捉えるのに失敗する可能性がある。
本稿では,エージェント固有の選好モデルを用いて,これらの課題に対処するMulti-AGent Preference-Integrated lEarning(MAGPIE)を提案する。
各エージェントは、選好信号を通じて専門の専門家によって評価され、グローバルな評価の必要性がなくなる。
我々はこれらの分散された選好を最適化することがナッシュ均衡政策に収束することを理論的に証明する。
局所的な嗜好をコヒーレントなグローバルな目的に統合するために、選好データからエージェント固有の報奨モデルを構築し、それらをモノトニックアグリゲーション機構を介して組み合わせる。
さらに、このアグリゲーション報酬モデルを最適化することは、ナッシュ均衡政策の訓練と等価であることを示す。
ベンチマークマルチエージェントタスクと逐次生産ラインタスクの広範な実験により、MAGPIEは報酬工学のベースラインに匹敵するパフォーマンスを達成し、正確な報酬工学が実用的でないシナリオでポリシー学習を促進する可能性を実証した。
関連論文リスト
- Poly-EPO: Training Exploratory Reasoning Models [62.82992914206963]
本稿では,学習後言語モデル(LM)の枠組みについて,楽観的な探索を明示的に奨励し,探索と搾取の相乗効果を促進する。
本稿では,この枠組みを探索と利用を明確に相乗化するための目的として,ポリクロミック探索政策最適化(Poly-EPO)を提案する。
論文 参考訳(メタデータ) (2026-04-19T22:54:19Z) - CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs [0.0]
マルチエージェントLLMシステムにおいて,フィルタフィードバック下で学習するための統合フレームワークであるCoFi-PGMAを紹介する。
提案手法は,経路と協調機構の両面から学習信号を補正する,限界貢献に基づく対実的エージェント単位の学習目標を導出する。
論文 参考訳(メタデータ) (2026-04-03T22:55:23Z) - Counterfactual Credit Policy Optimization for Multi-Agent Collaboration [27.260904103460664]
協調多エージェント大言語モデル(LLM)は、役割を分解し、多様な仮説を集約することで複雑な推論タスクを解くことができる。
本稿では,エージェント固有の学習信号を割り当てるフレームワークであるCCPOを紹介する。
CCPOは、エージェントのコントリビューションを除去して結果をシミュレートする動的反ファクト的ベースラインを構築する。
論文 参考訳(メタデータ) (2026-03-23T04:35:02Z) - ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning [88.87305027895657]
本研究では,現実シナリオにおけるショッピングエージェントの強化学習に基づく最適化について検討する。
エージェントは、客観的指標(生産的正確性)、主観的品質(説得性)、成果報酬(最終応答品質)、プロセス報酬(ツール効率)にまたがる複数の相互依存目標を同時に満たさなければならない。
実験の結果、我々のRL学習エージェントであるChatShopBuddyは、一般的な推論に依存する大きなモデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-03-06T09:18:51Z) - SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning [50.93295951454092]
本稿では,カーネル化類似性を用いたサンプル軌道上で定義された設定レベル多様性の目的について紹介する。
提案手法は,各サンプル軌跡に対する余剰余剰貢献を導出し,この目的を政策最適化のためのプラグイン・アドバンテージ・シェーピング用語として統合する。
様々なモデルスケールで実験を行い、提案アルゴリズムの有効性を示し、様々なベンチマークでPass@1とPass@Kの双方において、強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-01T07:13:20Z) - Achieving Equilibrium under Utility Heterogeneity: An Agent-Attention Framework for Multi-Agent Multi-Objective Reinforcement Learning [30.138706163658597]
本稿では,エージェント型マルチエージェント多目的強化学習(AA-MAMORL)フレームワークを提案する。
我々のアプローチは、訓練中に、他のエージェントのユーティリティ機能と関連するポリシーに対する共同信条を暗黙的に学習する。
実行中、各エージェントは、BNEを近似するために、ローカル観測とプライベートユーティリティ機能に基づいて、独立してアクションを選択する。
論文 参考訳(メタデータ) (2025-11-12T03:06:21Z) - Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z) - Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment [1.8552770604791606]
相補的な報酬パラダイムを統合するハイブリッド報酬モデリングフレームワークを提案する。
ハイブリッドおよびマルチアスペクト報酬モデルを適用する際に、異なるマルチモーダルベンチマーク間で一貫した改善を示す。
3Bファミリーで最高のパフォーマンスモデルでは、一般および数学の推論タスクで平均9.5%の改善を実現しています。
論文 参考訳(メタデータ) (2025-10-06T18:53:23Z) - Recursive Reward Aggregation [60.51668865089082]
本稿では,報酬関数の変更を不要としたフレキシブルな行動アライメントのための代替手法を提案する。
マルコフ決定過程(MDP)の代数的視点を導入することにより、ベルマン方程式が報酬の生成と集約から自然に現れることを示す。
我々のアプローチは決定論的および決定論的設定の両方に適用され、価値に基づくアルゴリズムとアクター批判的アルゴリズムとシームレスに統合される。
論文 参考訳(メタデータ) (2025-07-11T12:37:20Z) - Collab: Controlled Decoding using Mixture of Agents for LLM Alignment [90.6117569025754]
人間のフィードバックからの強化学習は、大規模言語モデルを整合させる効果的な手法として現れてきた。
制御された復号化は、再訓練せずに推論時にモデルを整列するメカニズムを提供する。
本稿では,既存の既成のLCMポリシを活用するエージェントベースのデコーディング戦略の混合を提案する。
論文 参考訳(メタデータ) (2025-03-27T17:34:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。