論文の概要: SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
- arxiv url: http://arxiv.org/abs/2609.08452v1
- Date: Tue, 08 Sep 2026 08:52:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.623334
- Title: SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
- Title(参考訳): SRPO:マルチエージェントLLMの整合的相対的ポリシー最適化
- Abstract要約: マルチエージェント大規模言語モデルは、共有環境で複数のポリシーを調整することで複雑なタスクを解決する。
既存の強化学習法は通常、複数の出力が1つの状態遷移を引き起こす場合であっても、それぞれの応答または軌道を個別に最適化する。
1つの遷移によって消費される出力の最小セットを1つのマルチエージェントアクションとして扱うSRPOを提案する。
- 参考スコア(独自算出の注目度): 16.941911451861277
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent large language models solve complex tasks by coordinating several policies in a shared environment. However, existing reinforcement learning methods usually optimize each response or trajectory separately, even when several outputs jointly cause one state transition. Consequently, the update unit differs from the action executed by the system. To address this problem, we propose SRPO (Setwise Relative Policy Optimization), which treats the active set the minimal set of outputs consumed by one transition, as one multi-agent action. Specifically, SRPO combines member log-ratios into one cardinality-normalized set ratio, assigns one relative advantage, and clips the set once. This formulation unifies division of labor and joint co-evolution as actions with different set sizes. Experiments on mathematical reasoning and multi-turn search demonstrate one training interface for fixed, mixed, and dynamically routed workflows across four model scales, with the strongest macro-average results among the reported comparisons. Optimization diagnostics further characterize its stability under different event reductions and set sizes.
- Abstract(参考訳): マルチエージェント大規模言語モデルは、共有環境で複数のポリシーを調整することで複雑なタスクを解決する。
しかし、既存の強化学習手法は通常、複数の出力が1つの状態遷移を引き起こす場合であっても、それぞれの応答または軌道を個別に最適化する。
これにより、更新部は、システムによって実行される動作と異なる。
この問題に対処するため,SRPO (Setwise Relative Policy Optimization) を提案する。
具体的には、SRPOはメンバーの対数比を1つの濃度正規化集合比に結合し、1つの相対的優位性を割り当て、セットを一度クリップする。
この定式化は、異なる大きさのアクションとして、労働と共同進化の分割を統一する。
数理推論とマルチターン探索の実験は、4つのモデルスケールにわたる固定、混合、動的ルーティングワークフローのための1つのトレーニングインターフェースを示し、報告された比較の中では最も高いマクロ平均結果を示した。
最適化診断は、異なるイベントリダクションとセットサイズの下での安定性をさらに特徴付ける。
関連論文リスト
- Contextual Plackett-Luce: An Efficient Neural Model for Probabilistic Sequence Selection under Ambiguity [4.162695034027842]
コンテキストプラケット・リュック(Contextual Plackett-Luce)は、配列選択のための構造化確率モデルである。
完全自己回帰予測と並列シーケンス選択のハイブリッドと見なすことができる。
強い平行基線に比べて構造整合性を改善し、曖昧な監督を受ける。
論文 参考訳(メタデータ) (2026-05-09T18:52:53Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models [67.45032003041399]
本稿では,MLLMに対する敵例の転送可能性を高めるために,MPCAttack(Multi-Paradigm Collaborative Attack)フレームワークを提案する。
MPCOは異なるパラダイム表現の重要性を適応的にバランスさせ、グローバルな最適化を導く。
我々のソリューションは、オープンソースおよびクローズドソースMLLMに対する標的および未ターゲットの攻撃において、常に最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2026-03-05T06:01:26Z) - Workflow-R1: Group Sub-sequence Policy Optimization for Multi-turn Workflow Construction [25.928675237308074]
本稿では,ワークフロー構築を多ターン,自然言語に基づく逐次意思決定プロセスとして再構成するフレームワークであるグラデーション-R1を提案する。
GSsPOは、多ターンエージェントシーケンシャル意思決定タスクの幅広いクラスに一般化可能な構造対応RLアルゴリズムとして機能する。
論文 参考訳(メタデータ) (2026-02-01T12:44:59Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents [56.625878022978945]
自律的なエージェントとしての大規模言語モデル(LLM)は、複雑で長期にわたる問題の解決にますます取り組まれている。
直接優先度最適化(DPO)は、正確なクレジット代入には大きすぎる信号を提供するが、ステップレベルのDPOは、しばしば、複数のステップの振る舞いの値をキャプチャするには、筋が通らない。
階層的選好学習(HPL)は、複数の相乗的粒度における選好信号を活用することで、LLMエージェントを最適化する階層的フレームワークである。
論文 参考訳(メタデータ) (2025-09-26T08:43:39Z) - VFP: Variational Flow-Matching Policy for Multi-Modal Robot Manipulation [3.986404588605909]
可変フローマッチングポリシー(VFP)は、タスクレベルとトラジェクトリレベルの両方のマルチモーダリティをキャプチャするフローマッチングポリシーである。
VFPは、標準的なフローベースベースラインよりもタスク成功率を49%向上させる。
論文 参考訳(メタデータ) (2025-08-03T07:23:02Z) - Collab: Controlled Decoding using Mixture of Agents for LLM Alignment [90.6117569025754]
人間のフィードバックからの強化学習は、大規模言語モデルを整合させる効果的な手法として現れてきた。
制御された復号化は、再訓練せずに推論時にモデルを整列するメカニズムを提供する。
本稿では,既存の既成のLCMポリシを活用するエージェントベースのデコーディング戦略の混合を提案する。
論文 参考訳(メタデータ) (2025-03-27T17:34:25Z) - Low-Rank Agent-Specific Adaptation (LoRASA) for Multi-Agent Policy Learning [3.333453555166201]
マルチエージェント強化学習(MARL)は、効率的にスケールするために、エフェムパラメータ共有(PS)に依存することが多い。
我々は,各エージェントのポリシーを,共有バックボーンから微調整した特別タスクとして扱う新しいアプローチである textbfLow-Rank Agent-Specific Adaptation (LoRASA) を提案する。
我々は、StarCraft Multi-Agent Challenge (SMAC)やMulti-Agent MuJoCo (MAMuJoCo)といった挑戦的なベンチマークでLoRASAを評価する。
論文 参考訳(メタデータ) (2025-02-08T13:57:53Z) - CHASE: Learning Convex Hull Adaptive Shift for Skeleton-based Multi-Entity Action Recognition [10.045163723630159]
CHASEはサンプル適応正規化法として機能し、濃度間分布の相違を緩和する。
このアプローチはシングルエンタリティのバックボーンにシームレスに適応し、マルチエンタリティシナリオにおけるパフォーマンスを向上します。
論文 参考訳(メタデータ) (2024-10-09T17:55:43Z) - UCB-driven Utility Function Search for Multi-objective Reinforcement Learning [51.00436121587591]
マルチオブジェクト強化学習(MORL)エージェントでは、意思決定行動の最適化を行う。
重みベクトル w でパラメトリした線型効用関数の場合に焦点を当てる。
学習過程の異なる段階で最も有望な重みベクトルを効率的に探索する上信頼境界に基づく手法を提案する。
論文 参考訳(メタデータ) (2024-05-01T09:34:42Z) - Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional
Reasoning Approach [10.904610735933145]
マルチエージェントポリシー勾配(MAPG)法は、一般的にそのようなポリシーを学ぶために用いられる。
大きな状態とアクション空間を持つ複雑な問題では、より高レベルなアクションを使用するために MAPG メソッドを拡張するのが有利である。
この問題に対処する新しい条件付き推論手法を提案する。
論文 参考訳(メタデータ) (2022-03-29T22:02:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。