論文の概要: Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.04470v1
- Date: Sun, 05 Jul 2026 19:29:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.944666
- Title: Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning
- Title(参考訳): LLM強化多エージェント強化学習のレギュム・コンディション安定化
- Abstract要約: LLMLにおける報酬重み付けの動的更新は,確率ベース形状の定常性の仮定に反することを示す。
本研究では, トレーニングフェーズ内で厳密な定常性を実現する相ベース凍結スケジュールと, エポゾン移動平均(EMA)の2つの安定化戦略を提案する。
- 参考スコア(独自算出の注目度): 1.889930012459364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) offer a natural interface for translating human objectives into reward signals for cooperative multi-agent reinforcement learning (MARL), yet the training-time dynamics of this integration remain poorly understood. We show that dynamically updating LLM-generated reward weights during off-policy MARL violates the stationarity assumption of Potential-Based Reward Shaping (PBRS) and contaminates the experience replay buffer, whose stored transitions carry reward labels computed under stale shaping weights. We characterise the result as a regime-dependent failure whose severity depends on how competent the unshaped baseline already is. To control it we propose two stabilisation strategies: a Phase-Based Freeze Schedule that enforces strict stationarity within training phases, and Exponential Moving Average (EMA) smoothing that bounds per-episode weight drift. We evaluate across three cooperative environments and five random seeds with QMIX, complemented by an exploratory VDN extension, yielding a three-regime taxonomy. In the augmentative regime (Simple Spread), where the baseline is functional (74.4 %), EMA significantly improves success to 86.7 % ($+12.3$ pp, $p<0.01$) while naive dynamic updates collapse it to 15.2 %. In the essential regime (Level-Based Foraging), where the baseline is broken (0.1 %), any shaping unlocks the task (95.9 % under EMA). In the supplementary regime (SMAC 3m), where the baseline is near-saturated (98.8 %), stabilised shaping preserves performance (99.9 %) while unstabilised shaping adds variance without gain. These findings establish reward-signal stationarity as a necessary design constraint and indicate that regime placement is a practical predictor of whether dynamic LLM shaping helps or harms.
- Abstract(参考訳): 大規模言語モデル(LLM)は、人間の目的を協調的マルチエージェント強化学習(MARL)のための報酬信号に翻訳するための自然なインタフェースを提供するが、この統合の訓練時間ダイナミクスは理解されていない。
本研究では, オフポリティクスMARLにおけるLCM生成報酬重みを動的に更新すると, PBRSの定常性仮定に反し, 記憶された遷移がスタルシェーピング重みで計算された報酬ラベルを格納する経験再生バッファを汚染することを示す。
我々は、その結果を、未形のベースラインがすでにどの程度の能力を持つかによって、深刻度が依存する状態依存の失敗として特徴づける。
そこで本研究では, トレーニングフェーズ内で厳密な定常性を強制する相ベース凍結スケジュールと, エポジュアル移動平均(EMA)の2つの安定化戦略を提案する。
我々は3つの協調環境と5つのランダムシードをQMIXで評価し、探索的なVDN拡張を補完し、3つの分類基準を得た。
ベースラインが機能する拡張型(Simple Spread)では(74.4 %)、EMAは86.7%(+12.3$ pp, $p<0.01$)に改善し、動的な更新は15.2 %に崩壊する。
ベースラインが壊れた(0.1%)必要条件(Level-Based Foraging)では、任意のシェイピングがタスクをアンロックする(EMAでは95.9%)。
ベースラインがほぼ飽和状態(98.8%)である補足型(SMAC 3m)では、安定化型整形は性能(99.9%)を維持し、不安定型整形は利得のない分散をもたらす。
これらの知見は、設計制約として報酬信号の定常性を確立し、レギュレーション配置が動的LLM整形が有用であるか否かの実用的な予測因子であることを示す。
関連論文リスト
- Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation [30.510566982907438]
M-OPD(Multi-Teacher on-policy distillation)は、ドメイン特化強化学習の専門家を、密集したトークンレベルの報酬管理を通じて、単一のジェネラリストの学生に統一するための、有望なパラダイムとして登場した。
実際の成功にもかかわらず、マルチ教師機能統合を管理する最適化のダイナミクスはいまだに理解されていない。
トークン共有バランス、ギャップ対応動的予算配分、学生報酬更新を取り入れた原則的フレームワークであるOpen-MOPDを紹介する。
論文 参考訳(メタデータ) (2026-08-19T16:50:39Z) - TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs [83.78708832901194]
大規模ビデオ言語モデル(LVLM)は、野生のマルチモーダル感情認識(ER)のようなマルチモーダルタスクにおいて顕著なパフォーマンスを示している。
しかし、現実のデプロイメントは依然として困難であり、テスト時にモダリティが欠落したりうる。
凍結した教師が自己蒸留により適応的な低学級の生徒を指導する手法を提案する。
MELD, DFEW, BAHを0%-50%のモダリティで実験した結果, この統一型適応復元設計はエントロピーベースの適応, RAG, およびパープレキシティベースの生成より一貫して優れていた。
論文 参考訳(メタデータ) (2026-08-18T23:40:28Z) - TRIDENT: Breaking the Hybrid-Safety-Physics Coupling for Provably Safe Multi-Agent Reinforcement Learning [26.128298844361183]
3つの特徴が有向バイアスのサイクルを形成し、既製のモジュールの素な構成を損なうことを示す。
3つのコンポーネントを共同設計して各リークをキャンセルする,最初のMARLフレームワークであるTRIDENTを紹介する。
マルチUAVモバイルエッジコンピューティング、自律交叉管理、ハイブリッドSMACでは、TRIDENTはトレーニング時間違反をMADDPGで95.5%、MACPOで76.3%削減している。
論文 参考訳(メタデータ) (2026-06-16T07:41:43Z) - Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy [27.237699512463475]
強化学習は予測不可能なサブ最適パフォーマンスやトレーニング崩壊に悩まされることが多い。
適切な学習信号が与えられた場合,学習方針は,その相違点を積極的に自己修正できることがわかった。
本稿では,この問題をDCMDP(Disdisrepancy-Constrained Markov Decision Process)として定式化する。
論文 参考訳(メタデータ) (2026-06-07T18:49:33Z) - AIS: Adaptive Importance Sampling for Quantized RL [21.387834718338496]
大規模言語モデル(LLM)の強化学習はロールアウト生成のコストに支配されている。
これは、ロールアウトトレーニングミスマッチを導入し、ポリシー勾配を偏り、推論ベンチマークでトレーニングが完全に崩壊する可能性がある。
このミスマッチは非定常的であり、二重刃の剣として機能し、初期のトレーニングでは探索ボーナスを提供し、トレーナーがアンダーサンプするトラジェクトリーへの勾配を露呈する。
本稿では,適応的重要度サンプリング(AIS)を提案する。
論文 参考訳(メタデータ) (2026-05-13T03:36:57Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training [18.849117699859622]
訓練安定性は、大規模言語モデルの強化学習における中心的な課題である。
変動周波数レベルのソフトポリシー最適化(VESPO)を提案する。
数学的推論ベンチマークの実験では、VESPOは安定なトレーニングを64倍の安定度と完全な非同期実行で維持している。
論文 参考訳(メタデータ) (2026-02-11T09:48:08Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Soft Adaptive Policy Optimization [67.61886077470528]
強化学習は、大規模言語モデルの推論能力を高める上で、ますます重要な役割を担っている。
GSPOやGRPOのような既存のグループベースのポリシー最適化手法は、ハードクリッピングによってこの問題を軽減する。
ハードクリッピングをスムーズな温度制御ゲートに置き換えるソフト適応ポリシー最適化(SAPO)を提案する。
論文 参考訳(メタデータ) (2025-11-25T14:25:19Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。