論文の概要: ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples
- arxiv url: http://arxiv.org/abs/2607.10481v1
- Date: Sat, 11 Jul 2026 21:22:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.440796
- Title: ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples
- Title(参考訳): ARMOR: オフポリティアンカーサンプルを使用したオンポリティLLM RLの安定化
- Authors: Kexin Huang, Junkang Wu, Jinda Lu, Shuo Yang, Chiyu Ma, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou,
- Abstract要約: 強化学習(RL)は,大規模言語モデル(LLM)の推論能力を大幅に向上させた。
本研究では,この不安定性の重要源である過最適化について検討する。
我々は,このパラダイムを受動的ペナルティからアクティブ標本安定化に移行するフレームワークARMORを提案する。
- 参考スコア(独自算出の注目度): 65.74946647574696
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has significantly enhanced the reasoning capabilities of large language models (LLMs), yet the training process remains notoriously fragile. In this work, we investigate a critical source of this instability: over-optimization, where models exploit training heuristics at the expense of generalizable reasoning. While reverse KL regularization is the standard defense against such degradation, our analysis reveals that it is often insufficient in this regime, as it fails to ensure comprehensive coverage of the reference distribution. To address this, we propose ARMOR (Anchor Rollout and Mixed Optimization for RL), a framework that shifts the paradigm from passive penalty to active sample stabilization. ARMOR comprises two key components: (1) Anchor Rollout, which leverages off-policy data from the reference policy to preserve established solution patterns; and (2) Mixed Optimization, which reformulates the policy objective to enable controlled exploration without relying on auxiliary losses. Extensive experiments on reasoning benchmarks validate that ARMOR effectively mitigates validation collapse, enabling sustained performance improvements over extended training horizons.
- Abstract(参考訳): 強化学習(RL)は、大規模言語モデル(LLM)の推論能力を大幅に向上させたが、トレーニングプロセスは脆弱なままである。
本研究では,モデルが一般化可能な推論を犠牲にして,トレーニングヒューリスティックスを活用する過最適化(over-optimization)という,この不安定性の重要源について検討する。
逆KL正則化は、そのような劣化に対する標準的な防御法であるが、我々の分析では、参照分布の包括的カバレッジを確保するのに失敗するため、この体制ではしばしば不十分であることが判明している。
そこで我々はARMOR(Anchor Rollout and Mixed Optimization for RL)を提案する。
ARMORは,(1)参照ポリシの外部データを活用して確立されたソリューションパターンを保存するアンカーロールアウト,(2)補助的損失に頼ることなく,制御された探索を可能にするための政策目標を再構築する混合最適化,の2つの重要なコンポーネントから構成される。
推論ベンチマークに関する大規模な実験は、ARMORがバリデーションの崩壊を効果的に軽減し、拡張されたトレーニング地平線よりも持続的なパフォーマンス改善を可能にすることを実証している。
関連論文リスト
- Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning [2.384534878752428]
校正された大言語モデルを強化学習訓練ループに統合するフレームワークである,不確実性を考慮した LLM-Guided Policy Shaping (ULPS) を提案する。
ULPS は A* ベースのオラクルを用いて最適な記号軌道を合成し、BERT ベースの言語モデルを微調整する。
成功率、報酬効率、サンプルの複雑さを、無誘導、非校正、標準のRLベースラインで一貫した改善を観察する。
論文 参考訳(メタデータ) (2026-06-04T19:46:45Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning [75.73135757250806]
エージェント強化学習(ARL)は、複雑で多段階の対話的なタスクを解決するためのトレーニングエージェントにとって有望なパラダイムとして急速に注目を集めている。
初期の成果を奨励しているにもかかわらず、ARLは非常に不安定であり、しばしばトレーニングの崩壊につながる。
本稿では,制御された再現可能な環境下でのトレーニング安定性を検証した,安定したトレーニングレシピと系統的分析フレームワークであるARLArenaを提案する。
論文 参考訳(メタデータ) (2026-02-25T03:43:34Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning [52.144281362465996]
本稿では,強化学習を長期シナリオに適用するためのEAPO(Evidence-Augmented Policy Optimization)を提案する。
最初にEvidence-Augmented Reasoningパラダイムを確立し、Tree-Structued Evidence Smplingを介して検証する。
次に、報酬モデルがグループ相対エビデンス・リワードを計算する特殊なRLアルゴリズムを導入する。
トレーニングを通して正確な監視を維持するため、適応的リワード・ポリティ共進化機構をさらに取り入れる。
論文 参考訳(メタデータ) (2026-01-15T11:40:57Z) - M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization [9.358876832727239]
自己教師付き強化学習(RL)は、大規模言語モデル(LLM)の推論能力を高めるための有望なアプローチを示す
従来の手法では,長期のトレーニングにおいて,パフォーマンスが急激に低下する「政治崩壊」という,致命的な障害モードに悩まされていることがわかった。
我々は、ゆっくりと進化する運動量モデルを利用して安定したトレーニングターゲットを提供するフレームワークであるM-GRPOを紹介する。
また,低エントロピートラジェクトリを動的に振る舞うIQR(Interquartile Range)に基づく適応フィルタリング手法を提案する。
論文 参考訳(メタデータ) (2025-12-15T08:07:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。