論文の概要: Combining On-Policy Optimization and Distillation for Long-Context Reasoning in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.12227v1
- Date: Tue, 12 May 2026 15:04:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.94508
- Title: Combining On-Policy Optimization and Distillation for Long-Context Reasoning in Large Language Models
- Title(参考訳): 大規模言語モデルにおけるオンライン最適化と長期推論のための蒸留の組み合わせ
- Authors: Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins,
- Abstract要約: 長文推論のためのDGRPO(Distilled Group Relative Policy Optimization)を提案する。
また、マルチホップ推論、コンテキストグラウンド、長文生成にまたがる合成長文データセットであるLongBlocksについても紹介する。
結果から, 結果に基づく政策最適化と知識蒸留を一つの目的に組み合わせることで, より安定かつ効果的に長文推論を行うことができることがわかった。
- 参考スコア(独自算出の注目度): 21.053554352318738
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting large language models (LLMs) to long-context tasks requires post-training methods that remain accurate and coherent over thousands of tokens. Existing approaches are limited in several ways: 1) off-policy methods such as supervised fine-tuning (SFT) and knowledge distillation (KD) suffer from exposure bias and limited recovery from model-generated errors over long horizons; 2) on-policy reinforcement learning methods such as Group Relative Policy Optimization (GRPO) better align training with model-generated states, but are unstable and sample-inefficient due to sparse rewards; 3) on-policy distillation (OPD) provides dense token-level guidance, but does not directly optimize arbitrary reward signals. In this paper, we propose Distilled Group Relative Policy Optimization (dGRPO), a method for long-context reasoning that augments GRPO with dense guidance from a stronger teacher via OPD. We also introduce LongBlocks, a synthetic long-context dataset spanning multi-hop reasoning, contextual grounding, and long-form generation. We conduct extensive experiments and ablations comparing off-policy training, sparse-reward GRPO, and our combined approach, leading to an improved recipe for long-context alignment. Overall, our results show that combining outcome-based policy optimization with knowledge distillation in a single objective provides a more stable and effective path to long-context reasoning, while preserving short-context capabilities.
- Abstract(参考訳): 大きな言語モデル(LLM)を長いコンテキストタスクに適用するには、何千ものトークンに対して正確で一貫性のあるトレーニング後メソッドが必要である。
既存のアプローチにはいくつかの制限がある。
1 監督微調整(SFT)及び知識蒸留(KD)のような非政治手法は、露光バイアス及び長期地平線上のモデル生成誤差からの限られた回復に苦しむ。
2 グループ相対的政策最適化(GRPO)等のオンライン強化学習手法は、モデル生成状態との整合性を向上するが、スパース報酬により不安定でサンプル非効率である。
3) オンライン蒸留(OPD)は高濃度のトークンレベルの誘導を提供するが, 任意の報酬信号を直接最適化するものではない。
本稿では,より強い教師の OPD による指導でGRPO を増強する長文推論手法であるDistilled Group Relative Policy Optimization (dGRPO) を提案する。
また、マルチホップ推論、コンテキストグラウンド、長文生成にまたがる合成長文データセットであるLongBlocksについても紹介する。
我々は、政治外のトレーニング、スパース・リワードGRPO、および我々の組み合わせによるアプローチを比較し、広範囲にわたる実験と改善を行い、長文アライメントのレシピの改善に繋がった。
以上の結果から, 結果に基づく政策最適化と知識蒸留を一つの目的に組み合わせることで, より安定的で効果的な長文推論の道筋が得られ, 短文処理能力の維持が期待できることがわかった。
関連論文リスト
- OPSDL: On-Policy Self-Distillation for Long-Context Language Models [3.2617036218058413]
OPSDL (On-Policy Self-Distillation) は、大規模言語モデルの長文能力を高めるためのオンライン自己蒸留法である。
OPSDLを7Bから32Bパラメータの長文ベンチマークで評価した。
論文 参考訳(メタデータ) (2026-04-19T16:53:56Z) - PolicyLong: Towards On-Policy Context Extension [23.33185151859789]
本稿では,データ構築を動的なオン・ポリティクスパラダイムにシフトするポリシLongを提案する。
データスクリーニングを反復的に再実行することで、PolicyLongは、進化する能力のトレーニングディストリビューショントラックを保証する。
PolicyLong は EntropyLong と NExtLong を一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-09T05:07:57Z) - ExO-PPO: an Extended Off-policy Proximal Policy Optimization Algorithm [2.6813717321945103]
より効率的な非政治データ利用による保守的オン・ポリティクス反復の安定性保証に基づく新しいPPO変種を提案する。
PPOと他の最先端の変種と比較して、バランスの取れたサンプル効率と各種タスクの安定性により、ExO-PPOの性能が向上することを示した。
論文 参考訳(メタデータ) (2026-02-10T12:29:57Z) - Coverage Improvement and Fast Convergence of On-policy Preference Learning [67.36750525893514]
言語モデルアライメントのためのオンラインのオンラインプライオリティ学習アルゴリズムは、オフラインのアルゴリズムよりも大幅に優れている。
我々は,サンプリング政策の包括的範囲が政治訓練を通じてどのように進展するかを分析する。
一般機能クラス設定における報奨蒸留のための原則的オンライン方式を開発した。
論文 参考訳(メタデータ) (2026-01-13T10:46:06Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - Polychromic Objectives for Reinforcement Learning [63.37185057794815]
強化学習微調整(Reinforcement Learning fine-tuning, RLFT)は、下流タスクの事前訓練されたポリシーを改善するための主要なパラダイムである。
多様な世代の探索・改良を明示的に実施する政策手法の目的について紹介する。
この目的を最適化するために、PPO(Pximal Policy Optimization)をどのように適用できるかを示す。
論文 参考訳(メタデータ) (2025-09-29T19:32:11Z) - Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization [56.97588709890706]
LongMab-POは、長文モデリングタスクのための高品質で多様な応答を生成する新しいフレームワークである。
実験の結果,LongMab-POは嗜好データペアの多様性と品質を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-19T16:33:55Z) - VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization [59.39976343879587]
VerIPOは、深く長期的な推論チェーンを生成するためのビデオLLMの能力を徐々に改善することを目指している。
トレーニングループはGRPOの拡張検索とDPOのターゲット最適化の恩恵を受けている。
我々の訓練されたモデルは、大規模命令調整ビデオ-LLMの直接推定を超えている。
論文 参考訳(メタデータ) (2025-05-25T06:41:28Z) - Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach [2.8626097661711394]
ヒューマンフィードバックからの強化学習は、ステアリングモデルにおいて顕著な成功を収めてきたが、複雑で不安定である可能性がある。
直接選好最適化(DPO)のような最近のアプローチは、好みに基づく微調整を単純化するが、バイアスや特定の目的のトレードオフをもたらす可能性がある。
安全かつ整合性のある言語生成を実現するために,多ラベル報酬回帰モデルを用いたグループ相対政策最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-26T05:50:33Z) - LongReward: Improving Long-context Large Language Models with AI Feedback [54.3321542678909]
LongRewardは、4次元の長文モデル応答に対して報酬を与える新しい方法である。
実験の結果,LongRewardはモデル長文性能を大幅に向上するだけでなく,短い命令に従う能力も向上することがわかった。
論文 参考訳(メタデータ) (2024-10-28T17:50:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。