論文の概要: SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts
- arxiv url: http://arxiv.org/abs/2608.04962v1
- Date: Wed, 05 Aug 2026 15:32:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.978422
- Title: SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts
- Title(参考訳): SpecRoll: 投機的強化学習ロールアウトのための高速な検証-フィードバック適応
- Authors: Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui,
- Abstract要約: ターゲットモデルのサンプリング分布を2つの時間スケールで調整しながら保存する投機ロールアウトエンジンであるSpecRollを紹介する。
一方、Reflexモジュールは遅延検証フィードバックを使用して、軌道上局所的な隠れ状態修正を行う。
1.5Bから14Bまでの5つのモデル、SpecRoll 1.26-2.15xの世代スピードアップと1.21-2.04xのエンド・ツー・エンドスピードアップである。
- 参考スコア(独自算出の注目度): 3.729816445527413
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) post-training improves the reasoning capabilities of large language models, but autoregressive rollout generation remains a major efficiency bottleneck. Speculative decoding can accelerate generation, yet applying it during RL is difficult because the target policy continually evolves: static proposers become stale, while frequent drafter updates add substantial overhead. We introduce SpecRoll, a speculative rollout engine that preserves the target model's sampling distribution while adapting at two timescales. Lightweight future-token heads generate parallel proposals, while our proposed Reflex module uses delayed verifier feedback to perform bounded, trajectory-local hidden-state corrections without backpropagation. A complementary slow path updates the head parameters only when sustained degradation is detected. SpecRoll combines these mechanisms with concurrency-aware sparse-tree verification and exact target verification, leaving the target rollout distribution and GRPO objective unchanged. Across five models ranging from 1.5B to 14B and three mathematical reasoning datasets, SpecRoll achieves 1.26-2.15x generation speedup and 1.21-2.04x end-to-end speedup over vanilla GRPO. It also outperforms FastGRPO in both generation and end-to-end time across all 15 matched settings, with an average pairwise end-to-end gain of 1.18x. Controlled ablations show that the fast and slow adaptation paths provide complementary benefits. Our source code is available at https://anonymous.4open.science/r/SpecRoll-26062006.
- Abstract(参考訳): 強化学習(RL)は、大規模言語モデルの推論能力を改善するが、自動回帰ロールアウト生成は依然として大きな効率ボトルネックである。
投機的復号化は生成を加速させるが、ターゲットポリシーが継続的に進化するので、RLでそれを適用するのは難しい。
ターゲットモデルのサンプリング分布を2つの時間スケールで調整しながら保存する投機ロールアウトエンジンであるSpecRollを紹介する。
提案するReflexモジュールは、遅延検証器フィードバックを用いて、バックプロパゲーションを伴わずに、有界かつ軌道局所な隠れ状態補正を行う。
相補的なスローパスは、持続的な劣化が検出された場合にのみヘッドパラメータを更新する。
SpecRollはこれらのメカニズムを並列性を考慮したスパースツリー検証と正確なターゲット検証と組み合わせ、ターゲットのロールアウト分布とGRPOの目的は変わらない。
1.5Bから14Bまでの5つのモデルと3つの数学的推論データセットで、SpecRollは1.26-2.15x生成のスピードアップと1.21-2.04xのエンドツーエンドのスピードアップをバニラGRPO上で達成している。
また、FastGRPOは15のマッチした設定すべてで、世代とエンドツーエンドの両方でパフォーマンスが良く、平均的なペアツーエンドのゲインは1.18倍である。
制御された改善は、高速で遅い適応経路が相補的な利点をもたらすことを示している。
ソースコードはhttps://anonymous.4open.science/r/SpecRoll-26062006で公開されています。
関連論文リスト
- EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts [20.460789503141466]
本稿では、RLロールアウトにおけるこのギャップに対処するために設計されたシステム対応セルフSDフレームワークであるEfficientRolloutを紹介する。
EfficientRolloutは、ARロールアウトベースラインを高速化することで、ロールアウトとエンドツーエンドのレイテンシをそれぞれ19.6%、12.7%削減する。
論文 参考訳(メタデータ) (2026-06-17T11:51:06Z) - Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding [8.43502622452414]
RLロールアウトにおけるアクセラレーションプリミティブとしての投機的復号化について検討する。
VLLMバックエンドでNeMo-RLの投機的復号化を実装した。
投機的デコーディングと非同期RLを組み合わせることで,最大2.5倍のエンドツーエンドのトレーニングスピードアップを235Bスケールで達成する。
論文 参考訳(メタデータ) (2026-04-29T15:11:48Z) - When RL Meets Adaptive Speculative Training: A Unified Training-Serving System [71.98182665273575]
Auroraは、生の推論トレースから直接投機子を直接学習することでループを閉じる統一的なトレーニングサービスシステムである。
我々の設計では,SGLangベースの推論サーバを非同期トレーニングサーバと統合し,サービス中断なしにホットスワップされた投機装置の更新を可能にする。
論文 参考訳(メタデータ) (2026-02-06T18:28:54Z) - Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter [52.111923076688505]
強力な推論能力を持つ大規模言語モデル(LLM)のトレーニングは、複雑な問題解決において新たなフロンティアを解放する重要なマイルストーンとなる。
本稿では,適応的投機的復号化を組み込むことで,RL学習の無作為に推論を高速化するシステムであるTLTを提案する。
論文 参考訳(メタデータ) (2025-11-20T18:59:25Z) - Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。
数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文 参考訳(メタデータ) (2025-11-17T19:02:12Z) - Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model [98.35868970993232]
拡散言語モデル(DLM)は、支配的な自己回帰パラダイムに代わる強力で有望な選択肢として現れています。
コード生成における推論速度と出力品質の向上を実現するために,適応加速度を用いた効率的なサンプリングとバックトラック強化リマッシング(セイバー)を導入する。
論文 参考訳(メタデータ) (2025-10-20T23:38:12Z) - Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference [11.957170239588535]
投機的復号化は、ドラフトモデルを使用して推測を加速する。
事前の方法は、ドラフトコストを部分的に削減するが、受け入れを低下させるか、スケーリングを制限するオーバーヘッドを導入する。
本稿では,遅延受容トレードオフを破る推論アルゴリズムであるMirror Speculative Decoding(Mirror-SD)を提案する。
論文 参考訳(メタデータ) (2025-10-15T05:22:57Z) - Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning [45.51804571136028]
強化学習(RL)は、大規模言語モデル(LLM)における推論の強化の中心となっている。
Slow-Fast Policy Optimization (SFPO)は,各ステップを3段階に分解することで,これらの制限に対処する,シンプルかつ効率的なフレームワークである。
SFPOは安定性を継続的に改善し、ロールアウトを低減し、推論RLトレーニングの収束を加速する。
論文 参考訳(メタデータ) (2025-10-05T07:22:54Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - FastLR: Non-Autoregressive Lipreading Model with Integrate-and-Fire [74.04394069262108]
我々は,全てのターゲットトークンを同時に生成する非自己回帰(NAR)リップリーダーモデルであるFastLRを提案する。
FastLRは最先端のリップリーダーモデルと比較して10.97$times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2020-08-06T08:28:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。