論文の概要: Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
- arxiv url: http://arxiv.org/abs/2604.11446v1
- Date: Mon, 13 Apr 2026 13:28:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.559463
- Title: Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
- Title(参考訳): LLM RLVR加速のための低ランク最適化軌道モデリング
- Authors: Zhipeng Chen, Tao Qian, Wayne Xin Zhao, Ji-Rong Wen,
- Abstract要約: 大規模言語モデル(LLM)に対する検証可能な報酬(RLVR)による強化学習のスケーリングが,効果的なトレーニングパラダイムとして登場した。
我々は低ランク軌跡のtextbfNonlinear textbfExtrapolation(textbfNExt)を提案する。
計算オーバーヘッドを約37.5%削減し,RLVRアルゴリズムやタスクとの互換性を維持した。
- 参考スコア(独自算出の注目度): 88.7332439088792
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, scaling reinforcement learning with verifiable rewards (RLVR) for large language models (LLMs) has emerged as an effective training paradigm for significantly improving model capabilities, which requires guiding the model to perform extensive exploration and learning, leading to substantial computational overhead and becoming a key challenge. To reduce the number of training steps, Prior work performs linear extrapolation of model parameters. However, the dynamics of model parameter updates during RLVR training remain insufficiently understood. To further investigate the evolution of LLMs during RLVR training, we conduct empirical experiments and find that the rank-1 subspace of the model does not evolve linearly, and its dominance over the original parameters is further amplified during LoRA training. Based on the above insights, we propose the \textbf{N}onlinear \textbf{Ext}rapolation of low-rank trajectories (\textbf{NExt}), a novel framework that models and extrapolates low-rank parameter trajectories in a nonlinear manner. Concretely, we first train the model using LoRA and extract the rank-1 subspace of parameter differences at multiple training steps, which is then used for the subsequent nonlinear extrapolation. Afterward, we utilized the extracted rank-1 subspace to train a predictor, which can model the trajectory of parameter updates during RLVR, and then perform the predict-extend process to extrapolate model parameters, achieving the acceleration of RLVR. To further study and understand NExt, we conduct comprehensive experiments that demonstrate the effectiveness and robustness of the method. Our method reduces computational overhead by approximately 37.5\% while remaining compatible with a wide range of RLVR algorithms and tasks. We release our code in https://github.com/RUCAIBox/NExt.
- Abstract(参考訳): 近年,大規模言語モデル(LLM)に対する検証可能な報酬(RLVR)による強化学習のスケーリングが,モデル機能を大幅に改善するための効果的なトレーニングパラダイムとして登場し,大規模な探索と学習を行うためのモデル指導が必要となり,計算オーバーヘッドが大幅に増加し,重要な課題となっている。
トレーニングステップの数を減らすため、事前作業はモデルパラメータの線形外挿を実行する。
しかし、RLVRトレーニングにおけるモデルパラメータ更新のダイナミクスは、まだ十分に理解されていない。
RLVRトレーニングにおけるLLMの進化を更に研究するため、実験実験を行い、モデルのランク-1部分空間が線形に進化しないこと、元のパラメータに対する支配がLoRAトレーニング中にさらに増幅されることを見出した。
以上の知見に基づいて,低ランクなトラジェクトリを非線形にモデル化・外挿する新しいフレームワークである低ランクなトラジェクトリ(\textbf{N}onlinear \textbf{Ext}rapolation)を提案する。
具体的には、まずLoRAを用いてモデルをトレーニングし、複数のトレーニングステップでパラメータ差のランク-1部分空間を抽出し、その後の非線形外挿に使用する。
その後、抽出したランク1部分空間を用いて予測器を訓練し、RLVR中のパラメータ更新の軌跡をモデル化し、RLVRの加速度を達成してモデルパラメータを外挿する予測処理を実行する。
NExtのさらなる研究と理解を目的として,本手法の有効性とロバスト性を示す包括的実験を行った。
提案手法は,RLVRアルゴリズムやタスクとの互換性を保ちながら,計算オーバーヘッドを約37.5\%削減する。
コードをhttps://github.com/RUCAIBox/NExtでリリースします。
関連論文リスト
- Not All Steps are Informative: On the Linearity of LLMs' RLVR Training [14.59942263367421]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)のポストトレーニングの中心的コンポーネントとなっている。
本研究では,将来のモデル状態が外挿による中間チェックポイントから予測可能かどうかを検討する。
Weight Extrapolationは標準RLトレーニングに匹敵する性能のモデルを生成すると同時に,計算量を大幅に削減することを示した。
論文 参考訳(メタデータ) (2026-01-08T03:06:18Z) - Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning [17.898277374771254]
本稿では,大規模基盤モデルにおける効率的なアンラーニングのための新しいフレームワークであるRecover-to-Forget(R2F)を紹介する。
R2FはローランクのLoRAアダプタ更新からフルモデル勾配方向を再構築する。
R2Fは、未学習のLLMにおいて、完全な再学習や内部パラメータへのアクセスを必要とせずに、スケーラブルで軽量な代替手段を提供する。
論文 参考訳(メタデータ) (2025-12-08T10:10:12Z) - The Path Not Taken: RLVR Provably Learns Off the Principals [85.41043469428365]
スパーシティはモデル条件の最適化バイアスの表面積であることを示す。
我々はこれらの力学を三ゲージ理論で機械的に説明する。
本稿では,RLVRの学習力学のパラメータレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-11-11T18:49:45Z) - On Predictability of Reinforcement Learning Dynamics for Large Language Models [20.320268628019047]
本研究は,大言語モデルにおけるRLによるパラメータ更新の2つの基本特性を同定する。
短期早期訓練ウィンドウを用いて最終パラメータ更新を補間するプラグインアクセラレーションフレームワークであるAlphaRLを提案する。
論文 参考訳(メタデータ) (2025-10-01T06:13:50Z) - Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? [66.61292196146016]
RLVR(Reinforcement Learning with Verifiable Rewards)は近年,大規模言語モデル(LLM)の推論性能の向上に成功している。
本研究はRLVRの現状を批判的に考察する。
現在のトレーニング設定では、根本的な新しい推論パターンが生まれていないことが分かりました。
論文 参考訳(メタデータ) (2025-04-18T17:59:56Z) - SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation [52.6922833948127]
本研究では,事前学習した拡散モデルにおけるパラメータの重要性について検討する。
本稿では,これらの非効率パラメータをフル活用するための新しいモデル微調整法を提案する。
本手法は,下流アプリケーションにおける事前学習モデルの生成能力を向上する。
論文 参考訳(メタデータ) (2024-09-10T16:44:47Z) - POAR: Efficient Policy Optimization via Online Abstract State
Representation Learning [6.171331561029968]
状態表現学習(SRL)は,複雑な感覚データからタスク関連特徴を低次元状態に符号化する。
我々は、SRLの解釈を改善するために、専門家のデモンストレーションを活用するために、ドメイン類似と呼ばれる新しいSRLを導入する。
我々はPOARを実証的に検証し、高次元のタスクを効率的に処理し、スクラッチから直接実生活ロボットの訓練を容易にする。
論文 参考訳(メタデータ) (2021-09-17T16:52:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。