論文の概要: LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
- arxiv url: http://arxiv.org/abs/2610.06647v2
- Date: Tue, 06 Oct 2026 21:08:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.481094
- Title: LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
- Title(参考訳): LoGRA: 低ランクなグラディエントスケッチによるLLM強化学習のスケールアップ
- Abstract要約: LoGRAはRLポストトレーニングのアプローチであり、低ランク勾配スケッチで有用な学習信号を保持することでメモリを削減している。
LoGRAは、パフォーマンスを損なうことなく推論タスクの平均トレーニングメモリ使用量を最大45.7%削減する。
- 参考スコア(独自算出の注目度): 56.66032629722664
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning has greatly advanced the capabilities of large language models, but its memory demands remain a barrier to broader adoption. We introduce LoGRA, an approach to RL post-training that reduces memory by retaining useful learning signals in low-rank gradient sketches. These compact representations support both model updates and efficient policy synchronization. To prevent overly large updates from disrupting learning, we complement gradient compression with predicted-KL step control, which estimates policy changes before applying each update and adjusts its magnitude accordingly. With all techniques combined, LoGRA reduces average training memory usage by up to 45.7% across reasoning tasks without compromising performance. It also enables stable training of a 27B-parameter model for over 1,100 steps on a single eight-GPU node, where dense Adam runs out of memory, making previously memory-infeasible RL training practical. Code is available in the \href{https://github.com/skzhang1/labs-molt/tree/logra/examples/scripts/logra}{Molt library}.
- Abstract(参考訳): 強化学習は、大規模言語モデルの能力を大幅に向上させたが、そのメモリ要求は、広く採用するための障壁であり続けている。
低ランク勾配スケッチにおいて有用な学習信号を保持することで、メモリを削減できるRLポストトレーニングのアプローチであるLoGRAを導入する。
これらのコンパクト表現は、モデル更新と効率的なポリシー同期の両方をサポートする。
過度に大規模な更新が学習を損なうのを防ぐため、予測KLステップ制御による勾配圧縮を補完し、各更新を適用する前にポリシー変更を推定し、それに応じてその大きさを調整する。
すべてのテクニックを組み合わせることで、LoGRAはパフォーマンスを損なうことなく推論タスクの平均トレーニングメモリ使用量を最大45.7%削減する。
また、1つの8GPUノード上で1,100ステップ以上の27Bパラメータモデルの安定的なトレーニングも可能で、Adamがメモリを使い果たし、それまでのメモリ不使用のRLトレーニングを実用的なものにしている。
コードは \href{https://github.com/skzhang1/labs-molt/tree/logra/examples/scripts/logra}{Molt library} で公開されている。
関連論文リスト
- APOLLO: SGD-like Memory, AdamW-level Performance [61.53444035835778]
大規模言語モデル(LLM)は、トレーニング中にメモリ集約的であることで知られている。
メモリ使用量を減らすために、様々なメモリ効率のScalが提案されている。
i)コストのかかるSVDオペレーション、(ii)AdamWと比較して大きなパフォーマンストレードオフ、(iii)競争性能を維持する上でのメモリオーバーヘッド、などです。
論文 参考訳(メタデータ) (2024-12-06T18:55:34Z) - BlockLLM: Memory-Efficient Adaptation of LLMs by Selecting and Optimizing the Right Coordinate Blocks [19.007090250576585]
BlockLLMはブロック座標降下にインスパイアされたアプローチである。
微調整と事前訓練の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-06-25T05:45:12Z) - VeLoRA: Memory Efficient Training using Rank-1 Sub-Token Projections [35.133698935322634]
大規模言語モデル(LLM)は、最近、多くの言語処理タスクに対処するための強力なツールとして登場した。
勾配勾配勾配を用いた効率的なモデル収束に必要な重要な成分を同定し,特徴付ける。
この結果から, 微調整と事前学習の両方のための, 安価かつメモリ効率のよいアルゴリズムが得られた。
論文 参考訳(メタデータ) (2024-05-28T09:23:14Z) - GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection [133.45193150403537]
LLM(Large Language Models)のトレーニングは、重み付けやGPU状態の増大によって、メモリ上の重大な問題が発生する。
本研究では,メモリ効率のトレーニング戦略としてグラディエント・ローランド・プロジェクション(GaLore)を提案する。
私たちの8ビットのGaLoreは、BF16ベースラインと比較して、メモリを82.5%、トレーニング総メモリを63.3%削減します。
論文 参考訳(メタデータ) (2024-03-06T07:29:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。