論文の概要: Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
- arxiv url: http://arxiv.org/abs/2607.25091v1
- Date: Mon, 27 Jul 2026 21:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.625356
- Title: Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
- Title(参考訳): 小規模言語モデルエージェントのロバスト強化学習に向けて
- Abstract要約: 本稿では,PPO(Proximal Policy Optimization)を用いて15の(モデル,コーパス)構成を訓練した。
実験にはPythia-70M, 160M, 410M, SmolLM2-135M, 360M on the TinyStories, CNN/DailyMail, Wiki-text103 corporaが含まれていた。
提案システムは,全ての実験において安定的に収束し,流動的な先行信号と情報的な報奨信号を持つ構成において,SFTベースラインに対する優先利得率を改善した。
- 参考スコア(独自算出の注目度): 5.301609879131692
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The alignment of Small Language Models (SLMs) in the 70--500M parameter range using reinforcement learning is often considered unstable, though the underlying failure mechanisms have not been systematically investigated. In the State-of-the-Art (SOTA) research, fifteen (model, corpus) configurations were trained using Proximal Policy Optimization (PPO). The experiments included Pythia-70M, 160M, 410M and SmolLM2-135M, 360M on the TinyStories, CNN/DailyMail, and Wikitext-103 corpora. Three reproducible failure modes were identified in small-scale language models: silent LoRA parameter freezing in standard PEFT/TRL pipelines, numerical overflow in importance ratios when using bfloat16, and catastrophic policy collapse due to reward-model error. These issues were addressed using a merge-and-reinitialize adapter technique, float32 precision during PPO updates, and a three-layer safety mechanism comprising reward whitening, importance-ratio guarding, and weight rollback. In this paper, a capacity-headroom hypothesis is proposed, which states that PPO performance at the SLM scale depends on both a fluent supervised model ($\text{PPL}<20$) and a discriminative reward signal, rather than on the number of model parameters. The proposed system converged stably in all experiments and improved preference win rate over the SFT baseline in configurations with a fluent prior and an informative reward signal. Furthermore, it outperformed instruction-tuned baselines while requiring significantly less training data. All checkpoints, preference datasets, and training scripts are publicly released$^§$.
- Abstract(参考訳): 強化学習を用いた70-500Mパラメータ範囲における小言語モデル(SLM)のアライメントは不安定であると考えられることが多いが,その基盤となる障害機構は体系的に検討されていない。
The State-of-the-Art (SOTA) Researchでは、15の(モデル、コーパス)構成をPPO(Proximal Policy Optimization)を用いてトレーニングした。
実験にはPythia-70M, 160M, 410M, SmolLM2-135M, 360M on the TinyStories, CNN/DailyMail, Wikitext-103 corporaが含まれていた。
3つの再現可能な障害モードが, 標準PEFT/TRLパイプラインにおけるサイレントロラパラメータの凍結, bfloat16を用いた場合の数値オーバーフロー, 報酬モデル誤差による破滅的政策崩壊の3つの言語モデルで同定された。
これらの問題は、マージ・アンド・リニカライズアダプタ技術、PPO更新時のfloat32精度、報酬白化、重要度保護、重量ロールバックを含む3層安全機構を用いて対処された。
本稿では,SLMスケールでのPPO性能は,モデルパラメータの数ではなく,流用型教師付きモデル($\text{PPL}<20$)と識別型報酬信号の両方に依存する,というキャパシティ・ヘッドルーム仮説を提案する。
提案システムは,全ての実験において安定的に収束し,流動的な先行信号と情報的な報奨信号を持つ構成において,SFTベースラインに対する優先利得率を改善した。
さらに、トレーニングデータを大幅に削減しながら、命令調整されたベースラインよりも優れていた。
すべてのチェックポイント、好みのデータセット、トレーニングスクリプトが公開され、$^*$になる。
関連論文リスト
- Calibrating Small Language Models for Claim Check-Worthiness Detection [7.856998585396422]
NN-PPIは予測パワー推論のポイントワイド拡張であり、推論時にモデル予測を軽量なポストホック層として校正する。
NN-PPIはベースラインモデルのサイズと性能に応じて12%から33.80%の重み付けF1ゲインを達成する。
論文 参考訳(メタデータ) (2026-08-31T13:04:57Z) - LLM-Metrics: Measuring Research Impact Through Large Language Model Memory [0.09685837672183746]
大規模言語モデル(LLM)のパラメトリックメモリから導出した研究・インパクト評価指標であるLLM-Metricsを提案する。
2023-2024年に発行された549のコンピュータサイエンス論文を,6つのベンダーから0.5Bから72Bのパラメータにまたがる17のLLMで評価した。
17モデルのうち15モデルが肯定的な予測を行い、そのうち9モデルが0.05未満のpで有意であり、rho = 0.1495 と p = 0.0004 のスピアマンの総合的な相関は引用数に対して有意であった。
論文 参考訳(メタデータ) (2026-05-21T08:45:57Z) - SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training [5.341188930460575]
現在の混合精度トレーニングアプローチは、すべてのGEMM操作に均一な精度を適用するか、トレーニング中に一般化に失敗する手法に依存するかのどちらかである。
本稿では,サブバイト精度をサポートするLSMプレトレーニングのための微粒化適応型混合精度学習フレームワークSNIPを紹介する。
1B, 3B, 7B, 70B Llamaのようなモデルに対する実験は、SNIPが既存のベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-02-01T19:34:27Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - AWM: Accurate Weight-Matrix Fingerprint for Large Language Models [44.93519442566325]
重み行列に基づくトレーニング不要な指紋認証手法を提案する。
線形アサインメント問題(LAP)と不偏中心カーネルアライメント(CKA)の類似性を利用してパラメータ操作の効果を中和する。
本手法は, 上記の6項目すべてに対して, 偽陽性のほぼゼロのリスクを示しながら, 例外的な堅牢性を示す。
論文 参考訳(メタデータ) (2025-10-08T07:51:11Z) - Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models [15.218318229687242]
大規模言語モデルにおける極端なアクティベーションアウトレイアは量子化性能を著しく低下させる。
生成を積極的に防止する実用的なガイドラインであるOutlier-Safe Pre-Training (OSP)を紹介した。
我々の研究は、アウトリーチはLLMに固有のものではなく、トレーニング戦略の結果であることを示した。
論文 参考訳(メタデータ) (2025-06-24T15:03:57Z) - Pangu Light: Weight Re-Initialization for Pruning and Accelerating LLMs [79.7618807098457]
大きな言語モデル(LLM)は多くのタスクにまたがって最先端の機能を提供しますが、その巨大なサイズと推論コストは、実用的なデプロイメントに重大な計算上の課題をもたらします。
本稿は,このような積極的関節切断を実現させる上で重要な,しばしば見落とされがちな側面として,残った重量の戦略的再初期化と調整があげられることを論じる。
構造化プルーニングを中心としたLCM加速のためのフレームワークであるPangu Lightと、新しい重量再初期化技術を紹介する。
論文 参考訳(メタデータ) (2025-05-26T15:57:08Z) - Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training [68.94373533768501]
我々は、知識保持をモデル化し、そのコーパスから事実情報を記憶するための事前学習言語モデルの能力を示し、学習前にそれを推定する原則的手法を導入する。
本稿では,知識周波数,知識特異度,モデルサイズを統合し,クローズドブック質問応答(QA)の精度を予測する情報理論予測器である,サイズ依存型相互情報(SMI)を提案する。
論文 参考訳(メタデータ) (2025-02-06T13:23:53Z) - ProFL: Performative Robust Optimal Federated Learning [20.54517189040872]
変形予測(Performative prediction)は、機械学習モデルのトレーニング中に発生する凸分布シフトである。
本稿では,フェデレート学習における性能最適点を抽出するPerformative Learningアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-23T17:57:14Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - Uncertainty-aware Parameter-Efficient Self-training for Semi-supervised
Language Understanding [38.11411155621616]
我々は,主に半教師あり学習の手法として,自己学習について研究している。
我々は,新しい不確かさを意識した自己学習フレームワークであるUPETを紹介する。
UPETは性能と効率の面で大幅に向上したことを示す。
論文 参考訳(メタデータ) (2023-10-19T02:18:29Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z) - A Meta-Learning Approach to Predicting Performance and Data Requirements [163.4412093478316]
本稿では,モデルが目標性能に達するために必要なサンプル数を推定する手法を提案する。
モデル性能を推定するデファクト原理であるパワー法則が,小さなデータセットを使用する場合の誤差が大きいことが判明した。
本稿では,2つのデータを異なる方法で処理するPPL法について紹介する。
論文 参考訳(メタデータ) (2023-03-02T21:48:22Z) - LoRA: Low-Rank Adaptation of Large Language Models [71.75808607987281]
Low-Rank Adaptation (LoRA)はトレーニング済みモデルの重みを凍結し、トレーニング可能な階数分解をTransformerアーキテクチャの各層に注入する。
GPT-3では、LoRAはトレーニング可能なパラメータの数を1万倍に減らし、計算ハードウェアの要求をフル微調整の3倍に削減できる。
論文 参考訳(メタデータ) (2021-06-17T17:37:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。