論文の概要: Efficient Controlled Language Generation with Low-Rank Autoregressive Reward Models
- arxiv url: http://arxiv.org/abs/2407.04615v2
- Date: Tue, 1 Oct 2024 09:23:32 GMT
- ステータス: 処理完了
- システム内更新日: 2024-11-08 23:46:45.200229
- Title: Efficient Controlled Language Generation with Low-Rank Autoregressive Reward Models
- Title(参考訳): 低ランク自己回帰回帰モデルを用いた効率的な制御言語生成
- Authors: Sergey Troshin, Vlad Niculae, Antske Fokkens,
- Abstract要約: 我々は、タスク固有の報酬モデルからスコアを用いて言語モデルから生成を制御するために、報酬拡張復号(RAD)アプローチを再検討する。
RADは、報酬行列を表現する際に高い柔軟性をサポートするように設計されており、復号時の計算コストが高くなることを示す。
そこで本研究では,高速かつ効率的な誘導復号化を可能にする報奨モデルの簡易かつ効率的な低ランクパラメトリゼーションを提案する。
- 参考スコア(独自算出の注目度): 13.38174941551702
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models trained on large amounts of data are known to produce inappropriate content in some cases and require careful tuning to be used in the real world. We revisit the reward augmented decoding (RAD) approach to control the generation from a language model using the scores from a task-specific reward model. We investigate the training objective of RAD, and reformulate it as a task of learning a reward matrix. We show that RAD is designed to support high flexibility when representing the reward matrices, which leads to a higher computational costs during decoding. However, we demonstrate that RAD does not use its full flexibility. Motivated by this, we propose a simpler but more efficient low-rank parametrization of the reward model enabling fast and effective guided decoding. For the detoxification and sentiment control tasks, we show that our low-rank reward model performs on par with the more flexible RAD parametrization, while requiring only a single reward model call per generated token.
- Abstract(参考訳): 大量のデータに基づいて訓練された言語モデルは、場合によっては不適切なコンテンツを生成することが知られており、現実世界で使用するには注意深いチューニングが必要である。
我々は、タスク固有の報酬モデルからスコアを用いて言語モデルから生成を制御するために、報酬拡張復号(RAD)アプローチを再検討する。
RADの学習目標について検討し,報奨行列の学習課題として再検討する。
RADは、報酬行列を表現する際に高い柔軟性をサポートするように設計されており、復号時の計算コストが高くなることを示す。
しかし、RADはその完全な柔軟性を使用しないことを示す。
そこで本研究では,高速かつ効率的な誘導復号化を可能にする報奨モデルの簡易かつ効率的な低ランクパラメトリゼーションを提案する。
解毒処理や感情制御のタスクでは、より柔軟なRADパラメトリゼーションと同等に動作し、生成トークンごとに単一の報酬モデル呼び出ししか必要とせず、低ランクの報酬モデルが実行可能であることを示す。
関連論文リスト
- HAF-RM: A Hybrid Alignment Framework for Reward Model Training [51.59246299566669]
報酬モデルトレーニングのためのハイブリッドアライメントフレームワークHaF-RMを提案する。
報酬モデルのパフォーマンスとアライメントを高めるための、原則的で効果的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-07-04T23:26:56Z) - RewardBench: Evaluating Reward Models for Language Modeling [100.28366840977966]
本稿では,報酬モデル評価のためのベンチマークデータセットとコードベースであるRewardBenchを紹介する。
データセットは、チャット、推論、安全性にまたがる、プロンプト・チョーゼン・リジェクトされたトリオのコレクションである。
RewardBenchのリーダーボードでは、様々な方法で訓練された報酬モデルを評価する。
論文 参考訳(メタデータ) (2024-03-20T17:49:54Z) - Dense Reward for Free in Reinforcement Learning from Human Feedback [64.92448888346125]
我々は報酬モデルが単にスカラー出力よりも多くの情報を含んでいるという事実を活用している。
私たちは、これらの注意重みを使って、完了全体に沿って報酬を再分配します。
経験的に、トレーニングを安定化し、学習速度を加速し、実際は、より良い局所最適性をもたらす可能性があることを示す。
論文 参考訳(メタデータ) (2024-02-01T17:10:35Z) - Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint [104.53687944498155]
強化学習(RL)は、大規模言語モデル(LLM)の訓練に広く用いられている。
本稿では,報酬モデルとして生成モデルを組み込んだRL法 RLMEC を提案する。
生成報酬モデルに基づいて、トレーニングのためのトークンレベルRL目標と、RLプロセスの安定化のための模倣ベース正規化を設計する。
論文 参考訳(メタデータ) (2024-01-11T17:58:41Z) - Let's Reinforce Step by Step [10.65244642965387]
人間のフィードバックからの強化学習をモデル推論の形式化に活用する。
以上の結果から, PRM法により得られる微粒な報酬は, 単純な数学的推論の精度を高めることが示唆された。
また、モデル性能において、報酬アグリゲーション関数が果たす重要な役割を示す。
論文 参考訳(メタデータ) (2023-11-10T01:35:51Z) - Reward-Augmented Decoding: Efficient Controlled Text Generation With a
Unidirectional Reward Model [47.722856876213946]
Reward-Augmented Decoding (RAD) は、言語モデルに特定の特性を持つテキストを生成するよう促すために、小さな一方向の報酬モデルを使用するテキスト生成プロシージャである。
一方向の報酬モデルを使用することで、RADは前世代のステップからアクティベーションをキャッシュすることで、計算オーバーヘッドを低減できる。
論文 参考訳(メタデータ) (2023-10-14T07:19:47Z) - CodeRL: Mastering Code Generation through Pretrained Models and Deep
Reinforcement Learning [92.36705236706678]
CodeRLは、事前訓練されたLMと深層強化学習によるプログラム合成タスクのための新しいフレームワークである。
推論中、我々は重要なサンプリング戦略を持つ新しい生成手順を導入する。
モデルバックボーンについては,CodeT5のエンコーダデコーダアーキテクチャを拡張し,学習目標を拡張した。
論文 参考訳(メタデータ) (2022-07-05T02:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。