論文の概要: S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF
- arxiv url: http://arxiv.org/abs/2607.18258v1
- Date: Fri, 15 May 2026 09:09:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.092523
- Title: S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF
- Title(参考訳): S2T-RLHF:安定な参照ベースRLHFの階層的クレジットアサインメント
- Abstract要約: 人間のフィードバックからの強化学習は不安定なトレーニングダイナミクスを示すことが多い。
標準RLHFは、トークンレベルのポリシー更新に伝達される単一のシーケンスレベルのスカラー報酬に依存している。
最近の研究は、より密集したトークンレベルの監視に報酬を精算することでこの問題に対処しようとしている。
- 参考スコア(独自算出の注目度): 23.50783768896415
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning from human feedback (RLHF) with preference-based reward models often exhibits unstable training dynamics. A key contributing factor is that standard RLHF relies on a single sequence-level scalar reward, which is propagated to token-level policy updates and leaves credit assignment within a response inherently ambiguous. Recent work has attempted to address this issue by refining rewards into denser token-level supervision, often relying on the implicit assumption that finer-grained credit assignment improves optimization. We argue that this assumption is incomplete: when preference signals are noisy and only defined at the response level, overly fine-grained reward refinement can amplify reward uncertainty and destabilize learning. To address this problem, we propose a granularity-aware principle for hierarchical credit assignment, emphasizing stability-oriented reward design rather than maximal allocation precision. Under this principle, sentences serve as a natural intermediate granularity, balancing semantic coherence with robustness to token-level noise. Guided by this view, we introduce S2T-RLHF. This sentence-to-token reward decomposition framework first allocates sequence-level preference rewards across sentences and then applies bounded token-level refinement within each sentence, without reward-model retraining or token-level supervision. Experiments across multiple datasets and optimization settings show that S2T-RLHF improves training stability and robustness while maintaining competitive preference alignment.
- Abstract(参考訳): 人間のフィードバックから強化学習(RLHF)と嗜好に基づく報酬モデルでは、不安定なトレーニングのダイナミクスがしばしば現れる。
鍵となる要因は、標準のRLHFが単一シーケンスレベルのスカラー報酬に依存していることだ。
最近の研究は、より詳細なクレジット代入が最適化を改善するという暗黙の仮定を頼りに、より密集したトークンレベルの監視に報酬を精査することでこの問題に対処しようと試みている。
優先信号がノイズが多く、応答レベルでのみ定義される場合、過度にきめ細かな報酬改善は報酬の不確実性を増幅し、学習を不安定化させる。
この問題に対処するため、階層的信用代入のための粒度を考慮した原理を提案し、最大割当精度よりも安定性指向の報酬設計を強調した。
この原理の下では、文は自然な中間粒度として機能し、意味的コヒーレンスと堅牢性とトークンレベルのノイズのバランスをとる。
この観点からS2T-RLHFを紹介する。
文間報酬分解フレームワークは、まず、文間でシーケンスレベルの優先報酬を割り当て、その後、報酬モデルの再訓練やトークンレベルの監督なしに、各文内に有界トークンレベルの洗練を施す。
複数のデータセットにわたる実験と最適化設定により、S2T-RLHFは、競争優位性を維持しながら、トレーニングの安定性と堅牢性を改善する。
関連論文リスト
- BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation [51.22170603236523]
幻覚緩和のためのバランスドトークンレベルの政策最適化フレームワークを提案する。
BalTOはチェック可能な事実クレームを抽出し、参照コンテキストに対して検証し、トークンレベルのラベルに対するクレームレベルの判断をプロジェクトする。
ConFiQA、RAGTruth、FinLLM-Evalの実験では、BALTOは6つのモデルで最高の忠実さを達成している。
論文 参考訳(メタデータ) (2026-06-14T16:25:59Z) - Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework [6.490241400619907]
内部フィードバックからの強化学習は、スケーラブルで教師なしの代替手段として最近登場した。
本稿では,学習信号を2つの補完成分に分解するマルチリワードRLIFフレームワークを提案する。
提案手法は,外部の地平監督に頼らずに,安定した長距離推論を支援することができることを示す。
論文 参考訳(メタデータ) (2026-05-21T15:30:47Z) - Unifying Stable Optimization and Reference Regularization in RLHF [64.16830602324345]
本稿では、報酬ハッキングの防止と安定したポリシー更新の維持を目標とする統一正規化手法を提案する。
我々の単純で原則化されたアライメント目的は、監督された微調整の損失を軽減し、優れたトレードオフをもたらし、アライメント結果と実装の複雑さの両方を明らかに改善する。
論文 参考訳(メタデータ) (2026-02-12T03:31:19Z) - Learning Explainable Dense Reward Shapes via Bayesian Optimization [45.34810347865996]
トークンレベルのクレジット代入に焦点をあてた最適化問題として、報酬形成の枠組みを定めている。
SHAP や LIME などの説明可能性法を用いて,報酬モデルから各報酬を推定する。
実験の結果,トークンレベルの報酬属性のバランスが良くなると,ベースラインよりもパフォーマンスが向上することがわかった。
論文 参考訳(メタデータ) (2025-04-22T21:09:33Z) - Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment [51.10604883057508]
DR-IRL(逆強化学習によるリワードの動的調整)を提案する。
まず、IRLを介して7つの有害なカテゴリをカバーするバランスの取れた安全データセットを用いて、カテゴリ固有の報酬モデルを訓練する。
次に,テキストエンコーダのコサイン類似性によるデータレベルの硬さ,報酬ギャップによるモデルレベルの応答性など,タスク難易度による報酬を導入することにより,グループ相対政策最適化(GRPO)を強化する。
論文 参考訳(メタデータ) (2025-03-23T16:40:29Z) - T-REG: Preference Optimization with Token-Level Reward Regularization [35.07328450591201]
人間のフィードバックからの強化学習(RLHF)は、大きな言語モデルと人間の価値の整合に不可欠である。
最近の手法ではトークンレベルの報酬を導入してこの制限に対処しようと試みている。
本稿では,トークンレベルの報酬を優先最適化に利用する新しい手法であるトークンレベルの報酬正規化(T-REG)を提案する。
論文 参考訳(メタデータ) (2024-12-03T18:56:07Z) - Uncertainty-Penalized Reinforcement Learning from Human Feedback with
Diverse Reward LoRA Ensembles [26.955375398765085]
人間のフィードバックからの強化学習(RLHF)は、大規模言語モデル(LLM)の整合性のための有望なパラダイムとして出現する。
本稿では,既存のRLHF法でよく用いられるKL正則化の弱点を観察し,過度な最適化に対処する。
本稿では,RLファインタニング中の不確実性正則化を取り入れた不確実性補償RLHF(UP-RLHF)を提案する。
論文 参考訳(メタデータ) (2023-12-30T14:14:14Z) - Stabilizing RLHF through Advantage Model and Selective Rehearsal [57.504894664689]
大規模言語モデル(LLM)は自然言語処理に革命をもたらしたが、これらのモデルを人間の価値観や好みに合わせることは依然として大きな課題である。
この課題は、報酬のハッキングや破滅的な忘れなど、さまざまな不安定さによって特徴づけられる。
1) 報酬ハッキング防止のために, スコアを直接モデル化し, タスク間のスコア分布を規制するアドバンテージモデル, 2) PPOトレーニングと知識リハーサルのためのデータを戦略的に選択することで, 悲惨な忘れを緩和する選択リハーサルを提案する。
論文 参考訳(メタデータ) (2023-09-18T23:06:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。