論文の概要: When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
- arxiv url: http://arxiv.org/abs/2608.31035v1
- Date: Mon, 31 Aug 2026 16:14:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.50123
- Title: When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
- Title(参考訳): 予測者に基づくRLと人間の知覚はいつ一致するか? : コーデックに基づく言語モデルにおける主観的態度の検討
- Authors: Joonyong Park, Jerry Li,
- Abstract要約: Codec-based text-to-speech (TTS) モデルは、言語モデルポストトレーニングを音声生成に適用する。
学習した知覚予測者が、人間の聴取者との整合性を失うことなく、強化学習報酬として機能するかは、まだ不明である。
本研究では,アニメのような話し方,自然性,自由度,覚醒性について学習報酬を用いて検討する。
- 参考スコア(独自算出の注目度): 6.949453644640367
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Codec-based text-to-speech (TTS) models make language-model post-training applicable to speech generation, but it remains unclear when learned perceptual predictors can serve as reinforcement learning rewards without losing alignment with human listeners. We study this question with Group Relative Policy Optimization (GRPO) using learned rewards for anime-like speaking style, naturalness, likability, and arousal. To prevent perceptual rewards from being optimized through transcript drift, we introduce a character error rate (CER) zone constraint and compare policy optimization with Best-of-$N$ reranking under the same reward gate. Across single-reward runs, each reward primarily improves its own target metric, showing that subjective predictors are not interchangeable quality surrogates. Multi-rater A/B tests further show uneven human transfer, while a reward-gap analysis separates average transfer from within-axis calibration: signed reward gaps significantly predict listener choices in the pooled analysis, whereas residual CER gaps do not, but per-axis calibration remains heterogeneous. Best-of-8 is a strong human-level baseline and is not clearly worse than GRPO perceptually, suggesting that GRPO should be viewed as amortizing reward-selected behavior into the policy rather than uniformly outperforming reranking. These results support analyzing subjective speech rewards as predictor-axis-base tuples and provide practical diagnostics for selecting rewards before multi-reward speech post-training.
- Abstract(参考訳): Codec-based text-to-speech (TTS) モデルは、言語モデルポストトレーニングを音声生成に適用するが、学習した知覚予測者が人間の聴取者との整合を失わずに強化学習報酬として機能するかどうかは不明である。
本稿では,アニメのような話し方,自然性,自由度,覚醒に対する学習報酬を用いて,GRPO(Group Relative Policy Optimization)を用いてこの問題を考察する。
そこで本研究では,文字誤り率(CER)の制約を導入し,同じ報酬ゲートの下でのBest-of-N$の再評価とポリシの最適化を比較した。
シングルリワードラン全体において、各報酬は、主観的予測器が交換可能な品質サロゲートでないことを示すために、主に自身の目標メトリックを改善する。
符号付き報酬ギャップは、プール分析におけるリスナーの選択を著しく予測するが、残りのCERギャップは不均一であるが、アクセルごとのキャリブレーションは相変わらず不均一である。
Best-of-8は強い人間レベルのベースラインであり、GRPOよりも明らかに悪くはない。
これらの結果は、主観的音声報酬を予測軸ベースタプルとして分析することを支援し、マルチリターン音声後トレーニングの前に報酬を選択するための実践的な診断を提供する。
関連論文リスト
- Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search [8.82040111147814]
本稿では,Emphportable Search クエリを生成するために,エンドツーエンドの RLAIF フレームワークを提案する。
このタスクは、ポリシー最適化がルーリックの欠陥を活用し、冗長なコピー動作をもたらす、非常に敵対的な報酬曲面を導入する。
提案手法では,提案手法の誤りを再現する報酬を補正するルールベースの報酬フロアを導入することで,家族間評価審査員に+0.147ドルの品質改善をもたらすことを示す。
論文 参考訳(メタデータ) (2026-06-25T17:09:12Z) - VIMPO: Value-Implicit Policy Optimization for LLMs [106.88933849641272]
GRPOのようなグループ相対的手法は、批評家の訓練を避けるが、典型的には全てのトークンに軌道レベルの利点を割り当てる。
アクター批判的手法は、より密集した学習信号を提供するが、学習価値関数を自身のトレーニング不安定性で要求する。
本稿では,KL-正規化強化学習の最適条件からポリシ実装値関数を導出する,批判のないポリシ最適化手法であるVIMPOを紹介する。
論文 参考訳(メタデータ) (2026-06-18T09:44:12Z) - Uncertainty-Aware Reward Modeling for Stable RLHF [18.133821471352405]
本稿では,不確実性認識リワードモデリング(Uncertainty-Aware Reward Modeling, UARM)を提案する。
HelpSteer、UltraFeedback、PKU-SafeRLHFによる実験では、UARMは報酬モデルのキャリブレーションを大幅に改善し、報酬のハッキングを低減し、下流のアライメント品質を向上させる。
論文 参考訳(メタデータ) (2026-06-18T05:46:32Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - A Regret Minimization Framework on Preference Learning in Large Language Models [33.19510618137341]
検証可能な報酬による強化学習は、タスク固有の検証に頼って推論集約的なタスクの進行を可能にした。
多くの現実的な言語タスクは信頼性の高い検証器を装備することは困難であり、人間のフィードバックからの強化学習への依存度が高まっている。
本稿では、RegretベースのPreference Optimization $(textbfRePO)$を紹介します。
論文 参考訳(メタデータ) (2026-06-08T07:18:44Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z) - Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference [15.038210624870656]
リワード推論は、ヒューマンフィードバックパイプラインからの強化学習における重要な中間ステップである。
本稿では,帯域幅を超える一般RL問題と決定論的MDP帯域幅,Bradley-Terryモデルを超える一般選好モデルについて,報酬推論のない2つのRLHFアルゴリズムを開発した。
論文 参考訳(メタデータ) (2024-09-25T22:20:11Z) - Improving Machine Translation with Human Feedback: An Exploration of Quality Estimation as a Reward Model [75.66013048128302]
本研究では,QEモデルを報酬モデルとして活用し,フィードバックトレーニングにおける人間の嗜好を予測する可能性について検討する。
まず,QEに基づくフィードバックトレーニングにおいて,翻訳品質が低下する中で,報酬の増大として現れる過度な最適化問題を同定した。
問題に対処するために,ルールを用いて誤った翻訳を検知し,報酬のスコアにペナルティ項を割り当てる,シンプルで効果的な手法を採用する。
論文 参考訳(メタデータ) (2024-01-23T16:07:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。