論文の概要: GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
- arxiv url: http://arxiv.org/abs/2608.03215v1
- Date: Tue, 04 Aug 2026 06:50:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.065585
- Title: GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
- Title(参考訳): GROW:自己回帰拡散テキスト・音声モデルのグループ関連アドバンテージ重み付きオンライン強化学習
- Authors: Guanrou Yang, Tian Tan, Qian Chen, Ziyang Ma, Yakun Song, Zhikang Niu, Qi Chen, Wenming Tu, Haitao Li, Shan Yang, Xie Chen,
- Abstract要約: 本稿では,標準フローマッチング目的に直接作用するグループ重み付きオンラインRL法GROWを提案する。
GROWは、政治上の発話のグループをサンプリングし、グループ内のインテリジェンスと話者-類似性報酬を個別に標準化し、それらを重回帰に結合する。
GROWは、32-NFE DiTAR-GRPOより2.9倍高速なトレーニングをしながら、同等のパフォーマンスを維持している。
- 参考スコア(独自算出の注目度): 27.732048282790192
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning for flow-matching text-to-speech is complicated by deterministic ODE sampling: trajectory-level policy-gradient methods typically convert the ODE into an SDE and track per-step likelihood ratios, introducing stochastic perturbations and substantial overhead. We propose GROW, a group-relative advantage-weighted on-policy RL method that acts directly on the standard flow-matching objective. For each prompt, GROW samples a group of on-policy utterances, separately standardizes intelligibility and speaker-similarity rewards within the group, and combines them to reweight flow-matching regression. A Wasserstein-2 velocity penalty anchors the updated model to a frozen pretrained reference. A group-mean reward baseline is introduced to convert reward weighting into advantage weighting. For strong pretrained TTS models with concentrated rewards, positive exponential weighting is dominated by reward-agnostic self-imitation, whereas a zero-mean signed advantage preserves effective within-group credit assignment. Instantiated on DiTAR and evaluated on LibriSpeech and Seed-TTS EN/ZH, GROW reduces average WER from 2.016 to 1.558 and raises speaker similarity from 0.676 to 0.715 while keeping UTMOS. With 10-NFE training rollouts and 32-NFE evaluation, GROW retains comparable performance while training 2.9x faster than 32-NFE DiTAR-GRPO. We will open-source complete GROW codes, faithful DiTAR reproduction, and all model checkpoints.
- Abstract(参考訳): トラジェクティブレベルのポリシー段階の手法は、一般的にODEをSDEに変換し、ステップごとの確率比をトラックし、確率的摂動を導入し、かなりのオーバーヘッドを発生させる。
本稿では,標準フローマッチングの目的に直接作用するグループ相対的な優位性を持つRL法であるGROWを提案する。
各プロンプトに対して、GROWは、政治上の発話のグループをサンプリングし、グループ内のインテリジェンスと話者類似性報酬を個別に標準化し、それらをリウェイトなフローマッチングレグレッションに結合する。
Wasserstein-2ベロシティペナルティは、更新されたモデルを凍結事前訓練された参照にアンカーする。
グループ平均報酬ベースラインを導入し、報酬重み付けを利点重み付けに変換する。
集中報酬を持つ強い事前訓練されたTSモデルでは、正の指数重み付けは報酬に依存しない自己想像によって支配されるが、ゼロ平均符号の利点はグループ内クレジットの効果的な割り当てを保っている。
DiTARをベースとしたLibriSpeechとSeed-TTS EN/ZHの評価により、GROWは平均WERを2.016から1.558に削減し、UTMOSを維持しながら話者類似度を0.676から0.715に引き上げる。
10-NFEのトレーニングロールアウトと32-NFEの評価により、GROWは32-NFE DiTAR-GRPOよりも2.9倍速くトレーニングしながら同等のパフォーマンスを維持している。
完全なGROWコード、忠実なDiTAR再現、およびすべてのモデルチェックポイントをオープンソースにします。
関連論文リスト
- CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents [1.4298580363875282]
結果のみの強化学習によるマルチターンエビデンス読解エージェントのトレーニングは、中間旋回が直接クレジットをほとんど受け取らないため不安定である。
Qwen2.5-3B-InstructによるHotpotQA実験では、GRPOは最初(標準F1 0.430)改善されたが、その後100%フォーマット違反の出力に崩壊する。
本研究では,各ターン当たりの報酬を中間的エビデンス読解ターンに割り当てることで,グループ報酬分布が1つの値に崩壊するのを防ぐ,分散テキスト戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T11:50:29Z) - Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models [0.0]
グループ相対政策最適化は、推論タスク上で言語モデルを整合させる効果的な強化学習アルゴリズムとして登場した。
本稿では,Adaptive-Horizon GRPOとSelective-Advantage AH-GRPOの2つの補完拡張を導入する。
解析の結果、非対称割引は正しい解の完全な勾配信号を保持し、エントロピー崩壊を防止し、トレーニングを著しく安定化させることがわかった。
論文 参考訳(メタデータ) (2026-06-03T20:57:57Z) - Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation [13.272542054938258]
非効率な勾配でトレーニングバッチの割合を定量化する最初の指標であるAdvantage Collapse Rate (ACR)を導入する。
次に、仮想報酬サンプルを注入するGRPOの軽量拡張であるAdaptive Virtual Sample Policy Optimization (AVSPO)を提案する。
AVSPOはGRPOに対して58~63%の利害崩壊を減少させ、すべてのモデルスケールで4~6ポイントの一貫した精度向上をもたらす。
論文 参考訳(メタデータ) (2026-05-20T12:57:37Z) - FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning [16.200486964371713]
フィードバック駆動型双方向強化学習フレームワークFBOS-RLを提案する。
具体的には、環境からのフィードバックに基づいて、フィードバックガイドによる探索強化を行う。
同じロールアウト数で、FBOS-RLはGRPOやフィードバックベースのベースラインよりもかなり高速に学習する。
論文 参考訳(メタデータ) (2026-05-18T12:48:36Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay [57.80564154223355]
既存のエクスペリエンスリプレイメソッドは、直接ポリシー更新のための正確なサンプルを再利用することで、この問題に対処する。
歴史的データは単に正確性を強化するのではなく、持続的な多様性を優先すべきである、と我々は主張する。
本稿では,シンプルで効果的な正規化フレームワークであるLEPJRを提案する。
論文 参考訳(メタデータ) (2026-03-17T06:20:56Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - WARM: On the Benefits of Weight Averaged Reward Models [63.08179139233774]
Weight Averaged Reward Models (WARM) を提案する。
最良N法とRL法を用いた要約タスクの実験は、WARMがLLM予測の全体的な品質とアライメントを改善することを示す。
論文 参考訳(メタデータ) (2024-01-22T18:27:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。