論文の概要: ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration
- arxiv url: http://arxiv.org/abs/2609.00061v2
- Date: Sat, 05 Sep 2026 05:18:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.324849
- Title: ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration
- Title(参考訳): ReNFT:内部確率による後方後訓練における修復モードの崩壊-質量補正
- Abstract要約: 再学習後、必然的に確率質量をいくつかの報奨モード、即時多様性を消去するモード崩壊に集中させる。
本稿では、内部の確率質量再校正により、高逆低ダイバーシティアダプタを修復するReNFTを提案する。
PickScoreとGenEvalでは、ReNFTはNFTの報酬の98.9%と99.0%を保持し、DreamSim-Divは58.8%、55.0%改善している。
- 参考スコア(独自算出の注目度): 84.10540890311843
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward post-training of diffusion generators inevitably concentrates probability mass on a few reward-favored modes, a mode collapse that erases within-prompt diversity. Existing methods for mitigating collapse rely on external signals or interfaces, augmenting the reward with perceptual objectives, adjusting reference regularization, or modifying the text encoder, but none repairs an adapter that has already collapsed while preserving the acquired reward. We observe that online post-training primarily reallocates probability mass over capabilities inherited from pretraining rather than learning new visual content. Collapse is therefore suppression, not deletion, and can be reversed from within the generator. We propose ReNFT, which repairs a high-reward, low-diversity adapter through internal probability-mass recalibration. Unconditional probes first prioritize "anti-hub" prompts where the prompt-independent bias is easiest to expose. Two policy-dominated mixed routes then generate matched counterfactual proposals from the same prompt and initial noise, one probing the frozen base direction for suppressed alternatives and the other exposing the post-trained unconditional tendency. Reward ranking with an adaptive flipping guard assigns pull and push roles, and a joint-and-paired NFT update realizes the repair. On PickScore and GenEval, ReNFT retains 98.9% and 99.0% of NFT's reward while improving DreamSim-Div by 58.8% and 55.0%, respectively, offering a complementary alternative to external interventions.
- Abstract(参考訳): 拡散発生器の再学習は、必然的にいくつかの報奨モードに確率質量を集中させる。
崩壊を緩和する既存の方法は、外部の信号やインターフェースに依存し、知覚的な目的で報酬を増強し、参照の正規化を調整するか、テキストエンコーダを変更するが、獲得した報酬を保存しながら既に崩壊したアダプタを修復することはない。
オンラインのポストトレーニングは、新しいビジュアルコンテンツを学ぶのではなく、事前学習から受け継いだ能力よりも、確率質量を主に再配置する。
したがって、崩壊は抑制され、削除されるのではなく、ジェネレータ内から逆転することができる。
本稿では、内部の確率質量再校正により、高逆低ダイバーシティアダプタを修復するReNFTを提案する。
非条件プローブは、最初に「反ハブ」を優先し、プロンプト非依存バイアスが露出し易い場所を指示する。
2つの政策に支配された混合経路は、同一のプロンプトと初期ノイズから一致した反現実的提案を生成し、1つは、抑制された代替手段に対する凍結ベース方向を探索し、もう1つは、訓練後の非条件的傾向を露呈する。
適応的なフリップガードを備えたリワードランキングでは、プルとプッシュのロールが割り当てられ、ジョイント・アンド・ペアのNFTアップデートが修復を実現する。
PickScoreとGenEvalでは、ReNFTはNFTの報酬の98.9%と99.0%を保持し、DreamSim-Divを58.8%、55.0%改善している。
関連論文リスト
- Scale-Consistent Posterior Dynamics for Diffusion Inverse Problems [16.685352002333225]
事前訓練された拡散前の後方サンプリングは、一般に難易度成分を有する条件付きスコアによって管理される。
クリーン後部にターゲットが近づいた騒音条件付き経路が連続的なサロゲートSDEを生成することを示す。
FFHQ と ImageNet の100点評価実験により,超解像および分解能の競争再現性を示す。
論文 参考訳(メタデータ) (2026-08-15T09:38:41Z) - Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training [51.18425726646089]
我々は、画像とビデオの拡散モデルのための統合潜在空間フレームワークであるtextscSUREを提案する。
報酬分布を学習し、信頼性を直接利用して、密集したポストトレーニングをガイドする。
textscSURE-REFLは評価手法の中で最も高いVBench品質、セマンティック、総得点を達成する。
論文 参考訳(メタデータ) (2026-08-06T14:55:42Z) - Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary [0.0]
我々は,人気度の高いBPRトレーニングが,協調フィルタリング埋め込みのユーザ間幾何学にどう影響するかを考察する。
定常アイテムによる人気バイアスのあるフィードバックの下では、$C$は安定した状態に収束する。
次に、その効果の限界について検討する。
論文 参考訳(メタデータ) (2026-08-03T17:33:25Z) - MARBLE: Multi-Aspect Reward Balance for Diffusion RL [71.6241143519038]
強化学習は、拡散モデルと人間の嗜好を整合させる主要なアプローチとなっている。
既存のプラクティスは、報酬ごとに1つのスペシャリストモデルをトレーニングすることで、複数の報酬を処理します。
我々は,各報酬に対する独立な優位推定器を維持する勾配空間最適化フレームワークMARBLEを提案する。
論文 参考訳(メタデータ) (2026-05-07T16:20:42Z) - SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models [48.335262141752715]
拡散モデルのための後トレーニングパイプラインには、キュレートされたデータに対する教師付き微調整(SFT)と報酬モデルによる強化学習(RL)の2段階がある。
本稿では,このギャップを埋めるバイアス補正ポストトレーニング法であるSOAR(Self-Correction for Optimal Alignment and Refinement)を提案する。
オンライン政治であり、報酬なしであり、クレジット割り当ての問題なく、時間ごとの密集した監督を提供する。
論文 参考訳(メタデータ) (2026-04-14T11:45:15Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - FAST-DIPS: Adjoint-Free Analytic Steps and Hard-Constrained Likelihood Correction for Diffusion-Prior Inverse Problems [2.9506605740700107]
トレーニングなし拡散の先行は、しばしば、繰り返し導関数や、保守的なステップサイズを持つ内部最適化/MCMCループに依存する。
本研究では、これらの内部ループをハードな測定空間実現可能性制約で置き換える訓練不要な解法を提案する。
実験はPSNR/SSIM/LPIPSと最大19.5$times$のスピードアップで、手書きのアジョイントや内部MCMCを使わずに、競争力のあるPSNR/SSIM/LPIPSを実現する。
論文 参考訳(メタデータ) (2026-03-02T08:17:26Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。