論文の概要: RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
- arxiv url: http://arxiv.org/abs/2608.26956v2
- Date: Sun, 30 Aug 2026 03:51:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 13:34:07.737004
- Title: RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing
- Title(参考訳): RubricRM: 画像生成と編集のための動的ルーブリックによる生成リワードモデリング
- Abstract要約: 本稿では,評価次元,重み,評価基準を有する入力固有ルーリックを生成し,そのルーリックを候補画像に応用するペアワイズ生成報酬モデリングフレームワークを提案する。
我々は、2段階のトレーニングパイプラインを用いて、テキスト・ツー・イメージ生成と画像編集のための専用RMモデルを訓練する。
- 参考スコア(独自算出の注目度): 9.858046310638803
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reward models play an essential role in aligning visual generative models, yet most existing visual reward models use a single scalar score or rely on fixed criteria that cannot adapt to different instructions. This limits both interpretability and task sensitivity, especially for text-to-image generation and instruction-based image editing, where different inputs require different evaluation dimensions. We propose RubricRM, a pairwise generative reward modeling framework that first produces an input-specific rubric with evaluation dimensions, weights, and scoring criteria, and then applies the rubric to score candidate images. We train dedicated RubricRM models for text-to-image generation and image editing using a two-stage training pipeline: supervised fine-tuning teaches the model the rubric-based scoring paradigm, while GRPO further improves scoring through fine-grained dimension-level rewards. Experiments on multiple generation and editing benchmarks show that RubricRM outperforms existing specialized reward models and remains competitive with strong proprietary MLLM judges despite using smaller backbones. Our models, data, and code are available at https://github.com/zijiankan/RubricRM.
- Abstract(参考訳): リワードモデルは視覚生成モデルの整合に不可欠な役割を果たすが、既存の視覚報酬モデルの多くは単一のスカラースコアを使用するか、異なる指示に適応できない固定基準に依存している。
これは解釈可能性とタスク感度の両方を制限するもので、特にテキスト・画像生成と命令ベースの画像編集では、異なる入力が異なる評価次元を必要とする。
本稿では,まず,評価次元,重み,評価基準を有する入力固有ルーリックを生成し,そのルーリックを候補画像のスコアリングに応用する,ペアワイズ生成報酬モデリングフレームワークであるRubricRMを提案する。
教師付き微調整は、ルーブリックに基づくスコアリングパラダイムをモデルに教え、GRPOは、よりきめ細かい次元レベルの報酬によってスコアリングをさらに改善する。
複数世代および編集ベンチマークの実験では、RubricRMは既存の特別報酬モデルよりも優れており、バックボーンが小さいにもかかわらず、強力なプロプライエタリなMLLM判事と競争している。
私たちのモデル、データ、コードはhttps://github.com/zijiankan/RubricRM.comで公開されています。
関連論文リスト
- DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation [94.61152963112704]
我々は,タスク関連基準を根拠として,基準対応優先比較を行う動的・基準対応報酬モデルDyCoRMを提案する。
また、T2I画像の選択に基準認識報酬モデルを適用するDyCoPickについても紹介する。
論文 参考訳(メタデータ) (2026-05-25T14:04:26Z) - Leveraging Verifier-Based Reinforcement Learning in Image Editing [41.64251379221566]
本稿では,下流画像編集のための階層検証型推論報酬モデル(RRM)を構築するフレームワークであるEdit-R1を紹介する。
我々の実験は、編集固有の報酬モデルとして強力なVLMを超越していることを示した。
論文 参考訳(メタデータ) (2026-04-30T06:54:39Z) - From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks [2.2483228605450956]
大規模な言語モデルは、テキスト生成において顕著な進歩を遂げてきたが、それでも生成的な書き込みタスクに苦戦している。
報酬モデルを記述するための細粒度評価パイプラインWEvalと、微粒度強化学習学習フレームワークWRLを提案する。
WRLは命令要求を選択的にドロップすることで正と負のサンプルを構築し、より正確な報酬モデルトレーニングを可能にする。
論文 参考訳(メタデータ) (2026-04-30T05:49:29Z) - Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation [67.26349227500084]
現在の報酬モデルは、強化学習の時に批評家として機能し、しばしば幻覚に悩まされ、うるさいスコアを割り当てる。
我々は、忠実な画像生成と編集のための正確で信頼性の高いガイダンスを提供するために、堅牢な報酬モデルを開発する包括的フレームワークFIRMを提案する。
FIRMは幻覚を緩和し、既存の一般的なモデルに対する忠実さと命令順守の新しい標準を確立した。
論文 参考訳(メタデータ) (2026-03-12T17:57:21Z) - Constantly Improving Image Models Need Constantly Improving Benchmarks [109.39018167487103]
本稿では,実際のモデル利用の証拠から直接ベンチマークを構築するためのフレームワークECHOを提案する。
GPT-4o Image Genにこのフレームワークを適用し,ソーシャルメディア投稿から収集した31,000以上のプロンプトのデータセットを構築した。
論文 参考訳(メタデータ) (2025-10-16T17:59:30Z) - OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning [26.133555631867385]
OneRewardは統合強化学習フレームワークで、複数のタスクにわたってモデルの生成能力を向上する。
マルチタスク強化学習によるマスク誘導生成モデルであるSeedream 3.0 Fillを開発した。
論文 参考訳(メタデータ) (2025-08-28T17:59:46Z) - ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation [25.39019070750831]
拡散モデルは珍しい概念や目に見えない概念を生み出すのに苦労する。
本稿では,あるテキストプロンプトに基づいて関連画像を動的に検索するImageRAGを提案する。
私たちのアプローチは高度に適応可能で、異なるモデルタイプにまたがって適用できます。
論文 参考訳(メタデータ) (2025-02-13T15:36:12Z) - EditAR: Unified Conditional Generation with Autoregressive Models [58.093860528672735]
本稿では,条件付き画像生成タスクのための単一の統合自己回帰フレームワークであるEditARを提案する。
このモデルは、画像と命令の両方を入力として取り、バニラの次のパラダイムで編集された画像トークンを予測する。
確立されたベンチマークにおいて,様々なタスクにまたがる実効性を評価し,様々なタスク固有の手法に対する競争性能を示す。
論文 参考訳(メタデータ) (2025-01-08T18:59:35Z) - Composing Ensembles of Pre-trained Models via Iterative Consensus [95.10641301155232]
本稿では,異なる事前学習モデルのアンサンブルを構成するための統一的なフレームワークを提案する。
事前学習したモデルを「ジェネレータ」あるいは「スコーラ」として使用し、クローズドループ反復コンセンサス最適化により構成する。
スコアラーのアンサンブルによって達成されたコンセンサスは、シングルスコアラーのフィードバックよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-10-20T18:46:31Z) - Meta Internal Learning [88.68276505511922]
単一画像生成のための内部学習は、単一の画像に基づいて新しい画像を生成するようにジェネレータを訓練するフレームワークである。
本稿では,サンプル画像の内部統計をより効果的にモデル化するために,画像集合のトレーニングを可能にするメタラーニング手法を提案する。
以上の結果から, 得られたモデルは, 多数の共通画像アプリケーションにおいて, シングルイメージのGANと同程度に適していることがわかった。
論文 参考訳(メタデータ) (2021-10-06T16:27:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。