論文の概要: RewardHarness: Self-Evolving Agentic Post-Training
- arxiv url: http://arxiv.org/abs/2605.08703v1
- Date: Sat, 09 May 2026 05:32:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.825737
- Title: RewardHarness: Self-Evolving Agentic Post-Training
- Title(参考訳): RewardHarness: 自己進化型エージェントのポストトライニング
- Abstract要約: RewardHarnessは、命令誘導画像編集のための自己進化型エージェント報酬フレームワークである。
ツールやスキルのライブラリを、100もの好みのデモから反復的に進化させることによって、人間の好みに合わせている。
画像編集評価ベンチマークの平均精度は47.4%で、GPT-5を5.3ポイント上回る。
- 参考スコア(独自算出の注目度): 51.16917192137169
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating instruction-guided image edits requires rewards that reflect subtle human preferences, yet current reward models typically depend on large-scale preference annotation and additional model training. This creates a data-efficiency gap: humans can often infer the target evaluation criteria from only a few examples, while models are usually trained on hundreds of thousands of comparisons. We present RewardHarness, a self-evolving agentic reward framework that reframes reward modeling as context evolution rather than weight optimization. Instead of learning from large-scale annotations, RewardHarness aligns with human preferences by iteratively evolving a library of tools and skills from as few as 100 preference demonstrations. Given a source image, candidate edited images, and an editing instruction, an Orchestrator selects the most relevant subset of tools and skills from the maintained library, and a frozen Sub-Agent uses them to construct a reasoning chain that produces a preference judgment. By comparing predicted judgments with ground-truth preferences and analyzing successes and failures in the reasoning process, the Orchestrator automatically refines its library of tools and skills without additional human annotation. Using only 0.05% of the EditReward preference data, RewardHarness achieves 47.4% average accuracy on image-editing evaluation benchmarks, surpassing GPT-5 by 5.3 points. When used as a reward signal for GRPO fine-tuning, RL-tuned models achieve 3.52 on ImgEdit-Bench. Project page: https://rewardharness.com.
- Abstract(参考訳): 命令誘導画像編集の評価には微妙な人間の嗜好を反映する報酬が必要であるが、現在の報奨モデルは通常、大規模な嗜好アノテーションと追加のモデルトレーニングに依存する。
モデルは通常、何十万もの比較でトレーニングされているが、人間は少数の例から目標評価基準を推測することができる。
RewardHarnessは自己進化型エージェント報酬フレームワークで、報酬モデリングを重み付け最適化よりもコンテキスト進化として再編成する。
大規模なアノテーションから学ぶ代わりに、RewardHarnessは、ツールとスキルのライブラリを、わずか100の好みのデモから反復的に進化させることによって、人間の好みに合わせている。
ソース画像、候補編集画像、編集命令が与えられた後、Orchestratorはメンテナンスライブラリから最も関連性の高いツールとスキルのサブセットを選択し、凍結されたサブエージェントがそれらを使用して、選好判断を生成する推論チェーンを構築する。
予測された判断を地道な選好と比較し、推論プロセスにおける成功と失敗を分析することで、Orchestratorは人間のアノテーションなしでツールやスキルのライブラリを自動的に洗練する。
EditRewardの選好データの0.05%しか使用していないRewardHarnessは、画像編集評価ベンチマークの平均精度を47.4%達成し、GPT-5を5.3ポイント上回っている。
GRPO微調整の報酬信号として使用されると、RL調整モデルはImgEdit-Benchで3.52となる。
プロジェクトページ:https://rewardharness.com
関連論文リスト
- ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning [86.61218827780675]
本稿では,テキスト誘導画像編集のための評価ツールReasonEditを紹介する。
Re-Reward と Group Relative Policy Optimization (GRPO) アルゴリズムから得られる報奨信号を用いて訓練する。
高品質な解釈可能な評価テキストを生成することができ、画像編集の透明性と信頼性を高めることができる。
論文 参考訳(メタデータ) (2026-05-08T09:23:26Z) - RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time [51.256131853751754]
本研究では,多次元的批判を明示的に生成するために報酬モデルを教えることで,受動的評価器から能動的最適化ツールへ変換することを示す。
提案手法では, 嗜好データから高品質な論理を復元する原理的フレームワークであるpreference-Anchored Rationalization (PARROT) を導入する。
その結果、RationalRewards (8B) は、オープンソース報酬モデル間の最先端の好み予測を実現する。
論文 参考訳(メタデータ) (2026-04-13T15:38:09Z) - One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning [54.580646706013965]
リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において重要な役割を果たす。
一般的なツール使用シナリオに適した軽量な生成型RMのファミリーであるToolRMを紹介する。
これらのモデルを構築するために,ルールベースのスコアリングと多次元サンプリングを用いたペアワイズ選好データを構築するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-30T06:08:27Z) - Listener-Rewarded Thinking in VLMs for Image Preferences [38.07052490646366]
視覚報酬モデルをトレーニングするためのリスナー強化GRPOフレームワークを提案する。
我々のリスナー型報酬方式は,ImageRewardベンチマークにおいて最も精度が高い。
これらの結果から、聞き手による報酬は、視覚言語モデルと微妙な人間の嗜好を整合させる、スケーラブルでデータ効率のよい経路を提供することが示された。
論文 参考訳(メタデータ) (2025-06-28T09:53:17Z) - Capturing Individual Human Preferences with Reward Features [47.43999785878563]
個人の好みを一般報酬特徴の線形結合として捉えることができることを示す。
このような特徴を学習し、その後、報酬モデルを特定の個人に迅速に適応させる方法を示します。
提案するアーキテクチャを非適応型報酬モデルと適応型報酬モデルと比較し,大規模言語モデルを用いた実験を行った。
論文 参考訳(メタデータ) (2025-03-21T17:39:33Z) - Self-Taught Evaluators [77.92610887220594]
本稿では,人工的なトレーニングデータのみを用いて,人間のアノテーションを使わずに即興で証明することを目的としたアプローチを提案する。
我々の自己学習評価器は、RewardBench上で75.4から88.3までの強いLDMを改善することができる。
論文 参考訳(メタデータ) (2024-08-05T17:57:02Z) - RewardBench: Evaluating Reward Models for Language Modeling [100.28366840977966]
本稿では,報酬モデル評価のためのベンチマークデータセットとコードベースであるRewardBenchを紹介する。
データセットは、チャット、推論、安全性にまたがる、プロンプト・チョーゼン・リジェクトされたトリオのコレクションである。
RewardBenchのリーダーボードでは、様々な方法で訓練された報酬モデルを評価する。
論文 参考訳(メタデータ) (2024-03-20T17:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。