論文の概要: Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts
- arxiv url: http://arxiv.org/abs/2609.35641v1
- Date: Mon, 28 Sep 2026 17:07:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 20:04:44.962614
- Title: Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts
- Title(参考訳): 合成シーンから自然プロンプトへの視覚的逆流の検証
- Abstract要約: 我々は、強化学習(RLVVR)の報酬として、ビジュアル・リワード(VVR)を用いる。
32以上の制約型に10,000のタスクを持つVVRBenchと、720以上の複雑なタスクを持つVVRBenchをリリースしています。
VVRスコアを強化学習(RLVVR)の報酬として使用すると、VVRBench上の安定3.5の精度が2.8%から28.3%に上昇し、一貫した使い易い一般化を示す。
- 参考スコア(独自算出の注目度): 86.83337731106667
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Precise instruction following in image generation, such as satisfying object counts and spatial relations, remains an open challenge at least in part because it is learned using unreliable reward models such as object detectors and vision-language models. We introduce Verifiable Visual Rewards (VVR), the first framework for programmatically verifiable image rewards, and show that training on it generalizes to natural prompts. Each VVR task is a scene of geometric objects and relations among them, from which we derive both the prompt and a deterministic verifier, so tasks can be generated in any number and at any chosen complexity. We release VVRBench, with 10,000 tasks over 32 constraint types, and VVRBench-Challenge, with 720 more complex tasks; the strongest model we evaluate---GPT-Image-2.5---solves 21.4% of VVRBench-Challenge. Using VVR scores as rewards for reinforcement learning (RLVVR) raises the accuracy of Stable Diffusion 3.5 Medium on VVRBench from 2.8% to 28.3% and demonstrates consistent easy-to-hard generalization. These gains extend to out-of-domain benchmarks, and mixing VVR into existing objectives further improves overall performance and human preference, motivating the adoption of VVR into standard image generation post-training recipes.
- Abstract(参考訳): オブジェクト数や空間関係を満たすような画像生成における精密な命令は、少なくとも部分的には、オブジェクト検出器や視覚言語モデルのような信頼性の低い報酬モデルを用いて学習されるため、オープンな課題である。
画像報酬をプログラムで検証する最初のフレームワークであるVerifiable Visual Rewards (VVR)を導入し、そのトレーニングが自然なプロンプトに一般化することを示す。
各VVRタスクは幾何学的対象とそれらの関係のシーンであり、そこからプロンプトと決定論的検証の両方を導出するので、任意の数と選択された複雑さでタスクを生成することができる。
VVRBenchは32種類の制約型に1万のタスクを持ち、VVRBench-Challengeは720以上の複雑なタスクを持ち、評価する上で最強のモデルである--GPT-Image-2.5-は21.4%のVVRBench-Challengeを解決します。
VVRスコアを強化学習(RLVVR)の報酬として使用すると、VVRBench上の安定拡散3.5媒体の精度が2.8%から28.3%に上昇し、一貫した使い易い一般化を示す。
これらのゲインは、ドメイン外のベンチマークにまで拡張され、既存の目的にVVRを混ぜることで、全体的なパフォーマンスと人間の嗜好が向上し、VVRをトレーニング後の標準画像生成レシピに採用する動機となっている。
関連論文リスト
- VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning [133.66021945481876]
本稿では,視覚的推論生成をネイティブに制御可能にするテストベッドであるVBVR-Proを紹介する。
VBVR-Proは、視覚的推論を300の手続き的に生成されたタスク空間に変換する。
VLM-as-a-judgeパラダイムの繰り返し発生する障害モードを同定する。
論文 参考訳(メタデータ) (2026-08-26T17:59:51Z) - UniVR: Thinking in Visual Space for Unified Visual Reasoning [109.8746743219571]
我々は、複雑な推論、きめ細かな物理力学、そして純粋な視覚的なデモンストレーションから長期計画を同時に学習する最初の調査であるUniVRを紹介する。
コアとなるUniVRは、補完的なグローバルとステップレベルの報酬を備えた強化学習パラダイムであるVR-GRPOを備えている。
UniVRをトレーニングし、評価するために、長い水平操作、空間パズル、物理的推論にまたがる16の様々なソースからキュレートされた大規模なベンチマークであるVR-Xを構築した。
論文 参考訳(メタデータ) (2026-07-14T14:15:13Z) - UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling [33.6086006552446]
ワールド・モデリングを用いたマルチビュー・ビジョン・ランゲージ・アクション・モデルであるUniviewVLAを提案する。
生成されたマルチビューの将来のビューを活用することで、UniviewVLAは隠蔽されたキューと将来のシーンの進化をモデル化する。
UniviewVLA は LIBERO で95.8%、CALVIN ABCD to D で4.60を達成している。
論文 参考訳(メタデータ) (2026-06-19T14:53:40Z) - Visual-ERM: Reward Modeling for Visual Equivalence [59.317480168347664]
Visual Equivalence Reward Model (Visual-ERM)は、細粒度、解釈可能、タスクに依存しないフィードバックを提供するマルチモーダル生成報酬モデルである。
Visual-ERM は Qwen3-VL-8B-Instruct を 8.4 で改善し、テーブルとSVGのパースで一貫したゲインを得る。
VisualCritic-RewardBench(VC-RewardBench)は、構造化された視覚データに対して微細な画像と画像の相違を判定するためのベンチマークである。
論文 参考訳(メタデータ) (2026-03-13T17:58:14Z) - Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning [52.107043437362556]
抽象視覚推論(AVR)は、抽象ルールを素早く発見し、新しいシナリオに一般化することを可能にする。
本稿では,統一フレームワークにおける複数のタスクに対処する,統一条件生成解法(UCGS)を提案する。
UCGSはゼロショット推論の能力を示しており、テストフェーズで目に見えないタスクから問題に対する抽象的推論を行うことができる。
論文 参考訳(メタデータ) (2025-07-15T21:54:51Z) - RAG-VR: Leveraging Retrieval-Augmented Generation for 3D Question Answering in VR Environments [3.2120448116996103]
RAG-VRは、検索強化世代(RAG)を組み込んだVR用3次元質問応答システムである
RAG-VRは答えの精度を17.9%-41.8%改善し、2つのベースラインシステムと比較してエンドツーエンドのレイテンシを34.5%-47.3%削減した。
論文 参考訳(メタデータ) (2025-04-11T04:55:50Z) - A Unified View of Abstract Visual Reasoning Problems [0.0]
タスクの統一的なビューを導入し、各インスタンスは、パネルの数、場所、役割に関する前提のない単一のイメージとしてレンダリングされる。
統一された視点の主な利点は、様々なタスクに適用可能な普遍的な学習モデルを開発する能力である。
Raven's Progressive Matrices と Visual Analogy Problems の4つのデータセットで実施された実験は、提案されたタスクの統一表現が、最先端のディープラーニング(DL)モデルや、より広範に、現代のDL画像認識方法に挑戦していることを示している。
論文 参考訳(メタデータ) (2024-06-16T20:52:44Z) - Perceptual Quality Assessment of Virtual Reality Videos in the Wild [53.94620993606658]
既存のパノラマビデオデータベースでは、合成歪みのみを考慮し、一定の視聴条件を仮定し、サイズに制限がある。
我々はVRVQW(VR Video Quality in the Wild)データベースを構築した。
我々は,2つの異なる視聴条件下で,139ドルの被験者から,スキャンパスと品質スコアを記録するための正式な心理物理実験を行った。
論文 参考訳(メタデータ) (2022-06-13T02:22:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。