論文の概要: Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- arxiv url: http://arxiv.org/abs/2607.29025v2
- Date: Wed, 05 Aug 2026 10:28:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:42.978949
- Title: Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- Title(参考訳): 一貫性のあるマルチ参照画像編集のための評価検証リワード
- Authors: Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin,
- Abstract要約: 多次元評価検証リワード(EVR)
EVRは評価を異なる視覚基準に分解する。
検証者は、各クレームを具体的視覚的証拠に根拠を置き、それを受け入れ、拒絶する。
- 参考スコア(独自算出の注目度): 40.370544121781144
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While recent image editing models have made rapid progress, multi-reference editing remains challenging, particularly in maintaining visual consistency across references and ensuring overall visual harmony. Reinforcement learning has proven highly effective for text-to-image generation and single-image editing, but its extension to multi-reference editing is hindered by the absence of suitable reward models that capture multi-image relational constraints. Moreover, naively using multimodal large language models(MLLMs) as zero-shot evaluators faces a key tension between hallucination-prone long-form reasoning and the limited deductive power of short-form judgments. We address these issues with a Multi-dimensional Evaluation-Verification Reward(EVR). EVR decomposes evaluation into distinct visual criteria; for each criterion, an MLLM Evaluator generates multiple candidate hypotheses, and a Verifier grounds each claim in concrete visual evidence to accept or reject it, producing reliable and fine-grained reward signals. Together with a scalable data pipeline, our method enables RL fine-tuning of off-the-shelf editors without architectural changes. Extensive experiments show substantial gains over the base Qwen-Image-Edit, improving consistency and harmony to match or surpass NanoBanana.
- Abstract(参考訳): 最近の画像編集モデルは急速に進歩しているが、特に参照間の視覚的一貫性を維持し、全体的な視覚的調和を確保する上で、マルチ参照編集は依然として困難である。
強化学習は、テキスト・ツー・イメージ生成や単一画像編集に非常に有効であることが証明されているが、マルチ参照編集への拡張は、マルチ画像関係制約をキャプチャする適切な報酬モデルがないために妨げられている。
さらに、ゼロショット評価器としてマルチモーダルな大言語モデル(MLLM)をネーティブに用いた場合、幻覚が引き起こすロングフォーム推論とショートフォーム判断の限定的導出力との間には重要な緊張が生じる。
本稿では,多次元評価検証リワード(EVR)を用いてこの問題に対処する。
EVRは、評価を異なる視覚基準に分解する。各基準に対して、MLLM評価器は複数の候補仮説を生成し、検証器は、具体的な視覚的証拠に各クレームを根拠として、それを受理または拒絶し、信頼性が高くきめ細かい報酬信号を生成する。
拡張性のあるデータパイプラインと組み合わせることで,アーキテクチャ上の変更を伴わずに既製のエディタをRLで微調整できる。
大規模な実験では、Qwen-Image-Editのベースよりも大幅に向上し、NanoBananaとの整合性や調和性が向上した。
関連論文リスト
- Enhanced Text-to-Image Generation by Fine-grained Multimodal Reasoning [13.412268665909826]
きめ細かいマルチモーダル推論(FiMR)は、視覚的質問応答(VQA)を利用して、明確できめ細かいフィードバックを生成するフレームワークである。
FiMRは推論ベースの方法を含む画像生成ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-15T05:24:29Z) - More Images, More Problems? A Controlled Analysis of VLM Failure Modes [80.64323947730905]
大規模視覚言語モデル (LVLM) は目覚ましい能力を示しているが、複数の画像に対する理解と推論の能力は未解明のままである。
LVLMのマルチイメージ能力を厳格に評価する新しいベンチマークMIMICを紹介する。
論文 参考訳(メタデータ) (2026-01-12T18:45:13Z) - Towards Generalized Multi-Image Editing for Unified Multimodal Models [56.620038824933566]
統一マルチモーダルモデル(UMM)は、マルチモーダル理解と生成を統合する。
UMMは、複数の入力画像にまたがる詳細を参照する場合、視覚的一貫性の維持と視覚的手がかりの曖昧さに制限される。
画像の同一性を明確に識別し、可変入力数に一般化するUMMのためのスケーラブルなマルチイメージ編集フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-09T06:42:49Z) - ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing [33.888289858260706]
画像編集の質を向上させるために,強化学習(RL)について検討した。
RL は,(1) ノイズ除去に限定した推論探索,(2) バイアスド報酬融合,(3) 不安定な VLM ベースの命令報酬の3つの主要な課題に直面している。
画像合成から視覚的推論を分離する推論中心のRLフレームワークであるThinkRL-Editを提案する。
論文 参考訳(メタデータ) (2026-01-06T23:43:00Z) - CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation [0.0]
CRAFT(Continuous Reasoning and Agentic Feedback Tuning)は、マルチモーダル画像生成に構造化推論パラダイムをもたらす、トレーニング不要でモデルに依存しないフレームワークである。
コンポジション精度、テキストレンダリング、好みに基づく評価を一貫して改善する。
これらの改善は無視できる推論時間のオーバーヘッドに過ぎず、より小型または安価なモデルでより高価なシステムの品質にアプローチすることができる。
論文 参考訳(メタデータ) (2025-12-23T13:44:41Z) - UniREditBench: A Unified Reasoning-based Image Editing Benchmark [52.54256348710893]
この研究は、推論に基づく画像編集評価のための統一ベンチマークUniREditBenchを提案する。
精巧にキュレートされた2,700個のサンプルからなり、8つの一次次元と18のサブ次元にわたる実世界シナリオとゲーム世界のシナリオをカバーしている。
このデータセットにBagelを微調整し、UniREdit-Bagelを開発した。
論文 参考訳(メタデータ) (2025-11-03T07:24:57Z) - What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models [88.398085358514]
DICEは、原画像と編集画像の局所的な差異を検出するために設計されたモデルである。
自己監督、塗布ネットワークからの蒸留、全監督を利用する戦略を用いて訓練されている。
DICEは一貫性のある編集を効果的に識別し、異なる編集モデルによって生成された画像を人間の判断と強く相関して効果的に評価する。
論文 参考訳(メタデータ) (2025-05-26T18:00:10Z) - CoLLM: A Large Language Model for Composed Image Retrieval [76.29725148964368]
Composed Image Retrieval (CIR)は、マルチモーダルクエリに基づいた画像検索を目的とした複雑なタスクである。
本稿では,イメージキャプションペアからトリプレットをオンザフライで生成するワンストップフレームワークであるCoLLMを提案する。
我々はLarge Language Models (LLMs) を利用して参照画像の埋め込みと修正テキストを生成する。
論文 参考訳(メタデータ) (2025-03-25T17:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。