論文の概要: DynEval: Holistic Evaluations of T2I Generative Models in the Wild
- arxiv url: http://arxiv.org/abs/2607.11199v1
- Date: Mon, 13 Jul 2026 07:50:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.368047
- Title: DynEval: Holistic Evaluations of T2I Generative Models in the Wild
- Title(参考訳): DynEval: 野生におけるT2I生成モデルの全体的評価
- Authors: Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty,
- Abstract要約: 我々は,テキストと画像のアライメントとT2Iモデルの画質を評価するために設計された動的評価フレームワークDynEvalを紹介する。
人間の注釈付きデータ以外のスケーラブルなトレーニングをサポートするため、我々は2つの大きなデータセットを構築した。
- 参考スコア(独自算出の注目度): 6.430113734582911
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in text-to-image (T2I) generation have led to models capable of producing highly realistic images. Yet, reliably evaluating their outputs remains challenging, especially at scale. Existing automatic evaluators, often relying on a static prompt set, struggle to capture subtle failure modes such as partial prompt misalignment, compositional errors, or visually plausible but semantically incorrect generations. In this work, we introduce DynEval, a Dynamic Evaluation framework designed to jointly assess text-to-image alignment and image quality of T2I models. To support scalable training beyond limited human-annotated data, we construct two large datasets. First, we build GenDB, a collection of 500K prompt-image pairs generated from human-written prompts drawn from DiffusionDB using a tiered prompt-model generation strategy. Second, building upon GenDB, we construct DynEvalInstruct, a 250K instruction dataset comprising prompt-image-response triplets distilled from a structured evaluation pipeline that decomposes evaluation into text-image alignment and visual quality reasoning. Using this dataset, we perform full fine-tuning of a compact evaluator through a curriculum learning strategy to effectively distill the superior evaluation capabilities of a larger teacher vision-language model, resulting in DynEval-2B and DynEval-4B. In extensive comparisons against existing evaluators across 11 benchmarks, our evaluator achieves a higher overall correlation with human judgments. Furthermore, it provides fine-grained analysis of the capabilities and failure modes of 36 T2I models across 42 subcategories and 9 semantic dimensions.
- Abstract(参考訳): テキスト・トゥ・イメージ(T2I)生成の最近の進歩は、非常にリアルなイメージを生成できるモデルを生み出している。
しかし、アウトプットを確実に評価することは、特に大規模では難しい。
既存の自動評価器は、しばしば静的なプロンプトセットに依存しており、部分的なプロンプトの修正、構成上の誤り、視覚的に妥当だが意味的に不正確な世代のような微妙な障害モードを捉えるのに苦労している。
本研究では,テキスト・画像のアライメントとT2Iモデルの画質を共同評価する動的評価フレームワークDynEvalを紹介する。
限定的な人間の注釈付きデータを超えてスケーラブルなトレーニングをサポートするため、我々は2つの大きなデータセットを構築した。
まず、DiffusionDBから引き出された人書きプロンプトから生成される500KプロンプトイメージペアのコレクションであるGenDBを、階層化されたプロンプトモデル生成戦略を用いて構築する。
第2に,GenDB上に構築したDynEvalInstructは,テキスト画像アライメントと視覚品質推論に分解した構造化評価パイプラインから抽出した,インパルス応答三重項からなる250Kの命令データセットである。
このデータセットを用いて、カリキュラム学習戦略を用いて、コンパクトな評価器の完全な微調整を行い、より大きな教師ビジョン言語モデルの優れた評価能力を効果的に抽出し、DynEval-2BとDynEval-4Bを実現する。
11のベンチマークにおける既存の評価器との比較において,評価器は人的判断との総合的相関を高くする。
さらに、42のサブカテゴリと9つのセマンティックディメンションにわたる36のT2Iモデルの機能と障害モードを詳細に分析する。
関連論文リスト
- Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education [57.241885377686486]
本稿では,算術方程式から有意義な視覚を生成するタスクである方程式対視覚生成について紹介する。
E2V-Benchは、4つの台座を持つ視覚的タイプにまたがるベンチマークであり、視覚的正当性を評価するための自動指標である。
評価の結果,最近のテキスト・トゥ・イメージ(T2I)モデルでは誤りが頻繁に発生し,誤りは不正確なオブジェクト数と破壊的リレーショナル構造に支配されることがわかった。
論文 参考訳(メタデータ) (2026-05-29T12:18:08Z) - AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models [58.85362281293525]
本稿では、アクション中心のプロンプトから画像を生成する際のT2Iモデルの性能を評価するためのベンチマークであるAcT2Iを紹介する。
我々は、先行するT2IモデルがAcT2Iにうまく対応していないことを実験的に検証した。
我々は,この制限に対処するために,大規模言語モデルを用いた訓練不要の知識蒸留技術を開発した。
論文 参考訳(メタデータ) (2025-09-19T16:41:39Z) - OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation [23.05106664412349]
テキスト・ツー・イメージ(T2I)モデルは、テキスト・プロンプトに整合した高品質な画像を生成する上で大きな注目を集めている。
OneIG-Benchは、T2Iモデルを複数の次元で評価するためのベンチマークフレームワークである。
論文 参考訳(メタデータ) (2025-06-09T17:50:21Z) - T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation [60.620408007636016]
T2I-Eval-R1は,大まかな品質スコアのみを用いて,オープンソースのMLLMを訓練する新しい強化学習フレームワークである。
提案手法では,グループ相対政策最適化を命令調整プロセスに統合し,スカラースコアと解釈可能な推論チェーンの両方を生成する。
論文 参考訳(メタデータ) (2025-05-23T13:44:59Z) - EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation [29.176750442205325]
本研究では,EvalMuse-40Kベンチマークにコントリビュートし,画像テキストアライメントに関連するタスクに対して,微粒な人間のアノテーションを用いた40K画像テキストペアを収集する。
本稿では,T2Iモデルの画像テキストアライメント機能を評価するための2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2024-12-24T04:08:25Z) - Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models [54.052963634384945]
画像再生タスクを導入し,テキスト・ツー・イメージ・モデルの評価を行う。
我々はGPT4Vを用いて参照画像とT2Iモデルのテキスト入力のギャップを埋める。
また、生成した画像の品質を高めるために、ImageRepainterフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-14T13:52:43Z) - Visual Programming for Text-to-Image Generation and Evaluation [73.12069620086311]
テキスト・トゥ・イメージ(T2I)生成と評価のための2つの新しい解釈可能・説明可能なビジュアル・プログラミング・フレームワークを提案する。
まず,T2I生成をオブジェクト/カウント生成,レイアウト生成,画像生成という3つのステップに分解する,解釈可能なステップバイステップT2I生成フレームワークであるVPGenを紹介する。
第2に、視覚プログラミングに基づくT2I生成のための解釈可能かつ説明可能な評価フレームワークであるVPEvalを紹介する。
論文 参考訳(メタデータ) (2023-05-24T16:42:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。