論文の概要: NegT2IBench: When Negation Changes the Picture. A Polarity Benchmark for Text-to-Image Models
- arxiv url: http://arxiv.org/abs/2610.03084v1
- Date: Fri, 02 Oct 2026 10:03:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.317847
- Title: NegT2IBench: When Negation Changes the Picture. A Polarity Benchmark for Text-to-Image Models
- Title(参考訳): NegT2IBench: 否定が画像を変えるとき
- Abstract要約: 我々は2つの属性タイプと4つの関係カテゴリをカバーする4,800のプロンプトのベンチマークであるNegT2IBenchを紹介した。
私たちの検出器に基づくスコアは再現可能で、監査可能で、要求が失敗したピンポイントです。
- 参考スコア(独自算出の注目度): 42.95507596219371
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Text-to-image (T2I) models are judged by benchmarks that measure whether requested content appears, but these benchmarks largely overlook the complementary ability to satisfy negated constraints, for example, generating "a non-red cup." Measuring negation raises challenges not faced by affirmation-based benchmarks and requires careful prompt and evaluation design. We introduce NegT2IBench, a benchmark of 4,800 prompts covering two attribute types and four relation categories. Prompts are organized by polarity: the number of positive statements that must hold and negated statements that must not, each ranging from 0 to 2. Varying the two independently separates the effect of negation from the effect of prompt complexity. Our detector-based scoring is reproducible, auditable, and pinpoints which requirement failed. On 600 images with three-annotator labels, it agrees with humans as closely as vision-language judges up to 30x larger, while using only a fraction of their GPU memory. Across eleven T2I models and 211,200 images, nine score lower on a single negated statement than on a single positive one. Per-statement scoring reveals that the loss is largest for color and near zero for proximity, and that 41.5% of failed statements render exactly what the prompt forbids. Rendering what a prompt asks for and withholding what it forbids are distinct capabilities that an aggregate compositional score cannot distinguish. NegT2IBench measures the latter directly, providing a controlled testbed for diagnosing negation failures and developing methods to overcome them.
- Abstract(参考訳): テキスト・ツー・イメージ(T2I)モデルは、要求されたコンテンツが現れるかどうかを測定するベンチマークによって判断されるが、これらのベンチマークは、例えば「非赤いカップ」を生成するように、否定された制約を満たす補完的な能力を見落としている。
否定を測定することは、肯定的なベンチマークでは直面しない課題を提起し、慎重なプロンプトと評価設計を必要とする。
我々は2つの属性タイプと4つの関係カテゴリをカバーする4,800のプロンプトのベンチマークであるNegT2IBenchを紹介した。
プロンプトは極性によって構成される: 0 から 2 までの範囲で、持たなければならない正のステートメントの数と、そうでなければならないステートメントを否定する数。
2つを分離することは、否定の効果と迅速な複雑性の効果を独立に分離する。
私たちの検出器に基づくスコアは再現可能で、監査可能で、要求が失敗したピンポイントです。
3つのアノテータラベルを持つ600の画像では、人間の約30倍の大きさの視覚言語判断に一致し、GPUメモリのごく一部しか使用していない。
11個のT2Iモデルと211,200枚の画像の合計で、1つの否定されたステートメントで9つのスコアが1つの肯定的なステートメントよりも低い。
パーステートメントスコアでは、損失は色で最大であり、近距離ではゼロ近くであり、失敗文の41.5%は、プロンプトが何をすることを正確に表している。
プロンプトが求めていることのレンダリングと、それが何を許すかの保持は、総合的な構成スコアが区別できない異なる能力である。
NegT2IBenchは後者を直接測定し、否定障害を診断し、それらを克服するための方法を開発するための制御されたテストベッドを提供する。
関連論文リスト
- DEPICT: Scoring Text-to-Image Alignment by Answer Agreement [4.8252947999831]
画像ベースとキャプションのみの回答との一致を期待して、固定参照回答を置き換えるトレーニングフリーのメトリクスであるDEPICTを提案する。
我々は,DECICTを3つのモデルファミリーの5つのベンチマークと11個のバックボーンで評価し,トレーニング不要の指標をすべて超越し,3つの人間相関ベンチマークのうち2つで微調整した評価器を超越していることを確認した。
論文 参考訳(メタデータ) (2026-10-02T17:13:49Z) - NumBench: Diagnosing Counting Failures in Text-to-Image Models [27.391694807526857]
テキスト・トゥ・イメージ(T2I)モデルは、しばしば間違った数のオブジェクトを生成するが、既存のベンチマークは、理由を説明するには小さすぎるか弱すぎる。
textbfは1,600のカテゴリにまたがる640,000のプロンプトと1から100までのカウントのベンチマークです。
また、要求されたインスタンスが解決可能な画像領域の有限セットに競合するプロセスモデルも開発する。
論文 参考訳(メタデータ) (2026-08-28T11:26:19Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Vision-Language Models Do Not Understand Negation [50.27667000027403]
NegBenchは18のタスクバリエーションと79ドルのサンプルに対する否定的理解を評価するために設計されたベンチマークである。
提案手法は, 否定的クエリに対するリコールが10%増加し, 否定的キャプションを用いた複数質問に対する精度が28%向上することを示す。
論文 参考訳(メタデータ) (2025-01-16T09:55:42Z) - Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2) [62.44395685571094]
T2IScoreScoreはプロンプトを含むセマンティックエラーグラフのキュレートされたセットであり,誤画像の集合である。
これにより、与えられた迅速な忠実度測定値が、客観的な誤差数に対して正しく画像を順序付けできるかどうかを厳格に判断することができる。
最先端のVLMベースのメトリクスは、CLIPScoreのような単純な(そしておそらく悪い)機能ベースのメトリクスを著しく上回りません。
論文 参考訳(メタデータ) (2024-04-05T17:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。