論文の概要: NumBench: Diagnosing Counting Failures in Text-to-Image Models
- arxiv url: http://arxiv.org/abs/2608.28206v1
- Date: Fri, 28 Aug 2026 11:26:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.299477
- Title: NumBench: Diagnosing Counting Failures in Text-to-Image Models
- Title(参考訳): NumBench: テキスト・ツー・イメージモデルにおけるカウンタ障害の診断
- Abstract要約: テキスト・トゥ・イメージ(T2I)モデルは、しばしば間違った数のオブジェクトを生成するが、既存のベンチマークは、理由を説明するには小さすぎるか弱すぎる。
textbfは1,600のカテゴリにまたがる640,000のプロンプトと1から100までのカウントのベンチマークです。
また、要求されたインスタンスが解決可能な画像領域の有限セットに競合するプロセスモデルも開発する。
- 参考スコア(独自算出の注目度): 27.391694807526857
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image (T2I) models often generate the wrong number of objects, yet existing benchmarks are too small or weakly controlled to explain why. We introduce \textbf{NumBench}, a benchmark of 640{,}000 prompts spanning 1{,}600 categories and counts from 1 to 100. Its factorial design varies object composition, spatial guidance, and appearance conditions while balancing counts and category exposure. We also develop a process model in which requested instances compete for a finite set of resolvable image regions. The model predicts a near-quadratic collision deficit at low occupancy and shows how coordinated placement reduces it. For scalable evaluation, we propose the Confidence-Weighted Numeric Precision Score (\cwnps), which aggregates three calibrated detectors and discounts uncertain proposals. Across five commercial systems, two open models, and two specialized counting methods, performance declines sharply with requested count; all evaluated methods are weak above 50 objects. Count range has the largest measured effect, followed by layout and composition. Grid guidance is strongest among guided layouts, consistent with the coordination prediction, although the analysis does not establish collision as the sole cause. A 14{,}400-image human study supports automated evaluation through count 50, while results on 243 natural-language prompts show transfer beyond NumBench templates.
- Abstract(参考訳): テキスト・トゥ・イメージ(T2I)モデルは、しばしば間違った数のオブジェクトを生成するが、既存のベンチマークは、理由を説明するには小さすぎるか弱すぎる。
1{,}600のカテゴリにまたがる640{,}000のプロンプトのベンチマークである \textbf{NumBench} を導入し、1から100までカウントする。
その因子的設計は、数とカテゴリーの露出のバランスを保ちながら、対象の組成、空間的ガイダンス、外観条件を変化させる。
また、要求されたインスタンスが解決可能な画像領域の有限セットに競合するプロセスモデルも開発する。
このモデルでは、低占有率での準四面体近傍の衝突欠陥を予測し、座標配置がいかに減少するかを示す。
スケーラブルな評価のために,3つの校正検出器を集約し,不確実な提案を割引する信頼性重み付き数値精度スコア(\cwnps)を提案する。
5つの商用システム、2つのオープンモデル、2つの特殊な数え方、要求された数え方で性能が急激に低下し、評価された手法はすべて50以上のオブジェクトよりも弱い。
カウントレンジは最大の測定結果を持ち、レイアウトと構成が続く。
配向予測と整合した配向配置では, グリッド誘導が最強であるが, 衝突は唯一の原因とはなっていない。
14{,}400-image human studyは、50の数え上げによる自動評価をサポートし、243の自然言語プロンプトの結果は、NumBenchテンプレートを超えて転送されることを示している。
関連論文リスト
- SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models [9.496555964908188]
マルチモーダル大規模言語モデル(MLLM)は、視覚とテキストの組み合わせによって現実の場面で基礎となる予測を行う。
SIGNPOST-Benchは,テキストビジョンのコンフリクト分解能を評価するための,制御されたデファクト・デファクト・ベンチマークである。
論文 参考訳(メタデータ) (2026-08-04T21:55:47Z) - PaintBench: Deterministic Evaluation of Precise Visual Editing [50.50559031686293]
PaintBenchは20の基本的なビジュアル編集操作のベンチマークである。
11の画像編集モデル全体では、全体的なパフォーマンスが低く、現在の最高パフォーマンスの業界リーダーは17.1%に過ぎなかった。
詳細なベンチマーク診断では、オブジェクト数、背景の複雑さ、色スキーム、編集領域サイズなどのシーン変動によって生じるパフォーマンス劣化が示されている。
論文 参考訳(メタデータ) (2026-05-29T16:01:14Z) - Measuring Representation Robustness in Large Language Models for Geometry [7.743292557234699]
幾何学において、同一の問題はユークリッド、座標、ベクトル形式で表すことができる。
既存のベンチマークでは、固定フォーマットの精度が報告されている。
表現対応評価フレームワークGeoRepEvalを提案する。
論文 参考訳(メタデータ) (2026-04-03T11:36:49Z) - Learning More from Less: Unlocking Internal Representations for Benchmark Compression [37.69575776639016]
異種隠蔽状態を統一潜在空間に整列させて代表コアセットを構成するREPCOREを導入する。
5つのベンチマークと200以上のモデルの実験は、ランキングの相関と推定精度において、出力ベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-01-31T13:11:39Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Beyond 'Templates': Category-Agnostic Object Pose, Size, and Shape Estimation from a Single View [69.6117755984012]
物体の6Dポーズ、サイズ、形状を視覚入力から推定することは、コンピュータビジョンの基本的な問題である。
一つのRGB-D画像から6次元のポーズ,サイズ,密な形状を同時に予測する統合されたカテゴリ非依存フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T17:49:15Z) - The NazoNazo Benchmark: A Cost-Effective and Extensible Test of Insight-Based Reasoning in LLMs [3.9977256267361754]
そこで本研究では,日本人児童のライドルから構築した費用効果評価指標であるNazonazoについて紹介する。
GPT-5以外のモデルは人間の性能に匹敵せず、平均精度は52.9%である。
論文 参考訳(メタデータ) (2025-09-18T07:50:04Z) - Large Language Monkeys: Scaling Inference Compute with Repeated Sampling [81.34900892130929]
モデルから候補解を繰り返しサンプリングする簡単な手法を用いて、推論計算をスケーリングのための別の軸として検討する。
複数のタスクやモデルにまたがって、カバレッジは4桁以上のサンプル数でスケールする。
コードや形式的証明のようなドメインでは、回答が自動的に検証されるので、カバレッジの増加は直接的にパフォーマンスの向上につながります。
論文 参考訳(メタデータ) (2024-07-31T17:57:25Z) - Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence [80.6840060272386]
本稿では,意味的対応のための幾何学的認識の重要性を明らかにする。
この情報を活用することで,意味的対応性能が著しく向上することを示す。
提案手法は,SPair-71kデータセット上で,65.4(ゼロショット)と85.6(教師)のPCK@0.10スコアを達成する。
論文 参考訳(メタデータ) (2023-11-28T18:45:13Z) - Single-Stage Visual Relationship Learning using Conditional Queries [60.90880759475021]
TraCQは、マルチタスク学習問題とエンティティペアの分布を回避する、シーングラフ生成の新しい定式化である。
我々は,DETRをベースとしたエンコーダ-デコーダ条件付きクエリを用いて,エンティティラベル空間を大幅に削減する。
実験結果から、TraCQは既存のシングルステージシーングラフ生成法よりも優れており、Visual Genomeデータセットの最先端の2段階メソッドを多く上回っていることがわかった。
論文 参考訳(メタデータ) (2023-06-09T06:02:01Z) - CounTR: Transformer-based Generalised Visual Counting [94.54725247039441]
我々は任意の意味圏からオブジェクト数を数える計算モデルを開発し、任意の数の「例」を用いて計算する。
FSC-147のような大規模カウントベンチマークの徹底的なアブレーション研究を行い、ゼロおよび少数ショット設定の両方で最先端の性能を示す。
論文 参考訳(メタデータ) (2022-08-29T17:02:45Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。