論文の概要: Benchmarking Frontier Text-to-Image Models on Image-Description Prompts
- arxiv url: http://arxiv.org/abs/2608.14976v1
- Date: Sat, 15 Aug 2026 01:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.140229
- Title: Benchmarking Frontier Text-to-Image Models on Image-Description Prompts
- Title(参考訳): 画像記述プロンプトにおけるフロンティアテキスト・ツー・イメージモデルのベンチマーク
- Abstract要約: 我々は,Hunyuan 3.0,Gemini 3 Pro Image(Nano Banana Pro),Black Forest Labs FLUX.2,Ideogram 3.0の4つの生産用テキスト・ツー・イメージシステムを評価した。
- 参考スコア(独自算出の注目度): 0.4078247440919473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image models are typically reported on average-case prompts, which understates the gap between systems on compositionally demanding requests involving precise object counts, multi-object attribute binding, legible embedded text, and explicit spatial constraints. We evaluate four production text-to-image systems: Hunyuan 3.0, Gemini 3 Pro Image ("Nano Banana Pro"), Black Forest Labs FLUX.2, and Ideogram 3.0. The evaluation uses the 48 hardest prompts drawn from the DataSeeds.AI Sample Dataset (DSD), selected through an automated complexity-scoring pass over the full corpus. Every generated image is graded using an independent-judge rubric. GPT-5.4-Pro authors an atomic, weighted, mutually exclusive and collectively exhaustive (MECE) evaluation rubric, while Gemini 3.1 Pro Preview independently determines whether each criterion is satisfied. Gemini 3 Pro Image ranks first with a score of 84.8/100, narrowly ahead of FLUX.2 at 82.3/100. Ideogram 3.0 and Hunyuan 3.0 score 65.7/100 and 63.3/100, respectively. Failure analysis shows that the leading systems primarily lose points through object miscounting and geometric artifacts, whereas the trailing systems more frequently produce garbled text. Ideogram 3.0 also frequently omits requested elements. Full per-sample rubrics, scores, and failure annotations are available from the authors upon request.
- Abstract(参考訳): テキスト・ツー・イメージ・モデルは、通常、平均ケースのプロンプトで報告され、正確なオブジェクト数、複数オブジェクト属性のバインディング、可読な埋め込みテキスト、明示的な空間的制約を含む、構成的に要求される要求に対するシステム間のギャップを過小評価する。
我々は,Hunyuan 3.0,Gemini 3 Pro Image(Nano Banana Pro),Black Forest Labs FLUX.2,Ideogram 3.0の4つの生産システムを評価する。
この評価は、DataSeeds.AI Sample Dataset (DSD)から抽出された48個の最も難しいプロンプトを使用しており、完全コーパス上の自動複雑性検査パスによって選択される。
生成された画像はすべて、独立ジュッジルーブを用いてグレードされる。
GPT-5.4-Proは原子量、重み付け、相互排他的、総括的(MECE)評価ルーリックを著し、ジェミニ3.1 Pro Previewはそれぞれの基準が満たされているかどうかを独立に決定する。
Gemini 3 Pro Imageのスコアは84.8/100で、FLUX.2の82.3/100よりわずかに高い。
Ideogram 3.0とHunyuan 3.0はそれぞれ65.7/100、63.3/100である。
故障解析は、主要なシステムが主にオブジェクトの誤算や幾何学的アーティファクトを通してポイントを失うのに対して、後続のシステムはより頻繁にガーブラードテキストを生成することを示している。
Ideogram 3.0はまた、要求された要素を省略する。
リクエストに応じて、サンプルごとのルーブリック、スコア、障害アノテーションが作者から入手可能である。
関連論文リスト
- Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision [0.1749935196721634]
既存のHuman-in-the-loopフレームワークは、余分なクリックを補助機械を介して密集した監視に拡張する。
本稿では, 任意の画素ではなく, 信頼度の高いモデル誤差をターゲットとした, 専門家によるクリックが, 厳密な監督と一致させるのに十分である,という仮説を立てる。
iSAGEは補助機械を使わずに動作する唯一の反復型人間-イン-ザ-ループフレームワークである。
論文 参考訳(メタデータ) (2026-06-08T20:09:35Z) - VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents [1.06378109904813]
VAREXは政府形態からの構造化データ抽出を評価するためのベンチマークである。
ベンチマークは、1,777の文書と1,771のユニークな文書から成っており、3相品質保証を通じて真理を検証している。
結果は、4Bパラメータ以下では、コンプライアンス出力 -- 抽出能力ではなく -- が主要なボトルネックであることを示している。
論文 参考訳(メタデータ) (2026-03-16T11:15:56Z) - MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models [42.91502354577658]
MMIG-Benchは総合的なマルチモーダル画像生成ベンチマークである。
4,850件の注釈付きテキストプロンプトと380件の被験者に1,750件のマルチビュー参照イメージをペアリングする。
MMIG-Benchを用いて、Gemini 2.5 Pro、FLUX、DreamBooth、IP-Adapterを含む17の最先端モデルをベンチマークする。
論文 参考訳(メタデータ) (2025-05-26T02:07:24Z) - Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation [3.4998703934432682]
Redemption Score(RS)は、3つの相補的な信号を三角測量することによって画像キャプションをランク付けする新しいフレームワークである。
Flickr8kベンチマークでは、RSはKendall-$tau$ 58.42を達成した。
論文 参考訳(メタデータ) (2025-05-22T03:35:12Z) - LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models [59.0256377330646]
Lensは3.4Kの現代画像と8つのタスクと12の日次シナリオをカバーする60K以上の人間による質問のベンチマークである。
このデータセットは本質的に、基本的な知覚から構成的推論に至るまで、画像不変のプロンプトを処理するためのMLLMの評価をサポートする。
我々は,Qwen2.5-VL-72B,InternVL3-78B,GPT-4oおよび2つの推論モデルQVQ-72B-previewとKim-VLなどの15以上のフロンティアMLLMを評価する。
論文 参考訳(メタデータ) (2025-05-21T15:06:59Z) - Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment [53.45813302866466]
我々は、インターリーブされたテキスト・画像生成のための総合的な評価フレームワークISGを提案する。
ISGは、全体性、構造性、ブロックレベル、画像固有性の4つのレベルで反応を評価する。
ISGと組み合わせて、ISG-Benchというベンチマークを導入し、8つのカテゴリと21のサブカテゴリにわたる1,150のサンプルを網羅した。
論文 参考訳(メタデータ) (2024-11-26T07:55:57Z) - Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots [66.95139377783966]
マルチモーダル大言語モデルのための包括的ビジュアルコーディングベンチマークであるPlot2Codeを紹介する。
公開されているマットプロットギャラリーから,手作業で選択した高品質なマットプロットプロットを6種類のプロットタイプで収集する。
各プロットに対して、ソースコードを慎重に提供し、GPT-4で要約した記述的命令を提供する。
論文 参考訳(メタデータ) (2024-05-13T17:59:22Z) - T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation [55.16845189272573]
T2I-CompBench++は、合成テキスト・画像生成のための拡張ベンチマークである。
8000のコンポジションテキストプロンプトは、属性バインディング、オブジェクト関係、生成数、複雑なコンポジションの4つのグループに分類される。
論文 参考訳(メタデータ) (2023-07-12T17:59:42Z) - Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations [67.92679668612858]
我々は,集団が個人より優れているという心理的概念に触発されたコンセンサスネットワーク(Css-Net)を提案する。
Css-Netは,(1)コンセンサスモジュールと4つのコンセンサスモジュール,(2)コンセンサス間の相互作用の学習を促進するKulback-Leibler分散損失の2つのコアコンポーネントから構成される。
ベンチマークデータセット、特にFashionIQでは、Css-Netが大幅に改善されている。特に、R@10が2.77%、R@50が6.67%増加し、リコールが大幅に向上している。
論文 参考訳(メタデータ) (2023-06-03T11:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。