Fugu-MT 論文翻訳(概要): A Survey on Quality Metrics for Text-to-Image Models

論文の概要: A Survey on Quality Metrics for Text-to-Image Models

arxiv url: http://arxiv.org/abs/2403.11821v4
Date: Tue, 23 Jul 2024 07:04:09 GMT
ステータス: 翻訳完了
システム内更新日: 2024-07-24 22:53:21.568723
Title: A Survey on Quality Metrics for Text-to-Image Models
Title（参考訳）: テキスト・画像モデルの品質指標に関する調査
Authors: Sebastian Hartwig, Dominik Engel, Leon Sick, Hannah Kniesel, Tristan Payer, Poonam Poonam, Michael Glöckler, Alex Bäuerle, Timo Ropinski,
Abstract要約: 本稿では,そのニュアンスに対処する既存のテキスト・ツー・イメージの品質指標の概要と,人間の嗜好に合わせた調整の必要性について述べる。本稿では,これらの指標を分類するための新しい分類法を提案する。我々は,テキスト・ツー・イメージ評価を行う実践者のためのガイドラインを導出し,評価メカニズムのオープンな課題と,現在の指標の限界について論じる。
参考スコア（独自算出の注目度）: 9.753473063305503
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Recent AI-based text-to-image models not only excel at generating realistic images, they also give designers more and more fine-grained control over the image content. Consequently, these approaches have gathered increased attention within the computer graphics research community, which has been historically devoted towards traditional rendering techniques that offer precise control over scene parameters such as objects, materials, and lighting, when generating realistic images. While the quality of rendered images is traditionally assessed through well-established image quality metrics, such as SSIM or PSNR, the unique challenges presented by text-to-image models, which in contrast to rendering interweave the control of scene and rendering parameters, necessitate the development of novel image quality metrics. Therefore, within this survey, we provide a comprehensive overview of existing text-to-image quality metrics addressing their nuances and the need for alignment with human preferences. Based on our findings, we propose a new taxonomy for categorizing these metrics, which is grounded in the assumption that there are two main quality criteria, namely compositionality and generality, which ideally map to human preferences. Ultimately, we derive guidelines for practitioners conducting text-to-image evaluation, discuss open challenges of evaluation mechanisms, and surface limitations of current metrics.
Abstract（参考訳）: 最近のAIベースのテキスト画像モデルは、現実的な画像の生成に優れるだけでなく、デザイナーが画像の内容をより細かく制御できるようになっている。これらのアプローチは、現実的な画像を生成する際に、オブジェクト、材料、照明などのシーンパラメータを正確に制御する伝統的なレンダリング技術に、歴史的に焦点をあてたコンピュータグラフィックス研究コミュニティ内で注目を集めている。レンダリング画像の品質は、従来、SSIMやPSNRといった確立された画像品質指標によって評価されてきたが、テキスト・ツー・イメージモデルによって提示される固有の課題は、シーンとレンダリングパラメータの制御を相互に行うのとは対照的に、新しい画像品質指標の開発が必要である。そこで本調査では,それらのニュアンスに対処する既存のテキスト・ツー・イメージの品質指標と,人間の嗜好に合わせた調整の必要性を概観する。そこで本研究では,これらの指標を分類する新たな分類法を提案する。これは,人間の嗜好に理想的に対応できる,構成性と一般性という2つの主要な品質基準が存在するという仮定に基づくものである。最終的に、テキスト・ツー・イメージ評価を行う実践者のためのガイドラインを導出し、評価メカニズムのオープンな課題と現在のメトリクスの表面的制限について議論する。

関連論文リスト

Aesthetics is Cheap, Show me the Text: An Empirical Evaluation of State-of-the-Art Generative Models for OCR [24.027154975869024]
我々は,テキスト画像の生成と編集の観点から,最先端の生成モデルの能力を評価する。我々は、33の代表的なタスクを選択し、それらを文書、手書きテキスト、シーンテキスト、芸術テキスト、複雑でレイアウトに富んだテキストの5つのカテゴリに分類する。包括的評価のために,クローズド・ソース領域とオープンソース領域の2つの領域にまたがる6つのモデルについて,画像入力とプロンプトを用いて検討した。
論文参考訳（メタデータ） (2025-07-20T18:43:09Z)
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing [60.66800567924348]
テキスト誘導画像編集モデルを評価するための新しいベンチマークを導入する。このベンチマークには、20種類のコンテンツカテゴリにわたる高品質な編集例が1000以上含まれている。我々は、GPT-Image-1をいくつかの最先端編集モデルと比較する大規模な研究を行っている。
論文参考訳（メタデータ） (2025-05-16T17:55:54Z)
Language-Guided Visual Perception Disentanglement for Image Quality Assessment and Conditional Image Generation [48.642826318384294]
CLIPのような対照的な視覚言語モデルは、セマンティック認識タスク間で優れたゼロショット機能を示している。本稿では, 画像のゆがみを導くために, ゆがみのあるテキストを利用する, マルチモーダルな非絡み付き表現学習フレームワークを提案する。
論文参考訳（メタデータ） (2025-03-04T02:36:48Z)
Visual question answering based evaluation metrics for text-to-image generation [7.105786967332924]
本稿では,各オブジェクトに対する入力テキストと生成画像のアライメントを評価するための新しい評価指標を提案する。実験結果から,提案手法はより微細なテキスト画像のアライメントと画質を同時に評価できる優れた指標であることがわかった。
論文参考訳（メタデータ） (2024-11-15T13:32:23Z)
KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities [93.74881034001312]
テキスト・画像生成モデルにおける実体の忠実度に関する系統的研究を行う。我々はランドマークの建物、航空機、植物、動物など、幅広い現実世界の視覚的実体を生成する能力に焦点をあてる。その結果、最も高度なテキスト・画像モデルでさえ、正確な視覚的詳細を持つエンティティを生成できないことが判明した。
論文参考訳（メタデータ） (2024-10-15T17:50:37Z)
Rank-based No-reference Quality Assessment for Face Swapping [88.53827937914038]
顔スワップ法における品質測定の基準は、操作された画像とソース画像の間のいくつかの距離に依存する。顔スワップ用に設計された新しい非参照画像品質評価法(NR-IQA)を提案する。
論文参考訳（メタデータ） (2024-06-04T01:36:29Z)
Information Theoretic Text-to-Image Alignment [49.396917351264655]
本稿では,ステア画像生成のための情報理論アライメント尺度を用いた新しい手法を提案する。提案手法は最先端の手法よりも優れているが,MIを推定するためには事前学習されたデノナイジングネットワークを必要としない。
論文参考訳（メタデータ） (2024-05-31T12:20:02Z)
QUASAR: QUality and Aesthetics Scoring with Advanced Representations [20.194917729936357]
本稿では,画像品質と美学評価のための新しいデータ駆動非パラメトリック手法を提案する。データに効率的な画像アンカーを提案することで、表現力のあるテキスト埋め込みの必要性を解消する。
論文参考訳（メタデータ） (2024-03-11T16:21:50Z)
Advancing Generative Model Evaluation: A Novel Algorithm for Realistic Image Synthesis and Comparison in OCR System [1.2289361708127877]
本研究は、生成モデル分野における重要な課題、特に合成画像の生成と評価について論じる。合成画像のリアリズムを客観的に評価するための先駆的アルゴリズムを提案する。我々のアルゴリズムは、アラビア文字の手書き数字の現実的な画像の生成と評価の課題に対処するために特に適している。
論文参考訳（メタデータ） (2024-02-27T04:53:53Z)
TIER: Text-Image Encoder-based Regression for AIGC Image Quality Assessment [2.59079758388817]
AIGCIQAタスクでは、画像は通常、テキストプロンプトを使用して生成モデルによって生成される。既存のAIGCIQAメソッドのほとんどは、個々の生成された画像から直接予測されたスコアを回帰する。本稿では,テキスト画像エンコーダに基づく回帰(TIER)フレームワークを提案する。
論文参考訳（メタデータ） (2024-01-08T12:35:15Z)
Stellar: Systematic Evaluation of Human-Centric Personalized Text-to-Image Methods [52.806258774051216]
我々は,個々のイメージを入力し,生成プロセスの基盤となるテキストと,所望の視覚的コンテキストを記述したテキストに焦点をあてる。我々は,既存の関連するデータセットよりも桁違いの大きさの個人画像と,リッチなセマンティックな接地真実アノテーションが容易に利用できるパーソナライズされたプロンプトを含む標準化データセット(Stellar)を紹介した。被験者ごとにテストタイムの微調整を必要とせず,新しいSoTAを定量的かつ人為的に設定した,シンプルで効率的でパーソナライズされたテキスト・ツー・イメージのベースラインを導出する。
論文参考訳（メタデータ） (2023-12-11T04:47:39Z)
Transparent Human Evaluation for Image Captioning [70.03979566548823]
画像キャプションモデルのためのルーリックに基づく人間評価プロトコルを開発した。人為的キャプションは機械的キャプションよりも著しく高品質であることを示す。この研究は、画像キャプションのためのより透明な評価プロトコルを促進することを願っている。
論文参考訳（メタデータ） (2021-11-17T07:09:59Z)
Image Quality Assessment in the Modern Age [53.19271326110551]
本チュートリアルは、画像品質評価(IQA)の基礎的理論、方法論、現状の進歩を聴衆に提供する。まず,視覚刺激を適切に選択する方法に着目し,主観的品質評価手法を再考する。手書きのエンジニアリングと(深い)学習ベースの手法の両方をカバーします。
論文参考訳（メタデータ） (2021-10-19T02:38:46Z)
Cross-Quality LFW: A Database for Analyzing Cross-Resolution Image Face Recognition in Unconstrained Environments [8.368543987898732]
現実世界の顔認識アプリケーションは、異なるキャプチャ条件のために、最適な画像の品質や解像度を扱うことが多い。最近のクロスレゾリューション顔認識手法は、画像品質における現実のエッジケースとの距離を測定するために、単純で任意で非現実的なダウンスケールとアップスケーリングの手法を用いている。本稿では,Wildにおける有名なラベル付き顔から派生した,新しい標準ベンチマークデータセットと評価プロトコルを提案する。
論文参考訳（メタデータ） (2021-08-23T17:04:32Z)
Improving Generation and Evaluation of Visual Stories via Semantic Consistency [72.00815192668193]
一連の自然言語キャプションが与えられた場合、エージェントはキャプションに対応する一連の画像を生成する必要がある。それまでの作業では、このタスクで合成テキスト・画像モデルより優れた繰り返し生成モデルを導入してきた。従来のモデリング手法には、デュアルラーニングフレームワークの追加など、いくつかの改善点を提示する。
論文参考訳（メタデータ） (2021-05-20T20:42:42Z)
Intrinsic Image Captioning Evaluation [53.51379676690971]
I2CE(Intrinsic Image Captioning Evaluation)と呼ばれる画像キャプションのための学習ベースメトリクスを提案する。実験の結果,提案手法は頑健な性能を維持し,意味的類似表現やアライメントの少ない意味論に遭遇した場合,候補キャプションに対してより柔軟なスコアを与えることができた。
論文参考訳（メタデータ） (2020-12-14T08:36:05Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。