論文の概要: Simile Understanding in Text-to-Image Models: An Evaluation Framework
- arxiv url: http://arxiv.org/abs/2608.04750v1
- Date: Wed, 05 Aug 2026 12:18:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.903844
- Title: Simile Understanding in Text-to-Image Models: An Evaluation Framework
- Title(参考訳): テキスト・ツー・イメージモデルにおけるシミュラ理解:評価フレームワーク
- Authors: Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe,
- Abstract要約: 最近のテキスト・ツー・イメージモデル(t2iモデル)は、シミュレートプロンプトから視覚的に魅力的な出力を生成することができる。
本稿では、簡易理解のためのスケーラブルな評価フレームワークを提案する。
- 参考スコア(独自算出の注目度): 62.87595758734574
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Similes provide a compact and expressive way to describe visual characteristics in text prompts. Recent text-to-image models (t2i models) can produce visually compelling outputs from simile prompts, yet even frontier models frequently misinterpret the metaphorical vehicle and confuse it with the object. These systematic failures reveal a gap between figurative language and object-level visual grounding in t2i models. To investigate this issue, we propose a scalable evaluation framework for simile understanding. Our framework includes (1) a controlled simile dataset in which metaphorical vehicles are drawn from a predefined set of object-detectable categories and combined with diverse templates, (2) automatic grounding metrics based on YOLO (You Only Look Once) detection, and (3) text encoder layer analysis using Diffusion Lens to track how metaphorical vehicles emerge during generation. Experiments across architecturally diverse t2i models reveal consistent literalization failure patterns. We further discuss potential mitigation strategies for improving simile grounding in t2i models.
- Abstract(参考訳): Similesは、テキストプロンプトで視覚的特徴を記述するためのコンパクトで表現力のある方法を提供する。
最近のテキスト・ツー・イメージモデル(t2iモデル)は、シミュレートプロンプトから視覚的に魅力的な出力を生成することができるが、フロンティアモデルでさえしばしば比喩的な車両を誤解釈し、オブジェクトと混同する。
これらの体系的な失敗は、 t2i モデルにおける図形言語とオブジェクトレベルの視覚的接点のギャップを明らかにする。
この問題を考察するため,我々は簡易理解のためのスケーラブルな評価フレームワークを提案する。
本フレームワークは,(1)隠喩車両を予め定義されたオブジェクト検出可能なカテゴリから抽出し,多様なテンプレートと組み合わせた制御されたシミュレーションデータセット,(2)YOLO(You Only Look Once)検出に基づく自動グラウンドリングメトリクス,(3)Diffusion Lensを用いたテキストエンコーダ層解析により,メタファー車両の発生状況を追跡する。
アーキテクチャ的に多様なt2iモデルに対する実験は、一貫したリテラライゼーション障害パターンを示している。
さらに, t2iモデルにおいて, 模擬接地を改善するための潜在的な緩和戦略について議論する。
関連論文リスト
- Metaphor identification using large language models: A comparison of RAG, prompt engineering, and fine-tuning [0.6524460254566904]
本研究では,大言語モデル(LLM)が全文でメタファ識別を自動化する可能性について検討する。
i) 検索拡張生成(RAG) モデルにコードブックを付与し,その規則や例に基づいて注釈を付けるように指示する手法, (ii) タスク固有の言語命令を設計する手法, (iii) ハンドコードされたテキストでモデルを訓練してパフォーマンスを最適化するファインチューニング,の3つの手法を比較した。
論文 参考訳(メタデータ) (2025-09-29T14:50:18Z) - Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation [120.23172120151821]
本稿では,事前学習した拡散モデルのバックボーンから視覚的特徴と意味的特徴を分離するための新しいアプローチを提案する。
注釈付きセマンティックと視覚対応を備えた画像ペアを構築する自動パイプラインを導入する。
被験者駆動画像生成における視覚的不整合を定量化する新しい指標であるビジュアルセマンティックマッチングを提案する。
論文 参考訳(メタデータ) (2025-09-26T07:11:55Z) - Can Generated Images Serve as a Viable Modality for Text-Centric Multimodal Learning? [3.966028515034415]
本研究は,テキスト・トゥ・イメージ(T2I)モデルにより生成した画像が,テキスト中心のタスクにおいて重要な相補的モダリティとして機能するかどうかを体系的に検討する。
論文 参考訳(メタデータ) (2025-06-21T07:32:09Z) - I Spy a Metaphor: Large Language Models and Diffusion Models Co-Create
Visual Metaphors [38.70166865926743]
言語メタファーから視覚的メタファーを生成するための新しい課題を提案する。
これは、暗黙的な意味と構成性をモデル化する能力を必要とするため、拡散ベースのテキスト-画像モデルにとって難しいタスクである。
我々は1,540の言語メタファーとそれに関連する視覚的エラボレートのための6,476の視覚的メタファーを含む高品質なデータセットを作成する。
論文 参考訳(メタデータ) (2023-05-24T05:01:10Z) - Benchmarking Spatial Relationships in Text-to-Image Generation [102.62422723894232]
本研究では,オブジェクト間の空間的関係を正確に生成するテキスト・ツー・イメージモデルについて検討する。
画像中にテキストで記述された空間関係がどれだけ正確に生成されるかを測定する評価指標であるVISORを提案する。
我々の実験では、最先端のT2Iモデルは高画質であるが、複数のオブジェクトを生成できる能力や、それらの間の空間的関係が著しく制限されていることが判明した。
論文 参考訳(メタデータ) (2022-12-20T06:03:51Z) - Improving Generation and Evaluation of Visual Stories via Semantic
Consistency [72.00815192668193]
一連の自然言語キャプションが与えられた場合、エージェントはキャプションに対応する一連の画像を生成する必要がある。
それまでの作業では、このタスクで合成テキスト・画像モデルより優れた繰り返し生成モデルを導入してきた。
従来のモデリング手法には、デュアルラーニングフレームワークの追加など、いくつかの改善点を提示する。
論文 参考訳(メタデータ) (2021-05-20T20:42:42Z) - Temporal Embeddings and Transformer Models for Narrative Text
Understanding [72.88083067388155]
キャラクタ関係モデリングのための物語テキスト理解のための2つのアプローチを提案する。
これらの関係の時間的進化は動的単語埋め込みによって説明され、時間とともに意味的変化を学ぶように設計されている。
最新の変換器モデルBERTに基づく教師付き学習手法を用いて文字間の静的な関係を検出する。
論文 参考訳(メタデータ) (2020-03-19T14:23:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。