論文の概要: T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2609.02255v1
- Date: Wed, 02 Sep 2026 08:02:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.14484
- Title: T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
- Title(参考訳): T2LSC-Bench:テキスト・画像生成における局所的意味制御のベンチマーク
- Abstract要約: 製品ラベリング、署名、インターフェースデザインでは、予め定義された主題のアイデンティティや周囲のシーンセマンティクスを変更することなく、指定されたテキストを含む領域内でターゲットテキストをレンダリングすべきである。
既存のビジュアルテキストベンチマークでは、可読性、スペル精度、レイアウトを評価しており、この種のセマンティックリークはほとんど検討されていない。
T2LSC-Benchは、50の被験者と1200のプロンプトケースからなる制御された診断ベンチマークであり、6つのモデルで7,160の画像が得られた。
デュアルブランチプロトコルは、OCR-VLMテキスト検証と構造化VLM意味判断を組み合わせて、テキスト・アット・アンカー精度(TAA)、意味的主題保存(Semantic Subject Preservation)を測定する。
- 参考スコア(独自算出の注目度): 30.939965668317967
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent text-to-image models have become increasingly capable of rendering explicit text, but reliable localized text control requires more than generating the correct string. In applications such as product labeling, signage, and interface design, target text should be rendered within a designated text-bearing region without altering the predefined subject identity or surrounding scene semantics. We refer to violations of this requirement as target-text-associated semantic leakage, in which target-text semantics are expressed through non-textual visual content beyond the designated anchor. Existing visual-text benchmarks primarily evaluate readability, spelling accuracy, and layout, leaving this form of semantic leakage largely unexamined. We introduce T2LSC-Bench, a controlled diagnostic benchmark comprising 50 seed subjects and 1,200 prompt cases per model, yielding 7,160 evaluated images across six models. Its factorized design varies semantic relation, scene openness, prompt mode, and language. A dual-branch protocol combines OCR-VLM text verification with structured VLM semantic judgments to measure Text-at-Anchor Accuracy (TAA), Semantic Subject Preservation (SSP), Semantic Leakage Rate (SLR), and Conditional Semantic Leakage Rate (cSLR). Under stress-test conditions, SLR increases from 1.2% to 18.1% and cSLR from 1.3% to 18.2%, whereas TAA decreases only from 91.4% to 90.9%. Anti-leakage prompting reduces SLR from 16.6% to 8.4% without degrading rendering accuracy. Human validation on 420 images shows strong agreement between automatic and adjudicated annotations. These results show that accurate text rendering does not guarantee local containment of target-text semantics.
- Abstract(参考訳): 最近のテキスト・ツー・イメージモデルは、明示的なテキストをレンダリングする能力がますます高まっているが、信頼性の高いローカライズされたテキスト制御は、正しい文字列を生成する以上のものを必要としている。
製品ラベリング、署名、インターフェースデザインなどのアプリケーションでは、予め定義された主題のアイデンティティや周囲のシーンセマンティクスを変更することなく、指定されたテキストを含む領域内でターゲットテキストをレンダリングすべきである。
本稿では、この要件に違反したことをターゲットテキスト関連セマンティックリークと呼び、ターゲットテキストセマンティクスは指定アンカーを超える非テキストビジュアルコンテンツを通して表現される。
既存のビジュアルテキストベンチマークは、可読性、スペル精度、レイアウトを主に評価し、この種のセマンティックリークはほとんど検討されていない。
T2LSC-Benchは、50の被験者と1200のプロンプトケースからなる制御された診断ベンチマークであり、6つのモデルで7,160の画像が得られた。
その分解されたデザインは意味的関係、シーンの開放性、プロンプトモード、言語によって異なる。
デュアルブランチプロトコルは、OCR-VLMテキスト検証と構造化されたVLM意味判断を組み合わせて、テキスト・アット・アンカー精度(TAA)、意味的対象保存(SSP)、意味的漏洩率(SLR)、条件的意味的漏洩率(cSLR)を測定する。
ストレステスト条件下では、SLRは1.2%から18.1%、cSLRは1.3%から18.2%、TAAは91.4%から90.9%に減少する。
SLRを16.6%から8.4%に低下させるが、精度は低下しない。
420個の画像上の人間の検証は、自動アノテーションと適応アノテーションの強い一致を示している。
これらの結果は、正確なテキストレンダリングは、ターゲットテキストセマンティクスの局所的封じ込めを保証していないことを示している。
関連論文リスト
- Confidence-Aware Ensemble and Long-Word Refinement for Artistic Text Recognition [0.6303112417588329]
アートテキスト認識(ATR)は、装飾的なフォント、湾曲したレイアウト、オブジェクトのような文字、散らかし、激しい歪みを言葉画像で組み合わせることがしばしばあるため、依然として困難である。
本稿では,この設定の標準化ベンチマークとしてWordArt-V1.5について検討し,最近のシーンおよび芸術的テキスト認識器を共通プロトコルで評価する。
本稿では, SVTRv2, PARSeq, MAERecを公式トレーニングスプリットの微調整後に組み合わせた自信認識アンサンブルを提案する。
論文 参考訳(メタデータ) (2026-08-30T18:56:04Z) - QuISE: Defense against Typographic Attacks on VLMs via Query-Irrelevant Semantic Editing [4.1436924146144944]
タイポグラフィー攻撃は視覚言語モデルにとって重大な脅威となる。
QuISEは、クエリ非関連セマンティック編集に基づく、モデルに依存しない、トレーニング不要なブラックボックスディフェンスである。
論文 参考訳(メタデータ) (2026-08-13T11:47:50Z) - Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning [9.515040235138084]
視覚言語アライメントは、オープンボキャブラリ認識、検索、LVLMグラウンド化に有効であるが、自然なキャプションはしばしば不特定である。
マルチビューキャプションを不完全な監視として扱うコア・残差アライメントフレームワークである部分制約としてテキストを提案する。
ゼロショット認識と対向ロバスト性により、TPCはImageNetで81.42/64.05、Avg-14転送スイートで76.19/52.03のクリーン/ローバスト精度を達成した。
論文 参考訳(メタデータ) (2026-07-03T09:32:01Z) - TextSculptor: Training and Benchmarking Scene Text Editing [88.11688559021628]
データ構築とシーンテキスト編集評価のための総合的なフレームワークであるTextSculptorを提案する。
TextSculptorはオープンソースのテキスト編集性能を改善し、プロプライエタリなモデルとのギャップを狭める。
論文 参考訳(メタデータ) (2026-05-20T12:22:26Z) - KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety [0.0]
KidsNannyは、子どもの安全のための2段階のマルチモーダルコンテンツモデレーションアーキテクチャである。
ステージ1は視覚変換器(ViT)と物体検出器を組み合わせた視覚スクリーニング(11.7ms)である。
ステージ2では、コンテキスト推論のためのOCRとテキストベースの7B言語モデル(総パイプライン120ms)が採用されている。
視覚のみ, アイソレーションステージ1, マルチモーダルの2つの条件でUnsafeBench Sexual category(1,054画像)を評価し, フルステージ1+2パイプラインの評価を行った。
論文 参考訳(メタデータ) (2026-03-17T07:00:43Z) - ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation [14.341691123354195]
ASemconsistは、プロンプトアライメントを犠牲にすることなく、文字アイデンティティの明示的な意味制御を可能にする。
我々のフレームワークは最先端のパフォーマンスを実現し、実質的に以前のトレードオフを克服します。
論文 参考訳(メタデータ) (2025-12-29T07:06:57Z) - TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment [68.91073792449201]
そこで本研究では,テキストの正確かつ完全な出現を促すトレーニング不要な方法であるTextGuiderを提案する。
具体的には,多モード拡散変換器(MM-DiT)モデルにおける注意パターンを解析し,特に画像に描画することを意図したテキスト関連トークンについて検討する。
テスト時間テキストレンダリングでは,OCR精度とCLIPスコアが大幅に向上し,高い結果が得られた。
論文 参考訳(メタデータ) (2025-12-10T06:18:30Z) - SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting [59.14029549151904]
エンドツーエンドテキストスポッティング,すなわちSemiETSのための新しいセミ教師付きフレームワークを提案する。
具体的には、各タスクの信頼性の高い階層的な擬似ラベルを徐々に生成し、ノイズの多いラベルを減らす。
双方向の流れから位置や転写の重要な情報を抽出し、一貫性を向上させる。
論文 参考訳(メタデータ) (2025-04-14T08:09:17Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - Self-supervised Character-to-Character Distillation for Text Recognition [54.12490492265583]
そこで本研究では,テキスト表現学習を容易にする汎用的な拡張を可能にする,自己教師型文字-文字-文字間蒸留法CCDを提案する。
CCDは、テキスト認識の1.38%、テキストセグメンテーションの1.7%、PSNRの0.24dB、超解像の0.0321(SSIM)で、最先端の結果を達成する。
論文 参考訳(メタデータ) (2022-11-01T05:48:18Z) - TAP: Text-Aware Pre-training for Text-VQA and Text-Caption [75.44716665758415]
テキストVQAとテキストキャプションタスクのためのテキスト認識事前学習(TAP)を提案する。
TAPは、事前トレーニングにシーンテキスト(OCRエンジンから生成される)を明示的に組み込む。
我々のアプローチは、複数のタスクで大きな利幅で芸術の状態を上回っている。
論文 参考訳(メタデータ) (2020-12-08T18:55:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。