論文の概要: TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters
- arxiv url: http://arxiv.org/abs/2608.19637v1
- Date: Thu, 20 Aug 2026 05:07:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.452635
- Title: TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters
- Title(参考訳): TextRefine:Product Postersにおけるテキスト編集のためのテキストの忠実度、空間配置、グリフレンダリングの改善
- Abstract要約: 製品ポスターのテキスト編集には、新しいテキストを挿入したり、既存のテキストを置き換えたり、製品の外観、背景コンテンツ、グローバルな構成を保存する必要がある。
textbfTextRefineは、教師付き微調整と操作固有の報酬最適化を組み合わせて、これらの相補的な障害モードに対処するタスク整列後トレーニングフレームワークである。
テキスト挿入において,テキスト・スパンレベルの報酬は意味的忠実度とターゲット・スパンのカバレッジを共同で評価し,製品と既存のテキストとの空間的衝突をペナルティ化し,非テキスト領域の保存にゲート構造制約を用いる。
テキスト置換では、グリフレベルの報酬はコネクショニストの時間的分類を利用する。
- 参考スコア(独自算出の注目度): 14.200794184177829
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text editing in product posters entails inserting new text or replacing existing text while preserving product appearance, background content, and global composition. Despite recent progress in instruction-based image editing, general-purpose models remain unreliable in this setting: they often omit or incorrectly render the target text, place it over salient products or pre-existing content, and produce structurally distorted or visually inconsistent glyphs. We introduce \textbf{TextRefine}, a task-aligned post-training framework that combines supervised fine-tuning with operation-specific reward optimization to address these complementary failure modes. For text insertion, our text-span-level reward jointly assesses semantic fidelity and target-span coverage, penalizes spatial conflicts with products and existing text, and employs a gated structural constraint to preserve non-text regions. For text replacement, our glyph-level reward leverages the connectionist temporal classification (CTC) posterior of the target character to provide graded supervision for fine-grained defects, including missing strokes, structural deformations, and confusion among visually similar characters. We further introduce \textbf{OpenTextEdit}, a dataset comprising 100K images for text editing in product posters, with multi-text layouts, detailed text attributes, product masks, and challenging low-frequency characters. Extensive experiments on both insertion and replacement demonstrate that TextRefine consistently outperforms the evaluated image editing baselines in textual fidelity, placement reliability, and glyph quality while better preserving source-image content.
- Abstract(参考訳): 製品ポスターのテキスト編集には、新しいテキストを挿入したり、既存のテキストを置き換えたり、製品の外観、背景コンテンツ、グローバルな構成を保存する必要がある。
命令ベースの画像編集の最近の進歩にもかかわらず、この設定では汎用モデルは信頼できないままであり、それらはしばしばターゲットのテキストを省略または誤ってレンダリングし、健全な製品や既存のコンテンツの上に配置し、構造的に歪んだり、視覚的に一貫性のないグリフを生成する。
我々は,教師付き微調整と操作固有の報酬最適化を組み合わせて,これらの相補的障害モードに対処するタスク整合後トレーニングフレームワークである‘textbf{TextRefine} を紹介した。
テキスト挿入において,テキスト・スパンレベルの報酬は意味的忠実度とターゲット・スパンのカバレッジを共同で評価し,製品と既存のテキストとの空間的衝突をペナルティ化し,非テキスト領域の保存にゲート構造制約を用いる。
テキスト置換では, グリフレベルの報酬は, 対象文字の接続性時間分類(CTC)後部を利用して, 脳卒中, 構造的変形, 視覚的に類似した文字間の混同など, きめ細かい欠陥を段階的に監視する。
さらに,複数テキストレイアウト,詳細なテキスト属性,製品マスク,低周波文字の挑戦といった,製品ポスターのテキスト編集のための100Kイメージからなるデータセットである‘textbf{OpenTextEdit}も紹介する。
挿入と置換の両方に関する大規模な実験により、TextRefineは評価済みのイメージ編集ベースラインを、テキストの忠実さ、配置の信頼性、グリフの品質で一貫して上回り、ソースイメージのコンテンツを保存しやすくしている。
関連論文リスト
- GlyphAnchor: Enhancing Visual Text Rendering via Position-Anchored Glyph Priors [44.606371845449424]
我々はGlyphAnchorを紹介した。GlyphAnchorはテキスト・ツー・イメージと画像編集拡散トランスモデルのための新しいテキストレンダリング拡張手法である。
複数のバックボーンとベンチマーク、例えば、長く、複雑で、密に配置されたテキストと稀な文字シナリオを含む実験は、GlyphAnchorが全体的な画質を保ちながら、一貫してテキストの忠実性を改善することを示している。
論文 参考訳(メタデータ) (2026-09-02T09:23:23Z) - TextWand: A Unified Framework for Scene Text Editing [32.59846554728947]
TextWandは、シーンテキストの削除、生成、置換を単一のモデルに統合するフレームワークである。
テキストの外観と背景の整合性の両方を正確に制御する。
優れたテキストコンテンツの正確性、レイアウトとスタイルの整合性、シーンテキストの削除、生成、置換タスク全体の画質を提供する。
論文 参考訳(メタデータ) (2026-06-04T05:43:24Z) - TextSculptor: Training and Benchmarking Scene Text Editing [88.11688559021628]
データ構築とシーンテキスト編集評価のための総合的なフレームワークであるTextSculptorを提案する。
TextSculptorはオープンソースのテキスト編集性能を改善し、プロプライエタリなモデルとのギャップを狭める。
論文 参考訳(メタデータ) (2026-05-20T12:22:26Z) - Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending [0.0]
本稿では,事前学習したFLUX.1-devバックボーンを用いたテキストレンダリングのためのトレーニングフリーフレームワークを提案する。
このタスクは、認識可能なタイポグラフィーを描画し、対象とするテキスト領域に隠蔽オブジェクトを置くモデルを必要とする。
そこで本研究では,オクルーダー挿入からテキスト保存を分離する2重ストリーム推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-16T04:58:07Z) - WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing [103.68419705566146]
WeEditは、スケーラブルなデータ構築パイプラインと2つのベンチマーク、2段階のトレーニング戦略を含む、システマティックなソリューションである。
具体的には、多様な編集操作と15言語をカバーする330Kのトレーニングペアを生成するHTMLベースの新しい自動編集パイプラインを提案する。
アルゴリズム面では、グリフ誘導による微調整を用いて、空間的および内容的事前の明示を注入し、次いで、命令の順守、テキストの明瞭さ、背景の保存と、生成を整合させる多目的強化学習ステージを用いる。
論文 参考訳(メタデータ) (2026-03-12T06:25:09Z) - TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering [76.53315206999231]
TextPeckerは、プラグアンドプレイで構造的異常を知覚するRL戦略である。
ノイズの多い報酬信号を緩和し、任意のテキスト・イメージ・ジェネレータで動作する。
構造的忠実度の平均利得は4%、意味的アライメントは8.7%である。
論文 参考訳(メタデータ) (2026-02-24T13:40:23Z) - TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment [68.91073792449201]
そこで本研究では,テキストの正確かつ完全な出現を促すトレーニング不要な方法であるTextGuiderを提案する。
具体的には,多モード拡散変換器(MM-DiT)モデルにおける注意パターンを解析し,特に画像に描画することを意図したテキスト関連トークンについて検討する。
テスト時間テキストレンダリングでは,OCR精度とCLIPスコアが大幅に向上し,高い結果が得られた。
論文 参考訳(メタデータ) (2025-12-10T06:18:30Z) - RepText: Rendering Visual Text via Replicating [15.476598851383919]
本稿では,ユーザが指定したフォントの視覚的テキストを正確にレンダリングする機能を備えた,事前学習されたモノリンガルテキスト・画像生成モデルの強化を目的としたRepTextを提案する。
具体的には、ControlNetの設定を採用し、さらに言語に依存しないグリフとレンダリングされたテキストの位置を統合して、調和したビジュアルテキストを生成する。
提案手法は,既存のオープンソース手法より優れており,ネイティブな多言語クローズドソースモデルに匹敵する結果が得られる。
論文 参考訳(メタデータ) (2025-04-28T12:19:53Z) - DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models [115.62816053600085]
デザインイメージをテキスト記述から合成するフレームワークであるDesignDiffusionを提案する。
提案するフレームワークは,ユーザプロンプトから直接テキストおよびビジュアルデザイン要素を合成する。
視覚テキストから派生した特徴的な文字埋め込みを利用して入力プロンプトを強化する。
論文 参考訳(メタデータ) (2025-03-03T15:22:57Z) - Beyond Flat Text: Dual Self-inherited Guidance for Visual Text Generation [17.552733309504486]
現実のイメージでは、斜めまたは湾曲したテキスト、特に缶、バナー、バッジは、芸術的なデザインやレイアウトの制約により、平らなテキストのように頻繁に現れる。
難易度の高いシナリオで視覚テキストを正確に生成する新しいトレーニングフリーフレームワークSTGenを導入する。
論文 参考訳(メタデータ) (2025-01-10T11:44:59Z) - TextDiffuser: Diffusion Models as Text Painters [118.30923824681642]
我々は、背景に忠実な視覚的に魅力的なテキストで画像を生成することに焦点を当てたTextDiffuserを紹介した。
我々は,OCRアノテーションを用いた最初の大規模テキスト画像データセットであるMARIO-10Mに,1000万の画像テキストペアをコントリビュートする。
テキストプロンプトのみまたはテキストテンプレート画像と併用して高品質なテキスト画像を作成し,テキストによる不完全な画像の再構成を行う,テキストディフューザは柔軟かつ制御可能であることを示す。
論文 参考訳(メタデータ) (2023-05-18T10:16:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。