論文の概要: InnoText: A Unified Model for Visual Text Generation and Editing
- arxiv url: http://arxiv.org/abs/2607.22101v1
- Date: Fri, 24 Jul 2026 08:54:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.08797
- Title: InnoText: A Unified Model for Visual Text Generation and Editing
- Title(参考訳): InnoText: ビジュアルテキスト生成と編集のための統一モデル
- Abstract要約: 単一モデル内でテキスト生成と編集を両立できる統合DiTベースのフレームワークを提案する。
InnoTextは優れた生成精度と編集品質を実現し、視覚的に魅力的でリアルなテキスト画像を生成する。
- 参考スコア(独自算出の注目度): 24.939021711792943
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models have recently achieved remarkable success in high-fidelity image synthesis, yet their application to visual text generation and editing remains relatively underexplored. Unlike general image generation, visual text tasks demand precise structural regularity and legibility, which may pose additional challenges for small-scale text and non-Latin scripts such as Chinese. Existing UNet-based models often struggle to produce clear and coherent text, while DiT-based models, though more expressive, are typically limited to a single task, which may lead to redundant training pipelines, inconsistent visual styles, and reduced cross-task generalization. To address these challenges, we propose InnoText, a unified DiT-based framework capable of performing both text generation and editing within a single model. We introduce a Font Size-Aware Modulation (FSAM) module to enhance representations across font scales, a Small-Character Aware Augmentation strategy to improve fine-grained fidelity, and a Task-Specific Region Weighted Loss for adaptive optimization. To support training and evaluation, we also construct a high-quality bilingual (English-Chinese) visual text dataset covering diverse fonts, sizes, and backgrounds. Experimental results demonstrate that our method achieves superior generation accuracy and editing quality, producing visually appealing and realistic text images.
- Abstract(参考訳): 拡散モデルは近年,高忠実度画像合成において顕著な成功を収めている。
一般的な画像生成とは異なり、視覚テキストタスクは正確な構造的規則性と正当性を要求するため、中国語のような小規模のテキストや非ラテン語のスクリプトにはさらなる課題が生じる可能性がある。
既存のUNetベースのモデルは明瞭で一貫性のあるテキストを生成するのに苦労することが多いが、DiTベースのモデルはより表現力があるものの、通常は単一のタスクに限られており、冗長なトレーニングパイプライン、一貫性のないビジュアルスタイル、クロスタスクの一般化が減少する可能性がある。
これらの課題に対処するために、単一のモデル内でテキスト生成と編集の両方を実行できる統合DiTベースのフレームワークInnoTextを提案する。
フォントスケールをまたいだ表現を強化するためのフォントサイズ・アウェア・モジュレーション(FSAM)モジュール、きめ細かなフィディリティを改善するための小型文字・アウェア・アジュメンテーション戦略、適応最適化のためのタスク-特定領域重み付き損失(Task-Specific Region Weighted Loss)を導入している。
学習と評価を支援するために,多種多様なフォント,サイズ,背景を含む高品質なバイリンガル(中国語)ビジュアルテキストデータセットを構築した。
実験により,提案手法は生成精度と編集品質を向上し,視覚的に魅力的でリアルなテキスト画像を生成することを示した。
関連論文リスト
- TextSculptor: Training and Benchmarking Scene Text Editing [88.11688559021628]
データ構築とシーンテキスト編集評価のための総合的なフレームワークであるTextSculptorを提案する。
TextSculptorはオープンソースのテキスト編集性能を改善し、プロプライエタリなモデルとのギャップを狭める。
論文 参考訳(メタデータ) (2026-05-20T12:22:26Z) - TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering [18.337757379089037]
画像中のテキスト中心領域の総合評価ベンチマークであるTextEditBenchを紹介する。
本ベンチマークでは, 物理的妥当性, 言語的意味, 相互依存をモデルで理解する必要のある, 推論集約的な編集シナリオを強調した。
また,意味的整合性,文脈的コヒーレンス,モーダル間の整合性を維持するためのモデルの推論能力を測定するセマンティック期待(Semantic expectation)を新たに提案する。
論文 参考訳(メタデータ) (2025-12-18T07:37:08Z) - TextSR: Diffusion Super-Resolution with Multilingual OCR Guidance [24.242452422416438]
我々は,多言語テキスト画像超解法に特化して設計された多モーダル拡散モデルであるTextSRを紹介する。
テキストの先行画像と低解像度のテキスト画像を統合することにより,本モデルが効果的に超解像過程を導出する。
TextZoom と TextVQA のデータセット上でのモデルの優れたパフォーマンスは、STISR の新しいベンチマークを設定します。
論文 参考訳(メタデータ) (2025-05-29T05:40:35Z) - RepText: Rendering Visual Text via Replicating [15.476598851383919]
本稿では,ユーザが指定したフォントの視覚的テキストを正確にレンダリングする機能を備えた,事前学習されたモノリンガルテキスト・画像生成モデルの強化を目的としたRepTextを提案する。
具体的には、ControlNetの設定を採用し、さらに言語に依存しないグリフとレンダリングされたテキストの位置を統合して、調和したビジュアルテキストを生成する。
提案手法は,既存のオープンソース手法より優れており,ネイティブな多言語クローズドソースモデルに匹敵する結果が得られる。
論文 参考訳(メタデータ) (2025-04-28T12:19:53Z) - TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark [61.412934963260724]
既存の拡散ベースのテキスト・ツー・イメージモデルは、しばしば画像に正確にテキストを埋め込むのに苦労する。
本研究では,画像に視覚テキストを統合する拡散モデルの有効性を評価するために,大規模で,かつ,迅速な複雑性駆動型ベンチマークであるTextInVisionを紹介する。
論文 参考訳(メタデータ) (2025-03-17T21:36:31Z) - Conditional Text-to-Image Generation with Reference Guidance [81.99538302576302]
本稿では,拡散モデルを生成するために,特定の対象の視覚的ガイダンスを提供する画像の追加条件を用いて検討する。
我々は、異なる参照を取る能力を持つ安定拡散モデルを効率的に支持する、小規模のエキスパートプラグインを複数開発する。
専門的なプラグインは、すべてのタスクにおいて既存のメソッドよりも優れた結果を示し、それぞれ28.55Mのトレーニング可能なパラメータしか含まない。
論文 参考訳(メタデータ) (2024-11-22T21:38:51Z) - TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles [12.182588762414058]
シーンテキスト編集は、オリジナルのように新たに生成されたテキストのスタイルを維持しながら、画像上のテキストを変更することを目的としている。
最近の研究は拡散モデルを活用し、改善された結果を示しているが、依然として課題に直面している。
emphTextMastero - 潜時拡散モデル(LDM)に基づく多言語シーンテキスト編集アーキテクチャを慎重に設計した。
論文 参考訳(メタデータ) (2024-08-20T08:06:09Z) - ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models [52.23899502520261]
本稿では,テキスト構造の学習に特化するために,専用のテキスト拡散モデルを組み込んだARTISTという新しいフレームワークを紹介する。
我々は、事前訓練されたテキスト構造モデルからテキスト構造情報を同化できるように、視覚拡散モデルを微調整する。
この歪んだアーキテクチャ設計とトレーニング戦略は、テキストリッチな画像生成のための拡散モデルのテキストレンダリング能力を著しく向上させる。
論文 参考訳(メタデータ) (2024-06-17T19:31:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。