論文の概要: LoGAN: Multilingual Font Localization with Generative Agents
- arxiv url: http://arxiv.org/abs/2609.07029v1
- Date: Mon, 07 Sep 2026 04:34:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.361247
- Title: LoGAN: Multilingual Font Localization with Generative Agents
- Title(参考訳): LoGAN: 生成エージェントを用いた多言語フォントの局在化
- Abstract要約: 本稿では,VLMに基づく多言語フォントローカライズのためのフレームワークであるLoGANを提案する。
LoGANはフォントやロゴの文字から少数の個々のグリフを取り込んで、他の言語で完全な文字セットを生成する。
フォントと現実世界の両方のロゴデータセットに対するアプローチを27言語以上にわたって評価した。
- 参考スコア(独自算出の注目度): 11.01687899097962
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Localizing a font into new languages is a highly intricate task requiring precise design adaptation of glyphs, color/texture, and spacing/kerning, from source to target languages. Most existing methods focus on single glyph generation with limited capability in handling multilingual font rendering. In this work, we propose LoGAN, a VLM-based agentic framework for few-shot multilingual font localization, which takes in a small number of individual glyphs from a font or letters from a logo and uses them to generate complete character sets in other languages. LoGAN breaks down this task into multiple components: a glyph-level diffusion model, a style finetuning module, a spacing and kerning transfer algorithm, and a texture expansion model, with a VLM agent coordinator. LoGAN achieves broad language coverage for font localization with various styles, including Chinese/Korean/Japanese (CJK). We evaluate our approach on both font and real-world logo datasets spanning more than 27 languages and compare it against both specialized font generation and state-of-the-art image editing models with strong text rendering capabilities (e.g., FLUX, Nano-Banana). Our approach yields higher glyph fidelity while maintaining better style, texture, and kerning consistency according to both quantitative and qualitative evaluations.
- Abstract(参考訳): フォントを新しい言語にローカライズすることは、グリフ、色/テクスチャ、およびソースからターゲット言語へのスペーシング/カーニングを正確に設計する必要がある非常に複雑なタスクである。
既存のほとんどのメソッドは、多言語フォントレンダリングの処理能力に制限のある単一のグリフ生成に焦点を当てている。
本稿では,VLMをベースとした多言語フォントローカライズのためのエージェントフレームワークであるLoGANを提案する。
LoGANは、このタスクを、グリフレベルの拡散モデル、スタイルの微調整モジュール、スペーシングとカーニング転送アルゴリズム、およびVLMエージェントコーディネータによるテクスチャ拡張モデルという、複数のコンポーネントに分解する。
LoGANは中国語/韓国語/日本語(CJK)を含む様々なスタイルでフォントローカライゼーションの幅広い言語カバレッジを実現している。
フォントと実世界のロゴデータセットを27言語以上で比較し,テキストレンダリング機能(FLUX,Nano-Bananaなど)を備えた特殊フォント生成モデルと最先端画像編集モデルを比較した。
本手法は, 質的, 質的, 質的, 質的評価の両面から, より優れたスタイル, テクスチャ, カーニング一貫性を維持しつつ, 高いグリフ忠実度が得られる。
関連論文リスト
- Few shot font generation via transferring similarity guided global style
and quantization local style [11.817299400850176]
文字類似性に基づくグローバル特徴とスタイル化コンポーネントレベルの表現からスタイルを集約する新しいフォント生成手法を提案する。
我々のAFFG法は、コンポーネントレベルの表現の完全なセットを得ることができ、また、グローバルなグリフ特性を制御できる。
論文 参考訳(メタデータ) (2023-09-02T05:05:40Z) - VQ-Font: Few-Shot Font Generation with Structure-Aware Enhancement and
Quantization [52.870638830417]
本稿では,VQGANベースのフレームワーク(VQ-Font)を提案する。
具体的には、コードブック内でフォントトークンをカプセル化するために、VQGANを事前訓練する。その後、VQ-Fontは、合成したグリフをコードブックで洗練し、合成されたストロークと実世界のストロークのドメインギャップをなくす。
論文 参考訳(メタデータ) (2023-08-27T06:32:20Z) - CF-Font: Content Fusion for Few-shot Font Generation [63.79915037830131]
本稿では、コンテンツ特徴をベースフォントのコンテンツ特徴によって定義される線形空間に投影するコンテンツ融合モジュール(CFM)を提案する。
提案手法では,参照画像のスタイル表現ベクトルの最適化も可能である。
我々は,6.5k文字の300フォントのデータセットを用いて評価を行った。
論文 参考訳(メタデータ) (2023-03-24T14:18:40Z) - Diff-Font: Diffusion Model for Robust One-Shot Font Generation [110.45944936952309]
Diff-Fontという拡散モデルに基づく新しいワンショットフォント生成手法を提案する。
提案するモデルは,フォントライブラリ全体を生成することを目的として,参照として1つのサンプルのみを与える。
十分に訓練されたDiff-Fontは、フォントギャップやフォントのバリエーションに対して堅牢であるだけでなく、難しい文字生成において有望なパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-12-12T13:51:50Z) - GAS-Net: Generative Artistic Style Neural Networks for Fonts [8.569974263629218]
このプロジェクトはAGIS-Netをベースとした数発のクロスランガルフォントジェネレータを開発することを目的としている。
我々のアプローチには、エンコーダと損失関数の再設計が含まれる。
提案手法は,複数の言語とデータセットで検証する。
論文 参考訳(メタデータ) (2022-12-06T11:23:16Z) - Few-Shot Font Generation by Learning Fine-Grained Local Styles [90.39288370855115]
フラッシュショットフォント生成(FFG)は、いくつかの例で新しいフォントを生成することを目的としている。
提案手法は,1)参照からきめ細かな局所スタイルを学習し,2)コンテンツと参照グリフの空間的対応を学習するフォント生成手法である。
論文 参考訳(メタデータ) (2022-05-20T05:07:05Z) - Font Completion and Manipulation by Cycling Between Multi-Modality
Representations [113.26243126754704]
中間表現としてグラフを用いた2次元グラフィックオブジェクトとしてフォントグリフの生成を探求する。
我々は、画像エンコーダと画像の間のグラフで、モダリティサイクルのイメージ・ツー・イメージ構造を定式化する。
本モデルでは,画像から画像までのベースラインと,それ以前のグリフ補完手法よりも改善された結果を生成する。
論文 参考訳(メタデータ) (2021-08-30T02:43:29Z) - Few-shot Font Generation with Localized Style Representations and
Factorization [23.781619323447003]
ユニバーサルスタイルの代わりに,局所化スタイル,すなわちコンポーネントワイドスタイル表現を学習し,新しいフォント生成手法を提案する。
提案手法は,8つの基準グリフ画像しか持たない少数のフォント生成結果が,他の最先端のフォントよりも著しく優れていることを示す。
論文 参考訳(メタデータ) (2020-09-23T10:33:01Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z) - Few-shot Compositional Font Generation with Dual Memory [16.967987801167514]
我々は、新しいフォント生成フレームワークDual Memory-augmented Font Generation Network (DM-Font)を提案する。
我々は、構成性を活用するために、メモリコンポーネントとグローバルコンテキスト認識をジェネレータに採用する。
韓国手書きフォントとタイ手書きフォントの実験では,本手法が忠実なスタイリングによるサンプルの品質を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2020-05-21T08:13:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。