論文の概要: MSTypography: Multi-character Semantic Typography via Balancing Word Legibility and Object Recognizability
- arxiv url: http://arxiv.org/abs/2609.37141v1
- Date: Tue, 29 Sep 2026 09:41:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.391975
- Title: MSTypography: Multi-character Semantic Typography via Balancing Word Legibility and Object Recognizability
- Title(参考訳): MSTypography: 単語の正当性と物体認識性とのバランスによるマルチ文字意味型分類
- Abstract要約: マルチキャラクタシナリオのためのグローバル・ローカル・タイポグラフィー・フレームワークを提案する。
マスク駆動のシルエット近似をグローバルレベルで実行し、セマンティック誘導による洗練をローカルレベルで実行し、その間に大きな一歩を踏み出します。
我々の知る限り、これは単語の可読性とオブジェクト認識性を効果的にバランスさせる最初のマルチ文字セマンティックタイポグラフィー手法である。
- 参考スコア(独自算出の注目度): 10.057432285479562
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic typography is a design technique where the visual representation of a word conveys its semantic meaning, while maintaining its legibility. Existing digital typography methods mainly focus on single-character scenarios. They suffer from a lack of legibility constraints and insufficient local deformation when extended to multi-character words, as the intricate structures among multiple characters are hardly preserved during the typography process. In this paper, we propose a global-to-local typography framework for multi-character scenarios. It performs mask-driven silhouette approximation at the global level, while semantic-guided refinement at the local level, with a culling step in between to improve efficiency. To preserve word legibility, we designed structural losses (including explicit collision constraints and implicit Jacobian singular value constraints) and an OCR constraint for character-level readability. To enhance the object recognizability, we leverage semantic guidance with diffusion priors, which drives the character glyph toward the target concept while preserving its structural integrity. To the best of our knowledge, this is the first multi-character semantic typography method that effectively balances word legibility and object recognizability. Evaluations on five representative languages (English, Chinese, Japanese, Korean, Arabic) demonstrate superiority over SOTA methods. Codes will be open-sourced.
- Abstract(参考訳): セマンティック・タイポグラフィー(Semantic typography)は、単語の視覚的表現が意味的意味を伝達する設計技法である。
既存のデジタルタイポグラフィー手法は主に単一文字シナリオに焦点を当てている。
複数文字間の複雑な構造はタイポグラフィープロセス中にほとんど保存されないため、多文字語に拡張する際の正当性制約の欠如と局所的な変形の欠如に悩まされる。
本稿では,マルチキャラクタシナリオを対象としたグローバル・ローカル・タイポグラフィー・フレームワークを提案する。
マスク駆動のシルエット近似を世界レベルで実行し、セマンティック誘導による洗練を地域レベルで実行し、効率を向上させるために大きなステップを踏む。
単語の可読性を維持するために,構造的損失(明示的衝突制約と暗黙的ジャコビアン特異値制約を含む)と文字レベルの可読性に対するOCR制約を設計した。
対象の認識性を高めるために,その構造的整合性を維持しつつ,対象概念に向かって文字グリフを駆動する,拡散前のセマンティックガイダンスを利用する。
我々の知る限り、これは単語の可読性とオブジェクト認識性を効果的にバランスさせる最初のマルチ文字セマンティックタイポグラフィー手法である。
代表的な5言語(英語,中国語,日本語,韓国語,アラビア語)に対する評価は,SOTA法よりも優れていた。
コードはオープンソース化される。
関連論文リスト
- See the Text: From Tokenization to Visual Reading [63.10220471118435]
SeeTokはテキストを画像(ビジュアルテキスト)としてレンダリングし、事前訓練されたマルチモーダル計算を利用して解釈する。
3つの異なる言語タスクの中で、SeeeTokはサブワードトークンをマッチまたはオーバーし、トークンを4.43倍少なくし、FLOPを70.5%削減する。
SeeTokは、象徴的なトークン化から人間のような視覚的な読み方へとシフトし、より自然で認知的にインスパイアされた言語モデルへと一歩前進する。
論文 参考訳(メタデータ) (2025-10-21T17:34:48Z) - Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach [51.95266411355865]
自己回帰言語モデルは、正書法攻撃に弱い。
この脆弱性は、サブワードトークン化器とその埋め込みに固有の語彙外問題に起因している。
本稿では,単語を個々の画像としてレンダリングすることで,テキストベースの埋め込みをピクセルベースの表現に置き換える,画素ベースの生成言語モデルを提案する。
論文 参考訳(メタデータ) (2025-08-28T20:48:38Z) - Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model [52.01031460230826]
伝統的なアプローチは固定語彙と閉集合分類パラダイムに大きく依存している。
近年の研究では、大規模言語モデルと視覚言語モデル(VLM)を組み合わせることで、オープンセット認識が可能であることが実証されている。
そこで本研究では,精密な視覚認識のための最先端の手法であるEnriched-FineRを提案する。
論文 参考訳(メタデータ) (2025-07-30T20:06:01Z) - Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning [52.92837273570818]
漢字は独特な構造と構成規則を示しており、表現にきめ細かい意味情報を使用することが可能である。
コントラストパラダイムに基づく階層型多言語画像テキストアライニング(Hi-GITA)フレームワークを提案する。
提案したHi-GITAは既存のゼロショットCCR法より優れている。
論文 参考訳(メタデータ) (2025-05-30T17:39:14Z) - Khattat: Enhancing Readability and Concept Representation of Semantic Typography [0.3994968615706021]
セマンティックタイポグラフィーは、アイデアを選択し、適切なフォントを選択し、創造性と可読性のバランスをとる。
このプロセスを自動化するエンドツーエンドシステムを導入します。
鍵となる機能はOCRベースの損失関数で、読みやすさを高め、複数の文字の同時スタイリングを可能にする。
論文 参考訳(メタデータ) (2024-10-01T18:42:48Z) - Exploiting Word Semantics to Enrich Character Representations of Chinese
Pre-trained Models [12.0190584907439]
本稿では,単語構造を利用して語彙意味を事前学習したモデルの文字表現に統合する手法を提案する。
提案手法は,中国の異なるNLPタスクにおけるBERT,BERT-wwm,ERNIEよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2022-07-13T02:28:08Z) - Single-Stream Multi-Level Alignment for Vision-Language Pretraining [103.09776737512078]
モーダルを複数のレベルで整列させる単一ストリームモデルを提案する。
対称的相互モダリティ再構築と擬似ラベル付きキーワード予測という2つの新しいタスクを用いてこれを実現する。
我々は、ゼロショット/ファインチューニングされた画像/テキスト検索、参照表現、VQAといった一連の視覚言語タスクにおいて、トップパフォーマンスを示す。
論文 参考訳(メタデータ) (2022-03-27T21:16:10Z) - Joint Visual Semantic Reasoning: Multi-Stage Decoder for Text
Recognition [36.12001394921506]
最先端のSOTA(State-of-the-art)モデルは、複雑な背景、さまざまなフォント、制御されていない照明、歪み、その他のアーチファクトのために、いまだに野生のシナリオで苦労している。
これは、そのようなモデルは、テキスト認識のための視覚情報にのみ依存するため、意味論的推論能力が欠如しているためである。
本稿では,複数段階の多段階の注意デコーダを提案する。
論文 参考訳(メタデータ) (2021-07-26T10:15:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。