論文の概要: Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer
- arxiv url: http://arxiv.org/abs/2605.27487v1
- Date: Tue, 26 May 2026 15:28:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.370629
- Title: Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer
- Title(参考訳): クロスドメインスタイル転送による拡散に基づくウクライナ手書きテキスト生成
- Authors: Andrii Ahitoliev, Pavlo Berezin,
- Abstract要約: ウクライナ文字の連結分割, 品質フィルタリング, ターゲットオーバーサンプリングを用いて, 308 人の書き手による 126,177 個の画像のウクライナ語手書き語データセットを構築した。
我々は、CANINE条件付き潜伏拡散U-Netを用いてMobileNetV2三重項型エンコーダを再訓練し、ラテン文字からキリル文字への直接転送をテストする。
クロスドメイン・スタイル・トランスファーは,英語サンプルからのクロスランガル・トランスファー,ゼロショット・トランスファー,20世紀初頭のウクライナの写本へのゼロショット・トランスファー,現代作家のわずかな模倣の3つの設定で評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Handwritten text generation (HTG) conditioned on writer style has been widely studied for Latin scripts, but remains underexplored for low-resource and non-Latin writing systems, leaving open how well existing models generalise beyond the Latin domain. Cyrillic, particularly Ukrainian, lacks both large-scale writer-labeled datasets and empirical evidence of such generalisation. To address this gap, we construct a Ukrainian handwritten word dataset of 126,177 images from 308 writers using connected-component segmentation, quality filtering, and targeted oversampling of underrepresented Ukrainian characters. We retrain DiffusionPen, a MobileNetV2 triplet-loss style encoder with a CANINE-conditioned latent diffusion U-Net, on this dataset without architectural modification, testing direct transfer from Latin to Cyrillic. We evaluate cross-domain style transfer in three settings: cross-lingual transfer from IAM English samples, zero-shot transfer to an early 20th-century Ukrainian manuscript, and few-shot imitation of contemporary writers. The model produces legible, style-consistent word images, indicating that few-shot latent diffusion models generalize beyond the Latin-script domain. We release the dataset, trained models, and evaluation protocol as a reproducible benchmark for writer-aware Cyrillic HTG, providing a foundation for extending stylized HTG to other underrepresented writing systems.
- Abstract(参考訳): 手書きのテキスト生成(HTG)はラテン文字で広く研究されているが、低リソースで非ラテン文字のシステムでは未熟であり、既存のモデルがラテン文字の領域を超えていかに一般化するかは未解明のままである。
キリル文字、特にウクライナ文字は、大規模な作家ラベル付きデータセットとそのような一般化の実証的な証拠の両方を欠いている。
このギャップに対処するため、我々は、連結成分のセグメンテーション、品質フィルタリング、未表現のウクライナ文字のターゲットオーバーサンプリングを用いて、308人の書き手による126,177個の画像のウクライナ語手書き語データセットを構築した。
我々は、CANINE条件付き潜伏拡散U-Netを用いたMobileNetV2三重奏型エンコーダであるDiffusionPenを、アーキテクチャ変更なしにこのデータセット上で再訓練し、ラテン文字からキリル文字への直接転送をテストする。
IAMの英語サンプルからの言語間移動、20世紀初頭のウクライナの写本へのゼロショット転送、現代作家のわずかな模倣の3つの設定でクロスドメイン・スタイル・トランスファーを評価した。
このモデルでは,ラテン文字領域を超えて,最小ショットの潜在拡散モデルが一般化されることが示唆された。
著者を意識したCyrillic HTGの再現可能なベンチマークとして,データセット,訓練されたモデル,評価プロトコルを公開し,HTGを他の未表現文字システムに拡張するための基盤を提供する。
関連論文リスト
- TextLDM: Language Modeling with Continuous Latent Diffusion [89.69255520673248]
拡散変換器(DiT)は、VAEラテント空間におけるフローマッチングで訓練され、画像やビデオ間で統一された視覚生成を行う。
最小限のアーキテクチャ変更で視覚的潜伏拡散のレシピをテキスト生成に転送するTextLDMを提案する。
論文 参考訳(メタデータ) (2026-05-08T13:54:34Z) - Bilingual Text-to-Motion Generation: A New Benchmark and Baselines [52.71312720094036]
LLMアノテーションと厳密な手動修正によって構築されたバイリンガルテキスト・モーション・ベンチマークであるBiHumanML3Dを紹介する。
また,CLA(Cross-Lingual Alignment)を用いたバイリンガルモーション拡散合成(BiMD)を提案する。
CLA を用いた BiMD は 0.045 対 0.169 対 R@3 対 80.8% の FID を達成し、単言語拡散モデルと BiHumanML3D の翻訳ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-03-26T08:48:27Z) - A Comprehensive Benchmark of Language Models on Unicode and Romanized Sinhala [0.2864713389096699]
本稿では,Unicode と Romanized Sinhala の多種多様なコーパス上での現代言語モデル (LM) のベンチマークを示す。
我々は,テキストの予測精度の指標であるパープレキシティ(perplexity)を用いて,オープンソースモデルを評価し,クローズドソースモデルを導出する。
論文 参考訳(メタデータ) (2026-01-21T12:58:46Z) - Capturing Style in Author and Document Representation [4.323709559692927]
著者と文書の埋め込みをスタイリスティックな制約で学習する新しいアーキテクチャを提案する。
本稿では,Gutenbergプロジェクトから抽出した文芸コーパス,Blog Authorship,IMDb62の3つのデータセットについて評価を行った。
論文 参考訳(メタデータ) (2024-07-18T10:01:09Z) - Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts [50.40191599304911]
非ラテン文字で書かれた低リソース言語に対するLLMの性能向上にも効果があるか検討する。
本稿では,(1) の原文,(2) ラテン文字,(3) の両文を対象とする3つのプロンプトテンプレートを提案する。
本研究の結果から,翻訳の有効性はタスクタイプやモデルサイズによって異なることが明らかとなった。
論文 参考訳(メタデータ) (2024-07-02T14:51:20Z) - Lost in Translation, Found in Spans: Identifying Claims in Multilingual
Social Media [40.26888469822391]
クレームスパン識別(CSI)は、ファクトチェックパイプラインの重要なステップである。
ジャーナリストや人間のファクトチェッカーにとって重要な問題だが、いまだに過小評価されている問題である。
我々は、多くのソーシャルメディアプラットフォームから5つのインド語と英語で収集された7Kの現実世界のクレームからなる、新しいデータセットX-CLAIMを作成します。
論文 参考訳(メタデータ) (2023-10-27T15:28:12Z) - PART: Pre-trained Authorship Representation Transformer [52.623051272843426]
文書を書く著者は、自分のテキストに識別情報を印字する。
以前の作品では、手作りの機能や分類タスクを使って著者モデルを訓練していた。
セマンティクスの代わりにテキストの埋め込みを学習するために、対照的に訓練されたモデルを提案する。
論文 参考訳(メタデータ) (2022-09-30T11:08:39Z) - A Simple Multi-Modality Transfer Learning Baseline for Sign Language
Translation [54.29679610921429]
既存の手話データセットには、約10K-20Kの手話ビデオ、グロスアノテーション、テキストが含まれています。
したがって、データは効果的な手話翻訳モデルの訓練のボトルネックとなる。
この単純なベースラインは、2つの手話翻訳ベンチマークで過去の最先端の結果を上回っている。
論文 参考訳(メタデータ) (2022-03-08T18:59:56Z) - Phonetic and Visual Priors for Decipherment of Informal Romanization [37.77170643560608]
観測されたロマライズされたテキストからオリジナルの非ラテン文字を解読するためのノイズチャネルWFSTカスケードモデルを提案する。
私たちは、エジプトのアラビア語とロシア語という2つの言語のロマン化データに基づいて、モデルを直接訓練します。
文字マッピングにおける音声と視覚の先行性による帰納的バイアスを加えることで、両方の言語におけるモデルの性能が大幅に向上することが実証された。
論文 参考訳(メタデータ) (2020-05-05T21:57:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。