論文の概要: Unsupervised Domain Adaptation for Symbol Spotting in Historical Encrypted Manuscripts
- arxiv url: http://arxiv.org/abs/2609.07159v1
- Date: Mon, 07 Sep 2026 07:54:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:23:35.09057
- Title: Unsupervised Domain Adaptation for Symbol Spotting in Historical Encrypted Manuscripts
- Title(参考訳): 歴史的暗号文書におけるシンボルスポッティングのための教師なしドメイン適応
- Abstract要約: クリーンでデジタル化されたフォントクエリと劣化した手書き文字記号のギャップを埋める3段階パイプラインを提案する。
実験の結果,CLIPやDINOv2などのゼロショット基礎モデルよりも大きな差が認められた。
この能力は、パレオグラフィー、歴史家、および未解読の原稿を扱う他の研究者と直接的に関係している。
- 参考スコア(独自算出の注目度): 4.547164943557434
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The decipherment of historical encrypted manuscripts poses a fundamental challenge in Digital Humanities: before any transcription can begin, the symbol inventory of the underlying cipher alphabet must first be identified and characterized. We address this challenge through symbol spotting: given a candidate alphabet specified as a set of rendered font glyphs, the task is to determine whether and where its characters appear in an unseen handwritten document, without any labeled examples from the target script. The main difficulty lies in the domain gap between clean, digitally rendered font queries and degraded handwritten manuscript symbols. We propose a three-stage pipeline that bridges this gap without manual annotation, combining a joint SimCLR+DANN encoder for domain-invariant glyph representations with an embedding-space style-adaptation mechanism applied at retrieval time, requiring no re-training. Experiments on fourteen pages from seven encrypted manuscript collections show that our method outperforms zero-shot foundation models, including CLIP and DINOv2, by a large margin ($+0.194$ P@1 over CLIP ViT-L/14), and surpasses task-specific trained baselines by $+0.138$ P@1. We further demonstrate that the Raw-Cover metric, computed in a fully unsupervised setting, provides a meaningful script-family fingerprint that identifies the underlying alphabet of an unknown document. This capability is of direct practical relevance to palaeographers, historians, and other researchers working with undeciphered manuscripts.
- Abstract(参考訳): 歴史的暗号化された写本の解読は、デジタル人間性において根本的な課題を生じさせる: 転写が始まる前に、基礎となる暗号アルファベットの記号目録を最初に識別し、特徴づけなければならない。
フォントグリフの集合として指定された候補アルファベットが与えられた場合、ターゲットスクリプトのラベル付き例を使わずに、文字が見えない手書き文書に現れるかどうかを判断することが課題である。
主な難点は、クリーンでデジタル化されたフォントクエリと劣化した手書きの原稿シンボルの間のドメインギャップにある。
手動のアノテーションなしでこのギャップをブリッジする3段階パイプラインを提案し、ドメイン不変のグリフ表現のためのSimCLR+DANNエンコーダと、検索時に適用される埋め込み空間スタイル適応機構を組み合わせ、再学習を必要としない。
7つの暗号化された原稿コレクションの14ページの実験では、我々のメソッドはCLIPやDINOv2を含むゼロショット基礎モデルよりも大きなマージン(CLIP ViT-L/14より+0.194$P@1)で、タスク固有のトレーニングベースラインを+0.138$P@1で上回ります。
さらに、完全に教師なしの設定で計算されたRaw-Coverメトリックが、未知の文書の下位のアルファベットを識別する有意義なスクリプト・ファミリー指紋を提供することを示した。
この能力は、パレオグラフィー、歴史家、および未解読の原稿を扱う他の研究者と直接的に関係している。
関連論文リスト
- MonkeyOCRv2: A Visual-Text Foundation Model for Document AI [71.06391669976786]
MonkeyOCRv2は、ドキュメントAIのためのビジュアルテキスト事前トレーニングモデルである。
MonkeyDoc v2は17言語にまたがる1億1300万のイメージからなる、最大規模のドキュメントイメージ事前トレーニングコーパスである。
論文 参考訳(メタデータ) (2026-07-13T13:43:39Z) - Learning to Decipher from Pixels -- A Case Study of Copiale [4.238413656800081]
本稿では,手書きの暗号画像を直接平文にマッピングするエンドツーエンドの書き起こし不要な手法を提案する。
汎用的な手書きデータに対する事前学習と、暗号固有の微調整により、解読精度が大幅に向上することを示す。
以上の結果から, 転写のない画像からテキストへの復号化は, 歴史的置換暗号にも有効であることが示唆された。
論文 参考訳(メタデータ) (2026-04-26T12:51:41Z) - Contrastive Masked Autoencoders for Character-Level Open-Set Writer Identification [25.996617568144675]
本稿では,文字レベルのオープンセット文字識別のためのCMAE(Contrastive Masked Auto-Encoders)を提案する。
我々は,Masked Auto-Encoders (MAE) とContrastive Learning (CL) を同時に組み合わせて,逐次情報を収集し,多様な手書きスタイルを区別する。
我々のモデルはCASIAオンライン手書きデータセットの最先端の結果を達成し、89.7%の精度で到達した。
論文 参考訳(メタデータ) (2025-01-21T05:15:10Z) - Online Writer Retrieval with Chinese Handwritten Phrases: A Synergistic Temporal-Frequency Representation Learning Approach [53.189911918976655]
DOLPHINは,相乗的時間周波数解析による手書き表現の向上を目的とした新しい検索モデルである。
OLIWER(OLIWER)は,1,731人から670,000以上の中国語の字句を含む大規模オンライン作家検索データセットである。
本研究は,手書き表現の質向上における点サンプリング周波数と圧力特性の重要性を強調した。
論文 参考訳(メタデータ) (2024-12-16T11:19:22Z) - Handwritten and Printed Text Segmentation: A Signature Case Study [0.0]
我々は手書きテキストセグメンテーションの課題に対処するための新しいアプローチを開発する。
我々の目的は、クラス全体からテキストを復元することであり、特に重なり合う部分のセグメンテーション性能を向上させることである。
私たちの最高の設定は、以前の2つの異なるデータセットで17.9%、IoUスコアで7.3%のパフォーマンスを上回っています。
論文 参考訳(メタデータ) (2023-07-15T21:49:22Z) - Recognizing Handwriting Styles in a Historical Scanned Document Using
Unsupervised Fuzzy Clustering [0.0]
特異な手書きスタイルは、文字サイズ、ストローク幅、ループ、ダクト、スラットアングル、カーシブリグチュアなど、いくつかの要素のブレンドで異なってくることがある。
隠れマルコフモデル、サポートベクターマシン、半教師付きリカレントニューラルネットワークによるラベル付きデータの研究は、中程度から高い成功を収めている。
本研究では, ファジィソフトクラスタリングと線形主成分分析を併用して, 歴史写本の手動変化を検知することに成功した。
論文 参考訳(メタデータ) (2022-10-30T09:07:51Z) - Open Set Classification of Untranscribed Handwritten Documents [56.0167902098419]
重要な写本の膨大な量のデジタルページイメージが世界中のアーカイブに保存されている。
ドキュメントのクラスや型付け'はおそらくメタデータに含まれる最も重要なタグです。
技術的問題は文書の自動分類の1つであり、それぞれが書き起こされていない手書きのテキスト画像からなる。
論文 参考訳(メタデータ) (2022-06-20T20:43:50Z) - Letter-level Online Writer Identification [86.13203975836556]
我々は文字レベルのオンラインライタIDという新たな問題に焦点をあてる。
主な課題は、しばしば異なるスタイルで手紙を書くことである。
我々はこの問題をオンライン書記スタイルのばらつき(Var-O-Styles)と呼ぶ。
論文 参考訳(メタデータ) (2021-12-06T07:21:53Z) - Scalable Font Reconstruction with Dual Latent Manifolds [55.29525824849242]
タイポグラフィー解析とフォント再構成を行う深層生成モデルを提案する。
このアプローチによって、効果的にモデル化できるキャラクタの種類を大規模にスケールアップすることが可能になります。
多くの言語の文字タイプを表す様々なデータセット上でフォント再構成のタスクを評価する。
論文 参考訳(メタデータ) (2021-09-10T20:37:43Z) - Few Shots Is All You Need: A Progressive Few Shot Learning Approach for
Low Resource Handwriting Recognition [1.7491858164568674]
本稿では,人的労働力のアノテーション処理を大幅に削減する,数ショットの学習に基づく手書き文字認識手法を提案する。
我々のモデルは、テキストライン画像中の与えられたアルファベットのすべてのシンボルを検出し、デコードステップは、シンボル類似性のスコアを転写されたシンボルの最終シーケンスにマッピングする。
このリトレーニングには,数千の手書き記号と境界ボックスのアノテーションが必要であるため,教師なしのプログレッシブ・ラーニング・アプローチによる人的作業を回避することを提案する。
論文 参考訳(メタデータ) (2021-07-21T13:18:21Z) - A Few-shot Learning Approach for Historical Ciphered Manuscript
Recognition [3.0682439731292592]
少数ショットオブジェクト検出に基づく手書き音声認識のための新しい手法を提案する。
合成データのトレーニングにより,提案アーキテクチャは未知のアルファベットで手書きの暗号を認識可能であることを示す。
論文 参考訳(メタデータ) (2020-09-26T11:49:18Z) - Enabling Language Models to Fill in the Blanks [81.59381915581892]
文書中の任意の位置にあるテキストの欠落を予測するタスクである,テキストを埋め込むためのシンプルなアプローチを提案する。
我々は、人工的にマスキングされたテキストと隠蔽されたテキストの連結を含むシーケンスに基づいて、オフザシェルフ言語モデル(またはファインチューン)を訓練する。
言語モデリングにより,この手法により,3つの分野(短編,科学的な要約,歌詞)において,LMが文全体を効果的に埋め込むことができることを示す。
論文 参考訳(メタデータ) (2020-05-11T18:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。