論文の概要: Joint Transcription and Decryption of Images of Encrypted Handwritten Documents: A Comparison with the Traditional Pipeline
- arxiv url: http://arxiv.org/abs/2606.27700v1
- Date: Fri, 26 Jun 2026 03:57:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.365247
- Title: Joint Transcription and Decryption of Images of Encrypted Handwritten Documents: A Comparison with the Traditional Pipeline
- Title(参考訳): 暗号化された手書き文書の画像の同時転写と復号化:従来のパイプラインとの比較
- Abstract要約: 我々は、暗号化された原稿画像をプレーンテキストに直接マッピングするエンドツーエンドアプローチであるDirect Image Decryptionを提案する。
Copiale暗号をケーススタディとして、我々は大規模な暗号のようなトレーニングデータを生成するための合成データ生成パイプラインを構築した。
結果から,共同画像と平文のモデリングは従来の転写に基づくパイプラインの代替となる可能性が示唆された。
- 参考スコア(独自算出の注目度): 4.407170127819703
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Historical encrypted manuscripts present a challenging problem at the intersection of cryptology, linguistics, paleography, and computer vision. Current automatic decipherment approaches usually rely on a two-stage pipeline: transcription of cipher symbols from manuscript images, followed by decryption into plaintext. However, this design is sensitive to transcription errors, which propagate to the final output. We present Direct Image Decryption, an end-to-end approach that directly maps encrypted manuscript images to plaintext, bypassing the intermediate transcription stage. Using the Copiale cipher as a case study, we build a synthetic data generation pipeline to create large-scale cipher-like training data and compare the traditional pipeline with the proposed joint architecture. Results show that joint image-to-plaintext modeling is a promising alternative to traditional transcription-based pipelines.
- Abstract(参考訳): 歴史的暗号化された写本は、暗号学、言語学、古文書学、コンピュータビジョンの交差点で難しい問題を提示している。
現在の自動解読アプローチは、通常2段階のパイプラインに依存している: 原稿画像から暗号記号を転写し、次に復号化して平文化する。
しかし、この設計は最終的な出力に伝播する転写エラーに敏感である。
我々は、中間転写段階をバイパスして、暗号化された原稿画像をプレーンテキストに直接マッピングするエンドツーエンドのアプローチであるDirect Image Decryptionを提案する。
Copiale暗号をケーススタディとして、我々は、大規模な暗号のようなトレーニングデータを作成し、従来のパイプラインと提案されたジョイントアーキテクチャを比較するために、合成データ生成パイプラインを構築します。
結果から,共同画像と平文のモデリングは従来の転写に基づくパイプラインの代替となる可能性が示唆された。
関連論文リスト
- Impact of Iterative Fine-Tuning on Transcription Accuracy in Complex Historical Sanskrit Manuscripts [0.0]
我々は、レイアウトレベルと外観レベルにおいて、ターゲット原稿に反復的に微調整できる、従来のOCRパイプラインを導入する。
我々は3つの複雑な歴史写本からテキストをデジタル化し、標準のPAGE-XMLフォーマットのUnicodeアノテーションとともに、粒度の細かいレイアウトレベルのアノテーションを持つデータセットを導入します。
提案する従来のOCRパイプラインの反復的な微調整による定量的なゲインを示すとともに,導入データセット上でのマルチモーダル大規模言語モデルの性能をベンチマークする。
論文 参考訳(メタデータ) (2026-08-19T08:50:45Z) - Learning to Decipher from Pixels -- A Case Study of Copiale [4.238413656800081]
本稿では,手書きの暗号画像を直接平文にマッピングするエンドツーエンドの書き起こし不要な手法を提案する。
汎用的な手書きデータに対する事前学習と、暗号固有の微調整により、解読精度が大幅に向上することを示す。
以上の結果から, 転写のない画像からテキストへの復号化は, 歴史的置換暗号にも有効であることが示唆された。
論文 参考訳(メタデータ) (2026-04-26T12:51:41Z) - Decoder Pre-Training with only Text for Scene Text Recognition [54.93037783663204]
シーンテキスト認識(STR)事前学習法は,主に合成データセットに依存し,顕著な進歩を遂げている。
STR(DPTR)用テキストのみを用いたDecoder Pre-trainingという新しい手法を提案する。
DPTRはCLIPテキストエンコーダが生成したテキスト埋め込みを擬似視覚埋め込みとして扱い、デコーダの事前訓練に使用する。
論文 参考訳(メタデータ) (2024-08-11T06:36:42Z) - Perceptual Image Compression with Cooperative Cross-Modal Side
Information [53.356714177243745]
本稿では,テキスト誘導側情報を用いた新しい深層画像圧縮手法を提案する。
具体的には,CLIPテキストエンコーダとSemantic-Spatial Awareブロックを用いてテキストと画像の特徴を融合する。
論文 参考訳(メタデータ) (2023-11-23T08:31:11Z) - Unified Multi-Modal Latent Diffusion for Joint Subject and Text
Conditional Image Generation [63.061871048769596]
本稿では, 特定対象を含む画像と共同テキストを入力シーケンスとして用いた, Unified Multi-Modal Latent Diffusion (UMM-Diffusion) を提案する。
より具体的には、入力テキストと画像の両方を1つの統一マルチモーダル潜在空間に符号化する。
入力テキストと画像の両面から複雑な意味を持つ高品質な画像を生成することができる。
論文 参考訳(メタデータ) (2023-03-16T13:50:20Z) - MaskOCR: Text Recognition with Masked Encoder-Decoder Pretraining [68.05105411320842]
本稿では,従来のエンコーダ・デコーダ認識フレームワークにおいて,視覚と言語を事前学習するための新しいアプローチであるMaskOCRを提案する。
マスク付き画像モデリング手法を用いて、未ラベルのテキスト画像の集合を用いて特徴エンコーダを事前学習する。
テキストデータを合成されたテキスト画像に変換し、視覚と言語のデータモダリティを統一し、シーケンスデコーダの言語モデリング能力を向上する。
論文 参考訳(メタデータ) (2022-06-01T08:27:19Z) - DocEnTr: An End-to-End Document Image Enhancement Transformer [13.108797370734893]
文書画像は多くの劣化シナリオに影響され、認識と処理が困難になる。
本稿では,視覚変換器をベースとしたエンコーダデコーダアーキテクチャを提案する。
論文 参考訳(メタデータ) (2022-01-25T11:45:35Z) - Towards Open-World Text-Guided Face Image Generation and Manipulation [52.83401421019309]
顔画像生成と操作の両方に統一的なフレームワークを提案する。
本手法は,画像とテキストの両方を含むオープンワールドシナリオをサポートし,再トレーニングや微調整,後処理は行わない。
論文 参考訳(メタデータ) (2021-04-18T16:56:07Z) - Text Compression-aided Transformer Encoding [77.16960983003271]
本稿では,トランスフォーマーのエンコーディングを強化するために,明示的で暗黙的なテキスト圧縮手法を提案する。
バックボーン情報、つまり入力テキストのgistは、特に焦点を当てていません。
評価の結果,提案した明示的かつ暗黙的なテキスト圧縮手法は,強いベースラインと比較して結果を改善することがわかった。
論文 参考訳(メタデータ) (2021-02-11T11:28:39Z) - A Few-shot Learning Approach for Historical Ciphered Manuscript
Recognition [3.0682439731292592]
少数ショットオブジェクト検出に基づく手書き音声認識のための新しい手法を提案する。
合成データのトレーニングにより,提案アーキテクチャは未知のアルファベットで手書きの暗号を認識可能であることを示す。
論文 参考訳(メタデータ) (2020-09-26T11:49:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。