論文の概要: Letter Lemmatization: One-to-one and Banded RNNs for Reversing Character-Set Simplification and Abbreviation in Medieval Text
- arxiv url: http://arxiv.org/abs/2607.09291v1
- Date: Fri, 10 Jul 2026 11:07:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.833086
- Title: Letter Lemmatization: One-to-one and Banded RNNs for Reversing Character-Set Simplification and Abbreviation in Medieval Text
- Title(参考訳): 文字の読み書き:中世テキストにおける文字セットの簡略化と省略のためのワンツーワンとバンド付きRNN
- Authors: Anguelos Nicolaou, Maria Pia Tiseo, Tamas Kovacs, Nicolas Renet, Georg Vogeler,
- Abstract要約: 我々は1対1の文字マッピングに焦点をあて、文字レベル1対1のRNNを訓練して自己監督でそれらを解き放つ。
このようなネットワークを使って、中世の憲章の書き起こしにおける略語をうまく拡張します。
- 参考スコア(独自算出の注目度): 0.7611870296994722
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Medieval document transcribers have very different practices; on top of that, heterogeneous digitization policies have resulted in corpora where the character-set must be viewed as fluid. In this paper we address the problem of changing between character-sets in a flexible manner. We focus on one-to-one character mappings and train characterlevel one-to-one RNNs to undo them with self-supervision; recovering half the CER even with 20 text lines. We analyse the use of these one-to-one networks for HTR post-correction and we see that they obtain significant improvements while totally ignoring ins-dels. We then use the exact same networks with character-level alignment groundtruth compiled from parallel corpora in a training and inference mode we call Banded RNNs. We use such networks to successfully expand abbreviations in medieval charter transcriptions. Finally we introduce an elaborate heuristic which takes the characters of two arbitrary character-sets and defines a metric encapsulating what we consider to be semantic similarity of characters. We call the construction of such mappings letter lemmatization and present a rich Python library that efficiently performs all presented methods.
- Abstract(参考訳): その上、異質なデジタル化ポリシーは、文字セットを流動的と見なさなければならないコーパスをもたらしている。
本稿では,文字集合間をフレキシブルに変化させる問題に対処する。
我々は1対1の文字マッピングに焦点を合わせ、文字レベル1対1のRNNを訓練し、それらを自己監督で解き放つ。
我々は、これらの1対1のネットワークをHTRのポストコレクションに使用することにより、インスデルを完全に無視しながら、大幅な改善が得られることを確認した。
次に、並列コーパスからコンパイルされた文字レベルのアライメント基盤を持つ全く同じネットワークを、Banded RNNと呼ばれるトレーニングおよび推論モードで使用する。
このようなネットワークを使って、中世の憲章の書き起こしにおける略語をうまく拡張します。
最後に、2つの任意の文字集合の文字を取り込み、文字の意味的類似性と考えるものをカプセル化する計量を定義する精巧なヒューリスティックを導入する。
このようなマッピングの構築をレタレントレマティゼーションと呼び、すべての提案したメソッドを効率的に実行するリッチなPythonライブラリを提示します。
関連論文リスト
- CTC Transcription Alignment of the Bullinger Letters: Automatic Improvement of Annotation Quality [0.28617987842985093]
歴史的文書に対する手書き文字認識は、手書きの可変性、劣化ソース、レイアウト対応アノテーションの制限により、依然として困難である。
我々は,CTCの損失を学習した動的プログラミングとモデル出力確率を用いて,全文字とテキスト行画像とをマッチングするCTCアライメントアルゴリズムに基づく自己学習手法を提案する。
提案手法は性能(例えば、PyLaia の CER の 1.1 パーセント)を改善し、アライメント精度を向上させる。
論文 参考訳(メタデータ) (2025-08-11T12:18:41Z) - Improving Quotation Attribution with Fictional Character Embeddings [11.259583037191772]
本稿では,文字のグローバルなスタイリスティックな情報をエンコードする文字埋め込みにより,人気のある引用帰属システムであるBookNLPを提案する。
提案するグローバル文字埋め込みとBookNLPの文脈情報を組み合わせることで,アナフォリックおよび暗黙的引用のための話者識別が向上することを示す。
論文 参考訳(メタデータ) (2024-06-17T09:46:35Z) - Integrating Bidirectional Long Short-Term Memory with Subword Embedding
for Authorship Attribution [2.3429306644730854]
マニフォールド語に基づくスタイリスティックマーカーは、著者帰属の本質的な問題に対処するために、ディープラーニング手法でうまく使われてきた。
提案手法は,CCAT50,IMDb62,Blog50,Twitter50の公営企業における最先端手法に対して実験的に評価された。
論文 参考訳(メタデータ) (2023-06-26T11:35:47Z) - TransLIST: A Transformer-Based Linguistically Informed Sanskrit
Tokenizer [11.608920658638976]
サンスクリットワードアルゴリズム(SWS)は、デジタル化されたテキストを利用できるようにし、下流のタスクをデプロイするのに不可欠である。
我々はTransLIST(Transformer based Linguistically Informed Sanskrit Tokenizer)を提案する。
TransLISTは、SWS特有のサンディー現象を考慮した潜在単語情報と共に文字入力を符号化する。
論文 参考訳(メタデータ) (2022-10-21T06:15:40Z) - Data-Driven Mitigation of Adversarial Text Perturbation [1.3649494534428743]
本研究では,NLPモデルを逆テキスト摂動に対して堅牢にするための難読化パイプラインを提案する。
CW2Vの埋め込みは、文字nグラムに基づく埋め込みよりも、テキストの摂動に対してより堅牢であることを示す。
我々のパイプラインはエンゲージメントベイト分類を0.70から0.67AUCに分類し、敵対的なテキストの摂動を発生させる。
論文 参考訳(メタデータ) (2022-02-19T00:49:12Z) - CDistNet: Perceiving Multi-Domain Character Distance for Robust Text
Recognition [87.3894423816705]
本稿では,MDCDP (Multi-Domain Character Distance Perception) と呼ばれる新しいモジュールを提案する。
MDCDPは位置埋め込みを使用して、クロスアテンションメカニズムに従って視覚的特徴と意味的特徴の両方を問合せする。
我々は、複数のMDCDPを積み重ねたCDistNetを開発し、徐々に正確な距離モデリングをガイドする。
論文 参考訳(メタデータ) (2021-11-22T06:27:29Z) - Charformer: Fast Character Transformers via Gradient-based Subword
Tokenization [50.16128796194463]
モデルの一部としてサブワードトークン化をエンドツーエンドに学習する新しいモデル帰納バイアスを提案する。
文字から潜在単語表現を自動的に学習する,ソフトグラデーションベースのサブワードトークンモジュール(GBST)を導入する。
また、GBSTを統合し、バイトレベルで動作する深層トランスフォーマーモデルであるCharformerを紹介する。
論文 参考訳(メタデータ) (2021-06-23T22:24:14Z) - PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering
Network [54.03560668182197]
任意形状のテキストをリアルタイムで読み取るための,完全畳み込み点収集ネットワーク(PGNet)を提案する。
PG-CTCデコーダを用いて2次元空間から高レベル文字分類ベクトルを収集し,NMSやRoI操作を使わずにテキストシンボルに復号する。
実験により,提案手法は競争精度が向上し,走行速度が著しく向上することが確認された。
論文 参考訳(メタデータ) (2021-04-12T13:27:34Z) - R$^2$-Net: Relation of Relation Learning Network for Sentence Semantic
Matching [58.72111690643359]
文意味マッチングのための関係学習ネットワーク(R2-Net)を提案する。
最初にBERTを使用して、グローバルな視点から入力文をエンコードします。
次に、cnnベースのエンコーダは、ローカルな視点からキーワードやフレーズ情報をキャプチャするように設計されている。
関係情報抽出にラベルを十分に活用するために,関係分類タスクの自己教師付き関係性を導入する。
論文 参考訳(メタデータ) (2020-12-16T13:11:30Z) - Pairwise Learning for Name Disambiguation in Large-Scale Heterogeneous
Academic Networks [81.00481125272098]
本稿では,MA-PairRNN(Multi-view Attention-based Pairwise Recurrent Neural Network)を提案する。
MA-PairRNNは、不均一グラフ埋め込み学習とペアワイズ類似学習をフレームワークに統合する。
実世界の2つのデータセットの結果から、我々のフレームワークは名前の曖昧さに対するパフォーマンスを著しく一貫した改善をしていることがわかる。
論文 参考訳(メタデータ) (2020-08-30T06:08:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。