論文の概要: The Effects of Character-Level Data Augmentation on Style-Based Dating
of Historical Manuscripts
- arxiv url: http://arxiv.org/abs/2212.07923v1
- Date: Thu, 15 Dec 2022 15:55:44 GMT
- ステータス: 処理完了
- システム内更新日: 2022-12-16 16:15:59.343004
- Title: The Effects of Character-Level Data Augmentation on Style-Based Dating
of Historical Manuscripts
- Title(参考訳): 文字レベルデータ拡張が歴史文書のスタイルベース日付に及ぼす影響
- Authors: Lisa Koopmans, Maruf A. Dhali and Lambert Schomaker
- Abstract要約: 本稿では,古写本の年代測定におけるデータ拡張の影響について考察する。
リニアサポートベクトルマシンは、歴史的写本から抽出されたテクスチャおよびグラファイムに基づく特徴に基づいて、k倍のクロスバリデーションで訓練された。
その結果, 付加データを用いたトレーニングモデルは, 累積スコアの1%~3%の古写本の性能を向上させることがわかった。
- 参考スコア(独自算出の注目度): 5.285396202883411
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Identifying the production dates of historical manuscripts is one of the main
goals for paleographers when studying ancient documents. Automatized methods
can provide paleographers with objective tools to estimate dates more
accurately. Previously, statistical features have been used to date digitized
historical manuscripts based on the hypothesis that handwriting styles change
over periods. However, the sparse availability of such documents poses a
challenge in obtaining robust systems. Hence, the research of this article
explores the influence of data augmentation on the dating of historical
manuscripts. Linear Support Vector Machines were trained with k-fold
cross-validation on textural and grapheme-based features extracted from
historical manuscripts of different collections, including the Medieval
Paleographical Scale, early Aramaic manuscripts, and the Dead Sea Scrolls.
Results show that training models with augmented data improve the performance
of historical manuscripts dating by 1% - 3% in cumulative scores. Additionally,
this indicates further enhancement possibilities by considering models specific
to the features and the documents' scripts.
- Abstract(参考訳): 古写本の制作年代を特定することは、古文書研究における古書家の主な目標の一つである。
自動化された手法は、より正確に日付を推定するための客観的なツールを提供することができる。
これまでは、手書きのスタイルが時代とともに変わるという仮説に基づいて、デジタル化された歴史写本の日付付けに統計的特徴が用いられてきた。
しかし、そのような文書の不足は、堅牢なシステムを得る上での課題となっている。
そこで本研究では,データ増補が古写本の年代にもたらす影響について考察する。
線形支持ベクターマシンは, 中世古図スケール, 初期のアラム写本, 死海巻など, 異なるコレクションの歴史的写本から抽出されたテクトラル的特徴とグラフ的特徴を, k-foldクロスバリデーションで学習した。
その結果, 付加データを用いたトレーニングモデルは, 累積スコアの1%~3%の古写本の性能を向上させることがわかった。
さらに、機能や文書のスクリプトに特有のモデルを考慮して、さらなる拡張の可能性を示す。
関連論文リスト
- A Bayesian Approach to Harnessing the Power of LLMs in Authorship Attribution [57.309390098903]
著者の属性は、文書の起源または著者を特定することを目的としている。
大きな言語モデル(LLM)とその深い推論能力と長距離テキストアソシエーションを維持する能力は、有望な代替手段を提供する。
IMDbおよびブログデータセットを用いた結果, 著者10名を対象に, 著者1名に対して, 85%の精度が得られた。
論文 参考訳(メタデータ) (2024-10-29T04:14:23Z) - Contrastive Entity Coreference and Disambiguation for Historical Texts [2.446672595462589]
既存のエンティティの曖昧さの方法はしばしば、現代の知識ベースに記憶されていない個人を悩ませる歴史文書の正確さに欠ける。
本研究は,文献の文書間照合の解決と曖昧さの解消に3つの重要な貢献をしている。
論文 参考訳(メタデータ) (2024-06-21T18:22:14Z) - PHD: Pixel-Based Language Modeling of Historical Documents [55.75201940642297]
実史文書に類似した合成スキャンを生成する新しい手法を提案する。
我々は,1700-1900年代における合成スキャンと実際の歴史新聞を組み合わせて,我々のモデルであるPHDを事前訓練した。
我々は、この領域におけるその有用性を強調しながら、我々のモデルを歴史的QAタスクに適用することに成功しました。
論文 参考訳(メタデータ) (2023-10-22T08:45:48Z) - How to Choose Pretrained Handwriting Recognition Models for Single
Writer Fine-Tuning [23.274139396706264]
近年のDeep Learning-based Handwriting Text Recognition (HTR) の進歩は、現代の写本や歴史文書に顕著な性能を持つモデルを生み出している。
これらのモデルは、言語、紙の支持、インク、著者の筆跡など、独特の特徴を持つ写本に適用した場合、同じパフォーマンスを得るのに苦労している。
本稿では,手書きテキスト生成モデルを用いて得られた,大規模で実際のベンチマークデータセットと合成データセットについて考察する。
我々は,5行の実際の微調整行数で,原稿を効果的に書き起こし可能なHTRモデルを得るための,そのようなデータの最も関連性の高い特徴を定量的に示す。
論文 参考訳(メタデータ) (2023-05-04T07:00:28Z) - Recognizing Handwriting Styles in a Historical Scanned Document Using
Unsupervised Fuzzy Clustering [0.0]
特異な手書きスタイルは、文字サイズ、ストローク幅、ループ、ダクト、スラットアングル、カーシブリグチュアなど、いくつかの要素のブレンドで異なってくることがある。
隠れマルコフモデル、サポートベクターマシン、半教師付きリカレントニューラルネットワークによるラベル付きデータの研究は、中程度から高い成功を収めている。
本研究では, ファジィソフトクラスタリングと線形主成分分析を併用して, 歴史写本の手動変化を検知することに成功した。
論文 参考訳(メタデータ) (2022-10-30T09:07:51Z) - PART: Pre-trained Authorship Representation Transformer [64.78260098263489]
文書を書く著者は、語彙、レジストリ、句読点、ミススペル、絵文字の使用など、テキスト内での識別情報をインプリントする。
以前の作品では、手作りのフィーチャや分類タスクを使用して著者モデルをトレーニングし、ドメイン外の著者に対するパフォーマンスの低下につながった。
セマンティクスの代わりにtextbfauthorship の埋め込みを学習するために、対照的に訓練されたモデルを提案する。
論文 参考訳(メタデータ) (2022-09-30T11:08:39Z) - Augraphy: A Data Augmentation Library for Document Images [59.457999432618614]
Augraphyはデータ拡張パイプラインを構築するためのPythonライブラリである。
標準的なオフィス操作によって変更されたように見えるクリーンなドキュメントイメージの拡張版を作成するための戦略を提供する。
論文 参考訳(メタデータ) (2022-08-30T22:36:19Z) - The LAM Dataset: A Novel Benchmark for Line-Level Handwritten Text
Recognition [40.20527158935902]
手書き文字認識(HTR)は、コンピュータビジョンと自然言語処理の交差点におけるオープンな問題である。
イタリア古写本のラインレベルの大規模なHTRデータセットであるLudocio Antonio Muratoriデータセットを60年以上にわたって1人の著者が編集した。
論文 参考訳(メタデータ) (2022-08-16T11:44:16Z) - A Generic Image Retrieval Method for Date Estimation of Historical
Document Collections [0.4588028371034407]
本稿では,異種コレクションの前方でよく一般化する検索手法に基づく頑健な日付推定システムを提案する。
我々は、スムーズなnDCGというランキング損失関数を用いて、各問題の文書の順序を学習する畳み込みニューラルネットワークを訓練する。
論文 参考訳(メタデータ) (2022-04-08T12:30:39Z) - Digital Editions as Distant Supervision for Layout Analysis of Printed
Books [76.29918490722902]
本稿では,この意味的マークアップを,レイアウト解析モデルのトレーニングと評価のための遠隔監視として利用する手法について述べる。
DTA(Deutsches Textarchiv)の50万ページにわたるモデルアーキテクチャの実験では、これらの領域レベルの評価手法と画素レベルのメトリクスとワードレベルのメトリクスとの高い相関性を見出した。
自己学習による精度向上の可能性と、DTAで訓練されたモデルが他の歴史書に一般化できる可能性について論じる。
論文 参考訳(メタデータ) (2021-12-23T16:51:53Z) - Neural Language Modeling for Contextualized Temporal Graph Generation [49.21890450444187]
本稿では,大規模事前学習言語モデルを用いた文書のイベントレベル時間グラフの自動生成に関する最初の研究について述べる。
論文 参考訳(メタデータ) (2020-10-20T07:08:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。