論文の概要: Cross-Language Learning within Arabic Script for Low-Resource HTR
- arxiv url: http://arxiv.org/abs/2605.02089v1
- Date: Sun, 03 May 2026 23:18:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:50.074742
- Title: Cross-Language Learning within Arabic Script for Low-Resource HTR
- Title(参考訳): 低リソースHTRのためのアラビア文字におけるクロスランゲージ学習
- Authors: Sana Al-azzawi, Elisa Barney, Marcus Liwicki,
- Abstract要約: クロススクリプト認識は、一様の精度向上よりも、スクリプトレベルのオーバーラップが主な原因である。
低資源体制下でアラビア文字HTRのためのクロススクリプト共同訓練のラインレベル制御を行った。
ペルシャ語(PHTD)では、共同トレーニングは9.99の文字誤り率(CER)を達成する。
- 参考スコア(独自算出の注目度): 5.227985502946548
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Handwritten Text Recognition (HTR) under limited labeled data remains a challenging problem, particularly for Arabic-script languages. Although modern sequence-based recognizers perform well in high-resource settings, their accuracy degrades sharply as training data becomes scarce. Arabic-script languages share a common writing system with substantial character overlap, motivating cross-script training as a strategy to mitigate data scarcity. We performed experiments on Arabic, Urdu, and Persian scripts and achieved improvements over single-script baselines (new SotA especially for low-resource settings). A key finding of our experiments is that cross-script transfer is largely driven by script-level overlap rather than uniform accuracy improvements. Through a statistical character-level analysis we show that gains are structurally concentrated on characters shared across scripts, while language-specific characters exhibit limited or negative transfer. These findings provide insight into transfer dynamics in low-resource script families. Detailed results include: We conduct a controlled line-level study of cross-script joint training for Arabic-script HTR under low-resource regimes (number of samples K \in 100, 500, 1000 labeled lines) on Arabic (KHATT), Urdu (NUST-UHWR), and Persian (PHTD). A CRNN model is trained on the union of multiple related Arabic-script datasets and evaluated on individual target languages. On Persian (PHTD), joint training achieves a Character Error Rate (CER) of 9.99, surpassing previously reported results despite not using the full available training data. On an Urdu dataset (UNHD), joint training reduces CER from 17.20 to 14.45. Code and data splits are released to ensure reproducibility.1
- Abstract(参考訳): 限られたラベル付きデータの下で手書きテキスト認識(HTR)は、特にアラビア文字言語では難しい問題である。
現代のシーケンスベースの認識器は、高リソース環境ではよく機能するが、トレーニングデータが不足するにつれて、その精度は急激に低下する。
アラビア文字言語は、データ不足を緩和する戦略としてクロススクリプトトレーニングを動機付け、かなりの文字重複を持つ共通の記述システムを共有している。
アラビア文字、ウルドゥー文字、ペルシャ文字で実験を行い、シングルスクリプトベースライン(特に低リソース設定のための新しいSotA)の改善を実現しました。
我々の実験で重要な発見は、クロススクリプト転送は、一様精度の改善よりもスクリプトレベルのオーバーラップが主な原因であるということだ。
統計的キャラクタレベル解析により、ゲインはスクリプト間で共有される文字に構造的に集中していることを示し、言語固有のキャラクタは限定的または負の転送を示す。
これらの知見は、低リソーススクリプトファミリーにおける転送ダイナミクスの洞察を与える。
我々は、低リソース体制下でアラビア文字HTR(K \in 100, 500, 1000のラベル付きライン数)、ウルドゥー語(NUST-UHWR)、ペルシャ語(PHTD)のクロススクリプト共同トレーニングを制御されたラインレベルで実施する。
CRNNモデルは、複数の関連するアラビア文字データセットの結合に基づいて訓練され、個々のターゲット言語で評価される。
ペルシャ語(PHTD)では、ジョイントトレーニングは9.99の文字誤り率(CER)を達成する。
Urduデータセット(UNHD)では、共同トレーニングによりCERは17.20から14.45に減少する。
再現性を保証するため、コードとデータ分割がリリースされる。
関連論文リスト
- The Role of Orthographic Consistency in Multilingual Embedding Models for Text Classification in Arabic-Script Languages [30.39307182175106]
アラビア文字のRoBERTa(AS-RoBERTa)ファミリー:RoBERTaをベースとした4つのモデルを紹介する。
アラビア文字を用いた言語におけるスクリプト認識特化の価値を強調し、スクリプトと言語特異性に根ざした事前学習戦略をさらに支援した。
論文 参考訳(メタデータ) (2025-07-24T19:28:33Z) - Extending LLMs to New Languages: A Case Study of Llama and Persian Adaptation [36.92567530333872]
我々は,大言語モデル(LLM)に新しい言語,すなわちペルシア語を追加することを研究する。
我々は単言語ペルシャ語のデータの事前学習を含む多段階的アプローチを採用する。
生成タスクと分類タスクにおいて,各段階でのモデルの性能を評価する。
論文 参考訳(メタデータ) (2024-12-17T23:18:06Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z) - MRN: Multiplexed Routing Network for Incremental Multilingual Text
Recognition [56.408324994409405]
多重ルーティングネットワーク(MRN)は、現在見られる言語ごとに認識器を訓練する。
MRNは、古いデータへの依存を効果的に減らし、破滅的な忘れ物との戦いを改善する。
既存の汎用IL法よりも大きなマージンで優れている。
論文 参考訳(メタデータ) (2023-05-24T06:03:34Z) - New Results for the Text Recognition of Arabic Maghrib{\=i} Manuscripts
-- Managing an Under-resourced Script [0.0]
アラビア文字Maghrib=iスクリプト専用のHTRモデル開発および微調整のための新しいモードオペラーディを導入・評価する。
いくつかの最先端のHTRモデルの比較は、アラビア語に特化した単語ベースのニューラルアプローチの関連性を示している。
その結果、アラビア文字処理のための新しい視点が開かれ、より一般的には、貧弱な言語処理のためのものである。
論文 参考訳(メタデータ) (2022-11-29T12:21:41Z) - Graphemic Normalization of the Perso-Arabic Script [47.429213930688086]
本稿では,ペルソ・アラビア語が最良文書言語を超えて提示する課題について述べる。
自然言語処理(NLP)の状況に注目する。
ペルソ・アラビア文字ディアスポラの多言語語族8言語に対する正規化が機械翻訳および統計言語モデリングタスクに及ぼす影響を評価する。
論文 参考訳(メタデータ) (2022-10-21T21:59:44Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - Transliteration of Judeo-Arabic Texts into Arabic Script Using Recurrent
Neural Networks [1.933681537640272]
我々は、ユダヤ・アラビア文字をアラビア語の文字に自動翻訳するモデルを訓練する。
我々は、リカレントニューラルネットワーク(RNN)とコネクショニスト時間分類(CTC)の損失を併用して、不平等な入出力長を扱う。
ベースラインの9.5%の文字エラーに対して改善を行い、最高の設定で2%のエラーを達成した。
論文 参考訳(メタデータ) (2020-04-23T18:03:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。