論文の概要: LV-ROVER-MLT: Low-Resource Maltese OCR by Multi-Stream Voting
- arxiv url: http://arxiv.org/abs/2607.00250v2
- Date: Thu, 02 Jul 2026 11:05:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.507123
- Title: LV-ROVER-MLT: Low-Resource Maltese OCR by Multi-Stream Voting
- Title(参考訳): LV-ROVER-MLT:マルチストリーム投票による低出力マルタOCR
- Abstract要約: 本稿では,文字誤り率0.0234の微調整Tesseractベースラインに対するベンチマーク結果について報告する。
アンサンブル認識のみは、ベースラインと同じラベルの慣例で行われ、文字エラー率を44%改善して0.01317に向上する。
Tesseractのストレートクォートとダッシュ出力をベンチマークのキュリークォート規則に合わせる後処理チェーンと、誤読ダイアクリティカルを回復する1つのステージは、完全なパイプラインを文字エラー率0.00700に導く。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Maltese, although a low-resource language, has its own text corpora and pretrained language models, but we are aware of only one real labelled PDF corpus for OCR training, 57 pages, far below what paragraph-level training needs. With no real corpus to train on at scale, we built a synthetic training pipeline and a 5-stream Tesseract ensemble voted under a lexicon-anchored, ROVER-style scheme adapted for a low-resource setting. We call the Maltese submission LV-ROVER-MLT: an engineered adaptation of LV-ROVER's voting algorithm, not a new one, submitted to the DocEng 2026 competition. All results below are dev-set figures from the competition's own benchmark; the held-out real test CER is unknown at the time of writing and this paper does not claim one. We report results on a 422-paragraph benchmark against a fine-tuned Tesseract baseline with a character error rate of 0.0234. Ensemble recognition alone, scored under the same label convention as the baseline, improves character error rate by 44 percent to 0.01317. A post-processing chain that aligns Tesseract's straight-quote and dash output to the benchmark's curly-quote convention, plus one stage that recovers misread diacritics, brings the full pipeline to a character error rate of 0.00700, a 70 percent reduction. We also tested the same method, unchanged, on Hungarian and Luxembourgish: a bootstrap and permutation audit confirms a 33.7 percent character error rate improvement on Luxembourgish, while the Hungarian margin, 0.8 percent, is not statistically significant.
- Abstract(参考訳): Malteseは低リソース言語だが、独自のテキストコーパスと事前訓練された言語モデルを持っているが、OCRトレーニングのための本当のラベル付きPDFコーパスは1つしかなく、段落レベルのトレーニングに必要なものよりはるかに少ない57ページである。
大規模なトレーニングを行うための本当のコーパスは存在せず、私たちは、低リソース環境に適応したレキシコンアンコール型ROVERスタイルで、合成トレーニングパイプラインと5ストリームのTesseractアンサンブルを構築しました。
我々はマルタのLV-ROVER-MLT(LV-ROVER-MLT:LV-ROVERの投票アルゴリズムの工学的な適応)をDocEng 2026コンペティションに提出した。
以下に示す結果は、コンペティションのベンチマークから得られたデベットセットの数字である。
文字誤り率0.0234の細調整Tesseractベースラインに対する422パラグラフベンチマークの結果を報告する。
アンサンブル認識のみは、ベースラインと同じラベルの慣例で行われ、文字エラー率を44%改善して0.01317に向上する。
Tesseractのストレートクォートとダッシュ出力をベンチマークのキュリークォート基準に合わせる後処理チェーンと、誤読ダイアクリティカルを回復する1つのステージは、完全なパイプラインを文字エラー率0.00700、70%削減する。
我々はまた、ハンガリーとルクセンブルクで同じ方法もテストした: ブートストラップと置換の監査では、ルクセンブルクで33.7%の文字誤り率の改善が確認されているが、ハンガリーのマージン0.8%は統計的に有意ではない。
関連論文リスト
- Contrastive ESA: Human Evaluation of Multiple Translations at Once [45.918020796451536]
Contrastive Error Spanを紹介します。
(cESA) ソース入力(テキスト、ビデオ、オーディオ、画像)の複数翻訳を行うプロトコル。
cESAでは、アノテータは同じ文書の複数の翻訳を見て、メジャーとマイナーのエラースパンをマークし、絶対スケールでスコアを0%から100%に割り当てる。
我々は,12モデルの日本語翻訳を人体で大規模に評価したcESAを検証し,標準点評価と比較して注釈時間と雑音の低減を実証した。
論文 参考訳(メタデータ) (2026-07-29T09:01:59Z) - Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models [1.4095958360608893]
本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応の最適化トレーニングパイプラインは、リソース制約のある環境向けに実装されている。
論文 参考訳(メタデータ) (2026-07-19T09:54:52Z) - Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study [0.0]
OCRシステムは、英語と中国語の文書ベンチマークで強い結果を報告しているが、Indicスクリプトの動作は、ほとんど文字化されていない。
我々は、古典的EasyOCR、オープンVLM(Qwen2.5-VL-3B、Qwen3-VL-8B、olmOCR-7B)、特殊OCR-VLM(DeepSeek-OCR、Unlimited-OCR)、フロンティアクローズドモデル(Gemini 2.5 Flash、Claude Opus 4.7、GPT-5.5、Mistral OCR)の10のシステムをベンチマークする。
ベンチマーク、コード、モデルをリリースします。
論文 参考訳(メタデータ) (2026-06-28T05:46:05Z) - Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity [43.23157850664282]
VOIR DIREは、米国と中国本土にまたがる、626の文化的にペアリングされたイメージプロンプトアーティファクトのマルチモーダルベンチマークである。
6つのMLLMにまたがって、バイアスは2つの障害に分解される。
本稿では,各参照プールに対して個別にアライメントを報告することを推奨する。
論文 参考訳(メタデータ) (2026-06-12T15:53:40Z) - RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching [10.755921557009307]
RobustSpeechFlowは、長さ保存リピートにマッチするコントラストフローを拡張し、遅延拡張をスキップすることでアライメントを改善するトレーニング戦略である。
ワードエラー率(WER)を0.06Bパラメータで1.44から1.38に削減する。
多様な話者および韻律条件に対して、一貫したインテリジェンスの改善を提供する。
論文 参考訳(メタデータ) (2026-05-21T07:22:28Z) - Locale-Conditioned Few-Shot Prompting Mitigates Demonstration Regurgitation in On-Device PII Substitution with Small Language Models [2.2228811750157482]
PIIのリアクションは通常、検出されたエンティティを[PERSON]のようなプレースホルダートークンに置き換える。
我々は、PIIを一貫した型保存型偽値で置き換える完全なオンデバイスパイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-13T13:47:11Z) - GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts [58.92151016423978]
我々は100以上のUnicodeスクリプトでOCRを評価する総合ベンチマークであるGlotOCR Benchを紹介する。
我々のベンチマークは、実際の多言語テキストからレンダリングされたクリーンで劣化した画像の変種で構成されている。
オープンウェイトでプロプライエタリなビジョン言語モデルを幅広く評価した結果,ほとんどの場合,10文字未満でうまく動作することがわかった。
論文 参考訳(メタデータ) (2026-04-14T17:12:41Z) - Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation [0.0]
Pashtoは、約6000~8000万人が話すが、共有公開テストセット上での多言語自動音声認識(ASR)のベンチマークは公開されていない。
本稿では,公開Pashtoデータに対する最初の再現可能なマルチモデル評価を行い,ゼロショットASR,スクリプトレベルの故障,微調整モデルのクロスドメイン評価について報告する。
論文 参考訳(メタデータ) (2026-04-06T11:23:42Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions [0.0]
パトログア・グラエカ・コーパス(Patrologia Graeca Corpus)は、古代ギリシアの19世紀の版において、最初の大規模なオープンなOCRと言語資源である。
このコレクションは、複雑なバイリンガル(ギリシャ・ラテン語)のレイアウトで印刷されたPatrologia Graeca(PG)の残されている未デジタル化の巻をカバーしており、高度に劣化したポリトニック・ギリシャのタイポグラフィーが特徴である。
We achieve a character error rate (CER) of 1.05% and a word error rate (WER) of 4.69%。
その結果得られたコーパスには、約600万の補修と音声タグ付きトークンが含まれており、フルに整列している。
論文 参考訳(メタデータ) (2026-03-10T10:21:54Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Why Stop at Words? Unveiling the Bigger Picture through Line-Level OCR [4.917745659609699]
単語レベルOCRから行レベルOCRへの自然な進化を提案する。
提案手法はOCRの精度だけでなく効率も向上することを示す。
実験の結果, エンドツーエンドの精度は5.4%向上した。
論文 参考訳(メタデータ) (2025-08-29T15:02:11Z) - KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding [24.9462694200992]
KITAB-Benchは、現在の評価システムのギャップを埋める包括的なアラビアOCRベンチマークである。
現代の視覚言語モデル(GPT-4o、Gemini、Qwenなど)は、従来のOCRアプローチを平均60%の文字誤り率(CER)で上回っている。
本研究はアラビア文書分析手法の改良を促進するための厳格な評価枠組みを確立する。
論文 参考訳(メタデータ) (2025-02-20T18:41:23Z) - CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy [50.78228433498211]
CC-OCRは、マルチシーンテキスト読取、多言語テキスト読取、文書解析、キー情報抽出の4つのOCR中心のトラックで構成されている。
39のサブセットと7,058のフルアノテートされたイメージが含まれており、そのうち41%が実際のアプリケーションからソースされ、初めてリリースされた。
我々は9つの顕著なLMMを評価し、これらのモデルの長所と短所、特にテキストの接地、多目的化、繰り返しの幻覚について明らかにした。
論文 参考訳(メタデータ) (2024-12-03T07:03:25Z) - Scaling A Simple Approach to Zero-Shot Speech Recognition [45.83866201822545]
MMS Zero-shotは、平均的な文字エラー率を100言語以上で相対46%削減する。
我々のアプローチはドメイン内の教師付きベースラインに比べて2.5倍高い。
論文 参考訳(メタデータ) (2024-07-25T08:08:55Z) - LOCR: Location-Guided Transformer for Optical Character Recognition [55.195165959662795]
自動回帰中にトランスフォーマーアーキテクチャに位置案内を組み込むモデルであるLOCRを提案する。
125Kの学術文書ページから777万以上のテキスト配置ペアからなるデータセット上でモデルをトレーニングする。
これは、編集距離、BLEU、METEOR、F測定によって測定されたarXivから構築されたテストセットの既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-04T15:34:12Z) - User-Centric Evaluation of OCR Systems for Kwak'wala [92.73847703011353]
OCRを利用すると、文化的に価値ある文書の書き起こしに費やした時間を50%以上削減できることを示す。
この結果から,OCRツールが下流言語ドキュメントや再生作業において持つ潜在的なメリットが示された。
論文 参考訳(メタデータ) (2023-02-26T21:41:15Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - Lexically Aware Semi-Supervised Learning for OCR Post-Correction [90.54336622024299]
世界中の多くの言語における既存の言語データの多くは、非デジタル化された書籍や文書に閉じ込められている。
従来の研究は、あまり良くない言語を認識するためのニューラル・ポスト・コレクション法の有用性を実証してきた。
そこで本研究では,生画像を利用した半教師付き学習手法を提案する。
論文 参考訳(メタデータ) (2021-11-04T04:39:02Z) - Neural OCR Post-Hoc Correction of Historical Corpora [4.427447378048202]
本稿では,再カレント(RNN)と深部畳み込みネットワーク(ConvNet)を組み合わせたニューラルアプローチを提案する。
我々のモデルは多様なOCR転写誤りを捕捉し、単語誤り率を32.3%減らして89%以上削減できることを示す。
論文 参考訳(メタデータ) (2021-02-01T01:35:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。