論文の概要: LV-ROVER: Multi-Stream Tesseract Voting for Maltese Paragraph OCR
- arxiv url: http://arxiv.org/abs/2607.00250v1
- Date: Tue, 30 Jun 2026 22:58:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.657055
- Title: LV-ROVER: Multi-Stream Tesseract Voting for Maltese Paragraph OCR
- Title(参考訳): LV-ROVER:マルタパラグラフOCRのためのマルチストリームテッセラクト投票
- Abstract要約: 実際にトレーニングするためのコーパスがなければ、私たちは合成トレーニングパイプラインと5ストリームのTesseract LV-ROVERアンサンブルを構築しました。
文字誤り率(CER)0.0234の細調整されたテッセラクトベースラインに対する422パラグラフベンチマークの結果を報告する。
アンサンブル認識だけでCERは44%改善され、0.01317になった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Maltese has decent text corpora and pretrained language models, but, like many languages outside the handful with large OCR benchmarks, only a single known real labelled PDF corpus for OCR training, 57 page, far below what paragraph-level training needs: low-resource for OCR specifically. With no real corpus to train on at scale, we built a synthetic training pipeline and a 5-stream Tesseract LV-ROVER ensemble, and report results on a 422-paragraph benchmark against a fine-tuned-Tesseract baseline of character error rate (CER) 0.0234. Ensemble recognition alone improves CER by 44 percent, to 0.01317; a five-stage post-processing chain brings the full pipeline to CER 0.00700, a 70 percent reduction. Most of that chain is typographic normalisation, but one stage recovers misread diacritics rather than aligning punctuation, so we report it as a recognition gain rather than folding the whole chain under one label. We treat the 44 percent figure as the portable estimate of what the recogniser learned, and the 70 percent figure as specific to this benchmark's label convention.
- Abstract(参考訳): Malteseにはまともなテキストコーパスと事前訓練された言語モデルがあるが、大規模なOCRベンチマークを持つ少数の言語以外の多くの言語と同様に、OCRトレーニングのための唯一の本当のラベル付きPDFコーパス、57ページしか知られていない。
実際の訓練用コーパスを持たず,5ストリームのTesseract LV-ROVERアンサンブルと5ストリームのTesseract LV-ROVERアンサンブルを構築し,文字誤り率(CER)0.0234の微調整されたTesseract-Tesseractベースラインに対する422パラグラフベンチマークの結果を報告する。
アンサンブル認識だけでCERを44%改善し、0.01317になった。
典型的正規化がほとんどであるが,一段目では句読点の整列ではなく,誤読点が回復するので,一段目の下に全鎖を折り畳むのではなく,認識の利得として報告する。
44%の数字を、認識者が何を学んだかのポータブルな見積もりとして扱い、70%の数字を、このベンチマークのラベル規約に固有のものとして扱います。
関連論文リスト
- Contrastive ESA: Human Evaluation of Multiple Translations at Once [45.918020796451536]
Contrastive Error Spanを紹介します。
(cESA) ソース入力(テキスト、ビデオ、オーディオ、画像)の複数翻訳を行うプロトコル。
cESAでは、アノテータは同じ文書の複数の翻訳を見て、メジャーとマイナーのエラースパンをマークし、絶対スケールでスコアを0%から100%に割り当てる。
我々は,12モデルの日本語翻訳を人体で大規模に評価したcESAを検証し,標準点評価と比較して注釈時間と雑音の低減を実証した。
論文 参考訳(メタデータ) (2026-07-29T09:01:59Z) - Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models [1.4095958360608893]
本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応の最適化トレーニングパイプラインは、リソース制約のある環境向けに実装されている。
論文 参考訳(メタデータ) (2026-07-19T09:54:52Z) - Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study [0.0]
OCRシステムは、英語と中国語の文書ベンチマークで強い結果を報告しているが、Indicスクリプトの動作は、ほとんど文字化されていない。
我々は、古典的EasyOCR、オープンVLM(Qwen2.5-VL-3B、Qwen3-VL-8B、olmOCR-7B)、特殊OCR-VLM(DeepSeek-OCR、Unlimited-OCR)、フロンティアクローズドモデル(Gemini 2.5 Flash、Claude Opus 4.7、GPT-5.5、Mistral OCR)の10のシステムをベンチマークする。
ベンチマーク、コード、モデルをリリースします。
論文 参考訳(メタデータ) (2026-06-28T05:46:05Z) - Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity [43.23157850664282]
VOIR DIREは、米国と中国本土にまたがる、626の文化的にペアリングされたイメージプロンプトアーティファクトのマルチモーダルベンチマークである。
6つのMLLMにまたがって、バイアスは2つの障害に分解される。
本稿では,各参照プールに対して個別にアライメントを報告することを推奨する。
論文 参考訳(メタデータ) (2026-06-12T15:53:40Z) - RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching [10.755921557009307]
RobustSpeechFlowは、長さ保存リピートにマッチするコントラストフローを拡張し、遅延拡張をスキップすることでアライメントを改善するトレーニング戦略である。
ワードエラー率(WER)を0.06Bパラメータで1.44から1.38に削減する。
多様な話者および韻律条件に対して、一貫したインテリジェンスの改善を提供する。
論文 参考訳(メタデータ) (2026-05-21T07:22:28Z) - Locale-Conditioned Few-Shot Prompting Mitigates Demonstration Regurgitation in On-Device PII Substitution with Small Language Models [2.2228811750157482]
PIIのリアクションは通常、検出されたエンティティを[PERSON]のようなプレースホルダートークンに置き換える。
我々は、PIIを一貫した型保存型偽値で置き換える完全なオンデバイスパイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-13T13:47:11Z) - GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts [58.92151016423978]
我々は100以上のUnicodeスクリプトでOCRを評価する総合ベンチマークであるGlotOCR Benchを紹介する。
我々のベンチマークは、実際の多言語テキストからレンダリングされたクリーンで劣化した画像の変種で構成されている。
オープンウェイトでプロプライエタリなビジョン言語モデルを幅広く評価した結果,ほとんどの場合,10文字未満でうまく動作することがわかった。
論文 参考訳(メタデータ) (2026-04-14T17:12:41Z) - Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation [0.0]
Pashtoは、約6000~8000万人が話すが、共有公開テストセット上での多言語自動音声認識(ASR)のベンチマークは公開されていない。
本稿では,公開Pashtoデータに対する最初の再現可能なマルチモデル評価を行い,ゼロショットASR,スクリプトレベルの故障,微調整モデルのクロスドメイン評価について報告する。
論文 参考訳(メタデータ) (2026-04-06T11:23:42Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions [0.0]
パトログア・グラエカ・コーパス(Patrologia Graeca Corpus)は、古代ギリシアの19世紀の版において、最初の大規模なオープンなOCRと言語資源である。
このコレクションは、複雑なバイリンガル(ギリシャ・ラテン語)のレイアウトで印刷されたPatrologia Graeca(PG)の残されている未デジタル化の巻をカバーしており、高度に劣化したポリトニック・ギリシャのタイポグラフィーが特徴である。
We achieve a character error rate (CER) of 1.05% and a word error rate (WER) of 4.69%。
その結果得られたコーパスには、約600万の補修と音声タグ付きトークンが含まれており、フルに整列している。
論文 参考訳(メタデータ) (2026-03-10T10:21:54Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Why Stop at Words? Unveiling the Bigger Picture through Line-Level OCR [4.917745659609699]
単語レベルOCRから行レベルOCRへの自然な進化を提案する。
提案手法はOCRの精度だけでなく効率も向上することを示す。
実験の結果, エンドツーエンドの精度は5.4%向上した。
論文 参考訳(メタデータ) (2025-08-29T15:02:11Z) - KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding [24.9462694200992]
KITAB-Benchは、現在の評価システムのギャップを埋める包括的なアラビアOCRベンチマークである。
現代の視覚言語モデル(GPT-4o、Gemini、Qwenなど)は、従来のOCRアプローチを平均60%の文字誤り率(CER)で上回っている。
本研究はアラビア文書分析手法の改良を促進するための厳格な評価枠組みを確立する。
論文 参考訳(メタデータ) (2025-02-20T18:41:23Z) - CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy [50.78228433498211]
CC-OCRは、マルチシーンテキスト読取、多言語テキスト読取、文書解析、キー情報抽出の4つのOCR中心のトラックで構成されている。
39のサブセットと7,058のフルアノテートされたイメージが含まれており、そのうち41%が実際のアプリケーションからソースされ、初めてリリースされた。
我々は9つの顕著なLMMを評価し、これらのモデルの長所と短所、特にテキストの接地、多目的化、繰り返しの幻覚について明らかにした。
論文 参考訳(メタデータ) (2024-12-03T07:03:25Z) - Scaling A Simple Approach to Zero-Shot Speech Recognition [45.83866201822545]
MMS Zero-shotは、平均的な文字エラー率を100言語以上で相対46%削減する。
我々のアプローチはドメイン内の教師付きベースラインに比べて2.5倍高い。
論文 参考訳(メタデータ) (2024-07-25T08:08:55Z) - LOCR: Location-Guided Transformer for Optical Character Recognition [55.195165959662795]
自動回帰中にトランスフォーマーアーキテクチャに位置案内を組み込むモデルであるLOCRを提案する。
125Kの学術文書ページから777万以上のテキスト配置ペアからなるデータセット上でモデルをトレーニングする。
これは、編集距離、BLEU、METEOR、F測定によって測定されたarXivから構築されたテストセットの既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-04T15:34:12Z) - User-Centric Evaluation of OCR Systems for Kwak'wala [92.73847703011353]
OCRを利用すると、文化的に価値ある文書の書き起こしに費やした時間を50%以上削減できることを示す。
この結果から,OCRツールが下流言語ドキュメントや再生作業において持つ潜在的なメリットが示された。
論文 参考訳(メタデータ) (2023-02-26T21:41:15Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - Lexically Aware Semi-Supervised Learning for OCR Post-Correction [90.54336622024299]
世界中の多くの言語における既存の言語データの多くは、非デジタル化された書籍や文書に閉じ込められている。
従来の研究は、あまり良くない言語を認識するためのニューラル・ポスト・コレクション法の有用性を実証してきた。
そこで本研究では,生画像を利用した半教師付き学習手法を提案する。
論文 参考訳(メタデータ) (2021-11-04T04:39:02Z) - Neural OCR Post-Hoc Correction of Historical Corpora [4.427447378048202]
本稿では,再カレント(RNN)と深部畳み込みネットワーク(ConvNet)を組み合わせたニューラルアプローチを提案する。
我々のモデルは多様なOCR転写誤りを捕捉し、単語誤り率を32.3%減らして89%以上削減できることを示す。
論文 参考訳(メタデータ) (2021-02-01T01:35:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。