論文の概要: Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs
- arxiv url: http://arxiv.org/abs/2607.00596v1
- Date: Wed, 01 Jul 2026 08:19:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.803708
- Title: Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs
- Title(参考訳): LLMを用いたアルメニア歴史新聞のセマンティックガイド読解順序再構築
- Authors: Chahan Vidal-Gorène, Nadi Tomeh, Victoria Khurshudyan,
- Abstract要約: 本稿では、アルメニアの歴史的新聞において、複雑なレイアウトと限られた言語資源を組み合わせた読解順序再構築について論じる。
66ページの注釈付きデータセットを導入し,幾何学的比較,YOLOに基づくレイアウト解析,エンドツーエンドの文書モデルECLAIR,意味領域検出と生成LDMを組み合わせたハイブリッド手法を提案する。
提案手法は,最強の幾何学的ベースライン上での順序誤差を最大76%削減し,マルチページ設定やノイズの多いOCRの下でも頑健な手法である。
- 参考スコア(独自算出の注目度): 3.437197921299943
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper addresses reading order reconstruction in historical Armenian newspapers, which combine complex layouts with limited language resources. We introduce a new annotated dataset of 66 pages and compare geometric heuristics, YOLO-based layout parsing, an end-to-end document model ECLAIR, and a hybrid method combining semantic zone detection with a generative LLM. Our hybrid method achieves the lowest error rates of all evaluated approaches, reducing ordering errors by up to 76% over the strongest geometric baseline, and remains robust in multi-page settings and under noisy OCR. Rather than targeting production the method is designed as a data bootstrapping strategy enabling rapid annotation in highly under-resourced scenarios. Alongside the dataset, we release a specialized Tesseract OCR model for historical Armenian print.
- Abstract(参考訳): 本稿では、アルメニアの歴史的新聞において、複雑なレイアウトと限られた言語資源を組み合わせた読解順序再構築について論じる。
我々は66ページの注釈付きデータセットを導入し、幾何学的ヒューリスティックス、YOLOに基づくレイアウト解析、エンドツーエンドの文書モデルECLAIR、意味領域検出とジェネレーションLLMを組み合わせたハイブリッド手法を比較した。
提案手法は,最強の幾何学的ベースライン上での順序誤差を最大76%削減し,マルチページ設定やノイズの多いOCRの下でも頑健な手法である。
プロダクションをターゲットにするのではなく、高度にリソース不足のシナリオで迅速なアノテーションを可能にするデータブートストラップ戦略として設計されている。
データセットとともに、アルメニアの歴史的印刷のための特殊なTesseract OCRモデルをリリースする。
関連論文リスト
- Mixture-of-RAG: Integrating Text and Tables with Large Language Models [5.038576104344948]
不均一文書RAGは、テキストデータと階層データ間の共同検索と推論を必要とする。
階層構造と異種関係を保存する新しい3段階フレームワークであるMixRAGを提案する。
実験の結果、MixRAGは強いテキストのみ、テーブルのみ、ナイーブミキサーベースラインよりもトップ1検索を46%向上させることがわかった。
論文 参考訳(メタデータ) (2025-04-13T13:02:33Z) - KAP: MLLM-assisted OCR Text Enhancement for Hybrid Retrieval in Chinese Non-Narrative Documents [0.0]
雑音の多いOCR出力を検索最適化テキストに変換する新しいフレームワークであるKAPを提案する。
KAPは2段階のアプローチを採用しており、まずOCRを用いてテキストを抽出し、次にマルチモーダル大言語モデルを用いて出力を洗練する。
実証的な結果は、KAPが従来の前処理手法よりも一貫して、著しく優れていることを示している。
論文 参考訳(メタデータ) (2025-03-11T14:01:03Z) - Reference-Based Post-OCR Processing with LLM for Precise Diacritic Text in Historical Document Recognition [1.6941039309214678]
コンテンツ中心の電子書籍を参照ベースとして活用し、不完全なOCR生成テキストを訂正する手法を提案する。
この技術は、ダイアクリティカル言語のための高精度な擬似ページ・ツー・ページラベルを生成する。
パイプラインは、古いドキュメントから様々な種類のノイズを排除し、欠落した文字、単語、乱れたシーケンスといった問題に対処する。
論文 参考訳(メタデータ) (2024-10-17T08:05:02Z) - xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token [108.7069350303884]
xRAGは、検索拡張生成に適した、革新的なコンテキスト圧縮手法である。
xRAGは、言語モデル表現空間に文書の埋め込みをシームレスに統合する。
実験の結果、xRAGは6つの知識集約タスクで平均10%以上の改善を達成していることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:15:17Z) - LOCR: Location-Guided Transformer for Optical Character Recognition [55.195165959662795]
自動回帰中にトランスフォーマーアーキテクチャに位置案内を組み込むモデルであるLOCRを提案する。
125Kの学術文書ページから777万以上のテキスト配置ペアからなるデータセット上でモデルをトレーニングする。
これは、編集距離、BLEU、METEOR、F測定によって測定されたarXivから構築されたテストセットの既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-04T15:34:12Z) - Neural Model Reprogramming with Similarity Based Mapping for
Low-Resource Spoken Command Recognition [71.96870151495536]
低リソース音声コマンド認識(SCR)のための新しいAR手法を提案する。
ARプロシージャは、(対象領域から)音響信号を修正して、事前訓練されたSCRモデルを再利用することを目的としている。
提案したAR-SCRシステムについて,アラビア語,リトアニア語,マンダリン語を含む3つの低リソースSCRデータセットを用いて評価した。
論文 参考訳(メタデータ) (2021-10-08T05:07:35Z) - Recent Developments Combining Ensemble Smoother and Deep Generative
Networks for Facies History Matching [58.720142291102135]
本研究は、ファシズムモデルのための連続パラメータ化を構築するためのオートエンコーダネットワークの利用に焦点を当てる。
本稿では,VAE,GAN,Wasserstein GAN,変分自動符号化GAN,サイクルGANの主成分分析(PCA),転送スタイルネットワークのPCA,スタイル損失のVAEの7種類の定式化をベンチマークする。
論文 参考訳(メタデータ) (2020-05-08T21:32:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。