論文の概要: Improving Access to Historical Archives with Real-time RAG-based Systems
- arxiv url: http://arxiv.org/abs/2607.03440v1
- Date: Fri, 03 Jul 2026 15:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:39:32.568875
- Title: Improving Access to Historical Archives with Real-time RAG-based Systems
- Title(参考訳): リアルタイムRAGシステムによる歴史的アーカイブへのアクセス改善
- Abstract要約: 本稿では,大規模言語モデルを統合するエンドツーエンドのアーカイブ処理と検索フレームワークを提案する。
本システムでは,テキスト品質を向上するOCR改良モジュールと,セマンティック検索とクロスエンコーダ再配置パイプラインの2つのコアコンポーネントを導入している。
- 参考スコア(独自算出の注目度): 16.569566038184625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Digitized historical archives are large, heterogeneous cultural heritage repositories, but access methods for such archives face challenges such as noisy optical character recognition (OCR) output and rigid keyword-based retrieval, which limit retrieval quality. In this work, we present an end-to-end archival processing and retrieval framework that integrates large language models (LLMs) into the archival pipeline. Our system introduces two core components: (i) an LLM-based OCR refinement module that improves text quality, and (ii) a semantic retrieval and cross-encoder reranking pipeline supporting natural-language question answering via retrieval-augmented generation (RAG). Our evaluations are done on a historical archival dataset of 500,000 Swiss newspaper segments spanning over three centuries (1762 to 2001). Experiments are conducted across 384 natural-language test queries. Our results highlight that LLM refinements reduce OCR errors by up to 44.52% (CER) and 60.95% (WER). More importantly, this is accompanied by downstream information retrieval improvements. Compared to traditional keyword baselines, our reranking pipeline increases NDCG@10 by 31.9% (from 65.99% to 87.05%) and achieves statistically significant gains in both answer correctness and context relevance. These results demonstrate that integrating LLMs with established document processing and retrieval pipelines can elevate digital libraries from static repositories to interactive, semantically searchable archival systems.
- Abstract(参考訳): デジタル化された歴史的アーカイブは、巨大で異質な文化遺産リポジトリであるが、そのようなアーカイブへのアクセス方法は、ノイズの多い光学文字認識(OCR)出力や、検索品質を制限する厳密なキーワードベースの検索といった課題に直面している。
本研究では,大規模言語モデル(LLM)をアーカイブパイプラインに統合するエンドツーエンドのアーカイブ処理と検索フレームワークを提案する。
システムには2つのコアコンポーネントが導入されている。
i) テキスト品質を改善するLLMベースのOCRリファインメントモジュール、及び
(II)検索拡張生成(RAG)による自然言語質問応答を支援する意味検索とクロスエンコーダのパイプライン。
我々の評価は、3世紀以上にわたる50万件のスイスの新聞の歴史的アーカイブデータセット(1862年-2001年)に基づいて行われた。
384の自然言語テストクエリに対して実験を行う。
LLMの改良により,OCRエラーの最大44.52%(CER)と60.95%(WER)が削減された。
さらに重要なのは、ダウンストリーム情報検索の改善が伴うことだ。
従来のキーワードベースラインと比較して、再ランクパイプラインはNDCG@10を31.9%(65.99%から87.05%)増加させ、回答の正しさと文脈関連性の両方において統計的に有意な向上を達成する。
これらの結果から,LCMを文書処理と検索パイプラインに統合することにより,静的リポジトリから対話型,意味論的検索可能なアーカイブシステムへデジタルライブラリを拡張できることが示唆された。
関連論文リスト
- TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents [3.972942030662871]
大規模エンジニアリングレポジトリを対象としたレイアウト対応マルチモーダル検索システムBlueprintを提案する。
Blueprintは標準描画領域を検出し、領域制限付きVLMベースのOCRを適用し、識別子を正規化し、軽量な領域レベルの再ランカで語彙的および密度の高い検索を融合する。
350名の専門家によるクエリを用いた5k-fileベンチマークでBlueprintの評価を行った。
論文 参考訳(メタデータ) (2026-02-12T19:48:44Z) - SAGE: Benchmarking and Improving Retrieval for Deep Research Agents [60.53966065867568]
SAGEは4つの科学領域にわたる1200のクエリからなる科学文献検索のためのベンチマークであり、20万の論文検索コーパスを備える。
6つのディープ・リサーチ・エージェントを評価し,全てのシステムが推論集約的な検索に苦しむことを発見した。
BM25は、既存のエージェントがキーワード指向のサブクエリを生成するため、LLMベースのレトリバーを約30%上回っている。
論文 参考訳(メタデータ) (2026-02-05T18:25:24Z) - Enriching Historical Records: An OCR and AI-Driven Approach for Database Integration [3.184882058033374]
この研究は1983年から1985年にかけて書かれた『Leidse hoogleraren en lectoren 1575-1815』をデジタル化し分析した。
OCR、解釈、データベースリンクを統合して、過去の文書画像から既存の高品質のデータベースレコードに調和させる自動パイプラインをどうやって設計できるのか?
我々は、OCR技術、データ抽出を構造化する生成AI復号法、データベースリンク法を適用して、OCRから抽出した文字誤り率(CER)が1.08%、ワード誤り率(WER)が5.06パーセントに達した。
論文 参考訳(メタデータ) (2025-11-17T15:13:42Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z) - LLM-Assisted Question-Answering on Technical Documents Using Structured Data-Aware Retrieval Augmented Generation [0.432776344138537]
大きな言語モデル(LLM)は自然言語の理解と生成を可能にする。
ファインチューニングは可能なソリューションのひとつだが、リソース集約であり、データ更新毎に繰り返す必要がある。
Retrieval-Augmented Generation (RAG)は、LLMが外部の知識ソースにアクセスできるようにすることにより、効率的なソリューションを提供する。
論文 参考訳(メタデータ) (2025-06-29T08:22:03Z) - ELITE: Embedding-Less retrieval with Iterative Text Exploration [5.8851517822935335]
大規模言語モデル(LLM)は自然言語処理において顕著な進歩を遂げた。
長期のコンテキスト制約を維持する能力は、ドキュメントレベルやマルチターンタスクのパフォーマンスを制限します。
論文 参考訳(メタデータ) (2025-05-17T08:48:43Z) - Cognitive-Aligned Document Selection for Retrieval-augmented Generation [2.9060210098040855]
本稿では,クエリを動的に更新し,高品質で信頼性の高い検索文書をフィルタリングするGGatrievalを提案する。
ユーザクエリを構文コンポーネントにパースし、検索したドキュメントときめ細かいグラウンドアライメントを実行する。
提案手法では,検索した文書をフィルタリングするための新しい基準を導入し,ターゲット情報を取得するための人的戦略を密にエミュレートする。
論文 参考訳(メタデータ) (2025-02-17T13:00:15Z) - Efficient Long Context Language Model Retrieval with Compression [57.09163579304332]
情報検索のための新しいパラダイムとしてLong Context Language Models (LCLM)が登場した。
本稿では,LCLM検索に適した新しい圧縮手法を提案する。
また,CoLoRはテキスト内サイズを1.91倍に圧縮し,検索性能を6%向上することを示した。
論文 参考訳(メタデータ) (2024-12-24T07:30:55Z) - DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems [99.17123445211115]
本稿では,大規模言語モデル(LLM)に基づく文書読解システムを評価するベンチマークであるDocBenchを紹介する。
我々のベンチマークには、人間のアノテーションの募集と、合成質問の生成が含まれる。
実際の文書は229件、質問は1,102件で、5つのドメインにまたがって4種類の質問がある。
論文 参考訳(メタデータ) (2024-07-15T13:17:42Z) - Synergistic Interplay between Search and Large Language Models for
Information Retrieval [141.18083677333848]
InteRにより、RMはLLM生成した知識コレクションを使用してクエリの知識を拡張することができる。
InteRは、最先端手法と比較して総合的に優れたゼロショット検索性能を実現する。
論文 参考訳(メタデータ) (2023-05-12T11:58:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。