論文の概要: From Historical Tabular Image to Knowledge Graphs: A Provenance-Aware Modular Pipeline
- arxiv url: http://arxiv.org/abs/2605.08222v1
- Date: Wed, 06 May 2026 14:33:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.474206
- Title: From Historical Tabular Image to Knowledge Graphs: A Provenance-Aware Modular Pipeline
- Title(参考訳): 歴史的タブラル画像から知識グラフへ:前向きなモジュラーパイプライン
- Authors: Sarah Binta Alam Shoilee, Victor de Boer, Jacco van Ossenbruggen, Susan Legêne,
- Abstract要約: 手書きアーカイブテーブルは、豊富な歴史的情報を含んでいるが、知識グラフのような構造化された表現に変換するには、テーブル構造認識、手書き認識、意味解釈を統合する必要がある。
エンドツーエンドのAI実装は、これらのステップを曖昧にし、人間の監視、批判的評価、信頼を妨げる不透明なアルゴリズム操作をもたらす可能性がある。
我々は,手書きの表紙イメージをKGに変換し,人間とAIのコラボレーションを支援するモジュール型実績認識パイプラインを提案する。
- 参考スコア(独自算出の注目度): 1.3999481573773072
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Handwritten archival tables contain rich historical information, yet transforming them into structured representations, such as Knowledge Graphs, requires integrating table structure recognition, handwriting recognition, and semantic interpretation - a complex multimodal process. End-to-end AI implementations can obscure these steps, resulting in opaque algorithmic operations that hinder human oversight, critical assessment, and trust. To address this, we present a modular, provenance-aware pipeline to convert handwritten tabular images into KGs supporting human-AI collaboration. The pipeline decomposes the workflow into three stages - table reconstruction, information extraction, and KG construction - while exposing intermediate representations for inspection, evaluation, and correction. A key contribution of our approach is the systematic integration of data provenance at every stage, ensuring that all extracted entities and literals remain traceable to their visual and textual origins. The proposed pipeline is demonstrated through a number of experiments on real-world archival material concerning military careers. The results across three different table reconstruction variants highlight the importance of modularisation. By coupling modularity with data provenance, our work advances transparent and collaboratively controllable image-to-KG pipelines for complex historical data.
- Abstract(参考訳): 手書きアーカイブテーブルは、豊富な歴史的情報を含んでいるが、知識グラフのような構造化された表現に変換するには、テーブル構造認識、手書き認識、意味解釈(複雑なマルチモーダルプロセス)を統合する必要がある。
エンドツーエンドのAI実装は、これらのステップを曖昧にし、人間の監視、批判的評価、信頼を妨げる不透明なアルゴリズム操作をもたらす可能性がある。
そこで本研究では,手書きの表紙イメージをKGに変換し,人間とAIのコラボレーションを支援するモジュール方式の実績認識パイプラインを提案する。
パイプラインはワークフローを3つのステージ – テーブル再構築、情報抽出、KG構築 – に分解し、検査、評価、修正のための中間表現を公開する。
このアプローチの重要な貢献は、すべての段階でデータプロファイランスを体系的に統合し、抽出されたエンティティとリテラルが、その視覚的およびテキスト的起源にトレース可能であることを保証することです。
提案されたパイプラインは、軍歴に関する実世界の考古学的資料に関する数多くの実験を通じて実証されている。
3つの異なるテーブル再構築のバリエーションによる結果は、モジュール化の重要性を浮き彫りにしている。
データ前駆体とモジュラリティを結合することにより、複雑な履歴データに対して透過的で協調的に制御可能な画像-KGパイプラインを構築することができる。
関連論文リスト
- Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - ArchGPT: Understanding the World's Architectures with Large Multimodal Models [6.504675786709239]
本稿では,マルチモーダルな視覚的質問応答(VQA)モデルであるArchGPTを提案する。
このパイプラインはArch-300Kというドメイン特化データセットを約315,000枚取得する。
論文 参考訳(メタデータ) (2025-09-25T07:49:43Z) - A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends [11.428017294202162]
Visually-Rich Document Understanding (VRDU)は、複雑なビジュアル、テキスト、レイアウト情報を含む文書を自動的に処理する必要があるため、重要な分野として登場した。
この調査はMLLMベースのVRDUの最近の進歩をレビューし、3つのコアコンポーネントを強調した。
論文 参考訳(メタデータ) (2025-07-14T02:10:31Z) - Spatial Understanding from Videos: Structured Prompts Meet Simulation Data [89.77871049500546]
本稿では,事前学習された視覚言語モデルにおける3次元空間推論を,アーキテクチャを変更することなく拡張するための統一的なフレームワークを提案する。
このフレームワークは、複雑なシーンと質問を解釈可能な推論ステップに分解する構造化プロンプト戦略であるSpatialMindと、多様な3Dシミュレーションシーンから構築されたスケーラブルな質問応答データセットであるScanForgeQAを組み合わせる。
論文 参考訳(メタデータ) (2025-06-04T07:36:33Z) - Efficient Relational Context Perception for Knowledge Graph Completion [25.903926643251076]
知識グラフ(KG)は知識の構造化された表現を提供するが、しばしば不完全性の課題に悩まされる。
従来の知識グラフ埋め込みモデルは、表現力のある特徴を捉える能力に制限がある。
逐次情報をモデル化し,動的文脈の学習を可能にする三重受容アーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-12-31T11:25:58Z) - Transforming Engineering Diagrams: A Novel Approach for P&ID Digitization using Transformers [2.5056643038238495]
本稿では,最先端のディープラーニングアーキテクチャであるRelationformerを用いて,P&IDからグラフを抽出する手法を提案する。
PID2Graphは,グラフ構造のための包括的ラベルを特徴とするP&IDデータセットである。
実世界のデータに対して、Relationformerは説得力のある結果を達成し、エッジ検出のためのモジュラーデジタル化アプローチを25%以上上回った。
論文 参考訳(メタデータ) (2024-11-21T08:27:18Z) - A Continual Relation Extraction Approach for Knowledge Graph Completeness [0.0]
本論文は,実世界から来るデータストリーム内のエンティティ間の関係を識別する,新たな連続関係抽出手法を開発することを目的とする。
この論文のドメイン固有のデータは、ドイツやオーストリアの新聞のコロナニュースである。
論文 参考訳(メタデータ) (2024-04-20T18:15:52Z) - Contextualization Distillation from Large Language Model for Knowledge
Graph Completion [51.126166442122546]
我々は、差別的かつ生成的なKGCフレームワークと互換性のあるプラグイン・アンド・プレイ方式であるContextualization Distillation戦略を導入する。
提案手法は,大規模言語モデルに対して,コンパクトで構造的な三重項を文脈に富んだセグメントに変換するように指示することから始まる。
多様なデータセットとKGC技術にわたる総合的な評価は、我々のアプローチの有効性と適応性を強調している。
論文 参考訳(メタデータ) (2024-01-28T08:56:49Z) - Joint Language Semantic and Structure Embedding for Knowledge Graph
Completion [66.15933600765835]
本稿では,知識三重項の自然言語記述と構造情報とを共同で組み込むことを提案する。
本手法は,学習済み言語モデルを微調整することで,完了作業のための知識グラフを埋め込む。
各種知識グラフベンチマーク実験により,本手法の最先端性能を実証した。
論文 参考訳(メタデータ) (2022-09-19T02:41:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。