論文の概要: Automated Construction of FAIR Digital Object Knowledge Graphs from Flat Cultural Heritage Records
- arxiv url: http://arxiv.org/abs/2608.23263v1
- Date: Mon, 24 Aug 2026 13:51:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.124067
- Title: Automated Construction of FAIR Digital Object Knowledge Graphs from Flat Cultural Heritage Records
- Title(参考訳): フラット文化遺産からFAIRデジタルオブジェクト知識グラフの自動作成
- Abstract要約: フラットなヨーロッパーラレコードをFDO準拠の知識グラフに変換するパイプラインを提案する。
私たちは、すべての遺産エンティティを、独自のPID、タイプ、プロファイル、メタデータレイヤを持つ独立したFDOとしてモデル化します。
パイプラインはメタデータスロットの86%をリンクし、ヨーロッパ人がまだ充実していない58.5%の値を解決した。
- 参考スコア(独自算出の注目度): 2.1222825191351817
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The FAIR Digital Object (FDO) framework mandates that metadata attribute values be expressed as persistent identifiers (PIDs) wherever possible, to produce a fully machine-actionable graph in which every reference is resolvable. The Europeana Data Model was designed long before the FDO specification, and it stores most metadata values as plain text. This serves human browsing well enough, but gives an automated agent nothing to follow across records or collections. We present a pipeline that transforms flat Europeana records into an FDO-compliant knowledge graph structured with CIDOC-CRM. Following the FDO specification, we model every heritage entity as a discrete FDO with its own PID, type, profile, and metadata layer. The core technical challenge is automating the FDO-prescribed distinction between values that must become PID references (resolvable entities) and those that may remain literals (terminal leaves such as notes, measurements, and dates). We address this with a large language model that classifies each metadata value, routes it to a controlled vocabulary (Getty AAT, Wikidata, VIAF, PeriodO), and links it to a shared entity FDO. We evaluate using 637 archaeological records from five Europeana providers, processing each with the LLM. The pipeline links 86% of metadata slots, resolving 58.5% of values Europeana had not already enriched. It also merges cross-lingual surface forms that byte-identical matching keeps apart, where 17 of 33 such merges are correct on manual review. Graph connectivity does not separate this from string matching; what distinguishes the FDO graph is that every node is typed and resolvable.
- Abstract(参考訳): FAIR Digital Object(FDO)フレームワークは、メタデータ属性の値を可能な限り永続的な識別子(PID)として表現し、すべての参照が解決可能な完全に機械で処理可能なグラフを生成することを義務付けている。
Europeana Data ModelはFDO仕様よりずっと前に設計され、ほとんどのメタデータ値をプレーンテキストとして保存する。
これは、人間のブラウジングに十分役立ちますが、自動化されたエージェントは、レコードやコレクションをまたぐものは何もありません。
CIDOC-CRM で構造化された FDO 準拠の知識グラフにフラットな Europeana レコードを変換するパイプラインを提案する。
FDO仕様に従って、私たちはすべての遺産エンティティを、独自のPID、タイプ、プロファイル、メタデータレイヤを持つ独立したFDOとしてモデル化します。
主な技術的課題は、PID参照(解決可能なエンティティ)となる値とリテラル(ノート、測定、日付などの終端の葉)をFDOが規定した区別を自動化することである。
メタデータの値を分類し、制御された語彙(Getty AAT, Wikidata, VIAF, PeriodO)にルーティングし、共有エンティティFDOにリンクする。
欧州の5つのプロバイダから得られた637の考古学的記録を用いて,それぞれをLLMで処理した。
パイプラインはメタデータスロットの86%をリンクし、ヨーロッパ人がまだ充実していない58.5%の値を解決した。
また、手動によるレビューで33のマージのうち17が正されるような、一意のマッチングが壊れ続けるような言語間曲面をマージする。
FDOグラフとの違いは、すべてのノードが型付けされ、解決可能であることです。
関連論文リスト
- Reification as a Transferable Vocabulary: Zero-Shot Link Prediction with Vanilla GNNs [0.033842793760651545]
ULTRAのような知識グラフ基盤モデルは、転送機構をハードコードする専用アーキテクチャを通じて、目に見えないグラフのゼロショットリンク予測を実現する。
この作業では、入力グラフを具現化することにより、そのメカニズムをアーキテクチャから表現に移します。
5つの教科書GNNは、1つのNVIDIA A100で4,245トリプルの知識グラフを30分間トレーニングし、ゼロショットを40のインダクティブリンク予測ベンチマークに転送する。
論文 参考訳(メタデータ) (2026-09-10T10:26:09Z) - FRAGMENT: Factorized Graph Representations for Document Generation and Editing via Entity-Aware Transformations [0.0]
ピクセルやトークンレベルで動作している生成モデルは、しばしば空間レイアウト、テキストコンテンツ、論理構造依存を効果的に捉えるのに苦労する。
我々は、文書を型付き関係グラフとして表現し、その分布を p(structure, content) = p(structure) * p(content | structure) として分解する生成フレームワーク FRAGMENT を探索する。
DocLayNet、FUNSD、SROIEの実験では、FRAGMENTを代表的自己回帰、レイアウトのみ、グラフベースのベースラインとともに評価している。
論文 参考訳(メタデータ) (2026-08-19T08:29:19Z) - Thinking with Anchors: Grounded and Efficient Document Reasoning [87.07530736788898]
ADOPD 2026はADOPDの拡張である。
ADOPD 2026はページ分解を空間的に基底化された文書理解に変換する。
ADOPD 2026は、ページ分解を検証可能なビジュアル・アンカー推論に接続することで、タスク・フレームワークを提供する。
論文 参考訳(メタデータ) (2026-08-05T04:09:05Z) - MetaConfigurator: AI-Assisted RDF Authoring from JSON Data [0.0]
本稿では,オープンソースエディタMetaConfiguratorを拡張したRDFオーサリングビューを提案する。
我々は、AI-assistedLマッピングを使用して既存のYAMLまたはCSVデータをRDFに変換し、トリプルを洗練し、SPARQLクエリを実行し、知識グラフを視覚化し、単一のWebインターフェース内でRDFシリアライズをエクスポートする。
論文 参考訳(メタデータ) (2026-06-05T09:42:01Z) - Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval [19.3757623473603]
実世界のデータは、暗黙のセマンティクスを持つテーブル、ドキュメント、半構造化ファイルにまたがる。
生のマルチソースデータから実行可能なスキーマを自動的に検出するシステムを提案する。
論文 参考訳(メタデータ) (2026-06-03T20:28:36Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding [55.48936731641802]
階層的に構造化されたマルチタスク形式理解ベンチマークであるSRFUNDを提案する。
SRFUNDはオリジナルのFUNSDとXFUNDデータセットの上に洗練されたアノテーションを提供する。
データセットには、英語、中国語、日本語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語を含む8つの言語が含まれている。
論文 参考訳(メタデータ) (2024-06-13T02:35:55Z) - FCDS: Fusing Constituency and Dependency Syntax into Document-Level
Relation Extraction [6.293453766383407]
ドキュメントレベルの関係抽出(DocRE)は、単一のドキュメント内でエンティティ間の関係ラベルを識別することを目的としている。
本稿では,構成と依存性の構文をDocREに融合することを提案する。
各種領域のデータセットに対する実験結果から,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2024-03-04T09:48:55Z) - Language Models As Semantic Indexers [78.83425357657026]
本稿では,ジェネレーティブ言語モデルを用いてセマンティックIDを学習するための自己教師型フレームワークLMIndexerを紹介する。
学習したIDの質を検証し,推奨,製品検索,文書検索の3つの課題において有効性を示す。
論文 参考訳(メタデータ) (2023-10-11T18:56:15Z) - ASDOT: Any-Shot Data-to-Text Generation with Pretrained Language Models [82.63962107729994]
Any-Shot Data-to-Text (ASDOT)は、多様な設定に柔軟に適用可能な新しいアプローチである。
データ曖昧化と文の融合という2つのステップから構成される。
実験の結果, ASDOT はベースラインよりも顕著な改善が得られた。
論文 参考訳(メタデータ) (2022-10-09T19:17:43Z) - DART: Open-Domain Structured Data Record to Text Generation [91.23798751437835]
82k以上のインスタンス(DART)を持つオープンドメイン構造化DAta Record to Text生成データセットであるDARTを提案する。
本稿では,テーブルヘッダとテーブルタイトル間の意味的依存関係を利用して,その構造を符号化するテーブルから意味的三重項を抽出する手法を提案する。
我々のデータセット構築フレームワークは、オープンドメイン意味解析と対話行動に基づく意味表現タスクからヘテロジニアスソースを効果的に統合する。
論文 参考訳(メタデータ) (2020-07-06T16:35:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。