論文の概要: Automated Tree Knowledge Graph Construction using Ontology Expansion and Retrieval from Vietnamese History Textbooks
- arxiv url: http://arxiv.org/abs/2609.00763v1
- Date: Tue, 01 Sep 2026 05:52:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.406461
- Title: Automated Tree Knowledge Graph Construction using Ontology Expansion and Retrieval from Vietnamese History Textbooks
- Title(参考訳): ベトナムの歴史教科書からのオントロジー拡張と検索を用いた木知識グラフの自動構築
- Authors: Ket Doan Nguyen, Minh N. H. Nguyen,
- Abstract要約: 階層的知識グラフ(KG)に基づく検索拡張生成(RAG)は,構造化知識を持つ大規模言語モデルを支援するための強力なアプローチとして登場した。
我々は,KG構築および検索戦略評価のためのエンドツーエンドパイプラインを提案する。
本稿では,ベトナムの高校歴史教科書(約400ページ)から木知識グラフを構築し,750のノードと4,341のセマンティックエッジを生成する。
- 参考スコア(独自算出の注目度): 1.0507359466436823
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Hierarchical Knowledge graph (KG)-based retrieval augmented generation (RAG) has emerged as a powerful approach for supporting large language models with structured knowledge. However, there are primary challenges: (i) the lack of methods for automatic KG construction using ontology expansion for low-resource languages such as Vietnamese, (ii) the absence of systematic evaluation for knowledge retrieval strategies leveraging the hierarchical structures. In this paper, we propose an end-to-end pipeline for KG construction and retrieval strategies evaluation. In the KG construction, we employ a three-phase hybrid relation extraction pipeline: intra-batch deduplication via Union-Find, approximate cross-batch search, and LLM extraction with a centroid filter that reduces prompts combined with a five-step dual-LLM validator to prevent bloated ontology. A two-tier architecture consists of unmergeable structural nodes to preserve the document structure and mergeable content nodes. The retrieval evaluation consists of three graph traversal strategies: Top-Down, Horizontal, and Bottom-Up, which are evaluated on a synthetically generated benchmark of 1,210 Vietnamese queries from 109 subgraphs, categorized by five query directions. In this paper, we construct the tree knowledge graph from Vietnamese high school History textbooks (nearly 400 pages) to produce 750 nodes and 4,341 semantic edges with controlled ontology growth from 40 to 41 types. Among experimental graph traversal strategies, the Top-Down strategy with structure surpasses the vector baseline by 4.7 percentage points in NDCG@10. As a result, tree-structural information provides valuable information beyond flat cosine similarity but degrades performance when the query does not require structural context.
- Abstract(参考訳): 階層的知識グラフ(KG)に基づく検索強化(RAG)は,構造化知識を持つ大規模言語モデルを支援するための強力なアプローチとして登場した。
しかし、主な課題がある。
(i)ベトナム語などの低リソース言語に対するオントロジー拡張を用いたKG自動構築手法の欠如
二 階層構造を利用した知識検索戦略の体系的評価がないこと。
本稿では,KG構築および検索戦略評価のためのエンドツーエンドパイプラインを提案する。
KG 構築では,Union-Find によるバッチ内重複除去,近似バッチ探索,LLM 抽出という3段階のハイブリッド関係抽出パイプラインを用いて,5段階の二重LLM 検証器と組み合わせたプロンプトを低減し,肥大したオントロジーを防止する。
2層アーキテクチャは、文書構造とマージ可能なコンテンツノードを保持するために、マージできない構造ノードで構成されている。
検索評価はTop-Down,Horizontal,Bottom-Upの3つのグラフトラバース戦略から成っている。
本稿では,ベトナムの高校歴史教科書(約400ページ)から木知識グラフを構築し,40~41種類のオントロジーを制御した750のノードと4,341のセマンティックエッジを生成する。
実験的なグラフトラバース戦略の中で、構造を持つトップダウン戦略は、NDCG@10においてベクトルベースラインを4.7%越えている。
結果として、ツリー構造情報は、フラットなコサイン類似性を超えた貴重な情報を提供するが、クエリが構造的コンテキストを必要としない場合、性能は低下する。
関連論文リスト
- HG-RAG: Hierarchy-Guided Retrieval-Augmented Generation for Structured Knowledge Graphs [0.0]
HG-RAG(Hierarchy-Guided RAG)は、階層的な知識グラフ上でグラフトラバースを実行し、構造化されたコンテキストを言語モデルに提供するフレームワークである。
そこで,HG-RAGを3つの世界規模(18-800ノード)にわたる高密度検索ベースラインに対して4種類のクエリタイプで評価した。
その結果、HG-RAGは階層的、リレーショナル、マルチホップ推論タスクにおいて、フラットベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-16T01:05:19Z) - From Flat to Structural: Enhancing Automated Short Answer Grading with GraphRAG [8.449978933501965]
本稿では,参照資料を構造化知識グラフに整理するグラフ検索拡張生成(GraphRAG)フレームワークを提案する。
提案手法では,高忠実度グラフ構築のためのMicrosoft GraphRAGとHippoRAGニューロシンボリックアルゴリズムの2相パイプラインを用いる。
論文 参考訳(メタデータ) (2026-02-28T04:44:06Z) - SAGE: Structure Aware Graph Expansion for Retrieval of Heterogeneous Data [47.930782177987446]
不均一なコーパスに答える検索拡張された質問は、テキスト、テーブル、グラフノード間で接続されたエビデンスを必要とする。
標準レトリバーリーダーパイプラインは、独立にチャンクされたテキスト上の平坦な類似性検索を使用し、モダリティ間のマルチホップエビデンスチェーンを欠いている。
SAGE(Structure Aware Graph Expansion)フレームワークを提案する。これは、パーセンタイルベースのプルーニングとメタデータ駆動の類似性を利用して、チャンクレベルのグラフをオフラインで構築する。
暗黙的クロスモーダルコーパスと明示的スキーマグラフのエージェント検索であるSPARK(Structure Aware Planning Agent for Retrieval over Knowledge Graphs)のハイブリッド高密度スパース検索を用いて初期検索をインスタンス化する。
論文 参考訳(メタデータ) (2026-02-18T23:57:19Z) - T-Retriever: Tree-based Hierarchical Retrieval Augmented Generation for Textual Graphs [14.797057622726037]
グラフベースのRAGアプローチは、局所グラフ構造に損傷を与える厳密な層特異的圧縮クォータを強制する。
グラフ検索をツリーベースとして再構成する新しいフレームワークであるT-Retrieverを紹介する。
T-Retrieverは最先端のRAG法を著しく上回り、複雑なクエリに対してより一貫性があり、文脈的に関連する応答を提供する。
論文 参考訳(メタデータ) (2026-01-08T13:49:12Z) - Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models [10.130178524819536]
知識グラフ(KGs)は、大規模言語モデル(LLMs)の構造化、検証可能な基盤を提供する
現在のLLMベースのシステムでは、KGをテキスト検索の補助構造として使用しており、本質的な品質は未探索のままである。
我々はオープンドメインテキストからKGを構成する多段階パイプラインであるWikonticを提案する。
論文 参考訳(メタデータ) (2025-11-29T18:44:25Z) - Is Implicit Knowledge Enough for LLMs? A RAG Approach for Tree-based Structures [0.5352699766206808]
大規模言語モデル(LLM)は、文脈内の情報に基づいて応答を生成するのに適している。
Retrieval-Augmented Generation (RAG)は、関連する文書を検索して、モデルのコンテキスト内学習を強化する。
本稿では,木構造からの知識を線形化する手法を提案する。
論文 参考訳(メタデータ) (2025-10-12T20:52:43Z) - Mixture of Structural-and-Textual Retrieval over Text-rich Graph Knowledge Bases [78.62158923194153]
テキストリッチなグラフ知識ベース(TG-KB)は、テキストおよび構造的知識を提供することで、クエリに応答する上でますます重要になっている。
本研究では,これら2種類の知識を計画・推論・組織化フレームワークを用いて検索するための構造・テキスト検索(MoR)の混合を提案する。
論文 参考訳(メタデータ) (2025-02-27T17:42:52Z) - Hierarchical clustering with dot products recovers hidden tree structure [53.68551192799585]
本稿では,階層構造の回復に着目した凝集クラスタリングアルゴリズムの新しい視点を提案する。
クラスタを最大平均点積でマージし、例えば最小距離やクラスタ内分散でマージしないような、標準的なアルゴリズムの単純な変種を推奨する。
このアルゴリズムにより得られた木は、汎用確率的グラフィカルモデルの下で、データ中の生成的階層構造をボナフェイド推定することを示した。
論文 参考訳(メタデータ) (2023-05-24T11:05:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。