論文の概要: Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search
- arxiv url: http://arxiv.org/abs/2607.05970v1
- Date: Tue, 07 Jul 2026 08:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.440558
- Title: Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search
- Title(参考訳): 忠実か発見可能か : RDFデータセット検索のためのLLM生成メタデータの評価
- Authors: Riccardo Terrenzi, Serkan Ayvaz,
- Abstract要約: 本研究では,RDFデータセットのメタデータ生成設定について,簡単な書き換えからプロファイルグラウンド,エージェントグラフベースの生成まで,6つの検討を行った。
制約のないメタデータの書き直しは、元のメタデータよりも強力な検索ゲインを提供するが、最も忠実ではない。
より接地された設定は忠実性を大幅に改善し、プロファイル接地された書き換えは、検索効率と接地の間の最もバランスのとれたトレードオフを提供する。
- 参考スコア(独自算出の注目度): 0.7734726150561086
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dataset search depends heavily on metadata, making LLM-generated metadata a consequential form of synthetic content in retrieval systems. We study six metadata-generation settings for RDF datasets, ranging from simple rewriting to profile-grounded and agentic graph-based generation, and evaluate them jointly for retrieval effectiveness and faithfulness. Unconstrained metadata rewriting delivers the strongest retrieval gains over the original metadata, but it is also the least faithful, showing that search improvements can be driven by unsupported semantic expansion. More grounded settings substantially improve faithfulness, and profile-grounded rewriting provides the most balanced trade-off between retrieval effectiveness and grounding. These findings position synthetic metadata as a system-level IR problem in which effectiveness, provenance, and trust must be evaluated together.
- Abstract(参考訳): データセット検索はメタデータに大きく依存しており、LLM生成メタデータを検索システムにおける合成コンテンツの連続的な形式とする。
本研究では,RDFデータセットのメタデータ生成設定について,簡単な書き換えからプロファイルグラウンド,エージェントグラフベースの生成まで6つについて検討し,検索の有効性と忠実性について共同で評価する。
制約のないメタデータの書き直しは、元のメタデータよりも強力な検索ゲインを提供するが、検索の改善がサポートされないセマンティック展開によって推進されることを示す最も忠実な方法でもある。
より接地された設定は忠実性を大幅に改善し、プロファイル接地された書き換えは、検索効率と接地の間の最もバランスのとれたトレードオフを提供する。
これらの結果から, 合成メタデータは, 有効性, 証明性, 信頼性を共に評価するシステムレベルのIR問題として位置づけられた。
関連論文リスト
- Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs [66.63911043019294]
データ準備は、生のデータセットを識別し、データセット間の関係を解明し、それらから貴重な洞察を抽出することを目的としている。
本稿では,様々な下流タスクのためのデータ準備にLLM技術を用いることに焦点を当てる。
データクリーニング、標準化、エラー処理、計算、データ統合、データ豊か化という3つの主要なタスクにフィールドを編成するタスク中心の分類を導入します。
論文 参考訳(メタデータ) (2026-01-22T12:02:45Z) - A Systematic Framework for Enterprise Knowledge Retrieval: Leveraging LLM-Generated Metadata to Enhance RAG Systems [0.0]
本研究では,大規模言語モデル(LLM)を用いたメタデータ強化のための体系的フレームワークを提案する。
提案手法では,文書セグメントに意味のあるメタデータを動的に生成する包括的,構造化されたパイプラインを用いる。
論文 参考訳(メタデータ) (2025-12-05T04:05:06Z) - Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining [45.51273144181658]
より広い範囲のメタデータを調査し、文書品質の詳細な指標など他の種類のメタデータを見つける。
トレーニング効率を向上させる手段としてメタデータ付加を導入する。
我々はメタデータがどのように学習を形作るかを理解するために潜在表現を分析する。
論文 参考訳(メタデータ) (2025-11-26T17:36:31Z) - Metadata-Driven Retrieval-Augmented Generation for Financial Question Answering [0.0]
文脈的にリッチなドキュメントチャンクを作成するための高度なインデックスパイプラインを導入します。
我々は、検索前フィルタリング、検索後再ランク付け、エンリッチな埋め込みなど、さまざまな拡張のスペクトルをベンチマークする。
提案する最適アーキテクチャは、LLM駆動の事前検索最適化とコンテキスト埋め込みを組み合わせることで、優れた性能を実現する。
論文 参考訳(メタデータ) (2025-10-28T13:16:36Z) - MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs [48.73595915402094]
MOLEは、アラビア語以外の言語のデータセットをカバーする科学論文からメタデータ属性を自動的に抽出するフレームワークである。
本手法では,複数の入力形式にまたがって文書全体を処理し,一貫した出力に対する堅牢な検証機構を組み込む。
論文 参考訳(メタデータ) (2025-05-26T10:31:26Z) - Lightweight and Direct Document Relevance Optimization for Generative Information Retrieval [49.669503570350166]
生成情報検索(GenIR)は、文書識別子(ドシデント)生成タスクとして文書検索を定式化する有望なニューラル検索パラダイムである。
既存のGenIRモデルはトークンレベルのミスアライメントに悩まされており、次のトークンを予測するためにトレーニングされたモデルは、ドキュメントレベルの関連性を効果的にキャプチャできないことが多い。
本稿では,トークンレベルのドシデント生成と文書レベルのドシデンス推定をペアのランク付けによる直接最適化により整合するダイレクトドキュメントレバレンス最適化(DDRO)を提案する。
論文 参考訳(メタデータ) (2025-04-07T15:27:37Z) - Leveraging Retrieval Augmented Generative LLMs For Automated Metadata Description Generation to Enhance Data Catalogs [1.1957520154275776]
データカタログは、さまざまなデータ資産の収集とアクセスのためのリポジトリとして機能する。
組織内の多くのデータカタログは、資産記述のようなメタデータが不十分なため、検索容易性が制限されている。
本稿では,メタデータ作成に関わる課題について考察し,既存のメタデータコンテンツを活用するという,独特なプロンプト・エンリッチメントの考え方を提案する。
論文 参考訳(メタデータ) (2025-03-12T02:33:33Z) - Understanding Synthetic Context Extension via Retrieval Heads [51.8869530817334]
本稿では,検索と推論を必要とする3つの長文タスクに対する合成データの微調整について検討する。
合成データに基づいてトレーニングされたモデルは、実際のデータには及ばないが、驚くべきことに、ミスマッチを解釈できる。
我々の結果は、合成データの微調整性能の解釈方法と、長期にわたる実世界の能力学習のためのより良いデータ作成方法に光を当てた。
論文 参考訳(メタデータ) (2024-10-29T17:55:00Z) - Corrective Retrieval Augmented Generation [36.04062963574603]
Retrieval-augmented Generation (RAG) は、検索された文書の関連性に大きく依存しており、検索が失敗した場合のモデルがどのように振る舞うかについての懸念を提起する。
生成の堅牢性を改善するために,CRAG(Corrective Retrieval Augmented Generation)を提案する。
CRAGはプラグアンドプレイであり、様々なRAGベースのアプローチとシームレスに結合できる。
論文 参考訳(メタデータ) (2024-01-29T04:36:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。