論文の概要: LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes
- arxiv url: http://arxiv.org/abs/2607.12310v2
- Date: Tue, 21 Jul 2026 16:32:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.064475
- Title: LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes
- Title(参考訳): LakeQuest: データレイクをまたいで回答する3つの主要なベンチマーク
- Abstract要約: リアルなデータレイク上で、エンドツーエンドの検索と合成のパイプラインを評価するためのベンチマークであるLakeQuestを紹介します。
LakeQuestは3つの多様なドメイン(AI/MLメタデータ、リテールバンキング、マルチモーダルなバイオメディカルドラッグ情報)にまたがっており、すべての質問と正確なモダリティを意識したエビデンスポインターをペアリングする。
標準的な検索ツール生成(RAG)やエージェントツール利用手法などの評価により,高品質な検索が正しい推論を保証していないことが明らかとなった。
- 参考スコア(独自算出の注目度): 15.997957478589482
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While modern question answering (QA) systems excel on clean, schema-aligned corpora, real-world knowledge is rarely so neatly packaged. Answering questions over enterprise and scientific data lakes requires systems to navigate heterogeneous, weakly structured collections of tables, passages, and linked metadata. Current benchmarks abstract away this noisy discovery process, failing to evaluate end-to-end performance. To bridge this gap, we introduce LakeQuest, a human-validated benchmark of 9,846 QA pairs designed to evaluate the end-to-end retrieve-and-synthesize pipeline over realistic data lakes. LakeQuest spans three diverse domains (AI/ML metadata, retail banking, and multimodal biomedical drug information) and pairs every question with exact, modality-aware evidence pointers. By isolating source discovery from cross-modal synthesis, LakeQuest exposes critical failure modes in modern QA systems. Our baseline evaluations, including standard Retrieval-Augmented Generation (RAG) and agentic tool-use methods, reveal that high-quality retrieval does not guarantee correct reasoning. Systems consistently struggle with relation chaining in metadata graphs, policy grounding in bank ledgers, and joint tabular QA in biomedical contexts, highlighting the need for robust discovery and faithful cross-file composition mechanisms in future agentic QA systems.
- Abstract(参考訳): 最新の質問応答(QA)システムはクリーンでスキーマに整合したコーパスに優れていますが、現実の知識はそれほどきちんとパッケージ化されることはめったにありません。
エンタープライズおよび科学データレイクに関する質問に答えるには、不均一で弱い構造化されたテーブル、パス、および関連メタデータのコレクションをナビゲートする必要がある。
現在のベンチマークでは、このノイズの多い発見プロセスを抽象化し、エンドツーエンドのパフォーマンス評価に失敗している。
このギャップを埋めるため、現実的なデータレイク上でエンドツーエンドの検索と合成のパイプラインを評価するために設計された、9,846のQAペアの人間検証ベンチマークであるLakeQuestを紹介した。
LakeQuestは3つの多様なドメイン(AI/MLメタデータ、リテールバンキング、マルチモーダルなバイオメディカルドラッグ情報)にまたがっており、すべての質問と正確なモダリティを意識したエビデンスポインターをペアリングする。
クロスモーダル合成からソース発見を分離することで、LakeQuestは現代のQAシステムにおいて重要な障害モードを公開する。
標準検索・拡張生成(RAG)やエージェントツール利用手法などのベースライン評価により,高品質な検索が正しい推論を保証していないことが明らかとなった。
システムは、メタデータグラフにおける関係連鎖、銀行台帳における政策基盤、バイオメディカルコンテキストにおける共同表型QAに一貫して苦労し、将来のエージェントQAシステムにおける堅牢な発見と忠実なクロスファイル構成機構の必要性を強調している。
関連論文リスト
- SANA: What Matters for QA Agents over Massive Data Lakes? [21.461240255601684]
我々は、EQAタスクをゴールドソースシーケンス、サニタイズされたサブクエスト、実行レコードを含むランタイムプロファイルに変換するフレームワークであるSANAを提案する。
我々は、最近の2つのEQAベンチマーク、LakeQAとKramaBenchを評価し、固定プロンプト、予算、データレイク、ランタイムの下で軽量で中規模のエージェントを評価する。
論文 参考訳(メタデータ) (2026-06-11T20:51:44Z) - EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge [53.44952808455985]
EvoBrowseCompは400の英語と400の中国語の複雑な質問のベンチマークである。
EvoBrowseCompは定期的に更新してデータの汚染を防ぐことができる。
自動更新可能でハイディフルトなベンチマークのためのスケーラブルなパラダイムを確立します。
論文 参考訳(メタデータ) (2026-06-11T09:48:32Z) - LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake [22.40754170625223]
データレイクに対する検索中心質問応答のベンチマークであるLakeQAを紹介する。
LakeQAはウィキペディアとオープンソースの政府データから約9.5TBのテキストリソースの異種コレクション上に構築されている。
例えば、GPT-5.2はレイクQAで18.37%の正確なマッチスコアしか達成していない。
論文 参考訳(メタデータ) (2026-06-09T06:15:36Z) - Helicase: Uncertainty-Guided Supply Chain Knowledge Graph Construction with Autonomous Multi-Agent LLMs [48.08345972608737]
textitHelicaseは、不確実性誘導サプライチェーン知識グラフ構築のための自律型マルチエージェントシステムである。
高レベルのサプライチェーンクエリを実行可能な調査計画に分解し、特別なWeb検索、推論、コーディングエージェントをコーディネートする。
その3層不確実性フレームワークは、動作、軌道、記憶層の不確実性を追跡し、構造的推論とキャリブレーションされた信頼性評価の両方を可能にする。
論文 参考訳(メタデータ) (2026-05-26T10:53:00Z) - iAgentBench: Benchmarking Sensemaking Capabilities of Information-Seeking Agents on High-Traffic Topics [9.25340189071758]
iAgentBenchは,クロスソース・センスメイキングのための動的ODQAベンチマークである。
iAgentBenchは、現実世界の注目信号からシードトピックを抽出し、共通のユーザ意図パターンを使用して、ユーザライクな質問を構築する。
各インスタンスには、トレース可能なエビデンスと、汚染チェックをサポートする監査可能な中間アーティファクトが付属している。
論文 参考訳(メタデータ) (2026-03-04T22:40:08Z) - CoDA: Agentic Systems for Collaborative Data Visualization [57.270599188947294]
深層研究はデータ分析に革命をもたらしたが、データサイエンティストは依然として手作業による視覚化にかなりの時間を費やしている。
単純なシングルエージェントシステムやマルチエージェントシステムを含む既存のアプローチは、しばしばタスクを単純化する。
本稿では,メタデータ分析,タスク計画,コード生成,自己回帰に特殊なLLMエージェントを利用するマルチエージェントシステムであるCoDAを紹介する。
論文 参考訳(メタデータ) (2025-10-03T17:30:16Z) - LLM Ensemble for RAG: Role of Context Length in Zero-Shot Question Answering for BioASQ Challenge [0.03437656066916039]
大規模言語モデル (LLM) は情報検索に使用できる。
ゼロショットモデルのアンサンブルは、ドメイン固有のYes/No QAタスクで最先端のパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2025-09-10T13:50:49Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z) - Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking [63.84117489519164]
知識グラフ質問 回答システムは、複雑なマルチホップ推論を評価するために高品質なベンチマークに依存している。
広く使われているにもかかわらず、WebQSPやCWQのような一般的なデータセットは、重要な品質問題に悩まされている。
我々はこれらの落とし穴を体系的に解決するLLM-in-the-loopフレームワークであるKGQAGenを紹介する。
本研究は,KGQA評価を推し進めるスケーラブルなフレームワークとして,より厳密なベンチマーク構築とKGQAGenの位置づけを提唱する。
論文 参考訳(メタデータ) (2025-05-29T14:44:52Z) - HM-RAG: Hierarchical Multi-Agent Multimodal Retrieval Augmented Generation [11.53083922927901]
HM-RAGは階層型マルチエージェントマルチモーダルRAGフレームワークである。
構造化、非構造化、グラフベースのデータ間での動的知識合成のための協調知能の先駆者である。
論文 参考訳(メタデータ) (2025-04-13T06:55:33Z) - PeerQA: A Scientific Question Answering Dataset from Peer Reviews [51.95579001315713]
実世界の科学的、文書レベルの質問回答データセットであるPeerQAを提示する。
データセットには208の学術論文から579のQAペアが含まれており、MLとNLPが多数を占めている。
収集したデータセットを詳細に分析し、3つのタスクのベースラインシステムを確立する実験を行う。
論文 参考訳(メタデータ) (2025-02-19T12:24:46Z) - Knowledge Graph Question Answering Leaderboard: A Community Resource to
Prevent a Replication Crisis [61.740077541531726]
コミュニティの焦点として、KGQAベンチマークデータセットに対して、新たな中心的でオープンなリーダボードを提供しています。
本分析は,KGQAシステムの評価において,既存の問題点を浮き彫りにする。
論文 参考訳(メタデータ) (2022-01-20T13:46:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。