論文の概要: DBAutoDoc: Automated Discovery and Documentation of Undocumented Database Schemas via Statistical Analysis and Iterative LLM Refinement
- arxiv url: http://arxiv.org/abs/2603.23050v1
- Date: Tue, 24 Mar 2026 10:42:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.43566
- Title: DBAutoDoc: Automated Discovery and Documentation of Undocumented Database Schemas via Statistical Analysis and Iterative LLM Refinement
- Title(参考訳): DBAutoDoc: 統計解析と反復LLMリファインメントによる未文書データベーススキーマの自動発見とドキュメンテーション
- Authors: Amith Nagarajan, Thomas Altman,
- Abstract要約: 膨大な数の重要なデータベースシステムには十分なドキュメントがない。
文書化されていないリレーショナルデータベーススキーマの発見とドキュメンテーションを自動化するDBAutoDocを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A tremendous number of critical database systems lack adequate documentation. Declared primary keys are absent, foreign key constraints have been dropped for performance, column names are cryptic abbreviations, and no entity-relationship diagrams exist. We present DBAutoDoc, a system that automates the discovery and documentation of undocumented relational database schemas by combining statistical data analysis with iterative large language model (LLM) refinement. DBAutoDoc's central insight is that schema understanding is fundamentally an iterative, graph-structured problem. Drawing structural inspiration from backpropagation in neural networks, DBAutoDoc propagates semantic corrections through schema dependency graphs across multiple refinement iterations until descriptions converge. This propagation is discrete and semantic rather than mathematical, but the structural analogy is precise: early iterations produce rough descriptions akin to random initialization, and successive passes sharpen the global picture as context flows through the graph. The system makes four concrete contributions detailed in the paper. On a suite of benchmark databases, DBAutoDoc achieved overall weighted scores of 96.1% across two model families (Google's Gemini and Anthropic's Claude) using a composite metric. Ablation analysis demonstrates that the deterministic pipeline contributes a 23-point F1 improvement over LLM-only FK detection, confirming that the system's contribution is substantial and independent of LLM pre-training knowledge. DBAutoDoc is released as open-source software with all evaluation configurations and prompt templates included for full reproducibility.
- Abstract(参考訳): 膨大な数の重要なデータベースシステムには十分なドキュメントがない。
宣言されたプライマリキーが欠落し、パフォーマンスのための外部キー制約が廃止され、列名は暗号的な省略形であり、エンティティ-リレーショナル図は存在しない。
本稿では,統計データ解析と反復的大言語モデル(LLM)の改良を組み合わせることで,文書化されていない関係データベーススキーマの発見とドキュメンテーションを自動化するDBAutoDocを提案する。
DBAutoDocの中心的な洞察は、スキーマ理解は基本的に反復的でグラフ構造化された問題であるということである。
ニューラルネットワークのバックプロパゲーションから構造的なインスピレーションを引き出すDBAutoDocは、記述が収束するまで、スキーマ依存グラフを通じて複数の改善イテレーションをまたいだセマンティックな修正を伝搬する。
初期の反復はランダムな初期化に似た粗い記述を生成し、連続的なパスは、コンテキストがグラフを流れるにつれてグローバルなイメージを鋭くする。
このシステムは4つの具体的なコントリビューションを論文に詳述している。
一連のベンチマークデータベースにおいて、DBAutoDocは総合的に96.1%の重み付けスコアを2つのモデルファミリー(GoogleのGeminiとAnthropicのClaude)で達成した。
アブレーション分析は、決定論的パイプラインがLLMのみのFK検出よりも23ポイントF1の改善に貢献し、システムの貢献がLLM事前学習の知識に大きく依存していることを確認する。
DBAutoDocは、すべての評価設定と、完全な再現性のためのプロンプトテンプレートを備えた、オープンソースソフトウェアとしてリリースされている。
関連論文リスト
- Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes [5.276278723196607]
Agentic DAG-Orchestrated Transformer (A.DOT) Plannerはマルチモーダル・マルチホップ質問応答のためのフレームワークである。
A.DOTは、ユーザNLクエリを構造化および非構造化の両方にまたがる有向非巡回グラフ(DAG)実行計画にコンパイルする。
System Decomposes query into parallelizable sub-queries, includess schema-aware reasoning, and applied both structure and semantic validation。
論文 参考訳(メタデータ) (2026-03-15T05:34:16Z) - DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering [11.177470565638666]
マルチドキュメント マルチエンティティ 回答 本質的には、複数のエンティティ間の暗黙のロジックを、散在するドキュメント間で追跡するようモデルに要求する。
既存のLarge Language Models (LLM) とRetrieval-Augmented Generation (RAG) フレームワークは、限界に悩まされている。
動的スキーマ発見、構造化情報抽出、エラー保証付きスキーマ対応リレーショナル推論を統合したエンドツーエンドのエージェントフレームワークであるDocSageを提案する。
論文 参考訳(メタデータ) (2026-03-12T11:00:09Z) - Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis [0.8193467416247519]
レビューとメタ分析は、物語を構造化され、数値化された研究記録に変換することに頼っている。
大規模言語モデル(LLM)の急速な進歩にもかかわらず、このプロセスの構造的要件を満たすことができるかどうかは不明だ。
本稿では,LLMに基づくエビデンス抽出をスキーマ制約クエリの進行として評価する構造的診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T14:09:43Z) - AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale [68.29002818359844]
既存の方法は違法なコストを発生させ、リコールとノイズのトレードオフに苦労し、大規模データベースに不利なスケーリングを行う。
我々は、反復的エージェント駆動プロセスとしてスキーマリンクを再構成する、自律的なエージェントフレームワークであるtextbfAutoLinkを提案する。
実験ではAutoLinkの優れたパフォーマンスを示し、最先端の厳密なスキーマリンクのリコール、すなわち textbf68.7% EX on Bird-Dev (CHESSより優れている)、 textbf34.9% EX on Spider-2.0-Lite (第2位)を実現している。
論文 参考訳(メタデータ) (2025-11-21T12:12:17Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - Retrieval-Augmented Generation of Ontologies from Relational Databases [13.160850863758]
本稿では、RDBオントロジーの検索拡張反復生成であるRIGORについて述べる。
リレーショナルを人間の最小限の労力でリッチスキーマに変換するアプローチが紹介されている。
論文 参考訳(メタデータ) (2025-06-02T01:10:05Z) - RelDiff: Relational Data Generative Modeling with Graph-Based Diffusion Models [83.6013616017646]
RelDiffは、外部キーグラフ構造を明示的にモデル化することによって完全な関係データベースを合成する新しい拡散生成モデルである。
RelDiffは、現実的で一貫性のある合成リレーショナルデータベースの作成において、従来手法よりも一貫して優れている。
論文 参考訳(メタデータ) (2025-05-31T21:01:02Z) - SchemaGraphSQL: Efficient Schema Linking with Pathfinding Graph Algorithms for Text-to-SQL on Large-Scale Databases [1.6544167074080365]
本稿では、まず、外部キー関係に基づくスキーマグラフを構築する、ゼロショットでトレーニング不要なスキーマリンク手法を提案する。
我々は、結合すべきテーブルや列の最適なシーケンスを特定するために、古典的なパスフィニングアルゴリズムと後処理を適用する。
提案手法はBIRDベンチマークの最先端結果を実現し,従来の特殊化,微調整,複雑な多段階LCMに基づくアプローチよりも優れていた。
論文 参考訳(メタデータ) (2025-05-23T20:42:36Z) - Proton: Probing Schema Linking Information from Pre-trained Language
Models for Text-to-SQL Parsing [66.55478402233399]
本稿では,ポアンカー距離測定に基づく探索手法を用いて,関係構造を抽出する枠組みを提案する。
スキーマリンクの一般的なルールベース手法と比較して,探索関係は意味的対応をしっかりと捉えることができることがわかった。
我々のフレームワークは3つのベンチマークで最先端のパフォーマンスを新たに設定する。
論文 参考訳(メタデータ) (2022-06-28T14:05:25Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z) - Text Summarization with Latent Queries [60.468323530248945]
本稿では,LaQSumについて紹介する。LaQSumは,既存の問合せ形式と抽象的な要約のための文書から遅延クエリを学習する,最初の統一テキスト要約システムである。
本システムでは, 潜伏クエリモデルと条件付き言語モデルとを協調的に最適化し, ユーザがテスト時に任意のタイプのクエリをプラグイン・アンド・プレイできるようにする。
本システムでは,クエリタイプ,文書設定,ターゲットドメインの異なる要約ベンチマークにおいて,強力な比較システムの性能を強く向上させる。
論文 参考訳(メタデータ) (2021-05-31T21:14:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。