論文の概要: SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition
- arxiv url: http://arxiv.org/abs/2605.31097v1
- Date: Fri, 29 May 2026 10:07:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.528466
- Title: SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition
- Title(参考訳): SpecDB: 特徴指向分解によるLLM生成のカスタマイズデータベース
- Abstract要約: 大規模言語モデルを用いてカスタマイズされたリレーショナルデータベースを合成するシステムであるSpecDBを提案する。
我々は9つの生産システムを調査し、それらを10個の機能モジュールに分解し、それぞれをさらに実装の変種に分割する。
コンパニオン選択コンポーネントは、自然言語のワークロード記述を実装変数のセットに変換する。
- 参考スコア(独自算出の注目度): 9.70886818749901
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mainstream relational databases ship a uniform feature set across deployments, although individual workloads exercise only a fraction of the available subsystems. We investigate whether a database can instead be generated on demand with a feature set matched to the target workload. We present SpecDB, a system that uses large language models (LLMs) to synthesize customized relational databases. We survey 9 production systems and decompose them into 10 functional modules, each further divided into implementation variants. To capture cross-module dependencies, including cases where implementations in disjoint subtrees must be co-designed, we adopt the FODA feature model and extend it with a cooperate edge, yielding a dependency graph DBGraph. SpecDB operationalizes DBGraph through a layered module-construction pipeline in which each module is generated, validated, and integrated by a dedicated subagent (driven by three inner agents: Main, Tester, Architect), and a Refining Agent that iteratively repairs and tunes the assembled database against a user-supplied refining harness with read-only access to existing database source code. A companion selection component translates a natural-language workload description into a set of implementation variants, providing an end-to-end pipeline from workload description to deployable database. We evaluate SpecDB on TPC-C with BenchmarkSQL. The generated database (23,779 lines of Rust) completes 60-minute TPC-C at 1 and 10 warehouses with zero errors. At 10 warehouses it reaches tpmC=130, compared to 128 for PostgreSQL and 127 for MySQL, with comparable latency at ~3% of their code size. Because the agent operates at module-specification level rather than product source, it can in principle combine techniques across system boundaries. Paired with falling LLM costs, generating a purpose-built database for a target workload is becoming straightforward.
- Abstract(参考訳): メインストリームリレーショナルデータベースは、デプロイ全体で一様の機能セットを出荷するが、個々のワークロードは利用可能なサブシステムのごく一部しか実行しない。
本稿では,データベースを要求に応じて生成できるかどうかを,対象のワークロードにマッチした機能セットで検討する。
大規模言語モデル(LLM)を用いてカスタマイズされた関係データベースを合成するシステムであるSpecDBを提案する。
我々は9つの生産システムを調査し、それらを10個の機能モジュールに分解し、それぞれをさらに実装の変種に分割する。
非結合なサブツリーの実装を共同設計しなければならないケースを含む、モジュール間の依存関係をキャプチャするために、FODA機能モデルを採用し、それを協調エッジで拡張し、依存性グラフDBGraphを生成する。
SpecDBはDBGraphを、各モジュールが生成され、検証され、専用のサブエージェント(Main、Tester、Architect)とRefining Agentによって統合される階層化されたモジュール構成パイプラインを通じて運用する。
コンパニオン選択コンポーネントは、自然言語のワークロード記述を一連の実装変種に変換し、ワークロード記述からデプロイ可能なデータベースへのエンドツーエンドパイプラインを提供する。
BenchmarkSQLを用いてTPC-C上でSpecDBを評価する。
生成されたデータベース(Rustの23,779行)は、1と10の倉庫で60分のTPC-Cをゼロエラーで完了している。
10のウェアハウスではtpmC=130に達し、PostgreSQLは128、MySQLは127で、コードサイズは3%程度である。
エージェントは製品ソースではなくモジュール特定レベルで動作するため、原則としてシステムの境界を越えてテクニックを組み合わせることができる。
LLMコストの低下に対応して、ターゲットのワークロード用に構築されたデータベースの生成が簡単になっています。
関連論文リスト
- Automating Database-Native Function Code Synthesis with LLMs [45.585082035125886]
データベースネイティブ関数を自動実装するLLMベースのDBCookerを提案する。
まず、関数キャラクタリゼーションモジュールは、複数のソース宣言を集約し、特別なコーディングを必要とする関数ユニットを特定し、ユニット間の依存関係をトレースする。
第二に,1)再利用可能な参照関数などの重要な要素を識別し,擬似コードに基づく符号化シーケンスを設計すること,2)確率的先行とコンポーネント認識によって導かれるハイブリッドフィリング・ザ・ブランクモデルにより,コアロジックと再利用可能なルーチンを統合すること,である。
論文 参考訳(メタデータ) (2026-04-02T02:56:04Z) - A Declarative Language for Building And Orchestrating LLM-Powered Agent Workflows [0.0]
本稿では,エージェントワークフロー仕様と実装を分離する宣言型システムを提案する。
これらの結果から,開発時間の60%削減,デプロイメント速度の3倍の改善が見られた。
製品検索やパーソナライズ,カート管理といった複雑な処理は,500行以上の命令型コードと比較して,50行未満のDSLで表現可能であることを示す。
論文 参考訳(メタデータ) (2025-12-22T05:03:37Z) - BAPPA: Benchmarking Agents, Plans, and Pipelines for Automated Text-to-SQL Generation [3.2476501707160543]
既存の大規模言語モデル(LLM)は、大きなスキーマサイズと複雑な推論のために、自然な命令からsqlを生成するのに苦労する。
本研究では,3つのマルチエージェントLPMパイプラインを探索し,小規模から大規模のオープンソースモデルにまたがる系統的なパフォーマンスベンチマークを行う。
Bird-Bench Mini-Dev セットの実験では、マルチエージェントの議論は小さなモデルの性能を向上させることができ、Qwen2.5-7b-Instruct の実行精度は最大10.6%向上した。
論文 参考訳(メタデータ) (2025-11-06T08:00:15Z) - From Queries to Insights: Agentic LLM Pipelines for Spatio-Temporal Text-to-SQL [8.496933324334167]
本研究では,MistralをベースとしたRellama-sqlcoder-8bによるオーケストレーションにより,簡単なテキストからActまでのベースライン(Rellama-sqlcoder-8b)を提案する。
ニューヨークと東京のチェックインで35の自然言語クエリを評価し,空間的・時間的マルチデータセット推論について検討した。
このエージェントは、データセット 91.4% 対 28.6% よりもかなり精度が高く、地図によるユーザビリティを高め、自然言語の要約を構造化する。
論文 参考訳(メタデータ) (2025-10-29T22:18:57Z) - TEXT2DB: Integration-Aware Information Extraction with Large Language Model Agents [64.11547566154947]
本稿では,IE 出力と対象データベースの統合を重視した IE TEXT2DB の新たな定式化を提案する。
データインフィル、行数、列の追加といった一般的な要求を特徴とする新しいベンチマークを導入する。
実験によると、OPALは異なるコードプランを生成し、必要なIEモデルを呼び出すことで、多様なデータベーススキーマにうまく適応できる。
論文 参考訳(メタデータ) (2025-10-28T02:49:40Z) - LLM$\times$MapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System [55.33058620876928]
LLM x MapReduce-V3 は、長期サーベイ生成のための階層的モジュラーエージェントシステムである。
システムは研究の視点を捉えて包括的な骨格を生成し、それを詳細な調査へと発展させる。
人間の評価から,本システムはコンテンツ深度と長さの両方において,代表的ベースラインを超越していることが示された。
論文 参考訳(メタデータ) (2025-10-13T01:38:37Z) - WikiDBGraph: A Data Management Benchmark Suite for Collaborative Learning over Database Silos [48.88393315169039]
協調学習(CL)技術により、複数のパーティが生データを共有せずにモデルを共同でトレーニングできる。
現在のCLベンチマークとアルゴリズムは、主に、分離、アライメント、結合可能なデータベースの仮定の下で学習ステップを目標としています。
我々は1700万の重み付きエッジでリンクされた10万の現実世界のリレーショナルデータベースから構築された大規模なデータセットを構築した。
論文 参考訳(メタデータ) (2025-05-22T13:07:06Z) - Text2Schema: Filling the Gap in Designing Database Table Structures based on Natural Language [22.15408079332362]
データベースのバックグラウンドを持たない人は、通常、ファイルシステムやExcelデータ管理のようなツールに依存します。
データベースシステムは強力な管理能力を持っているが、ユーザーからの高度な専門知識を必要とする。
論文 参考訳(メタデータ) (2025-03-31T09:39:19Z) - Relational Database Augmented Large Language Model [59.38841050766026]
大規模言語モデル(LLM)は多くの自然言語処理(NLP)タスクに優れる。
彼らは、トレーニングや教師付き微調整プロセスを通じてのみ、新しい知識を取り入れることができる。
この正確で最新のプライベート情報は、通常リレーショナルデータベースに格納される。
論文 参考訳(メタデータ) (2024-07-21T06:19:10Z) - A Unified and Efficient Coordinating Framework for Autonomous DBMS
Tuning [34.85351481228439]
既存のMLベースのエージェントを効率的に活用するための統合コーディネートフレームワークを提案する。
機械学習ベースのエージェントを効果的に利用し、ワークロードの実行時間に1.414.1Xのスピードアップでより良い設定を実現できることを示す。
論文 参考訳(メタデータ) (2023-03-10T05:27:23Z) - Proton: Probing Schema Linking Information from Pre-trained Language
Models for Text-to-SQL Parsing [66.55478402233399]
本稿では,ポアンカー距離測定に基づく探索手法を用いて,関係構造を抽出する枠組みを提案する。
スキーマリンクの一般的なルールベース手法と比較して,探索関係は意味的対応をしっかりと捉えることができることがわかった。
我々のフレームワークは3つのベンチマークで最先端のパフォーマンスを新たに設定する。
論文 参考訳(メタデータ) (2022-06-28T14:05:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。