論文の概要: Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass
- arxiv url: http://arxiv.org/abs/2607.07696v1
- Date: Wed, 08 Jul 2026 17:55:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.485891
- Title: Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass
- Title(参考訳): Breaking Database Lock-in: データベースバイパスのための高性能ストレージリーダのエージェント再生
- Abstract要約: Jailbreakは、データベースエンジンを完全にバイパスするアプローチで、ストレージファイルを直接読み出し、データをインエンジニアリングのカラムバッファとして実体化することで、データベースエンジンを完全にバイパスする。
Jailbreakの重要な洞察は、データベースファイルフォーマットがソースコードとドキュメントによって完全に指定されていることだ。
- 参考スコア(独自算出の注目度): 26.384010313580603
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Analytical workloads operating on data stored in external database systems face a fundamental bottleneck: data access is guarded entirely by the database driver, like JDBC or ODBC, forcing all reads through query execution and other driver layers that are not designed for bulk columnar analytics. We present Jailbreak, an approach that bypasses the database engine entirely by reading storage files directly and materializing data as in-memory columnar buffers. Jailbreak's key insight is that database file formats, while complex, are fully specified by their source code and documentation, artifacts that Large Language Models (LLMs) can ingest to regenerate operator-specific table reading components without human-engineered parsing logic. Jailbreak leverages LLM-assisted code synthesis for database storage decoding, turning a traditionally opaque format into a directly queryable artifact. We evaluate Jailbreak on PostgreSQL and MySQL storage files, targeting analytical snapshot scenarios common in read replicas and offline processing pipelines. The generated reader produces Apache Arrow buffers consumable directly by most of the widely known query engines, including DuckDB, Apache Spark, and GPU-accelerated frameworks such as cuDF and Spark RAPIDS. We validate correctness against JDBC/ODBC-based baselines using the TPC-H benchmark across all query results, and demonstrate significant performance improvements in end-to-end analytical throughput, achieving up to 27x speedups. Our results showcase that LLM-assisted storage reader synthesis is a viable and generalizable methodology for breaking data lock-in across database systems, with applications beyond PostgreSQL and MySQL for any system whose file format is available to the LLM from documentation or source code.
- Abstract(参考訳): データアクセスはJDBCやODBCのようなデータベースドライバによって完全に守られ、クエリの実行やバルクコラム解析用に設計されていない他のドライバ層を通じてすべての読み込みを強制される。
Jailbreakは、ストレージファイルを直接読み込んでデータをメモリ内のカラムバッファとして実体化することで、データベースエンジンを完全にバイパスするアプローチである。
Jailbreakのキーとなる洞察は、データベースファイルフォーマットは複雑なものであるが、ソースコードとドキュメントによって完全に指定されていることだ。
JailbreakはLLMによるコード合成をデータベースストレージのデコードに利用し、伝統的に不透明なフォーマットを直接クエリ可能なアーティファクトに変換する。
私たちはPostgreSQLとMySQLのストレージファイルでJailbreakを評価し、読み取りレプリカやオフライン処理パイプラインで一般的な分析スナップショットシナリオをターゲットにしています。
生成されたリーダは、DuckDB、Apache Spark、cuDFやSpark RAPIDSなどのGPUアクセラレーションフレームワークなど、広く知られているクエリエンジンのほとんどで、直接使用できるApache Arrowバッファを生成する。
我々は、TPC-Hベンチマークを用いてJDBC/ODBCベースのベースラインに対する正当性を検証し、エンドツーエンドの分析スループットにおいて、最大27倍の高速化を実現した。
以上の結果から, LLM を利用したストレージリーダ合成は, データベースシステム間のデータロックインを破る上で, 可能かつ一般化可能な手法であり, ファイルフォーマットが LLM に利用可能なシステムに対して, PostgreSQL や MySQL を越えるアプリケーションがドキュメントやソースコードから利用可能であることを示す。
関連論文リスト
- SafeLoad: Efficient Admission Control Framework for Identifying Memory-Overloading Queries in Cloud Data Warehouses [59.68732483257323]
メモリオーバーロードは、クラウドデータウェアハウスにおけるリソースの枯渇の一般的な形態である。
我々は,メモリオーバロード(MO)クエリの特定に特化して設計された,最初のクエリ入力制御フレームワークであるSafeLoadを提案する。
SafeLoadは、オンラインおよびオフライン時間オーバーヘッドの少ない最先端の予測性能を実現する。
論文 参考訳(メタデータ) (2026-01-05T08:29:51Z) - The Case for Instance-Optimized LLMs in OLAP Databases [0.7090165638014332]
大規模言語モデル(LLM)は、強力なデータ要約、クリーニング、セマンティックトランスフォーメーション機能を備えた分析システムを強化することができる。
IOLMDB は,クエリ固有モデル最適化により LLM 拡張データベースクエリを実用的なものにする新しいシステムである。
論文 参考訳(メタデータ) (2025-07-07T13:10:01Z) - Large Language Models are Good Relational Learners [55.40941576497973]
本稿では,グラフニューラルネットワーク(GNN)に基づくエンコーダを用いて,大規模言語モデル(LLM)のための構造化リレーショナルプロンプトを生成する新しいアーキテクチャであるRel-LLMを紹介する。
従来のテキストベースのシリアライズ手法とは異なり,本手法はデータベース固有の関係構造を保ちながら,LLMが複雑なエンティティ関係を処理・推論することを可能にする。
論文 参考訳(メタデータ) (2025-06-06T04:07:55Z) - LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference [16.438318417235205]
大規模言語モデル(LLM)に基づくテキスト検索は、ベクトル類似性に基づいて検索クエリに関連する文書を検索する。
非常に軽量なクエリエンコーダを備えた新しいLCMベースのレトリバーであるLightRetrieverを提案する。
本手法は,クエリエンコーディングの1000倍以上の高速化と,エンドツーエンドの検索スループットの10倍以上の高速化を実現する。
論文 参考訳(メタデータ) (2025-05-18T06:51:21Z) - TranSQL+: Serving Large Language Models with SQL on Low-Resource Hardware [16.47619754879028]
グラフを純粋なSQLクエリに変換して,リレーショナルデータベースで実行するテンプレートベースのコードジェネレータであるTran+を紹介した。
また、結合操作を改善するための行列列最適化(ROW2Seek)を提案する。
本稿では,低リソースハードウェア上での大規模言語モデルの実践環境として,リレーショナルデータベースに注目した。
論文 参考訳(メタデータ) (2025-02-05T01:36:40Z) - Relational Database Augmented Large Language Model [59.38841050766026]
大規模言語モデル(LLM)は多くの自然言語処理(NLP)タスクに優れる。
彼らは、トレーニングや教師付き微調整プロセスを通じてのみ、新しい知識を取り入れることができる。
この正確で最新のプライベート情報は、通常リレーショナルデータベースに格納される。
論文 参考訳(メタデータ) (2024-07-21T06:19:10Z) - RB-SQL: A Retrieval-based LLM Framework for Text-to-SQL [48.516004807486745]
文脈内学習を伴う大規模言語モデル(LLM)は、テキスト・ツー・タスクの性能を大幅に改善した。
In-context prompt Engineering のための新しい検索ベースフレームワーク RB- を提案する。
実験により,我々のモデルは,公開データセットのBIRDとSpiderの競合ベースラインよりも優れた性能が得られることが示された。
論文 参考訳(メタデータ) (2024-07-11T08:19:58Z) - Optimizing LLM Queries in Relational Data Analytics Workloads [50.95919232839785]
バッチデータ分析は、Large Language Models(LLMs)の急成長するアプリケーションである
LLMは、分類、エンティティ抽出、翻訳などの幅広い自然言語タスクを、大規模なデータセット上で実行可能にする。
本稿では,LLMコールによるリレーショナルデータ解析処理のコストを大幅に削減できる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-03-09T07:01:44Z) - LLatrieval: LLM-Verified Retrieval for Verifiable Generation [67.93134176912477]
検証可能な生成は、大きな言語モデル(LLM)がドキュメントをサポートするテキストを生成することを目的としている。
本稿では,LLatrieval (Large Language Model Verified Retrieval)を提案する。
実験により、LLatrievalは幅広いベースラインを著しく上回り、最先端の結果が得られることが示された。
論文 参考訳(メタデータ) (2023-11-14T01:38:02Z) - SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended) [53.95151604061761]
本稿では,大規模言語モデル(LLM)を用いたテキスト・ツー・フィルタリングのフレームワークを提案する。
数発のプロンプトで、実行ベースのエラー解析による一貫性復号化の有効性について検討する。
命令の微調整により、チューニングされたLLMの性能に影響を及ぼす重要なパラダイムの理解を深める。
論文 参考訳(メタデータ) (2023-05-26T21:39:05Z) - Querying Large Language Models with SQL [16.383179496709737]
多くのユースケースでは、情報はテキストに格納されるが、構造化データでは利用できない。
事前訓練されたLarge Language Models (LLMs) の台頭に伴い、大量のテキストコーパスから抽出された情報を保存および使用するための効果的なソリューションが現在存在する。
本稿では,従来のデータベースアーキテクチャに基づくプロトタイプであるGaloisについて紹介する。
論文 参考訳(メタデータ) (2023-04-02T06:58:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。