論文の概要: DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents
- arxiv url: http://arxiv.org/abs/2607.22165v1
- Date: Fri, 24 Jul 2026 10:11:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.111537
- Title: DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents
- Title(参考訳): DBA-Bench: LLMベースのデータベース操作エージェントのための生産忠実度ベンチマーク
- Abstract要約: LLMベースのデータベースエージェントは、将来性を示すが、タスクスコープ、テストベッド、メトリクスが比較を妨げている。
DBA-Benchは、生産効率、結果優先評価、制御シナリオを通じてこれらのギャップに対処するベンチマークである。
ベンチマークには7つのタスクドメインにわたる106のシナリオが含まれており、参照パスの深さと環境の複雑さに基づいた2つの公開困難ラベルがある。
- 参考スコア(独自算出の注目度): 11.99420231543344
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM-based database agents show promise, but differing task scopes, testbeds, and metrics hinder comparison. We identify four gaps between evaluation and production operations: live-environment fidelity (multi-turn read-write interaction with a running database); observation-space scale and complexity (causal diagnosis across thousands of time series, business logs, and concurrent activity); solution-space openness (multiple remediations with different operational trade-offs); and scenario complexity and coverage (faults cascading across internal mechanisms and operational domains). We present DBA-Bench, a benchmark addressing these gaps through production fidelity, outcome-first evaluation, and controlled scenario reproducibility. It uses instrumented PostgreSQL environments with active workloads, persistent state, and multi-source observations; defines success by measurable recovery or fault elimination under safety constraints; and restores snapshots with scenario-specific checks before each run. The benchmark contains 106 scenarios across seven task domains, with two public difficulty labels based on reference-path diagnostic depth and environmental complexity. We evaluate nine baseline groups, including six foundation-model systems, two GPT-5.5-backed database agents, and a Human DBA reference. Across 848 automated runs, Diagnosis, Outcome, and Safe Pass rates are 32.7%, 19.6%, and 12.4%; the best automated baseline reaches 17.9% Safe Pass versus 93.4% for the Human DBA reference. Automated Safe Pass falls from 19.6% on Easy scenarios to 7.6% on Hard scenarios, underscoring the difficulty of safe end-to-end remediation.
- Abstract(参考訳): LLMベースのデータベースエージェントは、将来性を示すが、タスクスコープ、テストベッド、メトリクスが比較を妨げている。
実環境の忠実さ(実行中のデータベースとの複数ターンの読み取り-書き込みインタラクション)、観測空間のスケールと複雑さ(数千の時系列、ビジネスログ、同時アクティビティにわたる因果診断)、解空間の開放性(複数の運用トレードオフによる複数の修復)、複雑さとカバレッジ(内部機構と運用領域にまたがるフォールト)の4つのギャップを特定します。
DBA-Benchは、生産効率、結果優先評価、制御シナリオ再現性を通じてこれらのギャップに対処するベンチマークである。
アクティブなワークロード、永続的な状態、マルチソース観測を備えた計測対象のPostgreSQL環境を使用し、安全制約の下で測定可能なリカバリや障害除去による成功を定義し、各実行前にシナリオ固有のチェックでスナップショットを復元する。
ベンチマークには7つのタスクドメインにわたる106のシナリオが含まれており、参照パスの診断深さと環境の複雑さに基づいた2つの公開困難ラベルがある。
6つの基礎モデルシステム,2つの GPT-5.5 支援データベースエージェント,および人間の DBA 参照を含む9つのベースライン群を評価した。
848回の自動走行、診断、アウトカム、セーフパスの比率は32.7%、19.6%、12.4%であり、人間のDBA基準では93.4%に対して、最高の自動化ベースラインは17.9%のセーフパスに達した。
自動化されたセーフパスは、簡単なシナリオで19.6%からハードシナリオで7.6%に減少し、安全なエンドツーエンドの修復の難しさを浮き彫りにする。
関連論文リスト
- SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue [1.9116784879310027]
本稿では,リトレーニングや追加のモデルコールを伴わずにロバスト性を向上させる軽量なプロンプトベースのリカバリ手法について検討する。
我々は,構造化データベースの状態に照らしたガイド付きリカバリプロンプトを含む3つの応答戦略を比較した。
30.5%の障害がMultiWOZで、20.9%がSGDで幻覚する。
論文 参考訳(メタデータ) (2026-06-30T08:18:11Z) - Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning [0.41942958779358674]
既存の評価は、孤立した単一プラットフォーム環境に焦点を当てている。
我々は、50個のデータ基底タスクのプロダクショングレードベンチマークであるCross-Vendor Sola ISPMベンチマークを紹介する。
また、最終回答の正当性だけでなく、明らかな根拠も測定する評価フレームワークにも貢献する。
論文 参考訳(メタデータ) (2026-06-01T12:41:00Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces [17.202580606345666]
生産性タスクを自動化するために、大規模言語モデル(LLM)エージェントがますますデプロイされる。
既存のベンチマークは単純化された環境に依存しており、現実的なマルチサービス環境をキャプチャできない。
我々は,現実的な生産性設定におけるLCMエージェントの評価と改善のためのベンチマークであるClawsBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-06T21:09:06Z) - ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - RAISE: Reasoning Agent for Interactive SQL Exploration [47.77323087050061]
本稿では,スキーマリンク,クエリ生成,反復的改善を1つのエンドツーエンドコンポーネントに統一する新しいフレームワークを提案する。
本手法は、不慣れなデータベースを扱う際に、人間がどう答えるかをエミュレートする。
論文 参考訳(メタデータ) (2025-06-02T03:07:08Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。