論文の概要: DatalogBench: Evaluating Large Language Models on Text-to-Datalog Synthesis
- arxiv url: http://arxiv.org/abs/2609.37233v1
- Date: Tue, 29 Sep 2026 10:43:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.428974
- Title: DatalogBench: Evaluating Large Language Models on Text-to-Datalog Synthesis
- Title(参考訳): DatalogBench: テキストからデータへの合成に基づく大規模言語モデルの評価
- Abstract要約: Datalogは、プログラム分析のような推論タスクを基盤としているが、プログラムを書くのは難しい。
大規模言語モデルは、自然言語の質問からテキストからデータへ合成するより自然な経路を示唆している。
我々は既存のDatalogベースのアーティファクトからキュレートされた136のテキスト・ツー・データログ合成タスクのベンチマークであるDatalogBenchを紹介する。
- 参考スコア(独自算出の注目度): 5.943241975204596
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Datalog underpins reasoning tasks such as program analysis, but its programs are hard to write. Existing synthesizers automate this task but require users to state their intent as input-output examples. Large language models (LLMs) suggest a more natural route, text-to-Datalog synthesis from a natural-language question, yet how well they do so has not been systematically evaluated. We present DatalogBench, a benchmark of 136 text-to-Datalog synthesis tasks curated from existing Datalog-based artifacts. Synthesized programs are graded by execution on held-out inputs against an oracle validated by mutation analysis. Across six LLMs and four prompting configurations, exact match peaks at 68.4%, and relation descriptions or an input-output example have only modest, model-dependent effects. Under direct prompting, most failures occur at compile time, typically because a model invents auxiliary predicates that it never declares or types consistently. Two coding agents reach up to 83.8% and eliminate nearly all such failures, leaving mostly semantic errors concentrated in recursive tasks. DatalogBench thus identifies recursive reasoning and decomposition as open challenges for current LLMs and agents, and offers a reliable, execution-grounded measure of both.
- Abstract(参考訳): Datalogは、プログラム分析のような推論タスクを基盤としているが、プログラムを書くのは難しい。
既存のシンセサイザーはこのタスクを自動化するが、ユーザはインプット・アウトプットの例としてインテントを記述する必要がある。
大規模言語モデル(LLM)は、自然言語の質問からテキストからデータへ合成するより自然な経路を示唆するが、その方法が体系的に評価されていない。
我々は既存のDatalogベースのアーティファクトからキュレートされた136のテキスト・ツー・データログ合成タスクのベンチマークであるDatalogBenchを紹介する。
合成プログラムは、突然変異解析によって検証されたオラクルに対するホールドアウト入力の実行によってグレードされる。
6つのLCMと4つのプロンプト構成、68.4%の正確な一致ピーク、および関係記述や入力出力の例は、モデストでモデルに依存した効果しか持たない。
直接的なプロンプトの下では、ほとんどの障害はコンパイル時に発生します。
2つのコーディングエージェントが最大83.8%まで到達し、ほとんどすべての失敗を排除し、ほとんどは再帰的なタスクに集中している。
そこでDatalogBenchは、再帰的推論と分解を、現在のLLMとエージェントのオープンな課題として認識し、信頼性の高い実行基盤の尺度を提供する。
関連論文リスト
- LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas [40.92526942288794]
我々は、ログおよびセマンティックグラウンドドスキーマ上で自然言語クエリを定式化するフレームワークであるLogNLQを提案する。
LogNLQは生ログをテンプレート付きリレーショナルテーブルに解析し、テンプレートとパラメータ列の両方に注釈を付けるために二重粒度セマンティックグラウンドを適用する。
クエリ時に、関連するスキーマ候補がセマンティック検索によって検索され、大きな言語モデルが実行可能sqlを生成する。
論文 参考訳(メタデータ) (2026-07-04T14:02:06Z) - OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning [51.58235452818926]
そこで我々は,論理的推論から述語レベルの妥当性推定を分離するニューロシンボリック検索フレームワークOrLogを紹介する。
大規模言語モデル (LLM) は1つの復号のない前方通過において原子述語に対する可視性スコアを提供し、確率論的推論エンジンはクエリ満足度の後方確率を導出する。
論文 参考訳(メタデータ) (2026-01-30T15:31:58Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - AUCAD: Automated Construction of Alignment Dataset from Log-Related Issues for Enhancing LLM-based Log Generation [19.410504836739058]
本稿では,LLMを用いた自動ログステートメント生成のための汎用データセットを用いた後学習による性能向上について検討する。
AUCADと呼ばれる新しいアプローチは、ログ関連の問題から情報を抽出したデータセットを自動的に構築する。
人的および実験的な評価は、これらのモデルが既存のLCMベースのソリューションを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2024-12-25T08:43:00Z) - LogParser-LLM: Advancing Efficient Log Parsing with Large Language Models [19.657278472819588]
LLM機能と統合された新しいログであるLog-LLMを紹介する。
粒度を解析する複雑な課題に対処し、ユーザが特定のニーズに合わせて粒度を調整できるようにするための新しい指標を提案する。
提案手法の有効性は,Loghub-2kと大規模LogPubベンチマークを用いて実験的に検証した。
論文 参考訳(メタデータ) (2024-08-25T05:34:24Z) - HELP: Hierarchical Embeddings-based Log Parsing [0.25112747242081457]
ログは、ソフトウェアのメンテナンスと障害診断のための、第一級の情報ソースである。
ログ解析は、異常検出、トラブルシューティング、根本原因分析などの自動ログ解析タスクの前提条件である。
既存のオンライン解析アルゴリズムは、ログドリフトの影響を受けやすい。
論文 参考訳(メタデータ) (2024-08-15T17:54:31Z) - MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning [63.80739044622555]
自然言語ナラティブで指定されたソフト推論タスクの言語モデルを評価するデータセットである MuSR を紹介する。
このデータセットには2つの重要な特徴がある。まず、ニューロシンボリック合成-自然生成アルゴリズムによって生成される。
第二に、私たちのデータセットインスタンスは、実世界の推論の領域に対応する無料のテキスト物語です。
論文 参考訳(メタデータ) (2023-10-24T17:59:20Z) - Self-Supervised Log Parsing [59.04636530383049]
大規模ソフトウェアシステムは、大量の半構造化ログレコードを生成する。
既存のアプローチは、ログ特化や手動ルール抽出に依存している。
本稿では,自己教師付き学習モデルを用いて解析タスクをマスク言語モデリングとして定式化するNuLogを提案する。
論文 参考訳(メタデータ) (2020-03-17T19:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。