論文の概要: EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming
- arxiv url: http://arxiv.org/abs/2608.01763v1
- Date: Mon, 03 Aug 2026 06:34:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.351839
- Title: EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming
- Title(参考訳): EntailLLM:論理プログラミングによるドメイン知識によるLLM生成脆弱性発見パスの検証
- Authors: Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne, Paulo Shakarian, Dana Warmsley, Nigel Stepp, Evelyn Kim,
- Abstract要約: 大規模な言語モデルは、ソフトウェア脆弱性を推論するためにますます使われています。
彼らのアウトプットはドメインの知識を静かに破り、医療機器などの安全上重要な設定での信頼性を制限します。
提案するEntailLLMは,LLMが提案する各アナリストパスをentailmentで検証する。
- 参考スコア(独自算出の注目度): 0.21778195728544394
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models are increasingly used to reason about software vulnerabilities, but their outputs can silently violate domain knowledge, limiting their reliability in safety-critical settings such as medical devices. Prior work either treats that output as a prediction to be scored or constrains it to walks within a single knowledge graph; neither checks whether reasoning over a binary is consistent with an independent body of domain knowledge. We present EntailLLM, which validates each LLM-proposed analyst path by entailment: the path is a traversal of the binary's function call graph, the domain knowledge is represented in a separate graph, and verification aligns the two under temporal annotated logic. Across three CWE classes, four LLMs, three prompting strategies, and seven binaries varying in size from 405 to 12,696 function call-graph nodes, domain knowledge raises pooled entailment from 78% to 98%, with entailment decreasing in only 3% of the experiments. EntailLLM is deployed end-to-end on real medical-device binaries, reaching 98% pooled entailment without per-device tuning. Our system inherits the formal guarantees of generalized annotated logic, providing logical verification of LLM output that is both explainable and grounded in well-defined semantics.
- Abstract(参考訳): 大規模な言語モデルはソフトウェア脆弱性の推論にますます使われていますが、そのアウトプットはドメインの知識を静かに破り、医療機器のような安全上重要な設定での信頼性を制限します。
以前の作業では、アウトプットを評価すべき予測として扱うか、単一の知識グラフ内を歩くよう制約する。
提案するEntailLLMは,LLMが提案する各アナリストパスを,そのパスがバイナリ関数呼び出しグラフのトラバースであり,ドメイン知識が別のグラフで表現され,検証が時間的注釈付き論理の下で整合する。
3つのCWEクラス、4つのLSM、3つのプロンプト戦略、7つのバイナリが405から12,696の関数コールグラフノードに変化し、ドメイン知識はプールされたエンターメントを78%から98%に増加させ、実験の3%しか減少しない。
EntailLLMは、実際の医療デバイスバイナリにエンドツーエンドにデプロイされ、デバイス毎のチューニングなしで98%のプール付きエンターメントに達する。
我々のシステムは、一般化された注釈付き論理の形式的保証を継承し、よく定義されたセマンティクスで説明可能なLLM出力の論理的検証を提供する。
関連論文リスト
- Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations [19.829321356625428]
Bian Queは、監視、警告応答、根本原因分析のためのエージェントフレームワークである。
これは中国の主要なショートビデオプラットフォームであるKuaiShouのeコマース検索エンジン上に展開された。
警告ボリュームを75%削減し、80%の根源解析精度を実現し、平均分解時間を50%以上削減する。
論文 参考訳(メタデータ) (2026-04-29T15:35:01Z) - A Prompt-Based Framework for Loop Vulnerability Detection Using Local LLMs [0.0]
本研究では,Python 3.7以上のコード中のループ脆弱性を検出するためのプロンプトベースのフレームワークを提案する。
このフレームワークは、制御とロジックのエラー、ループ内のセキュリティリスク、リソース管理の非効率といった、ループ関連の問題の3つのカテゴリをターゲットにしている。
設計されたプロンプトベースのフレームワークには、言語固有の認識、コード認識の接地、バージョン感度、幻覚予防といった重要な保護機能が含まれていた。
論文 参考訳(メタデータ) (2026-01-21T04:53:38Z) - Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs [50.075587392477935]
オープンソースのDeepSeek、Llama、Qwenのエコシステムから、705の現実世界の失敗に関する大規模な実証的研究を行った。
ホワイトボックスオーケストレーションは、モデルアルゴリズムの欠陥からデプロイメントスタックのシステム的脆弱性へと、信頼性のボトルネックを移動させます。
論文 参考訳(メタデータ) (2026-01-20T06:42:56Z) - LIDL: LLM Integration Defect Localization via Knowledge Graph-Enhanced Multi-Agent Analysis [16.217842423570055]
大規模言語モデル統合ソフトウェアにおける欠陥ローカライゼーションのためのマルチエージェントフレームワークLIDLを提案する。
LIDLを105のGitHubリポジトリと16のエージェントベースシステムから収集した146の現実世界の欠陥インスタンスで評価した。
論文 参考訳(メタデータ) (2026-01-09T05:47:59Z) - Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank [71.09032766271493]
大規模言語モデル (LLM) は誤りや幻覚を引き起こす傾向がある。
アウトプットを効果的かつ効率的にチェックする方法は、アプリケーションにとって重要な問題となっている。
論文 参考訳(メタデータ) (2025-10-28T11:01:10Z) - Binary Diff Summarization using Large Language Models [17.877160310535942]
大型言語モデル(LLM)は、従来のツールを拡張するためにバイナリ分析に適用されている。
LLMを用いた二項差分要約のための新しいフレームワークを提案する。
6つのオープンソースプロジェクトに3つの異なるマルウェアを注入することで、ソフトウェアサプライチェーンセキュリティベンチマークを作成します。
論文 参考訳(メタデータ) (2025-09-28T16:47:24Z) - Evaluating the Use of LLMs for Documentation to Code Traceability [3.076436880934678]
大規模言語モデルは、様々なソフトウェアドキュメンテーションとソースコードの間のトレースリンクを確立することができる。
私たちは2つのオープンソースプロジェクト(Unity CatalogとCrawl4AI)から2つの新しいデータセットを作成します。
その結果、最高の性能のLLMは2つのデータセットで79.4%と80.4%のF1スコアを達成した。
論文 参考訳(メタデータ) (2025-06-19T16:18:53Z) - Learning Efficient and Generalizable Graph Retriever for Knowledge-Graph Question Answering [75.12322966980003]
大規模言語モデル(LLM)は、様々な領域にわたって強い帰納的推論能力を示している。
既存のRAGパイプラインのほとんどは非構造化テキストに依存しており、解釈可能性と構造化推論を制限する。
近年,知識グラフ解答のための知識グラフとLLMの統合について検討している。
KGQAにおける効率的なグラフ検索のための新しいフレームワークであるRAPLを提案する。
論文 参考訳(メタデータ) (2025-06-11T12:03:52Z) - ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates [51.633266497799745]
思考テンプレートのスケーリングによる階層的LLM推論は、推論検索空間を効果的に最適化することができる。
i)類似または関連する推論問題に一般化可能な500ほどの高レベルな思考テンプレートを含む構造化・汎用的な思考テンプレートライブラリ,(ii)長いCoTではなく一連の思考テンプレート上で階層的な強化学習を行う,(iii)全く新しい推論スケーリングシステム,の3つの革新を紹介した。
論文 参考訳(メタデータ) (2025-02-10T18:51:47Z) - LINC: A Neurosymbolic Approach for Logical Reasoning by Combining
Language Models with First-Order Logic Provers [60.009969929857704]
論理的推論は、科学、数学、社会に潜在的影響を与える可能性のある人工知能にとって重要なタスクである。
本研究では、LINCと呼ばれるモジュール型ニューロシンボリックプログラミングのようなタスクを再構成する。
我々は,FOLIOとProofWriterのバランスの取れたサブセットに対して,ほぼすべての実験条件下で,3つの異なるモデルに対して顕著な性能向上を観察した。
論文 参考訳(メタデータ) (2023-10-23T17:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。