論文の概要: DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction
- arxiv url: http://arxiv.org/abs/2608.03591v1
- Date: Tue, 04 Aug 2026 12:43:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.19326
- Title: DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction
- Title(参考訳): DiagChain: 攻撃鎖再構築におけるLDMエージェントの評価のための診断基準
- Authors: Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao,
- Abstract要約: 本稿では,アタックチェーン再構築のための診断ベンチマークであるDiagChainを紹介する。
DiagChainには、複数のオペレーティングシステム、エビデンスノイズレベル、チェーン長さにまたがる69のシナリオスイートであるMAIN-69が含まれている。
DiagChainによると、最も強い構成でさえ、MAIN-69の849参照ステップの39.6%しか成功していない。
- 参考スコア(独自算出の注目度): 31.550677505379358
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents offer a promising approach to attack chain reconstruction by retrieving and interpreting heterogeneous telemetry to infer ordered attacker actions. However, existing benchmarks mainly evaluate final outputs or aggregate accuracy, providing limited insight into how errors arise and propagate across intermediate reasoning stages. We present DiagChain, a diagnostic benchmark for evidence-grounded attack chain reconstruction that enables stage-wise evaluation of LLM agents. DiagChain includes MAIN-69, a suite of 69 scenarios spanning multiple operating systems, evidence noise levels, and chain lengths. It further introduces Evidence-Centric Retrieval-Augmented Generation (ECRAG), which couples evidence retrieval with an evolving structured representation of the reconstructed chain. Five complementary metrics are introduced to assess distinct stages of the reconstruction process and support systematic failure diagnosis. Based on evaluations using 6 LLMs, DiagChain reveals that even the strongest configuration succeeds on only 39.6% of the 849 reference steps in MAIN-69. Our analysis further shows that smaller models struggle with the more basic task of incorporating retrieved evidence into their outputs, whereas larger models can proceed to later steps, where correctly ordering that evidence becomes the main bottleneck. These results validate the importance of diagnostic evaluation beyond end-to-end accuracy and provide actionable insights for improving evidence-grounded cybersecurity agents.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、命令された攻撃行動を推測するために不均一なテレメトリを検索し解釈することで、攻撃チェーン再構築のための有望なアプローチを提供する。
しかし、既存のベンチマークは主に最終的なアウトプットや集約精度を評価し、中間的推論段階にわたってエラーがどのように発生し伝播するかについての限られた洞察を与えている。
本稿では,LLMエージェントの段階的評価が可能なアタックチェーン再構築のための診断ベンチマークであるDiagChainを提案する。
DiagChainには、複数のオペレーティングシステム、エビデンスノイズレベル、チェーン長さにまたがる69のシナリオスイートであるMAIN-69が含まれている。
さらに、Evidence-Centric Retrieval-Augmented Generation (ECRAG)を導入し、エビデンス検索と再構成鎖の構造的表現を結合する。
再建過程の異なる段階を評価するために5つの相補的指標を導入し、系統的故障診断をサポートする。
6LLMを用いた評価に基づいて、DiagChainは最も強い構成でさえ、MAIN-69の849参照ステップの39.6%しか成功していないことを明らかにした。
我々の分析では、より小さなモデルでは、抽出された証拠をアウトプットに組み込むという、より基本的な作業に苦しむ一方、より大きなモデルは後続のステップに進むことができ、そこでは、証拠を正しく順序付けすることが主要なボトルネックとなる。
これらの結果は、エンドツーエンドの精度以上の診断評価の重要性を検証し、証拠を根拠としたサイバーセキュリティエージェントを改善するための実用的な洞察を提供する。
関連論文リスト
- Dementia Etiology Diagnosis via Collaborative Meta Knowledge Enhancement [81.27196033392559]
認知症発症診断のための協調的メタ知識向上(COME)フレームワークを提案する。
COMEは、マルチセンタ取得セマンティクス、ソース識別子、モダリティインジケータを異種性を認識した埋め込みとして、スケールアップトレーニングのためにTransformerアーキテクチャに注入する。
本手法は,平均マクロ平均AUCが85.62%,最強ベースラインが4.29ポイント向上し,最先端のドメイン性能を実現する。
論文 参考訳(メタデータ) (2026-07-24T04:26:47Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models [35.9432019263596]
医療診断をイテレーティブ・エビデンス・シークリング・タスクとして定式化する。
我々は,RLVR(Reinforcement Learning with Verifiable Rewards)を利用して,閉ループ環境における本質的な推論を行う。
本稿では,RAGES(Retrieval-Augmented Generation-based Examination Simulator)について紹介する。
論文 参考訳(メタデータ) (2026-07-03T05:43:00Z) - Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents [4.316569498378906]
本稿では,多エージェントシステムである Insights Generator (IG) について述べる。
IGレポートを用いた人間の専門家は、修正されていないベースラインの足場上での足場性能を30.4pp向上させた。
IGのスカウト・インベスティゲータアーキテクチャは、検出カバレッジと競合するアプローチに匹敵する結果をもたらす。
論文 参考訳(メタデータ) (2026-05-20T16:13:53Z) - Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models [60.418191092851636]
OmanicはオープンドメインのマルチホップQAリソースであり、推論プロセスを分析するための構造アノテーションとして分解されたサブクエストと中間回答を提供する。
10,296個の機械によるトレーニング例(Omanic Synth)と967個の専門家による注釈付き評価例(OmanicBench)を含む。
論文 参考訳(メタデータ) (2026-03-17T15:23:37Z) - UltrasoundAgents: Hierarchical Multi-Agent Evidence-Chain Reasoning for Breast Ultrasound Diagnosis [14.027321451902734]
本稿では,UltrasoundAgentsと呼ばれる階層型マルチエージェントフレームワークを提案する。
メインエージェントは、全画像の病変をローカライズし、作物と動物園の操作をトリガーする。
サブエージェントは局所的な視点を分析し、エコー原性パターン、石灰化、境界タイプ、エッジ形態学の4つの臨床的特性を予測する。
メインエージェントは、これらの構造化属性を統合してエビデンスに基づく推論を行い、BI-RADSカテゴリと悪性度予測を出力し、レビュー可能な中間証拠を生成する。
論文 参考訳(メタデータ) (2026-03-11T15:03:52Z) - Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation [0.0]
本稿では,明示的なレアソニングと忠実度検証を統合したドメイン固有RAGフレームワークを提案する。
我々のアーキテクチャは、ニューラルネットワークの書き換え、BGEベースのクロスエンコーダのランク付け、合理生成モジュールによる標準検索を強化する。
我々は、このフレームワークをBioASQとPubMedQAベンチマークで評価し、動的インコンテキスト学習の影響を具体的に分析する。
論文 参考訳(メタデータ) (2026-03-10T18:25:07Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。