論文の概要: DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense
- arxiv url: http://arxiv.org/abs/2607.24348v1
- Date: Mon, 27 Jul 2026 12:27:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.416024
- Title: DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense
- Title(参考訳): DeepFaith:多段階APT防衛における忠実なインシデント報告のためのエビデンスを取り巻くLCM
- Abstract要約: 先進的永続脅威(APT)は、多段階的かつステルス的な性質のため、検出と解釈が困難である。
最近の自律防衛システムは、前兆グラフと学習に基づくモデルを利用して検出と緩和を行っている。
大型言語モデル(LLM)はレポート生成に有望なインターフェースを提供するが、しばしば幻覚的あるいは弱い基礎的コンテンツを生成する。
マルチステージAPT防衛における忠実なインシデント報告のためのエビデンス基盤フレームワークであるDeepFaithを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advanced Persistent Threats (APTs) are difficult to detect and interpret due to their multi-stage and stealthy nature. While recent autonomous defense systems leverage provenance graphs and learning-based models for detection and mitigation, their outputs remain largely machine-oriented and difficult for analysts to interpret. Large language models (LLMs) offer a promising interface for report generation, but often produce hallucinated or weakly grounded content. In this paper, we propose DeepFaith, an evidence-grounded framework for faithful incident reporting in multi-stage APT defense. DeepFaith transforms structured outputs from autonomous defense and explainability modules into natural-language reports that are explicitly aligned with underlying system evidence. The framework integrates a unified evidence representation, evidence-grounded prompting, faithfulness-aware generation, and post-generation verification to ensure that all generated statements are supported. Experiments in a realistic enterprise testbed demonstrate that DeepFaith improves faithfulness from 0.68 to 0.92, reduces unsupported claims from 0.32 to 0.08, and increases temporal consistency from 0.6 to 0.88, while maintaining concise reports and lower error rates than existing template-based and LLM-based solutions. These results show that evidence-grounded generation enables reliable, interpretable, and actionable reporting for security operations centers.
- Abstract(参考訳): 先進的永続脅威(APT)は、多段階的かつステルス的な性質のため、検出と解釈が困難である。
近年の自律防衛システムは、前兆グラフと学習に基づくモデルを利用して検出と緩和を行っているが、そのアウトプットの大部分はマシン指向であり、分析者が解釈するのが困難である。
大型言語モデル(LLM)はレポート生成に有望なインターフェースを提供するが、しばしば幻覚的あるいは弱い基礎的コンテンツを生成する。
本稿では,多段階APT防衛における忠実なインシデント報告のための根拠に基づくフレームワークであるDeepFaithを提案する。
DeepFaithは、構造化されたアウトプットを、自律防衛と説明可能性モジュールから、基礎となるシステム証拠と明確に一致した自然言語レポートに変換する。
このフレームワークは、統一されたエビデンス表現、エビデンスに基づくプロンプト、忠実さを意識した生成、およびポストジェネレーション検証を統合して、生成されたすべてのステートメントが確実にサポートされるようにしている。
現実的なエンタープライズテストベッドの実験では、DeepFaithは信頼度を0.68から0.92に改善し、サポート対象のクレームを0.32から0.08に削減し、時間的一貫性を0.6から0.88に向上し、既存のテンプレートベースやLLMベースのソリューションよりも簡潔なレポートとエラー率の低下を維持している。
これらの結果から,エビデンス・グラウンドド・ジェネレーションは,セキュリティ・オペレーション・センターの信頼性,解釈,行動可能な報告を可能にすることが示唆された。
関連論文リスト
- Evidence-Grounded Retrieval for Investigation Hunt Lead Generation from CTI Reports [14.553976092752178]
AHLERTは、脅威レポートから関連性、環境認識、および鉛を自動抽出するシステムである。
妥協の緩い指標ではなく、構造化された直接作用可能な鉛を放出する。
市販のLLMモデルと比較すると、86.95%が最も有効である。
論文 参考訳(メタデータ) (2026-09-08T14:21:35Z) - MS-MFAD : Multimodal large language models for Face Anti-spoofing Detection [25.077055201475442]
顔検出のためのMFAD(Multimodal Large Language Models)を提案する。
MFADは、微細なピクセル・セマンティックアンカー機構により、マルチモーダル大言語モデルの本質的な推論機能を活性化する。
攻撃カテゴリごとに1,000の正確なマスクをアノテートすることで、我々はスプーフされた領域に厳密に対応するエビデンス連鎖を生成する。
論文 参考訳(メタデータ) (2026-08-18T03:38:59Z) - Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs [4.721990925113432]
修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
論文 参考訳(メタデータ) (2026-07-14T17:28:25Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs [69.11382230669491]
ビデオ証拠(忠実さ)または検証可能な世界知識(事実性)のどちらかに矛盾する結果である幻覚
textscINFACTは、4つのモードでモデルを評価する。
14の代表的なビデオ-LLMの実験では、高ベースモード精度が誘導モードの信頼性に確実に変換されないことが明らかになった。
論文 参考訳(メタデータ) (2026-03-12T03:03:16Z) - DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection [6.225860651499494]
多モーダル偽ニュース検出は、敵対的誤報の軽減に不可欠である。
進化的,エビデンス駆動推論パラダイムに基づくフレームワークであるDIVER(Dynamic Iterative Visual Evidence Reasoning)を提案する。
Weibo、Weibo21、GossipCopの実験では、DIVERは最先端のベースラインを平均2.72%上回っている。
論文 参考訳(メタデータ) (2026-01-12T04:01:33Z) - Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency [78.91846841708586]
完全な自己整合性で答えられた事実でさえ、軽微な文脈干渉の下で急速に崩壊することを示します。
本研究では,概念的近傍における応答コヒーレンスを評価する信念の構造尺度であるNighbor-Consistency Belief(NCB)を提案する。
また、文脈不変の信念構造を最適化し、長い知識の脆さを約30%低減する構造意識訓練(SAT)を提案する。
論文 参考訳(メタデータ) (2026-01-09T16:23:21Z) - The Facade of Truth: Uncovering and Mitigating LLM Susceptibility to Deceptive Evidence [49.94160400740222]
MisBeliefは、協調的な多ラウンドの相互作用によって誤解を招く証拠を生成するフレームワークである。
MisBeliefを用いて、3つの難易度で4,800のインスタンスを生成し、7つの代表的なLCMを評価する。
結果は、モデルは直接的な誤報に対して堅牢であるが、この洗練された証拠に非常に敏感であることを示している。
本稿では,疑似意図を証拠裏で推測することにより早期警告信号を提供するガバナンス機構である,認知的意図遮蔽(DIS)を提案する。
論文 参考訳(メタデータ) (2026-01-09T02:28:00Z) - Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking [64.97768177044355]
大規模言語モデル(LLM)は、現実のファクトチェックシステムにますます多くデプロイされている。
FactArenaは、完全に自動化されたアリーナスタイルの評価フレームワークである。
本研究では,静的クレーム検証精度とエンドツーエンドのファクトチェック能力の相違点を明らかにした。
論文 参考訳(メタデータ) (2026-01-06T02:51:56Z) - Knowledge-Grounded Agentic Large Language Models for Multi-Hazard Understanding from Reconnaissance Reports [14.8590499954111]
災害後の偵察報告には、マルチハザード相互作用を理解するための重要な証拠が含まれている。
MoRA-RAGは、偵察レポートをマルチハザード推論のための構造化基盤に変換する知識基盤のLLMフレームワークである。
MoRA-RAGは94.5パーセントの精度を達成し、ゼロショットのLLMを30%上回り、最先端のRAGシステムを10%上回っている。
論文 参考訳(メタデータ) (2025-11-18T00:36:31Z) - ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation [91.20492150248106]
本研究では,不誠実な生成の背後にある内部メカニズムを解明し,不均等に活性化される中深度フィードフォワードネットワーク(FFN)のサブセットを同定する。
本研究では,不信感関連FFNの活性化を抑制することにより,文脈的忠実度を向上させるフレームワークであるParametric Knowledge Mutingを提案する。
実験結果から,ParamMuteはCoFaithfulQAと確立されたConFiQAベンチマークの両方の信頼度を大幅に向上し,パラメトリックメモリへの依存度を大幅に低下させることが示された。
論文 参考訳(メタデータ) (2025-02-21T15:50:41Z) - FactCHD: Benchmarking Fact-Conflicting Hallucination Detection [64.4610684475899]
FactCHD は LLM からファクトコンフリクトの幻覚を検出するために設計されたベンチマークである。
FactCHDは、バニラ、マルチホップ、比較、セット操作など、さまざまな事実パターンにまたがる多様なデータセットを備えている。
Llama2 に基づくツール強化 ChatGPT と LoRA-tuning による反射的考察を合成する Truth-Triangulator を提案する。
論文 参考訳(メタデータ) (2023-10-18T16:27:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。