論文の概要: Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions
- arxiv url: http://arxiv.org/abs/2607.03233v1
- Date: Fri, 03 Jul 2026 11:42:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.563124
- Title: Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions
- Title(参考訳): オープンソースインテリジェンスとサイバー調査のためのエージェントAIと生成AI:分類,評価,課題,今後の方向性
- Authors: Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo,
- Abstract要約: 大規模言語モデル(LLM)とエージェントAIシステムが有望なソリューションとして登場している。
本調査は74研究を体系的にレビューし,4つのコントリビューションを行った。
- 参考スコア(独自算出の注目度): 24.28151698249644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid growth of publicly available digital information has rendered manual open-source intelligence (OSINT) analysis insufficient for modern intelligence, cybersecurity, and cyber investigation. Large language models (LLMs) and agentic AI systems, capable of tool use, multi-step reasoning, and iterative intelligence generation, have emerged as promising solutions, yet evaluation frameworks have not kept pace with reported capabilities. This survey systematically reviews 74 studies and makes four contributions. First, it establishes agentic AI as a distinct analytical category rather than an extension of LLM prompting, organising the literature through an 11-category taxonomy covering LLM foundations, agentic architectures, retrieval-augmented generation (RAG), knowledge graphs, prompt engineering, domain adaptation, evaluation benchmarks, and risk. Second, it identifies the hallucination-validation gap as a corpus-level finding: although hallucination is recognised as a major reliability concern in over twenty studies, end-to-end hallucination is empirically measured in only one OSINT-specific RAG-based system, non-reproducible conditions, while related reasoning and factual-correction studies evaluate general-domain question answering rather than OSINT. Third, it maps existing research to the OSINT lifecycle, showing strong support for collection and analysis but limited coverage of verification, reporting, dissemination, and decision support. Fourth, it derives a ten-point research agenda addressing evaluation, benchmarking, hallucination measurement, adversarial robustness, dark-web coverage, multimodal intelligence, and governance. It concludes that a human-AI co-pilot model, where LLMs assist collection and triage while analysts retain responsibility for verification and decision-making, represents the most defensible near-term deployment architecture.
- Abstract(参考訳): 公開されているデジタル情報の急速な成長により、手動のオープンソースインテリジェンス(OSINT)分析は、現代のインテリジェンス、サイバーセキュリティ、サイバー調査には不十分である。
ツール使用、多段階推論、反復的なインテリジェンス生成が可能な大規模言語モデル(LLM)とエージェントAIシステムは、有望なソリューションとして登場したが、評価フレームワークは報告された機能に追随していない。
本調査は74研究を体系的にレビューし,4つのコントリビューションを行った。
第一に、エージェントAIは、LSMの促進というよりも、エージェントAIを独立した分析カテゴリとして確立し、LSMの基礎、エージェントアーキテクチャ、検索強化世代(RAG)、知識グラフ、迅速なエンジニアリング、ドメイン適応、評価ベンチマーク、リスクをカバーする11のカテゴリの分類を通じて、文献を整理する。
第2に、幻覚の正解ギャップをコーパスレベルの発見として特定する: 幻覚は20以上の研究において主要な信頼性の懸念として認識されているが、エンド・ツー・エンドの幻覚は1つのOSINT固有のRAGベースのシステム、非再生可能な条件で実証的に測定され、関連する推論と事実補正研究はOSINTよりも一般ドメインの質問応答を評価する。
第3に、既存の研究をOSINTライフサイクルにマッピングし、コレクションと分析の強力なサポートを示すが、検証、レポート、普及、意思決定のサポートは限られている。
第4に、評価、ベンチマーク、幻覚測定、敵対的堅牢性、ダークウェブカバレッジ、マルチモーダルインテリジェンス、ガバナンスに対処する10点の研究課題を導出する。
LLMが収集とトリアージを支援し、アナリストが検証と意思決定の責任を負うという、人間とAIの共同パイロットモデルが、最も保証可能な短期的なデプロイメントアーキテクチャである、と結論付けている。
関連論文リスト
- LLM-Based Scientific Peer Review: Methods, Benchmarks, and Reliability Challenges [4.655159257282136]
この調査は,大規模言語モデル(LLM)に基づく科学的ピアレビューのシステムレベル分析を提供する。
批判生成とスコア予測という2つの中心的評価関数に注目した。
プロンプトインジェクション、データ中毒、検索脆弱性、報酬ハッキングなど、新興のリスクを特定します。
論文 参考訳(メタデータ) (2026-06-23T18:12:39Z) - AI-Driven Test Case Generation from Natural Language Requirements: A Survey of Techniques and Research Gaps [0.0]
ソフトウェアテストは、システムが特定の要件を満たすことを検証するために重要であるが、開発において最も時間がかかり、高価な活動の1つだ。
AI、自然言語処理(NLP)、大規模言語モデル(LLM)の最近の進歩により、パイプラインの自動化はますます実現可能になっている。
今回の調査では、自然言語要求からテストケースを生成するためにAIとNLPテクニックが提案されていること、これらのアプローチをサポートするツールとフレームワーク、研究ギャップが残っていること、の4つの研究課題に対処する。
論文 参考訳(メタデータ) (2026-06-04T15:07:23Z) - ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment [22.38716170940567]
研究員が歴史的証拠から前向きな判断を下せるかどうかを評価するためのベンチマークであるForeSciを紹介する。
ForeSciには、素早く動く4つのAIドメインと4つの意思決定ファミリに500のタスクが含まれている。
明確な証拠組織は、トレーサビリティと事実支援を改善するが、決定家族に強く依存する。
論文 参考訳(メタデータ) (2026-05-30T09:41:26Z) - AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery [184.2309450554096]
AutoResearchはAIを活用した科学ワークフロー自動化の開発スペクトルとして定義されている。
我々は、研究システムが制御、エビデンス、実行、検証、説明責任を再分配し、その分野を組織化する方法について分析する。
本稿では,5つの評価次元 – ノベルティ,インパクト,信頼性,証明 – を提案し,AutoResearchの自律性はドメイン条件であることを示す。
論文 参考訳(メタデータ) (2026-05-22T03:40:30Z) - AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - Assistance to Autonomy: A Systematic Literature Review of Agentic AI across the Software Development Life Cycle [4.241377338556251]
本研究は,ソフトウェア製品開発におけるエージェントシステムに関する現在の文献の包括的評価に寄与する。
また、高ボリュームSLRドメインのスクリーニングフェーズを自動化するためのAI支援ツールの形式での方法論的なコントリビューションも提供する。
論文 参考訳(メタデータ) (2026-05-14T10:46:51Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Explain Before You Answer: A Survey on Compositional Visual Reasoning [74.27548620675748]
構成的視覚推論は、マルチモーダルAIにおける重要な研究フロンティアとして登場した。
本調査は,トップ会場(CVPR,ICCV,NeurIPS,ICML,ACLなど)から260以上の論文を体系的にレビューする。
次に60以上のベンチマークとそれに対応するメトリクスを、基底精度、連鎖忠実性、高分解能知覚などの次元に沿って探索する。
論文 参考訳(メタデータ) (2025-08-24T11:01:51Z) - Survey on Evaluation of LLM-based Agents [28.91672694491855]
LLMベースのエージェントの出現は、AIのパラダイムシフトを表している。
本稿では,これらのエージェントに対する評価手法に関する総合的な調査を初めて実施する。
論文 参考訳(メタデータ) (2025-03-20T17:59:23Z) - A Literature Review of Literature Reviews in Pattern Analysis and Machine Intelligence [51.26815896167173]
本稿では,3つの相補的な側面からPAMIレビューを総合的に分析する。
我々の分析は、現在のレビューの実践において、独特の組織パターンと永続的なギャップを明らかにします。
最後に、最先端のAI生成レビューの評価は、コヒーレンスと組織の進歩を奨励していることを示している。
論文 参考訳(メタデータ) (2024-02-20T11:28:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。