論文の概要: LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment
- arxiv url: http://arxiv.org/abs/2608.28490v1
- Date: Fri, 28 Aug 2026 16:19:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.392058
- Title: LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment
- Title(参考訳): ソフトウェアとシステムセキュリティのためのLCMベースのエージェント:アプローチ、応用、評価
- Authors: Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai,
- Abstract要約: LLM(Large Language Model)ベースのエージェントは、計画、ツールの使用、状態保持、複数ステップにわたるアクションの修正が可能である。
しかし、この日までに、何がおこなわれたのか、そしてこの分野でどこまで進んでいるのかについて、体系的な理解の欠如が残っている。
本稿では,エージェントアーキテクチャ,知覚,記憶,推論と計画,行動空間,オーケストレーション,自己改善など,技術的アプローチの体系的なレビューを行う。
- 参考スコア(独自算出の注目度): 13.382767307824873
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Software and systems security workflows are typically procedural: analysts inspect heterogeneous artifacts, form hypotheses, invoke tools, interpret outputs, and revise plans. Large language model (LLM)-based agents, which can plan, use tools, retain state, and revise actions across multi-step workflows, are being rapidly adopted to automate this work. Given the consequences of delegating security decisions to autonomous systems, understanding how such agents are built, used, and assessed is crucial. Yet to this date, there remains a lack of systematic understanding of what has been done and how far we are in this field: the term "agent" is applied inconsistently, applications differ sharply in risk, and assessment protocols are often incomparable. To gain a comprehensive and coherent view of this area hence inform relevant future research, this paper provides a systematic literature review of the (1) technical approaches, including agent architecture, perception, memory, reasoning and planning, action space, orchestration, and self-improvement, (2) applications, with respect to the security tasks served, and (3) assessment, including the datasets, outcome and trajectory metrics, safety measures, and baselines considered, over the peer-reviewed literature spanning the emergence of this area (2023--2026). Our synthesis reveals a field that has built agents able to act but not yet agents whose authority is bounded or whose behavior is auditable. In addition to knowledge systematization, we also extend our insights into the limitations of and challenges faced by current approach, application, and assessment designs, which shed light on potentially promising future research directions.
- Abstract(参考訳): アナリストは異質なアーティファクトを検査し、仮説を作成し、ツールを起動し、アウトプットを解釈し、計画を改訂する。
大規模言語モデル(LLM)ベースのエージェントは、ツールを計画し、使用し、状態を保持し、複数のステップのワークフローでアクションを修正できるが、この作業を自動化するために急速に採用されている。
セキュリティ決定を自律システムに委譲する結果を考えると、そのようなエージェントがどのように構築、使用、評価されているかを理解することが重要です。
という用語は、矛盾なく適用され、アプリケーションはリスクが著しく異なり、アセスメントプロトコルはしばしば相容れない。
そこで本研究では,(1)エージェントアーキテクチャ,認識,記憶,推論と計画,行動空間,オーケストレーション,自己改善といった技術的アプローチ,(2)セキュリティタスクに関するアプリケーション,(3)データセット,結果とトラジェクトリのメトリクス,安全対策,ベースラインなどの評価を,この分野の出現にまたがる査読された文献(2023-2026)に対して,包括的かつ一貫した視点で検討した。
我々の合成は、作用できるエージェントを構築できるが、権限が拘束されているエージェントや、監査可能なエージェントをまだ作っていない分野を明らかにします。
知識体系化に加えて、現在のアプローチ、応用、評価設計が直面している限界や課題に対する洞察も拡張し、将来有望な研究の方向性を浮き彫りにした。
関連論文リスト
- Engineering Trustworthy Agentic AI for Critical Systems [1.8015174793525714]
この研究は、安全と制約満足度、堅牢性と信頼性、透明性と解釈可能性、説明責任と監査可能性、プライバシーとセキュリティの5つの横断的な側面で組織された信頼性モデルを採用している。
この基盤の上に構築されたエージェントシステムアーキテクチャ、脅威、具体的な信頼メカニズム、および定量的なメトリクスは、エージェントシステムの開発と評価において直接適用するために調査される。
これらの原則は、電力システム、自動運転車/ロボティクス/UAV、高性能コンピューティング、通信ネットワークの4つの制約のあるエンジニアリングドメインで検証される。
論文 参考訳(メタデータ) (2026-07-20T22:28:16Z) - Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems [64.88044474617854]
大規模言語モデルベースのエージェントをリコメンダシステムに迅速に統合することで、静的なランキングベースのパイプラインから、自律的でインタラクティブなシステムへのシフトが加速した。
この調査では、自律性のレベルとエージェントレコメンデータシステムの3つのコアパラダイムを基盤とした統合された分類法を紹介した。
論文 参考訳(メタデータ) (2026-07-05T17:55:05Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - AI Agent Systems: Architectures, Applications, and Evaluation [4.967019713320407]
AIエージェントは、基礎モデルと推論、計画、メモリ、ツールの使用を組み合わせる。
先行作業は、エージェントコンポーネントにまたがる統一された分類にまとめます。
レイテンシ対精度、自律性対可制御性、能力対信頼性といった重要な設計トレードオフについて論じます。
論文 参考訳(メタデータ) (2026-01-05T02:38:40Z) - Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems [0.0]
エージェントAIの最近の進歩は、スタンドアロンの大規模言語モデルから統合システムへと焦点を移している。
LLM、メモリ、ツール、環境を含む4つの評価柱を持つエンドツーエンドのエージェントアセスメントフレームワークを提案する。
我々はこのフレームワークを、従来のメトリクスによる振る舞いの偏りを示す、代表的なAutonomous CloudOpsユースケースで検証する。
論文 参考訳(メタデータ) (2025-12-14T18:17:40Z) - A Comprehensive Survey on Benchmarks and Solutions in Software Engineering of LLM-Empowered Agentic System [56.40989626804489]
この調査は、Large Language Modelsを使ったソフトウェアエンジニアリングに関する、最初の総合的な分析を提供する。
本稿では,150以上の最近の論文をレビューし,(1)素早い,微調整,エージェントベースのパラダイムに分類した解法,(2)コード生成,翻訳,修復などのタスクを含むベンチマークという2つの重要な側面に沿った分類法を提案する。
論文 参考訳(メタデータ) (2025-10-10T06:56:50Z) - Evaluation and Benchmarking of LLM Agents: A Survey [2.75311233296471]
本調査では,既存の作業を評価目的に沿って整理する2次元分類法を紹介する。
データへのロールベースのアクセスなど、企業固有の課題を強調します。
また、総合的で、より現実的で、スケーラブルな評価を含む、将来の研究の方向性を特定します。
論文 参考訳(メタデータ) (2025-07-29T04:57:02Z) - Survey on Evaluation of LLM-based Agents [28.91672694491855]
LLMベースのエージェントの出現は、AIのパラダイムシフトを表している。
本稿では,これらのエージェントに対する評価手法に関する総合的な調査を初めて実施する。
論文 参考訳(メタデータ) (2025-03-20T17:59:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。