論文の概要: Autonomous LLM Agents & CTFs: A Second Look
- arxiv url: http://arxiv.org/abs/2605.21497v1
- Date: Wed, 29 Apr 2026 09:42:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 12:34:33.986932
- Title: Autonomous LLM Agents & CTFs: A Second Look
- Title(参考訳): 自律型LDMエージェントとCTF
- Authors: Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi,
- Abstract要約: 攻撃的なセキュリティタスクを自動化するために、大規模言語モデル(LLM)エージェントがますます提案されている。
私たちは、30のWebベースのCapture-the-Flag(CTF)課題に対して、複雑さとモジュラリティを高めるために、さまざまなエージェントアーキテクチャを設計しました。
我々はこれらのエージェントを複数のLCMバックボーンでインスタンス化し、それらを内部アーキテクチャを自動的に決定する汎用エージェントであるclaude-codeと比較する。
- 参考スコア(独自算出の注目度): 2.475524451473685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents are increasingly proposed to automate offensive security tasks, with recent studies reporting near human-level success rates in Capture-the-Flag (CTF) challenges. We here revisit these results, providing a second look at these claims. We engineer different agent architectures of increasing complexity and modularity on 30 web-based CTFs challenges spanning 14 vulnerability classes. We instantiate these agents with multiple LLM backbones, and compare them with claude-code, a general-purpose agent that automatically determines its internal architecture. Our evaluation yields three main findings. First, claude-code achieves performance comparable to the engineered architectures (19/30 solved tasks), suggesting that general-purpose agents are strong baselines for offensive security tasks. Second, both our architectures and claude-code struggle in the same challenge categories, revealing persistent barriers that keep current agents below human-level capability. Third, by leveraging our manually designed architectures we can systematically measure the impact of additional components, finding that structured orchestration of specialized roles outperforms monolithic designs, improving run-to-run consistency, and reducing execution costs.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは攻撃的セキュリティタスクを自動化するためにますます提案されており、最近の研究では、キャプチャー・ザ・フラッグ(CTF)課題における人間レベルの成功率に近いことが報告されている。
ここでは、これらの結果を再考し、これらの主張を再確認する。
私たちは、14の脆弱性クラスにまたがる30のWebベースのCTF課題に対して、複雑さとモジュラリティを高めるために、さまざまなエージェントアーキテクチャを設計しました。
我々はこれらのエージェントを複数のLCMバックボーンでインスタンス化し、それらを内部アーキテクチャを自動的に決定する汎用エージェントであるclaude-codeと比較する。
私たちの評価は3つの主な結果をもたらす。
まず、Clude-codeはエンジニアアーキテクチャ(19/30の問題解決タスク)に匹敵するパフォーマンスを実現し、汎用エージェントが攻撃的セキュリティタスクの強力なベースラインであることを示唆している。
第2に、私たちのアーキテクチャとクロードコードの両方が、同じ課題カテゴリで苦労しており、現在のエージェントを人間レベルの能力以下に維持する永続的な障壁を明らかにしています。
第三に、手動で設計したアーキテクチャを利用することで、追加のコンポーネントの影響を体系的に測定し、特殊なロールの構造的なオーケストレーションがモノリシックな設計よりも優れ、実行時の一貫性を改善し、実行コストを削減できる。
関連論文リスト
- Architecture Matters for Multi-Agent Security [1.699014226195857]
本研究では,マルチエージェントシステムがタスク性能と攻撃抵抗のトレードオフをいかに形成するかを検討する。
マルチエージェントアーキテクチャは、構成の大部分においてスタンドアロンのエージェントよりも脆弱であることがわかった。
論文 参考訳(メタデータ) (2026-04-25T22:25:58Z) - Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition [53.50448142467294]
RAIMは、リポジトリレベルの機能追加のための、多設計およびアーキテクチャ対応のフレームワークである。
複数の多様な実装設計を生成することで、線形パッチから切り離される。
NoCode-bench Verifiedデータセットの実験では、RAIMが新しい最先端のパフォーマンスを確立することが示されている。
論文 参考訳(メタデータ) (2026-03-02T12:50:40Z) - MagicAgent: Towards Generalized Agent Planning [73.21129030631421]
汎用エージェント計画に特化して設計された基盤モデルである textbfMagicAgent について述べる。
多様な計画タスクにまたがる高品質なトラジェクトリを生成する軽量でスケーラブルな合成データフレームワークを提案する。
MagicAgent-32B と MagicAgent-30B-A3B は様々なオープンソースベンチマークにおいて優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-02-22T01:39:16Z) - Yunque DeepResearch Technical Report [12.184074646161223]
Yunque DeepResearchは階層的でモジュール的で堅牢なディープリサーチフレームワークである。
さまざまなエージェントによるディープリサーチベンチマークで最先端のパフォーマンスを実現している。
私たちは、コミュニティに力を与えるためのフレームワーク、再現可能な実装、そしてアプリケーションケースをオープンソースにしています。
論文 参考訳(メタデータ) (2026-01-27T13:10:00Z) - An Empirical Study on Failures in Automated Issue Solving [12.571536148821144]
我々は,SWE-Bench-Verifiedの自動問題解決タスクにおいて,パイプラインベースとエージェントアーキテクチャの両方にまたがる3つのSOTAツールの性能と効率を分析する。
ハイレベルなパフォーマンス指標から根本原因分析に移行するために,150件の障害事例の体系的手動分析を行った。
その結果、2つのアーキテクチャパラダイムの間には明確な失敗の指紋が明らかとなり、ほとんどのエージェント的失敗は、欠陥のある推論と認知的デッドロックに起因する。
論文 参考訳(メタデータ) (2025-09-17T13:07:52Z) - AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search [58.98450205734779]
大規模言語モデル(LLM)エージェントは、多様なドメインにまたがる強力な機能を示している。
既存のエージェントサーチ手法には3つの大きな制限がある。
これらの課題に対処するための包括的なフレームワークを導入します。
論文 参考訳(メタデータ) (2025-06-06T12:07:23Z) - OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation [65.15955645757705]
専門的な実行から戦略的計画を切り離す階層的なマルチエージェントフレームワークであるWorkforceを紹介します。
推論中、Workforceはワーカーエージェントの追加や修正によって新しいドメインにシームレスに適応する。
トレーニングには、ドメイン間の一般化を改善する最適化されたワークフォース学習(OWL)を導入する。
論文 参考訳(メタデータ) (2025-05-29T17:51:58Z) - Topological Structure Learning Should Be A Research Priority for LLM-Based Multi-Agent Systems [69.95482609893236]
大規模言語モデルに基づくマルチエージェントシステム(MAS)は、協調的な知性によって複雑なタスクに取り組むための強力なパラダイムとして登場した。
我々は,エージェント間相互作用の構造を明示的にモデル化し,動的に最適化する,エフェトロジーを意識したMASへのパラダイムシフトを求める。
論文 参考訳(メタデータ) (2025-05-28T15:20:09Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z) - D-CIPHER: Dynamic Collaborative Intelligent Multi-Agent System with Planner and Heterogeneous Executors for Offensive Security [22.86304661035188]
D-CIPHERは、協調サイバーセキュリティCTF問題解決のためのマルチエージェントフレームワークである。
エージェントと異なる役割を持つエージェントを動的フィードバックループに統合し、複雑なタスクの推論を強化する。
NYU CTF Benchでは22.0%、Cybenchでは22.5%、HackTheBoxでは44.0%である。
論文 参考訳(メタデータ) (2025-02-15T23:43:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。