論文の概要: Cochise: A Reference Harness for Autonomous Penetration Testing
- arxiv url: http://arxiv.org/abs/2605.11671v1
- Date: Tue, 12 May 2026 07:28:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.665252
- Title: Cochise: A Reference Harness for Autonomous Penetration Testing
- Title(参考訳): Cochise: 自律的侵入テストの基準的ハーネス
- Abstract要約: 自動貫入試験のための597 LOC Pythonリファレンスハーネスであるcochiseを提案する。
Cochiseは、LSM駆動エージェントをSSH上のLinuxホストに接続し、制御されたターゲット環境をサポートする。
リプレイと分析ツール: (i)コチス・リプレイ, (ii)コチス・アナライゼログ, コチス・アナライゼ-グラフ, コスト, トークン持続時間, 妥協解析。
- 参考スコア(独自算出の注目度): 1.3124479769761592
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work on LLM-driven autonomous penetration testing reports promising results, but existing systems often combine many architectural, prompting, and tool-integration choices, making it difficult to tell what is gained over a simple agent scaffold. We present cochise, a 597 LOC Python reference harness for autonomous penetration-testing experiments. Cochise connects an LLM-driven agent to a Linux execution host over SSH and supports controlled target environments reachable from that jump host. The prototype implements a separated Planner--Executor architecture in which long-term state is maintained outside the LLM context, while a ReAct-style executor issues commands over SSH and self-corrects based on command outputs. The scenario prompt can be adapted to different target environments. To demonstrate the efficacy of our minimal harness, we evaluate it against a live third-party testbed called Game of Active Directory (GOAD). Alongside the harness, we release replay and analysis tools: (i) cochise-replay for offline visualization of captured runs, (ii) cochise-analyze-alogs and cochise-analyze-graphs for cost, token, duration, and compromise analysis, and (iii) a corpus of JSON trajectory logs from GOAD runs, allowing researchers to study agent behavior without provisioning the 48--64 GB RAM / 190 GB storage testbed themselves. Cochise is intended not as a state-of-the-art pen-testing agent, but as reusable experimental infrastructure for comparing models, agent architectures, and penetration-testing traces.
- Abstract(参考訳): LLM駆動の自律浸透試験に関する最近の研究は、有望な成果を報告しているが、既存のシステムは、多くのアーキテクチャ、プロンプト、ツール統合の選択を組み合わせており、単純なエージェントの足場で何が得られたのかを判断することは困難である。
自動貫入試験のための597 LOC Pythonリファレンスハーネスであるcochiseについて述べる。
Cochiseは、LSM駆動のエージェントをSSH上のLinux実行ホストに接続し、そのジャンプホストから到達可能なコントロール対象環境をサポートする。
プロトタイプは、長期状態がLLMコンテキストの外で維持される分離されたPlanner-Executorアーキテクチャを実装し、ReActスタイルのエグゼキュータはコマンド出力に基づいてSSHと自己修正のコマンドを発行する。
シナリオプロンプトは、異なるターゲット環境に適応することができる。
最小限のハーネスの有効性を示すため,GOAD(Game of Active Directory)と呼ばれる実稼働のサードパーティテストベッドに対して評価を行った。
ハーネスとともに、リプレイと分析ツールをリリースします。
一 捕獲した走行のオフライン可視化のためのコチス再生
二 コスト、トークン、期間及び妥協分析のためのコチス分析ログ及びコチス分析グラフ
3) GOADから取得したJSONトラジェクトリログのコーパスにより,48--64 GB RAM / 190 GB ストレージテストベッドをプロビジョニングすることなく,エージェントの動作を研究することができる。
Cochiseは最先端のペンテストエージェントではなく、モデル、エージェントアーキテクチャ、浸透テストトレースを比較するための再利用可能な実験インフラとして意図されている。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - Automating the Design of Embodied Agent Architectures [17.294577626616917]
エージェントは一般的に、知覚、記憶、計画、行動モジュールのハンドデザインされた構成として構築される。
本研究では,エミュレータを編集可能なノード・アンド・ワイヤプログラムとしてホストし,シミュレータを意識した実行とエピソードレベルのログを生成する型グラフランタイムを提案する。
視覚言語ナビゲーション,具体的質問応答,言語条件の操作にまたがる4つの実施者を対象に,AASの3つの変種を評価した。
論文 参考訳(メタデータ) (2026-06-29T10:45:37Z) - Do you dare to try Test-Driven Forensics? Increasing Trust in Desktop Forensics with ADARE [0.0]
本稿では,法医学的期待を実行可能な仕様として扱う実践的アプローチとして,テスト駆動型法医学を紹介する。
本手法は,仮想マシン上で制御された実験を実行するオープンソースフレームワークであるADAREで実装されている。
オートプシーの25バージョンレグレッション調査では、輸出されたレポートの出力に大きく、ほとんど文書化されていない変化が見られる。
論文 参考訳(メタデータ) (2026-05-27T13:38:06Z) - Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction [0.02446672595462589]
我々は,LHC(Large Hadron Collider)から,公開論文とオープンサイエンスソフトウェアのみを用いて,言語モデルエージェントが実験分析を再現できるかどうかを評価するベンチマークであるCollind-Benchを紹介する。
したがってエージェントは、これらのギャップを埋めるために、物理的推論、ドメイン知識、試行錯誤に頼らなければならない。
以上の結果から, 平均的なエージェントが, ループ内解法を確実に打ち負かすことは不可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-13T18:00:00Z) - Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction [127.64173950476702]
エージェントが直接、汎用端末ツールを用いて、生コーパスを直接検索する直接コーパス間相互作用(DCI)について検討する。
このアプローチではオフラインインデックスを必要とせず、ローカルコーパスの進化に自然に適応する。
IRベンチマークとエンドツーエンドのエージェント検索タスク全体にわたって、この単純なセットアップは、強いスパース、密度、リランクベースラインよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-05-03T19:13:11Z) - Towards Multi-Agent Autonomous Reasoning in Hydrodynamics [0.06999740786886537]
本稿では,多エージェントをレイヤ実行グラフ(LEG)を介して協調させる,流体力学のためのマルチエージェントシステム(MAS)のプロトタイプを提案する。
プランナーエージェントは、ドメイン知識を厳密な制御ロジックとしてハードコーディングすることなく、自然言語ルーティングからクエリ固有の実行トポロジを構築する。
レポーターエージェントが最終応答を合成し、ランタイムが監査性をサポートするためのツール呼び出し毎に証明をログする。
論文 参考訳(メタデータ) (2026-05-01T21:17:55Z) - Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception [0.20305676256390928]
本稿では、長期LLMエージェントの永続ランタイムであるSpringdriftを紹介する。
我々は,このカテゴリに人工リテーナという用語を導入する。
これは、システム設計とデプロイメントのケーススタディに関する技術的なレポートであり、ベンチマークによる評価ではない。
論文 参考訳(メタデータ) (2026-04-06T13:14:37Z) - KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents [5.931389072124715]
ReActを使用した大規模言語モデルに基づくツールコール自律エージェントには3つの制限がある。
最近の作業は、計画と実行を分離する方向に進んでいるが、各ケースモデルでは、実行メカニズムと結合され続けている。
LLMエージェントのシステムレベルの抽象化を導入し,実行エージェントを推論層から分離する。
論文 参考訳(メタデータ) (2026-03-31T21:38:28Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering [0.0]
本稿では,ESAA(Event Sourcing for Autonomous Agents)アーキテクチャについて述べる。
アーキテクチャは、イベントソーシングパターンにインスパイアされた、認知意図とプロジェクトの状態突然変異を分離する。
2つのケーススタディは、アーキテクチャを検証し、単一エージェントのシナリオを超えたアーキテクチャのスケーラビリティの実証的な証拠を提供する。
論文 参考訳(メタデータ) (2026-02-26T16:45:59Z) - Automated structural testing of LLM-based agents: methods, framework, and case studies [0.05254956925594667]
LLMベースのエージェントは、様々な領域で急速に採用されている。
現在のテストアプローチは、ユーザの視点からの受け入れレベルの評価に重点を置いている。
LLMをベースとしたエージェントの構造試験を可能にする手法を提案する。
論文 参考訳(メタデータ) (2026-01-25T11:52:30Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - From Reproduction to Replication: Evaluating Research Agents with Progressive Code Masking [48.90371827091671]
AutoExperimentは、AIエージェントの機械学習実験の実装と実行能力を評価するベンチマークである。
我々は最先端のエージェントを評価し、n$が増加するにつれて性能が急速に低下することを発見した。
本研究は、長期コード生成、文脈検索、自律的な実験実行における重要な課題を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-24T15:39:20Z) - Get my drift? Catching LLM Task Drift with Activation Deltas [55.75645403965326]
タスクドリフトは攻撃者がデータを流出させたり、LLMの出力に影響を与えたりすることを可能にする。
そこで, 簡易線形分類器は, 分布外テストセット上で, ほぼ完全なLOC AUCでドリフトを検出することができることを示す。
このアプローチは、プロンプトインジェクション、ジェイルブレイク、悪意のある指示など、目に見えないタスクドメインに対して驚くほどうまく一般化する。
論文 参考訳(メタデータ) (2024-06-02T16:53:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。