論文の概要: How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation
- arxiv url: http://arxiv.org/abs/2608.26237v1
- Date: Wed, 26 Aug 2026 17:50:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.134062
- Title: How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation
- Title(参考訳): LLMエージェントはどのようにしてフラグを得るのか? エージェントの攻撃的セキュリティ評価のためのトレースレベルプロバンス
- Authors: Kimberly Milner, Minghao Shao, Nanda Rani, Haoran Xi, Venkata Sai Charan Putrevu, Meet Udeshi, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri,
- Abstract要約: トレースベースのエージェント監査フレームワークであるCTF-ABACUSを紹介する。
それぞれの実行をエビデンスベースの解決プロファイルとして再構築する。
エクスプロイトの発生場所、フラグが最初に現れる場所、そして、復元されたフラグが実証された振る舞いによってサポートされているかどうかを識別する。
- 参考スコア(独自算出の注目度): 19.20339330379649
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Capture-the-Flag (CTF) benchmarks are widely used to assess the offensive security capabilities of autonomous language-model agents. Evaluations rely on shallow binary judgments or aggregate scores, overlooking the agent's trajectory to the flag. Consequently actual exploitation is conflated with direct flag exposure, memorized recall, external lookup, guessing, and unsupported claims, potentially overstating the agent's cybersecurity capability. We introduce CTF-ABACUS, a trace-based agent auditing framework that reconstructs each run as an evidence-grounded solve profile. By decomposing agent actions into penetration-testing phases and categorical techniques, it identifies where exploitation occurs, where the flag first appears, and whether the recovered flag is supported by demonstrated behavior. Aggregating solve profiles across agents yields challenge signatures that reveal whether success was achieved via the intended exploit or via shortcut pathways. We apply CTF-ABACUS to 1,435 CTF attempts by six frontier and open-source models on 240 challenges, yielding 2,870 solve profiles under two judge lenses. Trace-verified exploits account for only 62-87% of recovered flags across benchmarks, while shortcut recoveries follow substantially shallower trajectories. These findings shift CTF evaluation from counting recovered flags to verifying demonstrated exploitation and provide a basis for designing benchmarks that better isolate the offensive capabilities.
- Abstract(参考訳): Capture-the-Flag(CTF)ベンチマークは、自律言語モデルエージェントの攻撃的セキュリティ能力を評価するために広く使用されている。
評価は、エージェントの旗への軌跡を見渡すために、浅い二分判定や集合スコアに依存している。
その結果、実際の攻撃は、直接の旗の露出、記憶されたリコール、外部のルックアップ、推測、およびサポートされていないクレームと混同され、エージェントのサイバーセキュリティ能力を過大評価する可能性がある。
CTF-ABACUSはトレースベースのエージェント監査フレームワークで,各ランをエビデンス基底の問題解決プロファイルとして再構築する。
エージェントアクションを浸透テストフェーズとカテゴリのテクニックに分解することで、最初にフラグが現れる場所、そして、復元されたフラグが実証された振る舞いによってサポートされているかどうかを識別する。
エージェント間で解決プロファイルを集約すると、意図したエクスプロイトやショートカットパスを通じて成功したかどうかを示すチャレンジシグネチャが生成される。
CTF-ABACUSを6つのフロンティアおよびオープンソースモデルによる240の課題に対する1,435のCTF試行に適用し、2つの判定レンズで2,870個の解プロファイルを得る。
トレース検証されたエクスプロイトは、ベンチマーク全体で回収されたフラグの62-87%に過ぎず、ショートカットのリカバリは、かなり浅い軌道に沿っている。
これらの結果は、CTFの評価を回収されたフラグのカウントから、実証されたエクスプロイトの検証にシフトさせ、攻撃能力をより分離したベンチマークを設計するための基盤を提供する。
関連論文リスト
- From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - MAP-Graph: Provenance-Aware Shared Memory for Multi-Agent Workflows [21.565934900490166]
MAP-Graphは,エージェント,ソース,メモリ,クレーム,アクションを型付き実行グラフで表現するメモリ層である。
祖先を辿り、許可なしのレコードを除外し、意味的類似性と乗法的経路信頼によって資格ある記憶を再引用し、影響された系統を監査するために保持しながら、行動実行前に危険に敏感なゲートを適用します。
論文 参考訳(メタデータ) (2026-08-11T05:31:18Z) - AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration [6.39392731596656]
脆弱性修正コミットが与えられた場合、トリガーローカライゼーションは、脆弱性のあるプログラム状態を具体的な安全でない操作に変換する特定のステートメントを問う。
脆弱性トリガをローカライズするエージェントパイプラインであるAutoTraceについて,コードプロパティグラフ層を層単位で探索することによって紹介する。
エージェントは自身の権限でトリガーを決して受け入れない。報告されたトリガーはすべて、グラフから引き出された明確な証拠によって裏付けられている。
論文 参考訳(メタデータ) (2026-07-13T18:21:42Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - CTFusion: A CTF-based Benchmark for LLM Agent Evaluation [15.091299960425857]
我々は,Live CTF上に構築されたストリーミング評価フレームワークであるCTFusionを提案する。
既存の CTF ベンチマークは LLM ベースのエージェントの評価では信頼性が低いことを実証する。
我々は,CTFusionをオープンソースとしてリリースし,今後の研究を促進する。
論文 参考訳(メタデータ) (2026-05-12T04:23:42Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - TraceLLM: Security Diagnosis Through Traces and Smart Contracts in Ethereum [23.800363904247146]
TraceLLMは、ジョイントトレースとコントラクトコード駆動セキュリティ分析のための最初のベンチマークを確立する。
TraceLLMは85.19%の精度で攻撃者および被害者のアドレスを特定し、70.37%の精度で自動レポートを生成する。
現実世界のインシデント全体で、TraceLLMは66.22%の精度でレポートを自動的に生成し、強力な一般化性を示す。
論文 参考訳(メタデータ) (2025-09-03T05:53:56Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。