論文の概要: Reveree: Diagnosing LLM Reverse-Engineering Agents
- arxiv url: http://arxiv.org/abs/2609.01185v1
- Date: Tue, 01 Sep 2026 12:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.668636
- Title: Reveree: Diagnosing LLM Reverse-Engineering Agents
- Title(参考訳): LLMリバースエンジニアリングエージェントの診断
- Authors: Hadjer Benkraouda, Hongyu Cai, Berkay Celik, Gang Wang,
- Abstract要約: LLM REエージェントの軌道を3段階にスコアする診断フレームワークであるRevereeを提案する。
88 picoCTFとNYU-CTFの課題に対して,9つのモデルと4つのプロンプト戦略を評価した。
- 参考スコア(独自算出の注目度): 5.6012345438669895
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reverse engineering (RE) is critical to security tasks such as malware analysis and vulnerability discovery, and large language model (LLM) agents are increasingly able to perform it autonomously. Capture-the-flag (CTF) RE challenges have become the standard proxy for measuring this capability, but evaluation rests on a single criterion: whether the agent captures the flag. This solve rate reveals neither where in the RE process an agent fails nor whether a success reflects analysis of the binary or recall of a public solution. In this paper, we propose Reveree, a diagnostic framework that scores an LLM RE agent's trajectory at three tiers: solve rate, milestone progress through an eight-stage RE schema, and a behavioral profile of its actions. Comprehension stages are scored by an outcome-blinded LLM judge validated against a human expert; all other stages are verified deterministically. Using Reveree, we evaluate nine frontier models and four prompting strategies on 88 picoCTF and NYU-CTF challenges. We find that the base model dominates performance, whereas prompting strategy is a secondary, model-dependent effect. Surprisingly, larger, newer, or costlier models are not reliably stronger. We also find that failures concentrate at the comprehension stages of the RE process, and that extra budget, persistence, or reasoning effort rescues few of them, pointing to a competence limit rather than a resource limit. Regarding memorization, while models reproduce picoCTF flags from challenge descriptions alone, NYU-CTF shows minimal measurable recall, and most solves survive surface perturbation, indicating that genuine analysis coexists with memorization. We release Reveree to the community.
- Abstract(参考訳): リバースエンジニアリング(RE)は、マルウェア分析や脆弱性発見などのセキュリティタスクに不可欠であり、大規模言語モデル(LLM)エージェントは、それを自律的に実行できるようになる。
Capture-the-flag (CTF) REの課題は、この機能を測定するための標準的なプロキシになっているが、評価は単一の基準(エージェントがフラグをキャプチャするかどうか)に依存している。
この解決率は、REプロセスにおいてエージェントが失敗する場所や、成功がバイナリの分析や公開ソリューションのリコールを反映するかどうかを明らかにしません。
本稿では,LLM REエージェントの軌道を3段階に分けた診断フレームワークであるRevereeを提案する。
理解段階は、人間の専門家に対して検証された結果盲検のLLM裁判官によって評価され、他のすべての段階は決定論的に検証される。
Revereeを用いて、88ピコCTFとNYU-CTFの課題に対して、9つのフロンティアモデルと4つのプロンプト戦略を評価した。
ベースモデルがパフォーマンスを支配しているのに対して、プロンプト戦略は二次的、モデルに依存した効果である。
驚いたことに、より大きく、より新しく、より高価なモデルは、確実に強力ではない。
また、障害はREプロセスの理解段階に集中しており、余分な予算、永続性、または推論努力が、リソース制限ではなく能力制限を指し示して、それらのうちのほとんどを救っていることもわかりました。
記憶に関しては、モデルがチャレンジ記述のみからピコCTFフラグを再現するのに対して、NYU-CTFは最小の計測可能なリコールを示し、ほとんどの場合、表面摂動を解消し、真の解析が記憶と共存することを示す。
私たちはRevereeをコミュニティにリリースします。
関連論文リスト
- How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation [19.20339330379649]
トレースベースのエージェント監査フレームワークであるCTF-ABACUSを紹介する。
それぞれの実行をエビデンスベースの解決プロファイルとして再構築する。
エクスプロイトの発生場所、フラグが最初に現れる場所、そして、復元されたフラグが実証された振る舞いによってサポートされているかどうかを識別する。
論文 参考訳(メタデータ) (2026-08-26T17:50:34Z) - Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems [15.825635807363499]
我々は、MAS実行軌跡を記録し、介入アンカーを確立する制御された評価フレームワークであるSymTraceを紹介する。
リプレイ中は、記録されたログを使用してアンカーの前の実行を効果的に再構築し、下流の軌道のみを再生する。
その結果,既存の無誘導再走行法は信頼性が低く,故障の再現率や修復率も低いことが明らかとなった。
論文 参考訳(メタデータ) (2026-08-26T15:33:47Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents [0.12891210250935145]
LLMエージェントに手続き的スキルを加えることは、通常、タスク成功の平均的な改善によって評価される。
この指標は重要なコストを隠蔽します。
約6,000回のランでエージェントとスキルと非スキルを比較して、双方を計測する。
論文 参考訳(メタデータ) (2026-07-24T17:50:03Z) - Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals [75.25256166997414]
本稿ではメタ認知に触発されたRLフレームワークであるメタ認知・アズ・リワード(MaR)を紹介する。
MaRは2つの一般的なプロセス次元を推論する。
MaRはモデル性能を継続的に改善し、ベースモデルよりも最大7.7%向上した。
論文 参考訳(メタデータ) (2026-05-22T08:54:37Z) - A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models [59.6715047267181]
小さな推論モデル(SRM)は、特に中間的推論ステップにおいて幻覚を起こす傾向がある。
オンライン強化学習に基づく既存の緩和手法は、結果に基づく報酬や粗粒度の連鎖評価に依存している。
本稿では、プロセス報酬モデルから、明示的な忠実度報酬を通じてステップレベルの監視を導入する、Fithfulness-Aware Step-Level Reinforcement Learning (FaithRL)を提案する。
論文 参考訳(メタデータ) (2026-02-05T17:15:12Z) - RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents [43.806220882212386]
RLVMRは、検証可能なメタ推論の振る舞いに報いることによって、密集したプロセスレベルの監視をエンドツーエンドのRLに統合する。
挑戦的なALFWorldとScienceWorldのベンチマークでは、RLVMRが新たな最先端の結果を達成している。
論文 参考訳(メタデータ) (2025-07-30T17:00:48Z) - One Token to Fool LLM-as-a-Judge [52.45386385722788]
大規模言語モデル(LLM)は、自動化された審査員としてますます信頼され、評価を支援し、他のモデルを訓練するための報酬信号を提供する。
生成的報酬モデルは、ハッキングに対して体系的に影響を受けやすい。
論文 参考訳(メタデータ) (2025-07-11T17:55:22Z) - Are Large Language Models Really Robust to Word-Level Perturbations? [68.60618778027694]
本稿では,事前学習した報酬モデルを診断ツールとして活用する,新たな合理的評価手法を提案する。
より長い会話は、質問を理解する能力の観点から言語モデルの包括的把握を示す。
この結果から,LLMは日常言語でよく使われる単語レベルの摂動に対する脆弱性をしばしば示している。
論文 参考訳(メタデータ) (2023-09-20T09:23:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。