論文の概要: Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection
- arxiv url: http://arxiv.org/abs/2607.26656v1
- Date: Wed, 29 Jul 2026 09:16:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.609307
- Title: Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection
- Title(参考訳): Graph is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection
- Abstract要約: VulAgentRLは、コードプロパティグラフ(CPG)上に構築された、相互の脆弱性検出のためのフレームワークである。
VulAgentRLは、フロンティアモデルを含む最先端のベースラインを厳密なペアワイズ補正基準で上回り、より少ないツールコールを発行する。
- 参考スコア(独自算出の注目度): 13.409515289348532
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world vulnerabilities often span multiple functions, yet most learning-based detectors classify each function in isolation: on a sample of real CVEs, we find that 71.7% of vulnerable functions require evidence from outside the function to be classified correctly. Agentic reinforcement learning (RL) could close this gap by enabling a model to gather that evidence itself, but it lacks a reliable reward, since a reward defined on the final verdict alone can be obtained without performing any investigation. We propose VulAgentRL, an agentic RL framework for interprocedural vulnerability detection built on a Code Property Graph (CPG). The CPG serves two roles: at inference time the policy queries it for callers, callees, dataflow, and other queries, and at training time the same graph verifies the evidence the policy cites. Because every CPG node carries a persistent integer identifier, this verification is an exact comparison rather than a textual match, so the reward credits verdicts that are supported by evidence. We further initialize the policy by distilling teacher investigations, and show that this warm start is necessary, since RL cannot acquire tool-use behavior it never samples. Under a repository-level split that prevents leakage, VulAgentRL outperforms state-of-the-art baselines, including frontier models, on the strict pair-wise-correct metric while issuing fewer tool calls, and its advantage persists on an out-of-distribution corpus and under class imbalance.
- Abstract(参考訳): 現実世界の脆弱性は、しばしば複数の機能にまたがるが、ほとんどの学習ベースの検出器は、それぞれの機能を個別に分類する: 実際のCVEのサンプルでは、71.7%の脆弱な関数は、関数の外部からの証拠を正しく分類する必要がある。
エージェント強化学習(RL)は、モデルが証拠そのものを収集できるようにすることで、このギャップを埋めることができるが、最終判断のみに定義された報酬は、いかなる調査も行わずに得られるので、信頼性に欠ける。
本稿では,コードプロパティグラフ(CPG)上に構築された言語間脆弱性検出のためのエージェントRLフレームワークであるVulAgentRLを提案する。
CPGは2つの役割を果たす: 推論時にポリシーが呼び出し元、呼び出し元、データフロー、その他のクエリをクエリし、トレーニング時に同じグラフがポリシーが引用する証拠を検証する。
全てのCPGノードは永続的な整数識別子を持つため、この検証はテキストマッチングよりも正確に比較されるので、報酬クレジットは証拠によって裏付けられる。
さらに,教師の調査を蒸留して政策を初期化し,RLが道具使用行動を取得することができないため,サンプリングは行わないため,この温かい開始が必要であることを示す。
リークを防止するリポジトリレベルの分割の下で、VulAgentRLは、フロンティアモデルを含む最先端のベースラインを、厳密なペアワイドなメトリックでパフォーマンスし、ツールコールを少なくし、その利点は、アウト・オブ・ディストリビューションのコーパスとクラス不均衡で持続する。
関連論文リスト
- From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents [75.69180947909148]
大規模言語モデル(LLM)エージェントのためのトラジェクトリレベルのUQフレームワークを提案する。
RuPAは、推論状態、ツールインタラクション、環境フィードバックが時間的およびセマンティックな依存関係エッジで接続されたノードである、指向的なトラジェクトリグラフとして実行履歴を表現している。
我々は,複数のモデルファミリにまたがる6つのオープンソースLCMを用いて,代用エージェントベンチマーク($2, Terminal-Bench-2, GAIA)でRUPAを評価した。
論文 参考訳(メタデータ) (2026-08-17T01:40:14Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection [16.007199928732614]
DREAはリポジトリレベルの脆弱性検出のための仮説駆動型フレームワークである。
ゴール指向コンテキスト取得は、この設計における検出改善の主な原因である。
RepoPairBenchは,実世界のプロジェクトから検証済みのPython脆弱性修正ペアの,リポジトリを基盤としたベンチマークである。
論文 参考訳(メタデータ) (2026-07-15T04:49:05Z) - When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion [0.0]
検証可能な報酬(RLVR)を用いた強化学習は、繰り返しサンプリング時にモデルを悪化させながら、一サンプル精度を向上させることができる。
トレーニング後、このポリシーはベースモデルよりも小さな問題を、大きな$k$で解決する可能性がある。
失敗は境界プロンプトに集中しており、ベースモデルにはサンプリングによって回復できる稀な正しい軌道が含まれており、有限のRLVRロールアウトグループに確実に現れるには小さすぎる。
論文 参考訳(メタデータ) (2026-07-12T17:17:18Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering [64.23115520219609]
結果に基づくRLに高密度トークンレベルガイダンスを付加する訓練時間金反応政策蒸留フレームワークを提案する。
GAPDはWebQSP、GrailQA、GraphQの最先端技術に一貫して勝っている。
論文 参考訳(メタデータ) (2026-05-28T08:28:10Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation [71.49152943451328]
我々は,AJ-Benchベンチマークを導入し,ドメイン検索,データシステム,グラフィカルユーザインタフェースの3つの領域にまたがるエージェント・アズ・ア・Judgeを評価する。
実験ではLLM-as-a-Judgeベースラインよりも一貫したパフォーマンス向上を示し、エージェントベースの検証においてかなりオープンな課題を明らかにした。
論文 参考訳(メタデータ) (2026-04-20T13:23:38Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - AutoResearch-RL: Perpetual Self-Evaluating Reinforcement Learning Agents for Autonomous Neural Architecture Discovery [5.110708177092157]
本稿では、強化学習エージェントが人間の監督なしにオープンエンドニューラルネットワーク研究を行うためのフレームワークであるAutoResearch-RLを提案する。
我々はこれをマルコフ決定過程として定式化し、軽微な仮定の下で収束保証を導出し、1つのGPUナノチャット事前学習ベンチマークで経験的に実証する。
論文 参考訳(メタデータ) (2026-03-07T17:49:44Z) - Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - PoU: Proof-of-Use to Counter Tool-Call Hacking in DeepResearch Agents [24.502121097996294]
Retrieval-augmented Generation (RAG) エージェントは、外部ツールを通じて、自律的な情報検索機能を備えた大規模言語モデルを拡張する。
以前見過ごされた障害モードであるTool-Call Hacking(ツールコールハッキング)を識別します。
提案するProof-of-Use(PoU)フレームワークは,検索された証拠,推論トレース,最終回答間の因果関係の検証を行う。
論文 参考訳(メタデータ) (2025-10-13T02:45:37Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。