論文の概要: Antares: Foundation Models for Agentic Vulnerability Localization
- arxiv url: http://arxiv.org/abs/2608.02407v1
- Date: Mon, 03 Aug 2026 15:49:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.683765
- Title: Antares: Foundation Models for Agentic Vulnerability Localization
- Title(参考訳): Antares: エージェント脆弱性のローカライゼーションのための基盤モデル
- Authors: Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi,
- Abstract要約: 脆弱性ローカライゼーションのためのコンパクト言語モデルであるAntaresを紹介する。
IBM Graniteベースモデルに基づいて、Antaresは2段階のパイプラインを通じてトレーニングされる。
Antares-3B は GPT-5.5 に接近し、200倍以上の大型のオープンウェイトモデルを上回った。
- 参考スコア(独自算出の注目度): 54.83971397981572
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vulnerability localization is a fundamental step in software security, requiring models to reason over large codebases and iteratively identify vulnerable implementations. We present Antares, a family of compact language models (350M, 1B, and 3B parameters) for agentic vulnerability localization. Based on IBM Granite base models, Antares is trained through a two-stage pipeline that combines supervised fine-tuning on cybersecurity reasoning and repository exploration data with reinforcement learning from verifiable rewards over vulnerable repositories. Across extensive evaluations, Antares-3B approaches GPT-5.5 while outperforming open-weight models over 200x larger in size. The Antares family further enables fast, low-cost local inference, completing a full 500-task evaluation sweep in approximately 15 minutes on a single H100 GPU, corresponding to an amortized evaluation time of under 2 seconds and less than $0.002 per task.
- Abstract(参考訳): 脆弱性のローカライゼーションは、大規模なコードベースを推論し、脆弱性のある実装を反復的に識別するモデルを必要とする、ソフトウェアセキュリティの基本的なステップである。
エージェント脆弱性ローカライゼーションのためのコンパクト言語モデル(350M, 1B, 3Bパラメータ)であるAntaresを提案する。
IBM Graniteベースモデルに基づいて、Antaresは、サイバーセキュリティ推論とリポジトリ探索データの教師付き微調整と、脆弱なリポジトリに対する検証可能な報酬からの強化学習を組み合わせた、2段階のパイプラインを通じてトレーニングされている。
広範に評価されたAntares-3B は GPT-5.5 に近づき、オープンウェイトモデルでは200倍以上のサイズである。
さらにAntaresファミリーは、高速で低コストなローカル推論を可能にし、1つのH100 GPU上で500タスク評価を約15分で完了し、1タスクあたり0.002ドル未満の2秒未満の償却評価時間に対応する。
関連論文リスト
- ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks [0.0]
我々は、NYU CTF Benchの200の課題すべてについて、7つのプロバイダから10のフロンティアモデルを評価する。
制御された因子分析により、Kali Linux環境はUbuntuよりも9.5パーセント向上していることがわかった。
モデルの中では、Claude 4.5 Opusが最も高い解決率(59%)を達成し、続いてGemini 3 Pro(52%)、そしてGemini 3 Flashは1ソルバあたり0.05ドルで最高のコスト効率を提供する。
論文 参考訳(メタデータ) (2026-04-18T22:13:23Z) - SALLIE: Safeguarding Against Latent Language & Image Exploits [1.6440434996206623]
本稿では,機械的解釈可能性に根ざした軽量ランタイム検出フレームワークであるSALLIEを紹介する。
SALLIEはモデルの内部アクティベーションから直接堅牢な信号を抽出する。
推測すると、SALLIEは3段階アーキテクチャで防御する。
論文 参考訳(メタデータ) (2026-04-06T16:29:05Z) - AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents [75.67445299298949]
AgentCPM-Exploreは、知識密度と強力な探索能力を備えたコンパクトな4Bエージェントモデルである。
本稿では,パラメータ空間モデルの融合,報酬信号の復調,文脈情報の改良を特徴とする総合的なトレーニングフレームワークを提案する。
AgentCPM-Exploreは4つのベンチマークで8BクラスのSOTAモデルにマッチまたは超え、また5つのベンチマークでClaude-4.5-SonnetやDeepSeek-v3.2のような大規模モデルよりも優れている。
論文 参考訳(メタデータ) (2026-02-06T08:24:59Z) - CHASE: LLM Agents for Dissecting Malicious PyPI Packages [2.384873896423002]
大規模言語モデル(LLM)は、自動コード分析に有望な機能を提供する。
セキュリティクリティカルなマルウェア検出への応用は、幻覚やコンテキストの混乱など、基本的な課題に直面している。
本稿では,これらの制約に対処する信頼性の高いマルチエージェントアーキテクチャCHASEを提案する。
論文 参考訳(メタデータ) (2026-01-11T10:06:14Z) - DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models [219.58681099795186]
本稿では,より優れた推論とエージェント性能で高い計算効率を調和させるモデルであるDeepSeek-V3.2を紹介する。
計算複雑性を大幅に低減する効率的な注意機構であるDSAを導入する。
DeepSeek-V3.2は、堅牢な強化学習プロトコルを実装し、訓練後の計算をスケールすることにより、GPT-5と同等に動作する。
論文 参考訳(メタデータ) (2025-12-02T09:25:14Z) - ARGOS: Anomaly Recognition and Guarding through O-RAN Sensing [3.018691733760647]
ローグ基地局(RBS)の攻撃、特にダウングレード脆弱性を悪用した攻撃は、引き続き永続的な脅威である。
本研究は、近リアルタイムRIC内に展開された総合的なO-RAN準拠侵入検知システム(IDS)であるARGOSを紹介する。
ARGOSは、O-RANコンテキスト内で探索されていない領域であるRBSのダウングレード攻撃を、リアルタイムで検出する。
論文 参考訳(メタデータ) (2025-06-07T20:32:23Z) - Recognize Any Regions [55.76437190434433]
RegionSpotは、ローカライゼーション基盤モデルから位置認識ローカライゼーション知識と、ViLモデルからのセマンティック情報を統合する。
オープンワールドオブジェクト認識の実験では、私たちのRereaSpotは、以前の代替よりも大きなパフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2023-11-02T16:31:49Z) - Small footprint Text-Independent Speaker Verification for Embedded
Systems [7.123796359179192]
本稿では,話者検証のための2段階モデルアーキテクチャのオーダーを共通解より桁違いに小さくする。
Raspberry Pi 3BのようなIoTシステムに典型的な小型デバイスでソリューションを実行する可能性を示し、5秒の発話で200ms未満のレイテンシを持つ。
論文 参考訳(メタデータ) (2020-11-03T13:53:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。