論文の概要: Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection
- arxiv url: http://arxiv.org/abs/2607.14628v1
- Date: Thu, 16 Jul 2026 06:45:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.014668
- Title: Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection
- Title(参考訳): ルーティングシーリングはドメインに依存しない:コードセキュリティ脆弱性検出における構造的事前注入
- Abstract要約: 大規模言語モデル(LLM)は、潜在能力と一貫したアクティベーションの間に、十分に文書化されたギャップを示す。
以前の報告では、構造的事前は分配性能を劇的に向上させるが、ゼロショットベースラインのアウト・オブ・ディストリビューション以下に崩壊する。
我々は、ソースコードの脆弱性検出においてSAIR設計を再現することにより、この現象がクロスドメインであるかどうかを検証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) exhibit a well-documented gap between latent capability and consistent activation: the router hypothesis posits that models possess the knowledge to solve a task but lack reliable internal routing to activate it. Prior work in formal mathematical reasoning (SAIR, Cázares 2026) reports that structural priors (cheatsheets) raise in-distribution performance dramatically, yet collapse below the zero-shot baseline out-of-distribution (OOD) -- and that iterative recalibration amplifies rather than corrects the collapse. We test whether this phenomenon is cross-domain by reproducing the SAIR design in source-code security vulnerability detection, evaluating three LLMs (GPT-OSS-120B, Llama-3.3-70B, Gemma-4-31B) across three vulnerability categories (CWE-798, CWE-284, and the non-CWE N+1 anti-pattern) spanning syntactic, contextual, and semantic complexity, then transferring cheatsheet-augmented prompts to real-world CVE data from VUDENC (CWE-89, CWE-22). Our findings replicate and extend SAIR: (F1) structural priors lift semantic-vulnerability recall from 20.0% to 100.0% across all models; (F2) zero-shot performance degrades along a semantic complexity gradient; (F3) the same cheatsheets that saturate synthetic performance amplify distribution-shift collapse on real CVE data (CWE-89: 100% synthetic F1 to 48.9% on VUDENC, -51.1pp); (F5) iterative recalibration produces a v2 cheatsheet that performs worse than v1 on real data, mirroring SAIR's AN45c-vs-AN38 finding. These results provide evidence that the cross-distribution trade-off surface documented in SAIR generalises to code security, and that the router hypothesis is cross-domain. We argue the structural nature of the collapse motivates distribution-aware training over prompt calibration. Code and evaluation scripts: https://github.com/bytepro-ai/bitcoder-v2-research
- Abstract(参考訳): 大規模言語モデル(LLM)は、潜在能力と一貫したアクティベーションの間によく文書化されたギャップを示す: ルータ仮説は、モデルがタスクを解くための知識を持っているが、それをアクティベートするための信頼できる内部ルーティングがないことを仮定する。
フォーマルな数学的推論 (SAIR, Cázares 2026) における先行研究は、構造的先行(チートシート)が分配性能を劇的に向上させるが、ゼロショットベースラインアウト・オブ・ディストリビューション (OOD) 以下に崩壊すると報告している。
我々は、この現象がソースコードのセキュリティ脆弱性検出においてSAIR設計を再現し、3つの脆弱性カテゴリ(CWE-798、CWE-284、および非CWE N+1アンチパターン)にまたがる3つのLSM(GPT-OSS-120B、Llama-3.3-70B、Gemma-4-31B)を評価することにより、構文的、文脈的、セマンティックな複雑さにまたがってSAIR設計のクロスドメイン性を検証する。
F1) 構造的プリミティブは,すべてのモデルにおいてセマンティック・ハザーナビリティのリコールを20.0%から100.0%に引き上げる; (F2) ゼロショットのパフォーマンスは,セマンティック・複雑性の勾配に沿って劣化する; (F3) 合成性能を飽和させるのと同じチートシートは,実CVEデータ(CWE-89:100%合成F1から48.9%,VUDENC,-51.1pp); (F5) 反復的リカバリは,実データ上でv1よりも悪いv2チートシートを生成し,SAIRのAN45c-vs-AN38の発見を反映している。
これらの結果は、SAIRに記録されているクロスディストリビューショントレードオフ面がコードセキュリティを一般化し、ルータ仮説がクロスドメインであることを証明している。
崩壊の構造的性質は、迅速な校正よりも分布認識訓練を動機付けていると論じる。
コードと評価スクリプト:https://github.com/bytepro-ai/bitcoder-v2-research
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair [2.4063592468412276]
イテレーティブなIaC修復はセキュリティのレグレッションを導入するが、保守的で防御可能なレートはおよそ3.3%のシナリオである。
本研究は,セキュリティに配慮したフィードバックループ設計と,実行可能な反復予算指導の動機付けである。
論文 参考訳(メタデータ) (2026-08-13T16:01:32Z) - From CVE to CWE: Syscall-Based HIDS Generalisation [41.99844472131922]
運用環境では、ディフェンダーは既知の脆弱性の新たなエクスプロイトを認識する必要がある。
我々は,CWE(Common Weaknession)クラスを共有するCVEの正常な動作に基づいて訓練された一級異常検知器が,同一クラス内の別の未知のCVEに一般化するか否かを実証的に検証した。
論文 参考訳(メタデータ) (2026-06-21T16:34:39Z) - Do Transformers Actually Help Intrusion Detection? A Temporal Sequence Evaluation on CIC-IDS2017 [1.2934180951771597]
我々はCIC-IDS 2017を、ネットワーク会話から順序付きフローシーケンスを構築することで、時間的侵入検出タスクとして再構成する。
中心的な発見は、アーキテクチャではなくパディング規約がトランスフォーマーのパフォーマンスを決定することである。
我々は、将来のIDS研究において、漏洩のない分割、明示的なパディング開示、シーケンシャル・アウェア・ベンチマークを標準的実践として推奨する。
論文 参考訳(メタデータ) (2026-06-09T16:57:10Z) - Mythos and the Unverified Cage: Z3-Based Pre-Deployment Verification for Frontier-Model Sandbox Infrastructure [0.0]
一部の二次アカウントはサンドボックスネットワークコードにCWE-190算術的脆弱性を仮定している。
本稿では,C/C++ インフラストラクチャにおける CWE-190/191/195 の算術的脆弱性パターンを,Z3 SMT ベースの形式検証エンジンである COBALT について述べる。
提案する: COBALT, VERDICT, DIRECTIVE-4, SENTINEL, 事前デプロイ検証, 事前実行制約, 出力制御, 実行時の監視をMythosインシデントによって公開された障害モードにマッピングする4層封じ込めフレームワーク。
論文 参考訳(メタデータ) (2026-04-22T12:28:23Z) - Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis [14.657771106188115]
脆弱性検出のためのトレーニング不要なマルチエージェントフレームワークであるPhoenixを提案する。
Phoenixは、検出をセマンティックスライダ、要求リバースエンジニア、契約審査員の3つのステージに分解する。
PrimeVul Pairedでは、Phoenix は F1 = 0.825 と Pair-Correct = 64.4% を獲得し、RASM-Vul (F1 = 0.668) と VulTrial (F1 = 0.563) を上回る。
論文 参考訳(メタデータ) (2026-04-21T03:02:34Z) - Synthetic Tabular Generators Fail to Preserve Behavioral Fraud Patterns: A Benchmark on Temporal, Velocity, and Multi-Account Signals [0.0]
本研究では,4つの行動不正パターン(P1-P4)の分類法を定式化し,事象間タイミング,バースト構造,マルチアカウントグラフモチーフ,速度ルールトリガ率について検討した。
我々は、IEEE-CIS Fraud DetectionとAmazon FraudデータセットでCTGAN、TVAE、GaussianCopula、TabularARGNをベンチマークした。
P1-P4フレームワークは、医療やネットワークセキュリティを含む、エンティティレベルのシーケンシャルデータを持つ任意のドメインに拡張する。
論文 参考訳(メタデータ) (2026-04-13T19:36:00Z) - AnomalyGen: Enhancing Log-Based Anomaly Detection with Code-Guided Data Augmentation [42.87177529900358]
AnomalyGenは、ラベル付きログシーケンスをソースコードから合成することによってトレーニングデータを増強する新しいフレームワークである。
12のさまざまな異常検出モデルに対するHDFSとZookeeperの評価は、AnomalyGenが一貫してパフォーマンスを改善していることを示している。
論文 参考訳(メタデータ) (2026-04-13T07:24:43Z) - Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis [0.0]
ソフトウェア脆弱性分析のための言語横断的な脆弱性ライフサイクルフレームワークを構築します。
89.84-92.02%の言語内検出精度,74.43-80.12%のゼロショット言語F1。
これらの結果は,LLM駆動型エージェントAIのための原理的かつ実用的に展開可能なメカニズムであることを示す。
論文 参考訳(メタデータ) (2026-04-12T20:22:23Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - ChainFuzzer: Greybox Fuzzing for Workflow-Level Multi-Tool Vulnerabilities in LLM Agents [42.37163874052913]
ChainFuzzerは、監査可能なエビデンスでマルチツール脆弱性を発見し再現するためのフレームワークである。
20の人気のあるLLMエージェントアプリ(998ツール)上でChainFuzzerを評価する。
論文 参考訳(メタデータ) (2026-03-13T03:35:54Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。