論文の概要: From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python
- arxiv url: http://arxiv.org/abs/2607.21069v1
- Date: Thu, 23 Jul 2026 09:02:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.340373
- Title: From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python
- Title(参考訳): 評価から最適化へ:PythonにおけるCWE予測のための階層型学習信号
- Authors: Muntasir Adnan, Manile Srun, Carlos C. N. Kuhn,
- Abstract要約: 教師付き微調整、二重頭部分類損失、強化学習の3つのメカニズムを比較した。
トレーニング信号としての階層的なペナルティの価値は、その提供の直接性に大きく依存する、と結論付けている。
- 参考スコア(独自算出の注目度): 0.8921166277011344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The original ALPHA benchmark introduced a taxonomy-aware penalty for evaluating CWE-level vulnerability prediction in Python and proposed that the penalty could theoretically also serve as a training signal. This paper provides that validation. We compare three delivery mechanisms: supervised fine-tuning, a dual-head classification loss, and reinforcement learning with a dense reward derived from the normalised penalty. We find that supervised approaches consistently regress below the zero-shot baseline under distribution shift, while GRPO succeeds. Our best policy reduces the cumulative ALPHA penalty of Qwen2.5-Coder-7B on Security Hardening and Adversarial Testing (SVEN) dataset by 27.9% under greedy decoding, and by 25.5% under sampled decoding(p = 0.005, Welch's t-test), reaching statistical parity with its 4.5x larger zero-shot teacher. We conclude that the value of a hierarchical penalty as a training signal depends largely on the directness of its delivery.
- Abstract(参考訳): オリジナルのALPHAベンチマークでは、PythonでCWEレベルの脆弱性予測を評価するために分類学的に認識されたペナルティを導入し、理論的にはトレーニングシグナルとしても機能できるとした。
この論文は、その検証を提供する。
教師付き微調整, 二重頭部分類損失, 正規化報酬による強化学習の3つのメカニズムを比較した。
GRPOが成功する一方で、教師付きアプローチは分布シフトのゼロショットベースライン以下で一貫して後退することがわかった。
我々のベストポリシーは、Qwen2.5-Coder-7B on Security Hardening and Adversarial Testing (SVEN)データセットの累積ALPHAペナルティを27.9%減らし、サンプルデコード(p = 0.005, Welch's t-test)で25.5%減らし、その4.5倍のゼロショット教師と統計的に同等になった。
トレーニング信号としての階層的なペナルティの価値は、その提供の直接性に大きく依存する、と結論付けている。
関連論文リスト
- When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming [0.0]
近似ポリシ最適化(PPO)を用いたコンパクトRLHFパイプラインの失敗モードに関する実証的研究について述べる。
我々は、学習した報酬の方向、判定スコア、および平均判定スコアを用いて、チェックポイント間の一致した遷移を分類する。
ROC-AUC 0.821による将来の行レベルの報酬ハッキングを予測し、行レベルの分析では、チェックポイント平均が12の3つの設定で見逃すような局所的な報酬ハックが見つかる。
論文 参考訳(メタデータ) (2026-06-02T06:55:52Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - RVPO: Risk-Sensitive Alignment via Variance Regularization [13.192921543523283]
本稿では, 利便集約時のリワード間分散をペナルティ化するリスクセンシティブなフレームワークであるReward-Variance Policy Optimization (RVPO)を提案する。
我々はTaylor拡張を通して、LogSumExp(SoftMin)オペレータがスムーズな分散ペナルティとして効果的に働くことを示す。
モデルがより簡単な目的を活かすために難しい制約を無視しないようにすることで、RVPOはHealthBenchの全体的なスコアを改善する。
論文 参考訳(メタデータ) (2026-05-07T06:43:05Z) - Adaptive Hierarchical Evaluation of LLMs and SAST tools for CWE Prediction in Python [1.0026496861838445]
脆弱性検出のための大規模言語モデルを評価する最初の関数レベルのPythonベンチマークを示す。
ALPHAはオーバージェネレーション、オーバースペクテーション、およびサイドエラーを区別する。
LLMはSASTよりかなり優れているが,SASTは検出時に高い精度を示す。
論文 参考訳(メタデータ) (2026-01-04T01:13:37Z) - Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning [50.93804891554481]
従来の逆確率スコア推定よりも優れた対数推定演算子(log-sum-exponential (LSE)演算子)に基づく新しい推定器を提案する。
我々のLSE推定器は, 重み付き条件下での分散低減とロバスト性を示す。
政治以外の学習シナリオでは、LSE推定器と最適ポリシーの間のパフォーマンスギャップである後悔の限界を確立します。
論文 参考訳(メタデータ) (2025-06-07T17:37:10Z) - Generating Unbiased Pseudo-labels via a Theoretically Guaranteed
Chebyshev Constraint to Unify Semi-supervised Classification and Regression [57.17120203327993]
分類におけるしきい値と擬似ラベルプロセス(T2L)は、ラベルの品質を決定するために信頼性を使用する。
本質的には、レグレッションは高品質なラベルを生成するためにバイアスのない方法も必要である。
チェビシェフの不等式に基づく不偏ラベルを生成するための理論的に保証された制約を提案する。
論文 参考訳(メタデータ) (2023-11-03T08:39:35Z) - Distributional Reinforcement Learning with Dual Expectile-Quantile Regression [51.87411935256015]
分布RLに対する量子レグレッションアプローチは、任意の戻り分布を柔軟かつ効果的に学習する方法を提供する。
我々は,分布推定が消失することを示し,推定分布が急速に平均に崩壊することを実証的に観察した。
我々は,$L$の学習効率に感化され,効率のよい学習方法として,返却分布の期待値と量子値を共同で学習することを提案する。
論文 参考訳(メタデータ) (2023-05-26T12:30:05Z) - End-to-End Semi-Supervised Object Detection with Soft Teacher [63.26266730447914]
本稿では,従来の複雑な多段階法とは対照的に,終端から終端までの半教師付き物体検出手法を提案する。
提案手法は, 種々のラベル付け比において, 従来手法よりも大きなマージンで性能を向上する。
最先端のSwin Transformerベースの物体検出器では、検出精度を+1.5 mAPで大幅に向上させることができる。
論文 参考訳(メタデータ) (2021-06-16T17:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。