論文の概要: Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration
- arxiv url: http://arxiv.org/abs/2606.05396v1
- Date: Wed, 03 Jun 2026 20:06:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.3753
- Title: Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration
- Title(参考訳): Willing but Unable: 可読化によるコードLLMの能力の分離
- Authors: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo,
- Abstract要約: 本稿では,このバリアを除去するためのツールとして,リフレクションストリームを再現する低ランクなウェイト編集である,消音の予備的研究を行う。
脆弱性判定は3つのツール検出アンサンブル(QLCode、Sem、Bandit)と手動で行う。
- 参考スコア(独自算出の注目度): 3.9458538778648964
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Producing a labeled vulnerable code at scale is a recurring obstacle for learning-based vulnerability detection: mined corpora carry substantial label noise, and existing LLM-based augmentation propagates these inaccuracies because it transforms vulnerable seeds rather than synthesising vulnerabilities from a specification. A complementary route is to start from safe code and ask an instruction-tuned LLM to inject a specified CWE (which would shift the labeling burden from open-ended detection to bounded binary confirmation) but safety-aligned code LLMs systematically refuse such prompts. This paper is a preliminary feasibility study of abliteration, a low-rank weight edit that orthogonally projects out the refusal direction in the residual stream, as a tool to remove this barrier. We use Python and CWE-89 (SQL injection) as a case study, evaluating the Qwen2.5-Coder-Instruct family at 3B, 7B, and 14B parameters on safe samples drawn from PromSec and SafeCoder, replicated three times per condition. We find that (i) refusal on injection prompts is strongly size- and prompt-context-dependent: the 14B refuses 100% of prompts, the 7B refuses 73% of PromSec but only 5% of SafeCoder, whereas the 3B is essentially never blocked; (ii) abliteration reduces refusal to zero or near-zero across all sizes while leaving syntactic validity above 93%, supporting the view that, in this setting, refusal can be detached from measured code-generation capability; and (iii) the post-abliteration injection rate remains capacity-bound (88-97% on the 14B, 89-90% on the 7B, and 25-48% on the 3B) separating willingness, which abliteration unlocks, from capability, which scales with parameters. Vulnerability verdicts are produced by a three-tool detector ensemble (CodeQL, Semgrep, Bandit) followed by manual adjudication by two authors on detector-positive outputs.
- Abstract(参考訳): マイニングされたコーパスは実質的なラベルノイズを持ち、既存のLLMベースの拡張は、脆弱性を仕様から合成するのではなく、脆弱な種を変換するので、これらの不正確さを伝播する。
補完的なルートは、安全なコードから始め、命令調整されたLLMに特定のCWEを注入するように要求することである(これはラベル付けの負担をオープンエンド検出から境界付きバイナリ確認にシフトさせる)が、安全に整合したLLMはそのようなプロンプトを体系的に拒否する。
本論文は,この障壁を除去するためのツールとして,残流の断線方向を直交的に投影する低ランクな重み付け編集である,消音の予備的実現可能性の研究である。
我々はPythonとCWE-89(SQLインジェクション)をケーススタディとして使用し、Qwen2.5-Coder-Instructファミリを3B、7B、14Bパラメータで評価し、PromSecとSafeCoderから引き出された安全なサンプルに対して、1条件あたり3回複製した。
私たちはそれを見つける。
(i)インジェクションプロンプトの拒絶は、強くサイズとプロンプトに依存している:14Bはプロンプトの100%を拒否し、7BはPromSecの73%を拒否するが、SafeCoderの5%しか拒否しないが、3Bは本質的にブロックされない。
二 棄却は、あらゆる大きさの拒絶をゼロまたはほぼゼロに減らし、構文上の妥当性を93%以上残し、この設定では、拒絶を、測定されたコード生成能力から切り離すことができるという見解を支持する。
三 消音後注入率(14Bが88~97%、七Bが89~90%、三Bが25~48%)は、消音後の消音後の消音後の消音時の消音意欲を、パラメータとともに拡張する能力から分離する。
脆弱性判定は3つのツール検出器アンサンブル(CodeQL、Semgrep、Bandit)で作成され、続いて検出器陽性出力に関する2人の著者が手動で行う。
関連論文リスト
- Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing [5.661334639541121]
CRANEは、シンキング・インストラクトデルタを、インストラクトバックボーンの候補推論編集のプールとして扱う、トレーニング不要なパラメータ編集手法である。
ペア化されたインストラクトとシンキングのチェックポイントを組み合わせることで、CRANEはどちらのモデルよりも強力なゲインを提供する。
論文 参考訳(メタデータ) (2026-05-13T20:09:35Z) - SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization [61.91729298584227]
SecureForgeは、フロンティアモデルのセキュリティリスクを監査し、監査インフォームされたセキュアなシステムプロンプトを生成する自動化パイプラインである。
SecureForgeは、まず静的に検出可能な脆弱性を生成する良性プロンプトを特定し、その後、さまざまなシナリオの大規模な合成プロンプトコーパスに増幅する。
フロンティアモデルでは、SecureForgeは、ユニットテストの成功と出力セキュリティの両方において統計的に有意な改善をもたらし、出力脆弱性は最大48%削減された。
論文 参考訳(メタデータ) (2026-05-08T18:40:47Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding [14.12354553465928]
安全性に整合した大言語モデル(LLM)は、過度に拒否される問題のために、無害なクエリに対する拒否応答を生成することが多い。
オーバーリファインを緩和する既存の方法は、悪意のあるクエリに対して高いリファイン比を維持しながら、無害なクエリに対して低リファイン比を維持することはできない。
我々は,LLMの安全性を維持しつつ,過度な拒絶を軽減し,トレーニング不要でモデルに依存しないアプローチであるAdaptive Contrastive Decoding (AdaCD)を提案する。
論文 参考訳(メタデータ) (2026-04-18T20:18:28Z) - LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests [0.0]
コーディングエージェントとLLMベースのアプリケーションは、通常、潜在的に敏感なコンテンツをクラウドのLLM APIに送信し、ログ化、保持、トレーニングに使用されるか、召喚される可能性がある。
プライバシ保護型LCM要求に対する8つの手法の系統的実証評価を行った。
MCPやOpenAI互換のAPIと互換性のあるオープンソースシムで、全8つ(あるいはデプロイメントがまだ実現不可能な、牽引可能な研究段階のサブセット)を実装しています。
論文 参考訳(メタデータ) (2026-04-13T21:05:42Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。