論文の概要: Activation Probes Surface Code-Security Signals that the Model's Output Misses
- arxiv url: http://arxiv.org/abs/2608.09643v1
- Date: Mon, 10 Aug 2026 14:22:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.304371
- Title: Activation Probes Surface Code-Security Signals that the Model's Output Misses
- Title(参考訳): Activation Probes Surface Code-Security Signals that the Model's Output Misss
- Abstract要約: AIコーディングエージェントが生産コードのシェアを拡大する。
人間のセキュリティレビューは、コードが生成される度にスケールしない。
それらのアクティベーションを読むと、同じレビュアーに見逃すセキュリティシグナルが回復するかどうかを尋ねる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI coding agents now write a growing share of production code, and human security review does not scale at the rate code is generated. The agents in widest use are closed-weight, so a deploying team cannot read their internals. It can instead run an open-weight model as a reviewer over the agent's output. That reviewer's activations are readable. We ask whether reading those activations recovers a security signal that simply asking the same reviewer misses. We fit a single linear probe per model on a corpus of paired vulnerable-and-fixed Python functions, then test it without retraining on real disclosed vulnerabilities whose weakness type the probe never saw in training, across five open-weight reviewer models. On the vulnerabilities fixed by changing a single function, the probe scores the vulnerable function above its fix on 61-67% of cases for every model, beating the 50% chance line. It also beats the same model's prompted YES/NO win-rate read from its logits, under every prompt we try. Asking the model for a written verdict, even with chain-of-thought, returns the same answer on the vulnerable and fixed function most of the time and so cannot tell them apart. Model activations carry a code-security signal that prompting the same model misses.
- Abstract(参考訳): AIコーディングエージェントは、生産コードのシェアが増加し、人間のセキュリティレビューはコード生成率でスケールしない。
最も広く使われているエージェントはクローズドウェイトなので、デプロイチームは内部を読めません。
代わりに、エージェントの出力に対してレビュアーとしてオープンウェイトモデルを実行することができる。
そのレビュアーのアクティベーションは読みやすい。
それらのアクティベーションを読むと、同じレビュアーに見逃すセキュリティシグナルが回復するかどうかを尋ねる。
モデル毎に1つの線形プローブをペア化された脆弱性と修正済みのPython関数のコーパスに適合させ、さらに5つのオープンウェイトレビュアーモデルで、プローブがトレーニングで見たことのない弱点を再トレーニングすることなく、テストします。
単一の関数を変更して修正された脆弱性について、プローブは、各モデルの61-67%のケースに対して、その修正の上の脆弱な関数をスコアし、50%の確率ラインを上回ります。
また、同じモデルのYES/NOの勝利率を、私たちが試すすべてのプロンプトで上回ります。
記述された評定のためのモデルを求めることは、たとえチェーン・オブ・シントであっても、しばしば脆弱で固定された関数について同じ答えを返すため、区別することができない。
モデルのアクティベーションは、同じモデルのミスを引き起こすコードセキュリティ信号を運ぶ。
関連論文リスト
- Recognition Without Enforcement: Configuration-Dependent Failures in LLM Agent Instruction Arbitration and External Control [0.0]
LLMエージェントはシステムプロンプト、ユーザ、メモリ、ツールから命令を仲裁するが、この仲裁は信頼境界を強制するものではない。
ソースフォーマット機能はモデルアクティベーションから線形にデオード可能であり、モデルがトリガーされたときの偽の権威を明示的に識別することができる。
モデル自己配置をセキュリティ境界ではなく機能として扱い、認証されたソースルーティングと機能限定ツールの実行を組み合わせた外部参照モニタを実装します。
論文 参考訳(メタデータ) (2026-08-28T16:34:05Z) - Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents [5.91817208489443]
検証・受け入れ・デプロイのギャップについて検討する。
このギャップは、エージェントの自己承認された検証信号と封印されたデプロイメント評価との相違を指す。
シーリング型外因性受容ループ(SEAL)について紹介する。
論文 参考訳(メタデータ) (2026-07-27T11:45:14Z) - The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK [0.0]
検証者主導のループにおいて、AIエージェントは古典的および後量子暗号、TLS 1.3、IKEv2、X.509、マトリックスクライアントにまたがるAda/SPARKのベアメタルセキュリティソフトウェアを書いて検証した。
GNATproveは49,280の証明義務を解除し、選択されたプリミティブに対して機能的正当性を確立し、残りのプリミティブに対して実行時のエラーがないことを証明した。
それぞれのレイヤが障害をキャッチし,中心的な教訓を引き出す方法を報告します。エージェントが確立するために信頼できるものは,そのフィードバックの強さに縛られているのです。
論文 参考訳(メタデータ) (2026-07-15T20:09:05Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs [95.06033929366203]
大規模言語モデル(LLM)開発者は、モデルが誠実で、有用で、無害であることを目標としている。
我々は,フロンティアLSMが,他の選択肢が利用可能であっても,新たな戦略として不便さを優先して開発可能であることを示す。
偽装する確率の明確な原因は見つからないが、より有能なモデルがこの戦略を実行するのに優れていることを示す。
論文 参考訳(メタデータ) (2025-09-22T17:30:56Z) - AI-Driven Cybersecurity Threat Detection: Building Resilient Defense Systems Using Predictive Analytics [0.7273611076094216]
本研究では、人工知能が米国のサイバー脅威の特定と緩和にどのように役立つかを検討する。
侵入検知、マルウェア分類、フィッシング検出、およびインサイダー脅威分析について調べる。
論文 参考訳(メタデータ) (2025-08-02T16:03:35Z) - Self-Evaluation as a Defense Against Adversarial Attacks on LLMs [20.79833694266861]
自己評価を生かした LLM に対する敵攻撃に対する防御策を導入する。
本手法では, モデル微調整を必要とせず, 生成モデルの入力と出力を評価するために, 事前学習モデルを用いる。
提案手法の有効性を解析し, 各種設定で評価器を攻撃しようとする試みを含む。
論文 参考訳(メタデータ) (2024-07-03T16:03:42Z) - Single Character Perturbations Break LLM Alignment [20.79833694266861]
モデル入力の端に空間を付加するだけで、モデルディフェンスを壊すことが可能であることを示す。
トークン化されたトレーニングデータに単一空間が存在する状況は、モデルにトリガーされた時にリストを生成することを奨励する。
本研究は, 現行モデルアライメントの脆弱さを浮き彫りにして, より堅牢なアライメント手法の開発の重要性を推し進めるものである。
論文 参考訳(メタデータ) (2024-07-03T16:03:10Z) - Steering Without Side Effects: Improving Post-Deployment Control of Language Models [61.99293520621248]
言語モデル(LM)は、デプロイ後予期せず振る舞うことが示されている。
KL-then-steer (KTS) は, その利点を保ちながら, 操舵の副作用を低減する技術である。
本手法はLlama-2-chat-7Bモデルと比較して44%のジェイルブレイク攻撃を防ぐ。
論文 参考訳(メタデータ) (2024-06-21T01:37:39Z) - Model Pairing Using Embedding Translation for Backdoor Attack Detection on Open-Set Classification Tasks [63.269788236474234]
バックドア検出のためのオープンセット分類タスクにモデルペアを用いることを提案する。
このスコアは、異なるアーキテクチャのモデルがあるにもかかわらず、バックドアの存在を示す指標であることを示している。
この技術は、オープンセット分類タスク用に設計されたモデル上のバックドアの検出を可能にするが、文献ではほとんど研究されていない。
論文 参考訳(メタデータ) (2024-02-28T21:29:16Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z) - MOVE: Effective and Harmless Ownership Verification via Embedded External Features [104.97541464349581]
本稿では,異なる種類のモデル盗難を同時に防ぐために,効果的かつ無害なモデル所有者認証(MOVE)を提案する。
我々は、疑わしいモデルがディフェンダー特定外部特徴の知識を含むかどうかを検証し、所有権検証を行う。
次に、メタ分類器をトレーニングして、モデルが被害者から盗まれたかどうかを判断します。
論文 参考訳(メタデータ) (2022-08-04T02:22:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。