論文の概要: Do All LLMs Know When They're Being Harmful? A Reproducibility Study of Latent-Space Safety Probes Across Model Families
- arxiv url: http://arxiv.org/abs/2608.08029v1
- Date: Sat, 08 Aug 2026 09:34:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.612496
- Title: Do All LLMs Know When They're Being Harmful? A Reproducibility Study of Latent-Space Safety Probes Across Model Families
- Title(参考訳): LLMはいつ有害か知っているか? モデルファミリ間の潜在空間安全プローブの再現性の検討
- Authors: Alizishaan Khatri, Dun Li Chan,
- Abstract要約: 単一の8Bモデルの最終層活性化に関する軽量プローブは、ガードモデルが1000倍大きいF1において有害なプロンプトを検出する。
私たちはこのパイプラインをエンドツーエンドに再現し、元の研究が開いた2つの軸に沿って拡張します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Khatri et al. (2026) [DOI: 10.1109/DSN-W70714.2026.00027] show that lightweight MLP probes on final-layer activations of a single 8B model (LLaMA-3.1-8B) detect harmful prompts at F1 competitive with guard models 1000x larger, using one probe per benchmark. We reproduce this pipeline end-to-end and extend it along two axes the original study leaves open. First, we test whether the result generalizes across other model architecture and scale by training identical probes on activations from models like Gemma-4-E4B, Mistral-7B-v0.3, and Qwen2-7B, using the three benchmarks (WildJailbreak, BeaverTails, AEGIS 2.0). Second, we test how much of the reported performance is affected by non-determinism during inference by repeating extraction under five random seeds and measuring the variance of F1 scores. Our results reproduce the original LLaMA model benchmarks within 0.37 percentage points of the original F1 scores (and within 0.2 points on BeaverTails). We find that the original MLP probe architecture extends to other model families with F1 scores within a point of the values reported for LLaMA-3.1-8B. Our experiments varying seed values reveal an interesting observation: final token latent vectors remained the same for all tested architectures irrespective of the seed values used.
- Abstract(参考訳): Khatri et al (2026) [DOI: 10.1109/DSN-W70714.2026.00027] は、単一の8Bモデル(LLaMA-3.1-8B)の最終層アクティベートに関する軽量のMLPプローブが、1000倍のガードモデルと競合するF1における有害なプロンプトを検出し、ベンチマーク毎に1つのプローブを用いて検出することを示した。
私たちはこのパイプラインをエンドツーエンドに再現し、元の研究が開いた2つの軸に沿って拡張します。
まず、3つのベンチマーク(WildJailbreak, BeaverTails, AEGIS 2.0)を用いて、Gemma-4-E4B、Mistral-7B-v0.3、Qwen2-7Bなどのモデルからのアクティベーションに関する同一プローブをトレーニングすることにより、結果が他のモデルアーキテクチャやスケールにわたって一般化されるかどうかを検証する。
第2に,5種の無作為種子の抽出を繰り返し,F1スコアのばらつきを測定することにより,非決定性による性能への影響を検証した。
我々の結果は、元のF1スコアの0.37ポイント(およびビーバータイルの0.2ポイント)でオリジナルのLLaMAモデルベンチマークを再現した。
元のMLPプローブアーキテクチャは、LLaMA-3.1-8Bで報告された値のポイント内において、F1スコアを持つ他のモデルファミリに拡張されている。
最終トークン潜在ベクトルは, シード値によらず, 試験されたすべてのアーキテクチャで同じ状態のままであった。
関連論文リスト
- When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness [0.0]
少数のインプット・アウトプット・デモペアをクエリにプリプロンプトして大きな言語モデルに提示する手法であるFew-shot promptingは、NLPで広く採用されている。
しかし、分類性能において、ショットカウントがモデルスケール、アーキテクチャ、出力フォーマットのコンプライアンスとどのように相互作用するかについて、体系的な研究はほとんど行われていない。
論文 参考訳(メタデータ) (2026-07-25T00:31:40Z) - Improving IoT Intrusion Detection Through SMOTE-Based Oversampling and Extended Multi-Model Evaluation on Side-Channel Power Data [0.0]
本稿では、電力系統侵入検知のためのサイドチャネルデータセットの不均衡問題を扱う。
ランダムフォレスト平均F1スコアは0.9989、マクロF1スコアは0.9794に達し、それまでで最高のマイクロF1結果を上回った。
エクストラツリーも同じパフォーマンスを提供するが、速度は10倍に向上した。
論文 参考訳(メタデータ) (2026-05-29T10:10:13Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Hallucination Detection via Activations of Open-Weight Proxy Analyzers [0.0]
大規模言語モデルにおける幻覚を検出するためのプロキシ・アナライザ・フレームワークを提案する。
生成モデルの内部を見る代わりに、ローカルにホストされた小さなオープンウェイトモデルを通して既存のテキストを読み、幻覚を見つける。
論文 参考訳(メタデータ) (2026-05-08T03:57:41Z) - Malware Detection based on API Calls: A Reproducibility Study [0.0]
本研究では,Felliciousらによるマルウェア検出手法を独立に再現する。
我々は、最初の公開データセット(250,533のトレーニングサンプル、83,511のテストサンプル)を使用し、Unigram、Bigram、Trigram、Combined n gramアプローチの4つのモデル変種を再現した。
F1スコアは全モデルで0.99%から2.57%,APIコール長は2,500。
論文 参考訳(メタデータ) (2026-01-13T16:50:29Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes [60.57770396565211]
強い推論能力は、はるかに少ないデータで実現可能であることを示す。
MobileLLM-R50MのAIMEスコアは15.5であり、OLMo-2-1.48Bは0.6、SmolLM-2-1.7Bは0.3である。
論文 参考訳(メタデータ) (2025-09-29T15:43:59Z) - Independence Tests for Language Models [47.0749292650885]
2つのモデルの重みを考えると、独立してトレーニングされたかどうかテストできますか?
制約付きと制約なしの2つの設定を検討します。
本稿では,2つのモデル間の隠れアクティベーションに一致し,逆変換やモデルアーキテクチャの変更に対して堅牢な新しいテストを提案する。
論文 参考訳(メタデータ) (2025-02-17T20:01:08Z) - Are You Sure? Challenging LLMs Leads to Performance Drops in The
FlipFlop Experiment [82.60594940370919]
大規模言語モデル(LLM)のマルチターン動作を研究するためのFlipFlop実験を提案する。
モデルが平均46%の時間で回答を反転させ、全てのモデルが最初の予測と最終予測の間に精度を低下させ、平均17%の低下(FlipFlop効果)を示す。
我々はオープンソースのLLMで微調整実験を行い、合成されたデータに対する微調整は、性能劣化を60%低減させることができるが、サイコファンティックな振る舞いを完全には解決できないことを発見した。
論文 参考訳(メタデータ) (2023-11-14T23:40:22Z) - Exploring the Value of Pre-trained Language Models for Clinical Named
Entity Recognition [6.917786124918387]
我々は、スクラッチからトレーニングされたTransformerモデルと、細調整されたBERTベースのLLMを比較した。
文脈学習を促進するために,追加のCRF層がそのようなモデルに与える影響を検討する。
論文 参考訳(メタデータ) (2022-10-23T16:27:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。