論文の概要: The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators
- arxiv url: http://arxiv.org/abs/2607.13075v1
- Date: Sun, 12 Jul 2026 20:37:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.521478
- Title: The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators
- Title(参考訳): 絡み合いの壁: リスク検知器としてのアクティベーション空間プローブはコンテキスト適応器ではない
- Abstract要約: コンテキストは、そのトピックやサーフェスフォームを変更することなく、リクエストが有害であるかどうかを変更することができる。
残留流探触子による有害な要求と表面整合ベニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグ
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Context can change whether a request is harmful without changing its topic or surface form. We ask whether residual-stream probes distinguish harmful requests from surface-matched benign controls at a useful operating point. Across three 7-8B model families, an activation sensor blocks 95.5-97.7 percent of judge-classified compliant attacks in a taxonomy-selected set. It also blocks 59.6-68.4 percent of XSTest prompts. A fully disjoint audit reconstructs near-ceiling source-contrast AUROC (0.996-0.999), but fixed transfer to matched pairs is weaker: 0.656-0.819 on the guard-selected Twin-n70 subset and 0.590-0.690 on the full Twin-n163 cohort. We test ten axes on the reference family and seven across all families with leakage, hold-out, and permutation controls. On Twin-n163, no axis evaluated without direct pair-boundary fitting reaches the specified numerical threshold. Requiring persistence on that full cohort was added at analysis time. A separately specified 24B/32B extension gives the same result. Pair-trained classifiers weaken under category and generation-batch hold-out and false-block 79.6-100 percent of XSTest at 95 percent in-corpus TPR. At the tested read points, these activation scores behave as broad-risk detectors rather than standalone context adjudicators.
- Abstract(参考訳): コンテキストは、そのトピックやサーフェスフォームを変更することなく、リクエストが有害であるかどうかを変更することができる。
残留流探触子による有害な要求と表面整合ベニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグナグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグナグニグニグニグニグニグニグナグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグ
3つの7-8Bモデルファミリーにまたがって、アクティベーションセンサーは、分類に選択されたセットにおいて、判断に適合した攻撃の95.5-97.7%をブロックする。
また、XSTestプロンプトの59.6-68.4%をブロックする。
AUROC (0.996-0.999) の完全非結合監査は、ほぼシーリングに近いソースコントラストのAUROC (0.996-0.999) を再構築するが、一致するペアへの固定転送はより弱く、ガード選択されたツイン-n70サブセットで0.656-0.819、完全なツイン-n163コホートで0.590-0.690である。
リファレンスファミリで10軸、リーク、ホールドアウト、置換制御を備えた全ファミリで7軸をテストします。
Twin-n163では、直接対界フィッティングなしで評価された軸が指定された数値しきい値に達することはない。
その完全なコホートに永続性を要求することは、分析時に追加された。
別々に指定された24B/32B拡張は、同じ結果を与える。
ペアトレーニングされた分類器は、クラスとジェネレーションバッチのホールドアウトと、XSTestの79.6-100%の偽ブロックの下で、95%の社内TPRで弱体化している。
テストされた読み点では、これらのアクティベーションスコアは、スタンドアローンの文脈調整器ではなく、幅広いリスク検出器として振る舞う。
関連論文リスト
- The Model Proposes, the Code Disposes: A Pre-Registered Ablation of a Verifier-and-Acceptance Stage in an LLM-Orchestrated Offensive-Security Agent [0.0]
決定的コードによって検証が強制されるモデル検証装置である検証受理段階が、LCMが主導する攻撃セキュリティエージェントが報告するものを変更するかどうかを評価する。
本報告では,15回の探索パイロット,20回の予備登録検定アブレーション,および2回の故意に脆弱な検査対象を40回実施した2×2因子分析を行った。
検証者はシステムが提供するものを変更し、決定論的コードは強制と監査性を提供します。
論文 参考訳(メタデータ) (2026-09-14T17:13:05Z) - Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce [39.937871162878785]
我々は、虚偽の事実主張、操作、共謀、脅迫を含む電子メールとして、音声行為の誤認識を運用する。
メールの12.6%はミスアライメントと表示されており、20行中、74.7%は個別のエージェントランで表示されている。
高い能力モデルが弱い候補を差分に利用しているという証拠は見つからない。
論文 参考訳(メタデータ) (2026-08-14T18:56:12Z) - Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions [87.95757610455173]
我々は、x演算グリッドとSO-OPFをサポートするために、インジェクティブに整合した残余セルアウトプロトコルを導入する。
グリッドが分かっているときにキャリアがホールドアウトバインディングを構成するかどうか、フラットなセルラベルからグリッドを回収できるかどうかという2つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-06T15:38:55Z) - Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination [11.215813718564283]
候補のヘッドルームを置換権限から切り離し、後者を明示的で監査可能なオブジェクトとします。
提案手法であるCon Agreement-Before-Diversityは,フリーフリーでラベルのない決定ルールである。
論文 参考訳(メタデータ) (2026-08-05T09:24:39Z) - ALIVE: Warnings Before Exclusion in Budgeted Multi-Source Learning [18.17400877167872]
ルーティング決定は次のトランザクションで修正可能だが、遅延ソースの除外は後続の判断で継続される。
我々は,有限人口監査と学習が予算を共有している場合,不平等なパーシステンス行動を認める証拠を問う。
論文 参考訳(メタデータ) (2026-07-31T13:18:47Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes [35.18016233072556]
Evo 2のようなゲノム基盤モデルは、リッチなシーケンス表現を学習するが、バイオセキュリティスクリーニングの価値はほとんど探索されていない。
凍結したEvo2層26の活性化に対して、最小限の線形および注意プローブを訓練することにより、これらの表現の中でどの程度のバイオセキュリティ関連信号が線形にアクセスできるかを問う。
保持されたメダゲノミクステストセット全体で、プローブは強い差別で抗菌抵抗を検出する。
論文 参考訳(メタデータ) (2026-07-15T17:38:02Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense [37.10272384523361]
我々は、各検出器のサンプルごとの信頼性と遅延を、同様の過去の入力に対する動作から予測するためのフレームワークを開発する。
SCOUT-450は、古いプロンプトインジェクションが表現下にある構造的に複雑でエージェント対応のインジェクションをキャプチャするベンチマークである。
SCOUT-450では、安全指向の動作点が攻撃発生率を46%減らし、壁時計全体の40%減らした。
論文 参考訳(メタデータ) (2026-05-29T04:49:20Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving [0.0]
言語モデルの安全性評価は、サービス構成を固定されたバックグラウンドインフラストラクチャとして扱うことが多い。
我々は4つのアーティファクト支援研究をペアテストプロトコルに合成する。
標準vLLMは、現在のスコアフリップ候補に対して22/55ラベルのフリップを再生し、VLLM_BATCH_INIANT=1を有効にすることで、同じテストを0/55フリップに削減する。
論文 参考訳(メタデータ) (2026-05-26T23:22:55Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation [0.0]
政策シミュレーションにおいて,大規模言語モデル(LLM)を用いたマルチエージェント検討システムの提案が進んでいる。
評価エージェントは、割り当てられた値の観点に関わらず、同じ選択肢に収束する。
我々は、三段階の審議フレームワークであるAI Councilを提示し、2つの介入をテストするための2つの政策シナリオにわたる120の審議を行う。
論文 参考訳(メタデータ) (2026-04-29T11:47:28Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection [0.0]
マルチターンプロンプトインジェクション攻撃は、複数の会話ターンに悪意のある意図を分散させる。
プロキシ層での会話レベルのリスクスコアにターン毎のパターンスコアを集約する公式は存在しない。
本稿では,ピークの単一ターンリスク,持続率,カテゴリの多様性を組み合わせ,ピーク+累積スコアリング法を提案する。
論文 参考訳(メタデータ) (2026-02-11T17:53:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。