論文の概要: Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
- arxiv url: http://arxiv.org/abs/2608.12652v1
- Date: Wed, 12 Aug 2026 23:27:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.343847
- Title: Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
- Title(参考訳): 余剰分離性:ベンチマーク汚染検出のためのNuisance-Controlled Residual-Stream Probing
- Abstract要約: これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを指定する。
実際の変圧器では、ベースライン深度プロファイルは測度的に平坦ではなく、時間分割で最大29.1の精度ポイントである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmark contamination is diagnosed today with n-gram overlap, with likelihood-based membership inference, or with canary strings, and each needs something usually unavailable: the training corpus, a well-chosen test statistic, or foresight at dataset release. A recent alternative reads contamination off a linear probe on internal activations. We show that the natural way to do this does not work, and specify one that survives measurement. The protocol reports a zero-sum contrast on the depth profile of probe accuracy, recentred on a level-matched placebo baseline, tested against a label-permutation null, with the reference set twice the size of the suspect set. Each choice replaces a simpler alternative we measured and rejected. Reporting the level of excess separability rather than its shape makes the false positive rate track the size of the analyst's own control set, from 0.03 to 0.99 under a true null. Contrasting against a flat depth profile fails in both directions, rejecting a true null 0.72 of the time when surface decodability rises with depth and losing all power when it falls. An item bootstrap holds the fitted probe fixed and rejects up to 0.09 of the time where a permutation null that refits it holds 0.02. A half-size baseline triples the error rate. On real transformers, baseline depth profiles are measurably not flat, spanning up to 29.1 accuracy points on a temporal split, and their non-flatness tracks the surface difference between the item sets (correlation 0.87 over 6 audits), so the correction is largest exactly where it is needed. All 4 well-matched Pile arms return null, and the protocol refuses a verdict on the temporal split rather than reporting one. What this does not establish is whether transformers carry a familiarity direction at all: the only positive sits on the split where exchangeability fails. Implementation, tests and audits are released.
- Abstract(参考訳): ベンチマーク汚染は、今日、n-gramオーバーラップ、可能性ベースのメンバーシップ推論、カナリアストリングと診断され、それぞれが通常利用できないものを必要としている。
最近の代替手段は、内部の活性化に関する線形プローブから汚染を読み取るものである。
これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを指定する。
このプロトコルは、プローブ精度の深さプロファイルに対してゼロサムコントラストを報告し、最近はレベルマッチングされたプラセボベースラインでテストされ、ラベル置換ヌルに対してテストされ、参照セットは被疑者集合の2倍の大きさである。
それぞれの選択肢は、私たちが測定し、拒否したより単純な選択肢に取って代わります。
形状よりも余分な分離性のレベルを報告することで、偽陽性率はアナリスト自身のコントロールセットのサイズを、真のnullの下で0.03から0.99に追跡する。
平らな深さプロファイルとの対比は両方向で失敗し、表面の陰極性度が深さとともに上昇する際の真のヌル0.72を拒絶し、落下時にすべての電力を失う。
アイテムブートストラップは、固定されたプローブを保持し、0.02をリフィットする置換ヌルの最大0.09を拒絶する。
半大のベースラインはエラー率を3倍にする。
実際の変圧器では、ベースライン深度プロファイルは測度的に平坦ではなく、時間分割で最大29.1の精度ポイントに広がり、その非平坦性はアイテムセットの表面の差(相関0.87と6の監査)を追跡するので、修正は必要な場所では最大である。
4つの整合したPileのアームはすべてnullを返すが、プロトコルはそれを報告するのではなく、時間分割の判断を拒否する。
これが確立していないのは、トランスフォーマーが親しみやすい方向を全く持たないかどうかである。
実装、テスト、監査がリリースされている。
関連論文リスト
- When Single-Dataset Conclusions Fail: A 45-Task Study of Threshold Tuning and Resampling for Imbalanced Classification [0.0]
クラス不均衡処理は、単一のベンチマークデータセットで定期的に評価される。
リークフリーなネスト型クロスバリデーションプロトコルの下では、デフォルト0.5しきい値のプレーンランダムフォレストがF1 = 0.861 +/-0.021に達する。
閾値調整の利点は、不均衡比において非単調である。
論文 参考訳(メタデータ) (2026-08-17T05:58:33Z) - Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions [87.95757610455173]
我々は、x演算グリッドとSO-OPFをサポートするために、インジェクティブに整合した残余セルアウトプロトコルを導入する。
グリッドが分かっているときにキャリアがホールドアウトバインディングを構成するかどうか、フラットなセルラベルからグリッドを回収できるかどうかという2つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-06T15:38:55Z) - Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents [1.4915002678801434]
ボンフェロニ配置は分布自由であるが,相関誤差下では保守的であることを示す。
粗いラベルの選択は、学習された依存なしにほぼ完璧な相関関係を作ることができる。
ステージ単位の証明書とペアの重なり合うバウンドを用いたモジュール証明書は、正の平均利得が0.6%となる。
論文 参考訳(メタデータ) (2026-08-04T23:48:36Z) - How fine a change can moments see? A scale law for detecting distribution shift, with a kernel calibration rule [0.0]
法則の帯域幅が支配するカーネルテストを示す。
我々は、トポロジ的な要約は役に立たないと結論づけるのではなく、このタスクでは、法則が支配するカーネルテストを行う。
論文 参考訳(メタデータ) (2026-08-02T14:21:58Z) - Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop [0.0]
メカニカルオラクル下での対向試験硬化ループについて検討した。
テスタモデルはテストを書き、変異テスト名は生き残った欠陥を注入し、Cryticモデルはテストを書き、それらを正確に実行します。
私たちは、すべてのレシートと分析コードの両方のプロトコルをリリースします。
論文 参考訳(メタデータ) (2026-07-25T02:38:07Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Fixed-Protocol Amortized MPS Tomography with Conformalized Predictive Uncertainty [31.082191748525137]
量子状態トモグラフィーはサンプリング・スターベットされ、その状態は狭く学習可能な多様体上で生きていく。
事前の見積もりは、既にほぼ最適であり、ほとんどの測定値において高い忠実度」は、断層撮影よりも家族の記憶である可能性がある。
そこで本稿では,ゲージ不変の忠実度損失を一度トレーニングしたemph-protocolアモータライズMPS推定器を提案する。
論文 参考訳(メタデータ) (2026-07-13T08:57:23Z) - When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents [0.0]
長い答えのLSMエージェントは静かに失敗する可能性があり、彼らは証拠を早期に読み上げ、残りの期間をその証拠を守るのに費やした。
我々は、表現的コミットメントを、固定された推論ステップにおいて、クロスランな隠れ状態収束として定義する。
ランタイムモニタは、AUROCの隠れ状態から0.97までの不整合軌道を検出する(より厳密なスプリットの下で0.85-0.88)。
論文 参考訳(メタデータ) (2026-06-22T07:13:13Z) - Anticipating the Optimism Gap: Predicting Distribution-Shift Degradation of RF-Impairment Detectors from In-Distribution Statistics [0.0]
電波障害の検知器は、通常、調整された分布で測定された単一のAUCで報告される。
アウト・オブ・ディストリビューション・データを見る前に、この楽観主義が予測できるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-20T14:10:59Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Code Correctness Signals in LLM Hidden States: Pre-Generation Probing and Repair Geometry [0.0]
モデルのファーストアタプティブコードの正しさは、プロンプト-ファイナル隠れ状態から線形にデオード可能である。
モデルが失敗した最初の試みを修復しようとするケース236では、失敗した試みからその修復への隠れ状態シフトが統計的に検出可能なコントラスト方向をもたらす。
論文 参考訳(メタデータ) (2026-06-12T15:06:15Z) - Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations [5.218766876318545]
LLMのアクティベーションをトレーニングした線形プローブは、騙し検出指標としてますます提案されているが、AUROCは分布シフトの下で崩壊しながらクリーンなベンチマークで0.96を超えることを報告している。
本稿では, Gemma 3 モデルファミリ(1B-27B パラメータ)における圧力-プローブ-ベースの測定値について, 系統的に検討する。
1) 単線方向, (2) 多次元部分空間, (3) 凸円錐殻, (4) エントロピープロキシの4つの仮説を検証した。
論文 参考訳(メタデータ) (2026-05-27T04:51:55Z) - Mind the Sim-to-Real Gap & Think Like a Scientist [44.54570296032634]
我々は,シミュレータを実験で補うべき時期と方法について検討する。
我々はシミュレーション支援実験政策であるFisher-SEPを提案する。
論文 参考訳(メタデータ) (2026-05-20T17:48:14Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Discovering Causal Relationships using Proxy Variables under Unmeasured Confounding [42.70985072862832]
観測研究における変数ペア間の因果関係の推測は極めて重要であるが,困難である。
我々は,不測の共同設立者の下で因果仮説をテストするために,離散的かつ連続的な設定を両立する一般的な非パラメトリックアプローチを開発する。
Intensive Care Data and World Values Surveyの広範囲なシミュレーションと実世界データによるアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2025-10-20T05:13:12Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - Locally minimax optimal confidence sets for the best model [40.60301522036206]
この論文は基本的な推論問題に取り組む:$P$ over $mathbbRd$ が未知の平均$boldsymbolmu$ である場合、$boldsymbolmu$ の最小成分に対応する指数に対する信頼セットを形成する必要がある。
我々は$d$が$n$でスケールするか、および$boldsymbolmu$の任意の関係によらず、妥当性を維持する「次元に依存しない」テストを提案する。
論文 参考訳(メタデータ) (2025-03-27T16:06:07Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z) - Towards Self-Supervised Covariance Estimation in Deep Heteroscedastic Regression [102.24287051757469]
深部異方性回帰における自己教師付き共分散推定について検討する。
正規分布の間の2-ワッサーシュタイン距離の上界を導出する。
幅広い合成データセットと実データセットに対する実験により、提案された2-ワッサーシュタインと擬似ラベルアノテーションが結合した結果、計算的に安価で正確な深部ヘテロ代用回帰が導かれることが示された。
論文 参考訳(メタデータ) (2025-02-14T22:37:11Z) - Mean-Shifted Contrastive Loss for Anomaly Detection [34.97652735163338]
そこで本研究では,集中損失法とコントラスト損失法の両方の障害モードを克服できる新たな損失関数を提案する。
私たちの改善は、$textitMean-Shifted Contrastive Loss$に基づいて、新しい異常検出アプローチをもたらします。
提案手法は,ROC-AUC$9.5%を含む複数のベンチマークにおいて,最先端の異常検出性能を実現する。
論文 参考訳(メタデータ) (2021-06-07T17:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。