論文の概要: Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
- arxiv url: http://arxiv.org/abs/2608.12652v2
- Date: Sun, 16 Aug 2026 22:46:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.587138
- Title: Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
- Title(参考訳): 余剰分離性:ベンチマーク汚染検出のためのNuisance-Controlled Residual-Stream Probing
- Authors: Florian Braun,
- Abstract要約: ベンチマーク汚染はn-gram重なり、可能性に基づくメンバーシップ推論、カナリア文字列と診断される。
これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを特定し、それを動作させる補正が、テストされるnullよりも多くのばらつきをもたらすことを見つけます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmark contamination is diagnosed with n-gram overlap, likelihood-based membership inference, or canary strings, and each needs something usually unavailable: the training corpus, a well-chosen test statistic, or foresight at release. A recent alternative reads it off a linear probe on internal activations. We show the natural way to do this does not work, specify one that survives measurement, then find that the correction making it work carries more variance than the null it is tested against. The protocol reports a zero-sum contrast on the depth profile of probe accuracy, recentred on a level-matched placebo baseline, tested against a label-permutation null, with the reference set twice the size of the suspect set. Each choice replaces a simpler alternative we rejected on measurement. Reporting the level of excess separability rather than its shape makes the false positive rate track the size of the analyst's own control set, 0.03 to 0.99 under a true null. Contrasting against a flat depth profile rejects a true null 0.72 of the time when surface decodability rises with depth, and loses all power when it falls. On real transformers the protocol fails a test the simulations did not pose. The recentring subtracts an estimate, and the permutation null holds it fixed. Re-estimated across split seeds on four audits of contaminated checkpoints, its standard deviation is 1.30 to 1.56 times the null's own in every arm: what is subtracted to remove a bias is more variable than what it corrects. The one nominally significant result, p = 0.0075, becomes 0.0745 once that variance is propagated, and no verdict is issued. The simulations missed this because their surface key is the covariate driving item variation; on real text it is a proxy, and degrading key quality in simulation reproduces it. We add a companion measurement and a widened null. No arm shows contamination.
- Abstract(参考訳): ベンチマーク汚染はn-gramの重複、可能性に基づくメンバーシップ推論、カナリア文字列と診断され、それぞれが通常利用できないものを必要としている。
最近の代替案では、内部の活性化に関する線形プローブが読み上げられている。
これを行う自然な方法はうまくいかないことを示し、測定を生き残るものを特定し、それを動作させる補正が、テストされるnullよりも多くのばらつきをもたらすことを見つけます。
このプロトコルは、プローブ精度の深さプロファイルに対してゼロサムコントラストを報告し、最近はレベルマッチングされたプラセボベースラインでテストされ、ラベル置換ヌルに対してテストされ、参照セットは被疑者集合の2倍の大きさである。
それぞれの選択肢は、測定で拒否したより単純な選択肢に取って代わります。
形状よりも余分な分離性のレベルを報告することで、偽陽性率はアナリスト自身のコントロールセットのサイズを、真のnullの下で0.03から0.99に追跡する。
平坦な深さプロファイルとは対照的に、表面の陰極性が深さとともに上昇する真のヌル0.72を拒絶し、落下するとすべての電力を失う。
実際のトランスでは、プロトコルはテストに失敗し、シミュレーションは起こらなかった。
最近の例では見積もりを減算し、置換 null はそれを固定する。
汚染されたチェックポイントの4つの監査で分割された種子間で再推定され、標準偏差は各腕のヌルの1.30から1.56倍である。
名目上重要な結果である p = 0.0075 は、分散が伝播すると 0.0745 となり、判定は発行されない。
実際のテキストでは、それはプロキシであり、シミュレーションにおけるキー品質の劣化はそれを再現する。
コンパニオン測定と拡張nullを追加します。
腕に汚染はない。
関連論文リスト
- Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions [87.95757610455173]
我々は、x演算グリッドとSO-OPFをサポートするために、インジェクティブに整合した残余セルアウトプロトコルを導入する。
グリッドが分かっているときにキャリアがホールドアウトバインディングを構成するかどうか、フラットなセルラベルからグリッドを回収できるかどうかという2つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-06T15:38:55Z) - Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents [1.4915002678801434]
ボンフェロニ配置は分布自由であるが,相関誤差下では保守的であることを示す。
粗いラベルの選択は、学習された依存なしにほぼ完璧な相関関係を作ることができる。
ステージ単位の証明書とペアの重なり合うバウンドを用いたモジュール証明書は、正の平均利得が0.6%となる。
論文 参考訳(メタデータ) (2026-08-04T23:48:36Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents [0.0]
長い答えのLSMエージェントは静かに失敗する可能性があり、彼らは証拠を早期に読み上げ、残りの期間をその証拠を守るのに費やした。
我々は、表現的コミットメントを、固定された推論ステップにおいて、クロスランな隠れ状態収束として定義する。
ランタイムモニタは、AUROCの隠れ状態から0.97までの不整合軌道を検出する(より厳密なスプリットの下で0.85-0.88)。
論文 参考訳(メタデータ) (2026-06-22T07:13:13Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations [5.218766876318545]
LLMのアクティベーションをトレーニングした線形プローブは、騙し検出指標としてますます提案されているが、AUROCは分布シフトの下で崩壊しながらクリーンなベンチマークで0.96を超えることを報告している。
本稿では, Gemma 3 モデルファミリ(1B-27B パラメータ)における圧力-プローブ-ベースの測定値について, 系統的に検討する。
1) 単線方向, (2) 多次元部分空間, (3) 凸円錐殻, (4) エントロピープロキシの4つの仮説を検証した。
論文 参考訳(メタデータ) (2026-05-27T04:51:55Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - Locally minimax optimal confidence sets for the best model [40.60301522036206]
この論文は基本的な推論問題に取り組む:$P$ over $mathbbRd$ が未知の平均$boldsymbolmu$ である場合、$boldsymbolmu$ の最小成分に対応する指数に対する信頼セットを形成する必要がある。
我々は$d$が$n$でスケールするか、および$boldsymbolmu$の任意の関係によらず、妥当性を維持する「次元に依存しない」テストを提案する。
論文 参考訳(メタデータ) (2025-03-27T16:06:07Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。