論文の概要: Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores
- arxiv url: http://arxiv.org/abs/2608.02985v1
- Date: Tue, 04 Aug 2026 00:45:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.982078
- Title: Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores
- Title(参考訳): LLMバックテストにおける経時的漏洩:測定,検証,調整スコア
- Authors: Zeyu Zhang, Bradly C. Stadie,
- Abstract要約: LLMバックテストにおける汚染の標準チェックは非形式的であることを示す。
4つのフラッグシップモデルは、記憶できない質問で失敗します。
受動的バックテストが2つを本当のスキルから切り離すことができないことを証明しています。
- 参考スコア(独自算出の注目度): 6.428238071336693
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The standard check for contamination in LLM backtests is simple: compare scores before and after the training cutoff. We show this check is uninformative. Four flagship models fail it on questions they cannot have memorized: every scored question resolved after their cutoffs. The reason is structural. Models legitimately know more about times near their cutoff, so recency mimics leakage, and we prove no passive backtest can separate the two from genuine skill. Measurement, not just detection, requires information from outside the backtest. We supply it in two forms. A known cutoff identifies leakage at the boundary; a matched clean control identifies it globally and yields a leakage-adjusted score. We also derive where leakage hides: it concentrates on outcomes that surprised the crowd and were well covered in training, and partial memorization is disproportionately rewarded. We validate the estimators against ground truth by planting leakage in twin models, where they recover the injected dose and return null on clean questions. Deployed on frontier models, they detect one cutoff-localized signature and, at the audit's power floor, clear five models whose apparent advantages were recency alone. Backtests need not be discarded; they need one defensible reference.
- Abstract(参考訳): LLMバックテストにおける汚染の標準チェックは単純で、トレーニングカット前後のスコアを比較します。
この小切手は形骸化していない。
4つのフラッグシップモデルは、彼らが記憶できない質問で失敗する。
理由は構造的です。
モデルはカットオフに近い時間について正当に知るので、リレーレンシーはリークを模倣するので、受動的バックテストが本物のスキルから2つを分離できないことを証明します。
測定は単に検出するだけでなく、バックテストの外部からの情報を必要とする。
私たちはそれを2つの形で供給します。
既知のカットオフは境界におけるリークを識別し、マッチしたクリーンコントロールはそれを世界規模で識別し、リーク調整されたスコアを得る。
群衆を驚かせた結果に集中し、トレーニングで十分にカバーされ、部分記憶は不公平に報われます。
二つのモデルに漏れを埋め込むことにより, 地中真実に対する推定値の検証を行い, クリーンな質問に対して入射線量を回収し, nullを返却する。
フロンティアモデル上に展開され、1つのカットオフ局所化シグネチャを検出し、オーディションのパワーフロアでは、明らかな優位性は信頼性のみである5つのモデルをクリアした。
バックテストは破棄される必要はない。
関連論文リスト
- When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR [0.0]
コードに対するRLVR報酬として使用されるテストスイートには、自然な偽陽性がある。
デプロイされたスイート上で、事前登録された2本腕の因果コントラストを実行します。
報酬は単なるスイートアーティファクトではなく、実際のバグに対して支払われていることに気付きました。
論文 参考訳(メタデータ) (2026-07-13T02:41:16Z) - LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation [79.03892269184145]
LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
論文 参考訳(メタデータ) (2026-06-19T06:20:58Z) - When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks [2.743683637024251]
検証者駆動型自己DPOは、自己改善型視覚言語モデルのための一般的なレシピである。
検証器の品質がタスク固有のため,この仮定は失敗する可能性がある。
本稿では,プログレッシブゲートリプレイとその方向ミスマッチ故障モードに対する分散定理を用いて,コンパクトなメカニスティックな説明を行う。
論文 参考訳(メタデータ) (2026-06-12T16:55:30Z) - A prior-free blind detection of information leakage from model predictions [0.0]
本稿では,リーク診断が予測リスク/アウトカム則の関数となる決定論的枠組みを提案する。
正当モデルの校正と識別に適合する校正されたリークは、予測の空白関数により、正直な性能と区別できない。
ほぼ決定論的部分群は、非決定論的結果の正当な予測者が製造できない持続的単位純度ヘッドを生成する。
論文 参考訳(メタデータ) (2026-06-09T05:13:03Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning [27.979418392479033]
大規模な推論モデル(LRM)は、反射を伴う長い推論トレースを生成することにより、強い性能を達成する。
その結果, 自己検証(再確認)により, 中間結果の確認が繰り返し行われることが判明した。
これは、自己検証の頻度と実際に役に立つ頻度のミスマッチを明らかにします。
過剰な検証を削減できる新しい経験駆動型テストタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-03T12:58:23Z) - Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation [12.503662455234954]
現代の言語モデルでは、誤った回答が破滅的な結果をもたらす場合でも、自信ある幻覚が生じることを示す。
RLVR(Reinforceed Hesitation)は,2進法ではなく3進法を用いた強化学習(Reinforcement Learning from Verifiable Rewards, RLVR)の修正である。
論文 参考訳(メタデータ) (2025-11-14T17:20:45Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。