論文の概要: What Fixed-Rollout pass@k Evaluations Can Identify
- arxiv url: http://arxiv.org/abs/2609.09245v1
- Date: Tue, 08 Sep 2026 10:27:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.744631
- Title: What Fixed-Rollout pass@k Evaluations Can Identify
- Title(参考訳): Fixed-Rollout Pass@k Evaluations can Identify
- Abstract要約: 繰り返しサンプリング評価は、問題毎に収集されたサンプル数nをはるかに超え、pass@kを外挿する。
プール/ランダム・タスク条件付きビノミカルモデルでは、固定nの成功回数は、潜在タスク毎の成功分布の n 自由モーメントのみを識別する。
- 参考スコア(独自算出の注目度): 3.0318216701273397
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Repeated-sampling evaluations increasingly extrapolate pass@k far beyond the number n of samples collected per problem. We show that, in the pooled/random-task conditional-Binomial model, fixed-n success counts identify only the n free moments of the latent per-task success distribution. Consequently, direct pass@k is identified for k <= n, but generic extrapolated pass@k, tail exponents, and tail constants are not identified for k > n, even with arbitrarily many exchangeable tasks at the same rollout budget. This is stronger than the observation that the usual estimator is undefined beyond n: it characterizes the information missing from the fixed-depth count-law experiment. We give exact count-law-preserving constructions with incompatible extrapolations, state the exceptional unique-extension case, and compute sharp population identified intervals through Hausdorff principal representations. On the public 10,000-rollout-per-problem release of Brown et al., counterfactual n = 16 evaluations leave failure at k = 1000 ambiguous by factors from 1.5 to over 2,600 across four MATH/GSM8K/CodeContests configurations. The calibration shows that intermediate-scale failure share alone does not determine width. Our result does not reject parametric inference-time scaling laws; it supplies the nonparametric baseline against which their assumptions can be evaluated. We give an exact, conservative one-coordinate finite-task confidence certificate and a reporting standard separating direct estimates, identified sets, and model-conditioned forecasts.
- Abstract(参考訳): 繰り返しサンプリング評価は、問題毎に収集されたサンプル数 n を超えて、pass@k を外挿する傾向にある。
プール/ランダム・タスク条件付きビノミカルモデルでは、固定nの成功回数は、潜在タスク毎の成功分布の n 自由モーメントのみを識別する。
したがって、directpass@kは k <= n に対して識別されるが、一般的な外挿パス@k、テール指数、テール定数は k > n に対して識別されない。
これは、通常の推定器が n を超えて定義されていないという観測よりも強く、固定深度法則実験から欠落した情報を特徴付ける。
不整合な外挿を持つ正確な法則保存構成を与え、例外的な一意拡張のケースを述べるとともに、ハウスドルフの主表現を通して特定された急激な集団を計算する。
Brown et al の公開1万ロールアウト/プロブレムリリースでは、偽ファクト n = 16 の評価は 4つの MATH/GSM8K/CodeContests 構成に対して 1.5 から 2,600 を越える因子によって k = 1000 の不明瞭さを保っている。
キャリブレーションは、中間スケールの障害のみが幅を決定できないことを示している。
提案法は, パラメトリックな推定時間スケーリング法則を否定するものではなく, 仮定を評価可能な非パラメトリックなベースラインを提供する。
我々は、厳密で保守的な有限タスク信頼性証明書と、直接推定、特定セット、モデル条件付き予測を分離する報告標準を与える。
関連論文リスト
- Optimal Stratified Allocation for Rare-Event Onset Forecasting in Dependent Sequences [2.2632368327435732]
我々は,K0とK1を2つの層に配置した設計の下で,サブサンプルKnから全体のリスクを推定する。
重み付きリスク推定器の厳密な有限個体群分散をクラス条件によるサンプリングで導出する。
論文 参考訳(メタデータ) (2026-09-03T19:38:01Z) - Separating Covariate Shift from Mechanism Change with Two Discriminators: CJSD, a Conditional Discrepancy with an Exact Covariate-Concept Decomposition [0.0]
Conditional Jensen-Shannon Discrepancy (CJSD)
202組のデータセットの10測定バッテリーでは、CJSDとkNNプラグインの2つの条件情報推定器だけがフェールする。
論文 参考訳(メタデータ) (2026-08-20T10:48:08Z) - PAIR-CI: Calibrated Conditional Independence Testing for Causal Discovery with Incomplete Data [0.0]
PAIR-CIは非パラメトリック条件独立(CI)テストであり,複数の命令を直接推論手順に統合することによりキャリブレーションを回復する。
確率的に一貫した分散推定器は、クロスバリデーションと多重計算による不確かさを共同で説明する。
論文 参考訳(メタデータ) (2026-05-06T12:34:37Z) - Online Covariance Estimation in Nonsmooth Stochastic Approximation [14.818683408659764]
非滑らかな変分包含問題を解くために近似法(SA)を適用することを検討する。
我々の収束構造は、統計的推定法で最もよく知られているものを確立する。
論文 参考訳(メタデータ) (2025-02-07T20:16:51Z) - Relaxed Quantile Regression: Prediction Intervals for Asymmetric Noise [51.87307904567702]
量子レグレッション(Quantile regression)は、出力の分布における量子の実験的推定を通じてそのような間隔を得るための主要なアプローチである。
本稿では、この任意の制約を除去する量子回帰に基づく区間構成の直接的な代替として、Relaxed Quantile Regression (RQR)を提案する。
これにより、柔軟性が向上し、望ましい品質が向上することが実証された。
論文 参考訳(メタデータ) (2024-06-05T13:36:38Z) - Model-Agnostic Covariate-Assisted Inference on Partially Identified Causal Effects [1.9253333342733674]
多くの因果推定値は、潜在的な結果間の観測不能な関節分布に依存するため、部分的にしか識別できない。
本研究では,部分的同定された推定値の広いクラスに対して,統一的かつモデルに依存しない推論手法を提案する。
論文 参考訳(メタデータ) (2023-10-12T08:17:30Z) - Nonparametric extensions of randomized response for private confidence sets [51.75485869914048]
本研究は,局所的差分プライバシー(LDP)の制約の下で,集団平均の非パラメトリック,非漸近的統計的推測を行う手法を導出する。
民営化データへのアクセスのみを与えられた場合、$mustar$に対して信頼区間(CI)と時間一様信頼シーケンス(CS)を提示する。
論文 参考訳(メタデータ) (2022-02-17T16:04:49Z) - Universal Off-Policy Evaluation [64.02853483874334]
ユニバーサルオフ政治推定器(UnO)への第一歩を踏み出す
我々は, 平均, 分散, 分位数/中間数, 分位数範囲, cvar, および累積分布全体の推定と同時結合に uno を用いる。
論文 参考訳(メタデータ) (2021-04-26T18:54:31Z) - Distribution-free binary classification: prediction sets, confidence
intervals and calibration [106.50279469344937]
分布自由条件における二項分類のための不確実性定量化(キャリブレーション、信頼区間、予測セット)の3つの概念について検討する。
固定幅と一様質量の両双対の双対確率に対する信頼区間を導出する。
我々の「三脚」定理の結果として、双有理確率に対するこれらの信頼区間は分布自由キャリブレーションに繋がる。
論文 参考訳(メタデータ) (2020-06-18T14:17:29Z) - Nonparametric Score Estimators [49.42469547970041]
未知分布によって生成されたサンプルの集合からスコアを推定することは確率モデルの推論と学習における基本的なタスクである。
正規化非パラメトリック回帰の枠組みの下で、これらの推定器の統一的なビューを提供する。
カールフリーカーネルと高速収束による計算効果を享受する反復正規化に基づくスコア推定器を提案する。
論文 参考訳(メタデータ) (2020-05-20T15:01:03Z) - Estimating Gradients for Discrete Random Variables by Sampling without
Replacement [93.09326095997336]
我々は、置換のないサンプリングに基づいて、離散確率変数に対する期待値の偏りのない推定器を導出する。
推定器は3つの異なる推定器のラオ・ブラックウェル化として導出可能であることを示す。
論文 参考訳(メタデータ) (2020-02-14T14:15:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。