論文の概要: What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training
- arxiv url: http://arxiv.org/abs/2610.07405v1
- Date: Mon, 05 Oct 2026 21:16:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.667779
- Title: What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training
- Title(参考訳): Pass@kが計測できないこと: トレーニング後の多様性と能力維持を評価する
- Abstract要約: pass@$k$は、正しいサンプルの確率にのみ依存しており、どのように出力に分散するかという用語は存在しない。
これは、通常の認証に使用されるプロパティが欠落している標準評価プロトコルの具体例である、と我々は主張する。
- 参考スコア(独自算出の注目度): 4.500362688166346
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: pass@$k$, the fraction of problems a model solves within $k$ sampled attempts, is the field's default protocol for deciding whether reinforcement-learning (RL) post-training on verifiable rewards improved a model. At the population level, pass@$k$ depends only on a problem's probability of a correct sample, with no term for how it is distributed across outputs. We show this gap is not academic. Training Qwen2.5-1.5B-Instruct on grade-school math with Group Relative Policy Optimization (GRPO) and with rejection-sampling fine-tuning (RFT, training on the model's own shortest verifier-passed rollout) moves three complementary diversity measures (token-level entropy, answer-level entropy, unique answers per prompt) in opposite directions, with zero overlap across three seeds per arm. The gap survives restricting to verifier-correct completions only (lexical diversity among correct solutions is 15% lower for GRPO, after controlling for length) and a count-controlled check isolating diversity among incorrect answers alone, ruling out that GRPO's higher accuracy alone explains it. Yet pass@8 and pass@32 show no consistent winner on GSM8K, and a hard MATH-500 subset shows the same pattern: separation only at low $k$. Compared against the starting checkpoint, no trained arm significantly improves hard-problem coverage: RFT is significantly worse, while GRPO is statistically indistinguishable from it - so GRPO's pass@1 edge over RFT reflects a smaller loss relative to Base, not a capability gain, a missing-control issue, not a failure of pass@$k$. On GSM8K, only pass@1, with no role in detecting diversity by construction, separates the arms cleanly, rewarding the arm whose correct solutions are least diverse. We argue this is a concrete instance of a standard evaluation protocol missing a property it is routinely used to certify.
- Abstract(参考訳): pass@k$は、モデルが$k$のサンプル試行で解決する問題のごく一部であり、検証可能な報酬に対する強化学習(RL)後のトレーニングがモデルを改善したかどうかを判断するためのフィールドのデフォルトプロトコルである。
人口レベルでは、pass@$k$は正しいサンプルの確率にのみ依存する。
このギャップは学術的でないことを示す。
Qwen2.5-1.5B- Instruct on grade-school math with Group Relative Policy Optimization (GRPO) and with rejection-sampling fine-tuning (RFT, training on the model's own short least verifier-passed rollout)は、3つの相補的多様性尺度(token-level entropy, answer-level entropy, unique answer per prompt)を反対方向に移動させる。
このギャップは、検証正解のみに制限され(正しい解の語彙の多様性は、長さを制御した後、GRPOでは15%低い)、不正解の多様性を単独で分離するカウント制御チェックは、GRPOのより高い精度だけで説明できると判断する。
しかし、pass@8とpass@32はGSM8Kで一貫した勝者を示しておらず、硬いMATH-500サブセットは同じパターンを示している。
RFTとGRPOは統計的に区別できないため、GRPOのpass@1 edgeはBaseに対する損失が小さく、能力向上ではなく、コントロール不足の問題であり、pass@k$の失敗ではない。
GSM8Kでは、pass@1だけで、建設によって多様性を検知する役割はないが、腕をきれいに分離し、正しい解が最少の腕に報いる。
これは、通常の認証に使用されるプロパティが欠落している標準評価プロトコルの具体例である、と我々は主張する。
関連論文リスト
- Learning from the Gap Between Pass@K and Pass@1 [5.390994765967647]
本研究では,各クエリが検索なしで1つの応答を受信する単一サンプル復号法について検討し,検索対象の振る舞いをモデルに吸収できるかどうかを問う。
既存のトレーニング後レシピは、Kサンプル内で回収された障害から、最初のデコードで既に解決されている問題を一般的に区別するものではない。
本稿では、ソースチェックポイントの単一サンプル結果とPass@K-Pass@1ギャップ上の微調整によってトレーニングエビデンスを選択するGapFTを紹介する。
論文 参考訳(メタデータ) (2026-09-17T04:34:33Z) - When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion [0.0]
検証可能な報酬(RLVR)を用いた強化学習は、繰り返しサンプリング時にモデルを悪化させながら、一サンプル精度を向上させることができる。
トレーニング後、このポリシーはベースモデルよりも小さな問題を、大きな$k$で解決する可能性がある。
失敗は境界プロンプトに集中しており、ベースモデルにはサンプリングによって回復できる稀な正しい軌道が含まれており、有限のRLVRロールアウトグループに確実に現れるには小さすぎる。
論文 参考訳(メタデータ) (2026-07-12T17:17:18Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL [10.399451281089318]
我々はMiniGridをコア評価として,MuJoCoを境界応力試験として用いたPPO訓練剤について検討した。
私たちの監査では、報酬の洪水とセマンティック/API誤解という、2つの主要なワンショット障害モードを見つけました。
本稿では,トレーニング診断と障害モード分類ガイドが報酬関数の修正を対象とする,診断駆動反復改善法を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:57:43Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning [17.384089089363382]
既存の手法が見落としている根本原因を同定する。
現在のアプローチでは、グループ内のすべての誤ったロールアウトを同一に扱う。
非対称信頼度を考慮した誤り罰(ACE)を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:46:43Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking [49.8843966537226]
テスト時間スケーリング(TTS)は,大規模言語モデル(LLM)の推論能力向上に有効であることが証明された。
提案手法は「一問題・複数解」(1PNS)の学習パラダイムであり,モデルから妥当な推論軌跡を抽出する手法である。
Reasoning Path Divergence (RPD) を用いて、問題ごとの最大多様な解集合と微調整Qwen3-4B-Baseをキュレートする。
論文 参考訳(メタデータ) (2025-10-30T04:08:53Z) - Nudging the Boundaries of LLM Reasoning [77.26972440427285]
現在のオンライン強化学習アルゴリズムは、モデルに「解決不可能」な問題から学べない。
自己生成ヒントを用いてLLM推論の上界を推し進める「看護」手法であるNuRLを提案する。
NuRLは、テスト時間スケーリングを補完しながら、6つのベンチマークと3つのモデルで一貫した改善を実現している。
論文 参考訳(メタデータ) (2025-09-30T02:01:40Z) - The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning [37.13807960501503]
検証可能な報酬を伴う強化学習(RLVR)は、言語モデル(LM)のトレーニングに有望なアプローチである
我々は学習信号を正しい応答の強化と正負の正負の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の
我々は、NSRが不正確な世代を抑え、確率質量を他の可算候補に向けて再分配することで、モデルの以前の信念に導かれることを示す。
論文 参考訳(メタデータ) (2025-06-02T06:10:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。