論文の概要: Are Verifier Errors Independent Within a GRPO Group? Evidence from Qwen2.5 Rollouts
- arxiv url: http://arxiv.org/abs/2609.06386v1
- Date: Sun, 06 Sep 2026 04:56:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.233328
- Title: Are Verifier Errors Independent Within a GRPO Group? Evidence from Qwen2.5 Rollouts
- Title(参考訳): GRPOグループ内で検証エラーは独立しているか?Qwen2.5ロールアウトからの証拠
- Abstract要約: 検証可能な報酬(RLVR)を用いたグループベース強化学習は、自動検証器を用いて、プロンプト毎に複数の完了点をスコアする。
本研究では,Qwen2.5-1.5B onMATH,GSM8K,DeepMath-103Kにより生成された8つの完了の24,998基の依存性について検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Group-based reinforcement learning with verifiable rewards (RLVR) scoresmultiple completions per prompt using automatic verifiers. Analysesbased on independent verifier errors may overlook dependence associatedwith shared answer formats. We investigate this dependence in24,998 groups of eight completions generated by Qwen2.5-1.5B onMATH, GSM8K, and DeepMath-103K. We estimate a pooled within-groupverifier-error correlation of 0.530 (95% confidence interval:0.500--0.560). Under an exchangeable-error model, this correspondsto a design-effect-adjusted effective sample size of 1.70 for aneight-completion group. Dependence varies substantially across answerforms: fractions, radicals, symbolic expressions, and intervals exhibitstronger clustering than unit annotations and percent signs. Replayinggroup-relative advantages across four rule-based verifier configurationsidentifies at least one advantage-sign disagreement in up to 0.83% ofgroups. Because a group is repeated sampling for one prompt, thiswithin-group clustering may reflect shared prompt difficulty as well asshared answer form, and we do not attempt to separate the two here.Unlike studies of correlated judgments across multiple evaluators, ouranalysis examines dependence across completions scored by the sameverifier. These findings motivate prompt- and answer-form-aware analysesof verifier noise rather than characterizations based solely onaggregate error rates.
- Abstract(参考訳): 検証可能な報酬(RLVR)を用いたグループベース強化学習は、自動検証器を用いて、プロンプト毎に複数の完了点をスコアする。
独立検証器のエラーに基づく分析は、共有回答形式に関連付けられた依存を見逃す可能性がある。
本研究は, Qwen2.5-1.5B onMATH, GSM8K, DeepMath-103K で生成した8つの完了点の24,998群について検討した。
グループ検証器内エラー相関を0.530(95%信頼区間:0.500--0.560)と推定した。
交換可能なエラーモデルの下では、これはアニート・コンプリート・グループに対する設計効果調整された有効サンプルサイズ 1.70 に対応する。
依存は応答形式によって大きく異なる: 分数、根基、記号表現、インターバルは単体アノテーションやパーセンテージ記号よりもストロンガークラスタリングを示す。
リプレイング群-相対的な4つのルールベースの検証器の構成上の利点は、最大0.83%のグループの少なくとも1つの利点符号の不一致を証明している。
グループを1つのプロンプトに対して繰り返しサンプリングするので、このグループクラスタリングは共有の急激な難易度や解答形式を反映する可能性があり、ここでは2つを分離しようとはしない。
これらの知見は,アグリゲート誤り率のみに基づく評価よりも,アグリゲーションノイズとアグリゲーションノイズによる検証ノイズの分析を動機付けている。
関連論文リスト
- CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning [6.428392127849263]
本稿では,複数のVLM応答を共有意味応答空間にマッピングする訓練不要不確実性フレームワークCUSPを提案する。
本稿では,集合的不確実性,プール化意見の分散,ジェンセン・シャノン発散(JSD)の2つの相補的システムレベル信号について報告する。
静的なマルチVLMアンサンブルでは、集合的不確実性は小モデル状態において最強の信号である。
論文 参考訳(メタデータ) (2026-09-04T20:27:47Z) - Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents [1.4915002678801434]
ボンフェロニ配置は分布自由であるが,相関誤差下では保守的であることを示す。
粗いラベルの選択は、学習された依存なしにほぼ完璧な相関関係を作ることができる。
ステージ単位の証明書とペアの重なり合うバウンドを用いたモジュール証明書は、正の平均利得が0.6%となる。
論文 参考訳(メタデータ) (2026-08-04T23:48:36Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Socio-Conformal Calibration in Complex Survey Data: Marginal Validity Is Not Enough for Subgroup Reliability [1.089614199781423]
我々は,Pew American Trends Panel上での5段階のAI態度予測の順序性予測について検討した。
標準コンフォメーションは4つのベース予測器全てに対して名目上の限界範囲を達成しているが、重み付けされたサブグループギャップは13ポイントである。
最強の予測者(XGBoost)にとって、モンドリアンは公平性と効率性のトレードオフを悪化させる。
グループしきい値を大域量子化に向けて縮小する正規化コンパレータは、この不安定性を緩和する。
論文 参考訳(メタデータ) (2026-05-07T01:10:48Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z) - A structured regression approach for evaluating model performance across intersectional subgroups [53.91682617836498]
分散評価(disaggregated evaluation)は、AIフェアネスアセスメントにおける中心的なタスクであり、AIシステムのさまざまなサブグループ間でのパフォーマンスを測定することを目的としている。
非常に小さなサブグループであっても,信頼性の高いシステム性能推定値が得られることを示す。
論文 参考訳(メタデータ) (2024-01-26T14:21:45Z) - Advancing Vision Transformers with Group-Mix Attention [59.585623293856735]
グループミクス・アテンション(GMA)は、従来の自己アテンションの先進的な代替品である。
GMAは、さまざまなグループサイズとトークン・ツー・トークン・ツー・グループ、グループ・ツー・グループ相関を同時に取得する。
GroupMixFormerは、画像分類、オブジェクト検出、セマンティックセグメンテーションにおける最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-11-26T01:25:03Z) - Examining and Combating Spurious Features under Distribution Shift [94.31956965507085]
我々は、最小限の統計量という情報理論の概念を用いて、ロバストで刺激的な表現を定義し、分析する。
入力分布のバイアスしか持たない場合でも、モデルはトレーニングデータから急激な特徴を拾い上げることができることを証明しています。
分析から着想を得た結果,グループDROは,グループ同士の相関関係を直接考慮しない場合に失敗する可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-14T05:39:09Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。