論文の概要: Quality-Diversity Stress Tests for Process Reward Models:What Archive Coverage Can and Cannot Certify
- arxiv url: http://arxiv.org/abs/2608.08008v1
- Date: Sat, 08 Aug 2026 08:41:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.602041
- Title: Quality-Diversity Stress Tests for Process Reward Models:What Archive Coverage Can and Cannot Certify
- Title(参考訳): プロセス・リワードモデルの品質多様性ストレステスト:アーカイブ・カバレッジが証明し得ないもの
- Abstract要約: MAP-Elites を用いた品質多様性探索問題として PRM ストレス試験を定式化する。
有限セル修復は、カバーセルのテールリスクと平均残酷さを境界とするが、カバーレートだけでは最悪の残酷なセルをバウンドすることはできない。
事前宣言されたペアのLoRA修復プロトコルは、攻撃率が0.148から0.037から0.074に減少し、最悪の攻撃は0.333から0.177から0.212に減少し、最高の4つの精度を低下させることなくAUROCのランキングを改善する。
- 参考スコア(独自算出の注目度): 1.0742675209112622
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Process reward models (PRMs) score intermediate reasoning steps and are widely used for search, ranking, and training, but optimization can exploit these learned proxies by increasing reward while turning correct reasoning into incorrect reasoning. We formulate PRM stress testing as a quality-diversity search problem using MAP-Elites, retaining the most severe correctness-flipping edit in each behavior-space region while separating search coverage from exploit coverage. We characterize what such archives certify: finite-cell repair bounds covered-cell tail risk and average residual severity but cannot bound the worst remaining cell from covered fraction alone; under Lipschitz post-repair loss and metric-cover auditing, the residual is bounded by archive fitting error plus the Lipschitz constant times the covering radius. A controlled landscape validates this certificate and the impossibility of any fraction-only worst-case guarantee. On real PRMs, the search reveals an aggregation-dependent vulnerability in Qwen2.5-Math-PRM-7B: padding yields 44 strict exploits with maximum gain 0.294 under mean pooling versus one exploit under minimum readout; a matched syntactic control isolates the mechanism, and an RLHFlow value-head model shows the same qualitative effect with maximum gain 0.005. A predeclared paired LoRA repair protocol reduces exploit rates from 0.148 to 0.037 to 0.074, lowers the worst attack from 0.333 to 0.177 to 0.212, improves ranking AUROC without degrading best-of-4 accuracy, attributes gains to adversarial fine-tuning rather than archive diversity, and is confirmed by independent unpaired replications (44 to 1, clean-split worst gain 0.0092, MATH-500 41 to 0, clean ranking 40/40).
- Abstract(参考訳): プロセス報酬モデル(PRM)は、中間推論ステップをスコアし、検索、ランキング、トレーニングに広く使用されているが、最適化は、正しい推論を誤った推論に変えながら報酬を増大させることで、これらの学習したプロキシを利用することができる。
我々は、MAP-Elitesを用いてPRMストレステストを品質多様性探索問題として定式化し、各行動空間領域において最も厳密な正当性フライング編集を維持しながら、検索カバレッジとエクスプロイトカバレッジを分離する。
有限セル補修は、カバーセルのテールリスクと平均残重大度を束縛するが、カバーレートのみから最悪の残余セルを束縛することはできない;リプシッツの余剰損失と計量被覆監査の下では、残余はアーカイブフィッティングエラーとカバー半径のリプシッツ定数倍で束縛される。
制御されたランドスケープは、この証明書と、分数のみの最悪の保証が不可能であることを検証します。
実際のPRMでは,Qwen2.5-Math-PRM-7Bにおけるアグリゲーション依存の脆弱性が明らかとなり,最大利得が0.294で44個の厳密なエクスプロイトが平均利得が0.294で,最小利得が0.294で,一致した構文制御が機構を分離し,RLHFlow値ヘッドモデルが最大利得0.005で同じ定性的効果を示す。
事前宣言されたペア化LoRA修復プロトコルは、エクスプロイトレートを0.148から0.037から0.074に下げ、最悪の攻撃を0.333から0.177から0.212に下げ、最高の4の精度を低下させることなくAUROCをランク付けし、アーカイブの多様性よりも敵の微調整による属性ゲインを向上し、独立したアンペアレプリケーション(44から1、クリーンスプリットの最低ゲイン0.0092、MATH-500 41から0、クリーンランキング40/40)によって確認する。
関連論文リスト
- Valid Per-Field Selective Risk Control for Document Extraction: Three Failure Modes, a Validity Ladder, and When Conditioning Pays [0.0]
フィールド単位の受け入れ/レビューは、ほとんどのアルファ版において選択的なリスクを持つが、信頼契約文書抽出システムを必要とする。
13,859 個の CORD レシート (49.0% ) からの真の Claude-sonnet-5 フィールドでは、3 つの障害モードを診断する。
シードピンでレグレッション付きプロシージャを備えたApache-2.0がリリースされた。
論文 参考訳(メタデータ) (2026-07-28T17:08:50Z) - Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion [46.262619407930266]
我々は、専門家のMITRE Center for Threat-Informed Defense mappingsから1,207 CVEのキュレートされた金のデータセットにマルチラベル分類器をトレーニングする。
その結果得られたモデルは、ゼロショットの埋め込み類似性のベースラインと比較して、おおよそdoubles recall@5である。
次に,LLMによるラベリングが金のデータセットを拡張できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-28T10:59:04Z) - Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs [0.0]
小作農の絵ベースの農業保険では、被害検出の欠落は誤報よりもかなり高いコストがかかる。
本稿では,2段階のカスケードアーキテクチャであるCascadeCropNetを提案する。
軽量のセンチネルモデルでは2値の健康トリアージを行い、キャリブレーションされた損傷確率閾値タウを超えるサンプルを専門家モデルにエスカレーションして詳細な診断を行う。
論文 参考訳(メタデータ) (2026-07-28T09:01:27Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - RUBRIC: Realism--Utility Balanced Ranking for Imbalanced Classification [38.8278639079174]
クラス不均衡は、詐欺検出や診断などのリスクに敏感なアプリケーションにおいて、根本的な課題となる。
そこで, RUBRICは, 合成試料選択を品質/周波数最適化問題として定式化する, ジェネレータに依存しないフィルタリングフレームワークである。
RUBRICはF1マクロとリコールを改善しつつ,複数のジェネレータ間で同等のROC-AUCを維持していることを示す。
論文 参考訳(メタデータ) (2026-07-10T06:37:12Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - RVPO: Risk-Sensitive Alignment via Variance Regularization [13.192921543523283]
本稿では, 利便集約時のリワード間分散をペナルティ化するリスクセンシティブなフレームワークであるReward-Variance Policy Optimization (RVPO)を提案する。
我々はTaylor拡張を通して、LogSumExp(SoftMin)オペレータがスムーズな分散ペナルティとして効果的に働くことを示す。
モデルがより簡単な目的を活かすために難しい制約を無視しないようにすることで、RVPOはHealthBenchの全体的なスコアを改善する。
論文 参考訳(メタデータ) (2026-05-07T06:43:05Z) - Predictive Entropy Links Calibration and Paraphrase Sensitivity in Medical Vision-Language Models [2.064612766965483]
我々は,MedGemma 4BITの分布MIMIC CXRと外分布PadChest chest X ray データセットの5つの不確実性定量化手法を示し,LLaVA RAD7Bのクロスアーキテクチャ検証を行った。
うまく校正された単一モデル法では、一方のフォワードパスからの予測エントロピーは、メドジェマのAUROC 0.711、LLaVARAD p 10 4の0.878、信頼できないと敏感な予測の両方を1つのエントロピーしきい値でフラグ付けることができる。
論文 参考訳(メタデータ) (2026-04-10T04:18:47Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Causally-Enhanced Reinforcement Policy Optimization [36.523007244998695]
Causally-Enhanced Policy Optimization (CE-PO)は、因果一貫性のための異なるプロキシでポリシー最適化を強化する、ドロップイン報酬形成フレームワークである。
CE-POは、ヤコビアンに基づく感性によるモデル内部の影響を推定し、これらのシグナルを反実的に硬化させてニュアンスを抑えるとともに、結果のコヒーレンススコアをタスク精度フィードバックと融合させる。
4つのデータセットにわたる実験結果から、CE-POは平均で5.49%の精度(最大9.58%)を向上し、相関因果フリップや光対実編集による堅牢性を改善した。
論文 参考訳(メタデータ) (2025-09-27T04:10:16Z) - Probabilistic Soundness Guarantees in LLM Reasoning Chains [37.440902632372904]
ARES(Autoregressive Reasoning Entailment Stability)は、事前に検証された前提のみに基づいて、各推論ステップを評価する確率的フレームワークである。
ARESは4つのベンチマークで最先端のパフォーマンスを達成し、非常に長い合成推論チェーン上で優れた堅牢性を示す。
論文 参考訳(メタデータ) (2025-07-17T09:40:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。