論文の概要: AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification
- arxiv url: http://arxiv.org/abs/2608.25637v1
- Date: Wed, 26 Aug 2026 11:06:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.775479
- Title: AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification
- Title(参考訳): AutoVerifier:Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification
- Authors: Zebei Zhao, Zhihao Shi, Minqi Shi,
- Abstract要約: AutoVerifierは繰り返し検証エラーから暗黙の仮定を学ぶ。
4つの検証器ベンチマークの実験により、AutoVerifierは最先端の検証器を大きなマージンで上回ることを示した。
- 参考スコア(独自算出の注目度): 5.990350746292239
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reference-based verifiers are important for evaluating reasoning models and providing accurate outcome rewards in reinforcement learning with verifiable rewards. To improve verification accuracy, prior work has explored rule-based, model-based, and tool-augmented verifiers for checking answer equivalence across diverse answer forms. However, the equivalence of answer forms such as $1+3.14$ and $1+π$ may depend on the question and scoring criterion. We frame such implicit assumptions as verifier inductive biases. To address this challenge, we propose AutoVerifier, a residual-guided non-parametric optimization method that learns these biases from recurring verifier errors. Specifically, AutoVerifier records these biases in rule cards and promotes them to code modules or prompt guidance only after replay validation detects no direct regressions, keeping accepted updates auditable, editable, and reusable. Experiments on four verifier benchmarks demonstrate that AutoVerifier outperforms state-of-the-art verifiers by a large margin.
- Abstract(参考訳): 基準ベース検証は、推論モデルの評価と、検証可能な報酬を用いた強化学習における正確な結果報酬の提供に重要である。
検証精度を向上させるために、先行研究では、様々な回答形式にまたがる回答等価性をチェックするためのルールベース、モデルベース、ツール拡張検証について検討している。
しかし、1+3.14$ や 1+π$ のような解形の同値性は、質問やスコアリング基準に依存するかもしれない。
我々は、検証帰納バイアスのような暗黙の仮定を定めている。
この課題に対処するために,残差誘導非パラメトリック最適化法であるAutoVerifierを提案する。
具体的には、AutoVerifierはこれらのバイアスをルールカードに記録し、リプレイバリデーションが直接回帰を検知せず、承認された更新を監査可能、編集可能、再利用可能なものにした後のみ、コードモジュールやガイダンスにプロンプトする。
4つの検証器ベンチマークの実験により、AutoVerifierは最先端の検証器を大きなマージンで上回ることを示した。
関連論文リスト
- FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality [24.614192550852277]
モデル生成の正当化が、ユーザーが正しい回答を正しく区別するのに役立つかどうかに関して、標準的な手段は存在しない。
我々は、このアイデアを誤り検証可能性として形式化し、正当性によってレーダが解答正当性を正確に評価できるかどうかを測るバランスの取れた指標である$v_textbal$を提案する。
本稿では, 数学的推論のためのリフレクション・アンド・リフレーズ (RR) と, 事実QAのためのオラクル・リフレーズ (OR) の2つの手法を提案する。
論文 参考訳(メタデータ) (2026-04-06T04:53:59Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense [36.71358559780692]
HEROは、検証者信号と報酬モデルスコアを構造化された方法で統合する強化学習フレームワークである。
HEROはRMのみのベースラインと検証者のみのベースラインを一貫して上回り、検証可能なタスクと検証しにくいタスクの両方で大きな利益を上げている。
論文 参考訳(メタデータ) (2025-10-08T17:09:41Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification [118.03466985807331]
我々は、FVの関連性よりも、クレーム検証者が取得した証拠から導出する実用性に焦点を当てる必要があると論じる。
本稿では,エビデンス検索プロセスの最適化に,クレーム検証器からのフィードバックを取り入れたフィードバックベースのエビデンス検索手法(FER)を提案する。
論文 参考訳(メタデータ) (2023-10-18T02:59:38Z) - Benchmarking Answer Verification Methods for Question Answering-Based
Summarization Evaluation Metrics [74.28810048824519]
質問応答に基づく要約評価メトリクスは、QAモデルの予測が正しいかどうかを自動的に判断する必要がある。
筆者らは,現在QAベースのメトリクスで使用されている語彙的回答検証手法と,より洗練された2つのテキスト比較手法をベンチマークした。
論文 参考訳(メタデータ) (2022-04-21T15:43:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。