論文の概要: VERPO: Verified Evidence Regularized Policy Optimization
- arxiv url: http://arxiv.org/abs/2609.06100v1
- Date: Sat, 05 Sep 2026 13:52:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.20227
- Title: VERPO: Verified Evidence Regularized Policy Optimization
- Title(参考訳): VERPO: 検証された証拠 正規化ポリシー最適化
- Abstract要約: 検証可能な結果報酬は、言語モデルポストトレーニングをガイドするが、シーケンスレベルの利点は、どのトークンレベルの決定を保存または修正すべきかを特定しない。
検証エビデンス正規化政策最適化フレームワークであるVERPOを紹介する。
これは、証拠のない参照復元と署名されたトークンレベルの証拠修正を分離する。
- 参考スコア(独自算出の注目度): 14.40177244052392
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Verifiable outcome rewards guide language-model post-training, but sequence-level advantages do not identify which token-level decisions should be preserved or revised. Evidence-conditioned Teachers provide denser supervision by replaying sampled trajectories with privileged feedback. Yet indiscriminate imitation risks transferring formatting or reasoning-style shifts that do not support task success. We introduce VERPO, a Verified Evidence Regularized Policy Optimization framework that treats evidence as a proposal for policy correction while retaining the outcome objective. It separates evidence-free reference restoration from signed token-level evidence corrections. Fisher Evidence Contrast attenuates corrections along an estimated evidence-presence direction. A stopped token-wise ZPD controller scales acceptance according to local reward alignment and Fisher movement cost, while the reference channel remains independent of acceptance. Across five scientific-reasoning and tool-use tasks, the best variant on each backbone exceeds the strongest compared baseline in average score. The averages rise from 0.6826 to 0.6857 on Qwen3-4B, from 0.6895 to 0.7058 on Qwen3-8B, and from 0.4751 to 0.5657 on Llama-3.2-1B.
- Abstract(参考訳): 検証可能な結果報酬は、言語モデルポストトレーニングをガイドするが、シーケンスレベルの利点は、どのトークンレベルの決定を保存または修正すべきかを特定しない。
エビデンス条件の教師は、特権的なフィードバックでサンプルトラジェクトリを再生することで、より密集した監督を提供する。
しかし、模倣の非差別化は、タスクの成功をサポートしないフォーマットや推論スタイルのシフトを転送するリスクを負う。
結果の目標を維持しつつ、政策修正の提案として証拠を扱い、検証された証拠の正則化政策最適化フレームワークであるVERPOを紹介する。
これは、証拠のない参照復元と署名されたトークンレベルの証拠修正を分離する。
フィッシャー・エビデンス・コントラスト(Fisher Evidence Contrast)は、推定されたエビデンス・プレゼンス方向に沿って補正を減衰させる。
停止トークンワイズZPDコントローラは、参照チャネルが受け入れから独立している間、局所的な報酬アライメントとフィッシャー移動コストに応じて受け入れをスケールする。
科学的推論とツール使用の5つのタスクの中で、各バックボーンの最良の変種は平均スコアにおいて最強のベースラインを超えた。
平均はQwen3-4Bで0.6826から0.6857、Qwen3-8Bで0.6895から0.7058、Llama-3.2-1Bで0.4751から0.5657に上昇する。
関連論文リスト
- Candidate Comparability Before Promotion: Conditional Validation in Adaptive Network Intrusion Detection [0.0]
後続の攻撃検出に責任があるモデルを変更するため、プロモーションはセキュリティ関連である。
自己完結型チャレンジャーパイプラインによるCICIDS 2017 UNSW-NB15とToN-IoTへの依存性をテストする。
クラス当たり512から2,000のサンプルから名目上の候補証拠の蓄積により、プール構築されたプログレッシブドリフト(+0.53, +1.67, +0.38)による昇進が向上した。
論文 参考訳(メタデータ) (2026-09-03T18:55:09Z) - FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience [18.64380706071327]
FlowBalanceは、完全応答上の正規化分布を学習する検証器による自己改善手法である。
オンラインの軌跡ごとに、同じポリシーの凍結されたトレーニングタイムビューは、特権付きコンテキストを使用してトークンレベルのログ確率ゲインを生成する。
分析では, 群内コントラスト保存, 最小値逆KL特性, 目標報酬の単調検証, 拒否応答に対する偽陽性自己誘導に対する正確な補正が確立された。
論文 参考訳(メタデータ) (2026-09-03T00:47:11Z) - PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization [40.91256615677526]
本稿では,好みを安定的に最適化するための後ラベル補正DPOを提案する。
主要な考え方は、適切な修正措置を取るために、政策基準マージンをオンライン証拠として使うことである。
PLC-DPOは、DPOに対する最良の平均勝利率を得る(次ベット法では60.5対55.5)
論文 参考訳(メタデータ) (2026-08-31T11:11:33Z) - Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification [1.547549252134621]
本稿では,クロスフィット型残効ユーティリティとプライマリ保存型認知決定ポリシーを用いて,推論後の問題について検討する。
構造化されたkan-Fourier分類器はデフォルトの確率を提供し、ニューラルおよび非ニューラル候補は観測可能な証拠を提供する。
RMLA、RMLB、HISARでは、完全なシステムは全体の精度を63.632%から66.332%、65.161%から66.168%、77.769%から79.867%に改善している。
論文 参考訳(メタデータ) (2026-08-03T11:07:37Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - ContainmentBench: Trace-Based Evaluation of Post-Injection Containment in Tool-Using LLM Agents [4.018837636907658]
我々は、ベンチマーク定義のエンドポイントポリシーコンプライアンスを測定するサンドボックスベースのトレースベースのベンチマークを導入する。
集計されたスレッドのランキングは、エビデンスステージの構成と分母の選択によって変化する。
これらの結果から, 終端政策ラベルは, 被曝後の封じ込めに十分な統計量ではないことが示唆された。
論文 参考訳(メタデータ) (2026-07-27T04:51:20Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。