論文の概要: SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.26873v1
- Date: Wed, 29 Jul 2026 13:03:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.684122
- Title: SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
- Title(参考訳): SERPO:オープンエンディングテスト時間強化学習のための自己進化型ルーブリックポリシー最適化
- Authors: Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen,
- Abstract要約: テスト時強化学習(TTRL)により、ラベル付きフィードバックなしで推論時に言語モデルを自己進化させることができる。
SERPOを導入し、回答投票をクローズドループに置き換え、レスポンスエビデンス、クエリトケン、ポリシーパラメータを共進化させる。
新しいアクターロールアウトはアーカイブとルーリックの両方をリフレッシュし、3方向の進化ループを閉じる。
- 参考スコア(独自算出の注目度): 14.505575259468053
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time reinforcement learning (TTRL) enables language models to self-evolve at inference time without labeled feedback. Existing methods rely on answer voting and therefore do not extend naturally to open-ended generation, where valid responses cannot be mapped to a shared canonical answer. Without external reward models or stronger judges, adaptation must instead construct reliable rewards from the model's own outputs. We introduce SERPO (Self-Evolving Rubric Policy Optimization), which replaces answer voting with a closed loop that co-evolves response evidence, query-specific rubrics, and policy parameters. Good-Normal-Bad (G-N-B) response evolution organizes maximally separated rollouts into ordered archives; rubric evolution retains criteria that discriminate these archives; probabilistic criterion scoring converts verdict-token likelihoods into reward signals; and policy evolution optimizes the actor with the resulting signals. New actor rollouts then refresh both the archives and rubrics, closing the three-way evolution loop. Across two model configurations, two in-domain benchmarks, and four OOD benchmarks, SERPO improves HealthBench and ResearchQA by up to 20.63 and 20.31 points over the corresponding base models, raises the six-benchmark macro-average by up to 8.06 points, and supports OOD transfer and continued cross-benchmark evolution.
- Abstract(参考訳): テスト時強化学習(TTRL)により、ラベル付きフィードバックなしで推論時に言語モデルを自己進化させることができる。
既存の手法は解答投票に依存しているため、有効応答を共有正準応答にマッピングできないようなオープンエンド生成に自然に拡張することができない。
外部報酬モデルや強力な審査員がいなければ、適応はモデル自身の出力から信頼できる報酬を構築する必要がある。
SERPO(Self-Evolving Rubric Policy Optimization)を導入し、回答投票をクローズドループに置き換える。
Good-Normal-B (G-N-B) 応答の進化は、最大限に分離されたロールアウトを順序づけられたアーカイブに整理し、ルーブリック進化は、これらのアーカイブを識別する基準を維持し、確率的基準スコアリング(probabilistic criterion score)は、評定確率を報奨信号に変換し、ポリシーの進化は、結果として得られる信号でアクターを最適化する。
新しいアクターロールアウトはアーカイブとルーリックの両方をリフレッシュし、3方向の進化ループを閉じる。
2つのモデル構成、2つのドメイン内ベンチマーク、4つのOODベンチマークにおいて、SERPOはHealthBenchとResearchQAを20.63および20.31ポイント改善し、平均6ベンチマークのマクロ平均値を8.06ポイント引き上げ、OOD転送をサポートし、クロスベンチマークの進化を継続する。
関連論文リスト
- Co-Evolving LLM Evaluators and Policies via DynamicRubric [67.2962847914162]
政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
論文 参考訳(メタデータ) (2026-07-22T12:35:40Z) - The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators [17.44053709945519]
自己改善エージェントはエージェントコーディングベンチマークの最先端(SOTA)であり、最近一般的なドメインに拡張されている。
非定常ユーティリティ下での自己改善のための進化的フレームワークであるRed Queen Godel Machine(RQGM)を紹介する。
RQGMは、補完的なエージェント・アズ・ア・ジャッジ・コード・レビュー信号を追加することにより、以前のSOTAよりもテストパス率を向上させることを示す。
次に、科学論文の執筆とレビュー、オリンピアードレベルの証明の執筆と評価に目を向け、RQGMは以前の自己改善エージェントよりもパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-06-24T18:38:26Z) - EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning [22.209572966965165]
EvoRubricsは、ポリシージェネレータとRLジェネレータが、各トレーニングステップ内の対角的相互作用を通じて共同で改善される、共進化的なフレームワークである。
EvoRubricsは、ベンチマーク全体で、静的および動的ルーブリックを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-22T08:46:23Z) - INFUSER: Influence-Guided Self-Evolution Improves Reasoning [54.101135873140066]
2つの共進化的役割を持つ反復的協調学習フレームワークを導入する。
解答器は、生成元が提供する回答に対して標準正当性報酬で訓練される。
8B INF共進化ジェネレータは、数学とコーディングにおいて凍った32B思考ジェネレータより優れている。
論文 参考訳(メタデータ) (2026-06-08T05:40:36Z) - EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics [86.49781345669436]
言語モデルは事前学習からかなりの評価知識を符号化する。
現在のポストトレーニング手法は、報酬信号を生成するために外部の監督に依存している。
EVOLMは、モデルの評価能力を明示的な識別的ルーブリックに構造化する手法である。
論文 参考訳(メタデータ) (2026-05-05T15:31:00Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。