論文の概要: From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
- arxiv url: http://arxiv.org/abs/2607.23802v1
- Date: Sun, 26 Jul 2026 19:04:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.229835
- Title: From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
- Title(参考訳): RLVRからRTSVRへ:タスク変換はオープンエンディングLDM自己改善のための自己検証リワードを誘導する
- Authors: Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao,
- Abstract要約: RLVR(Reinforcement Learning with Verifiable Rewards)は、推論指向の大規模言語モデル(LLM)の最近の進歩を推進している。
本稿では、RLVRをオープンなタスクに拡張するためのタスク変換に基づくトレーニングパラダイムであるRLSVR(Reinforcement Learning with Self-Verifiable Rewards)を提案する。
SpyRLは、誰にインスパイアされたマルチエージェントのセルフプレイ環境だ。
- 参考スコア(独自算出の注目度): 56.26277769790695
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has driven recent progress in reasoning-oriented large language models (LLMs) by enabling large-scale optimization. However, its applicability remains largely limited to domains such as mathematics and coding, where correctness can be deterministically verified. Open-ended tasks instead often rely on human preferences, reward models, or LLM-based judges, introducing evaluation bias, judge capability bottlenecks, and additional inference costs.Drawing on the principle of self-supervised learning, which constructs pretext tasks to derive supervision from the data itself, we propose Reinforcement Learning with Self-Verifiable Rewards (RLSVR), a task-transformation-based training paradigm for extending RLVR to open-ended tasks. RLSVR transforms open-ended tasks into verifiable proxy environments whose internal rules and interaction outcomes automatically generate reward signals. We instantiate RLSVR with SpyRL, a multi-agent self-play environment inspired by Who Is the Spy?. Agents receive asymmetric information, complete the same target task, and vote to identify a designated spy. Because the spy identity is predetermined, voting outcomes provide fully verifiable rewards, while successful identification remains closely related to output quality. Experiments on text summarization, creative writing, and mathematical reasoning show that SpyRL outperforms existing self-improvement methods on non-verifiable tasks and yields consistent gains on verifiable reasoning tasks. These results demonstrate that task transformation can extend scalable RLVR-based self-improvement beyond inherently verifiable domains. Models and code have been released at https://github.com/wangqinsi1/SpyRL.
- Abstract(参考訳): Reinforcement Learning with Verifiable Rewards (RLVR)は、大規模最適化を実現することによって、推論指向の大規模言語モデル(LLM)の最近の進歩を促している。
しかし、その適用性は数学やコーディングのような領域に限られており、正確性は決定論的に検証できる。
オープンエンドタスクは、人間の嗜好、報酬モデル、LLMベースの判断に頼り、評価バイアス、判断能力ボトルネック、追加の推論コストに頼り、データ自体から教師付きタスクを導出する自己監督学習の原則に基づき、RLVRをオープンエンドタスクに拡張するためのタスク変革ベースのトレーニングパラダイムであるRLSVR(Reinforcement Learning with Self-Verifiable Rewards)を提案する。
RLSVRはオープンなタスクを検証可能なプロキシ環境に変換し、内部ルールとインタラクションの結果が自動的に報酬信号を生成する。
SpyRLは、誰にインスパイアされたマルチエージェントのセルフプレイ環境だ。
と。
エージェントは非対称な情報を受信し、同じターゲットタスクを完了し、指定されたスパイを特定する投票を行う。
スパイのアイデンティティが規定されているため、投票結果は完全な検証可能な報酬を提供するが、成功した識別は出力品質と密接に関連している。
テキスト要約、創造的記述、数学的推論の実験により、SpyRLは検証不可能なタスクにおける既存の自己改善手法よりも優れており、検証可能な推論タスクにおいて一貫した利得が得られることが示された。
これらの結果は、タスク変換が本質的に検証可能なドメインを超えてスケーラブルなRLVRベースの自己改善を拡張できることを示します。
モデルとコードはhttps://github.com/wangqinsi1/SpyRLでリリースされた。
関連論文リスト
- From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Auditable-choice reframing unlocks RL-based verification for open-ended tasks [23.12421867559344]
Verible Multiple-Choice Reformulation (VMR)は、オープンエンドデータを検証可能な複数選択形式に再構成する新しいトレーニング戦略である。
8つのオープンエンドベンチマークで、VMRベースのトレーニングはベースラインで平均5.99ポイント向上します。
論文 参考訳(メタデータ) (2025-11-04T10:45:52Z) - LaSeR: Reinforcement Learning with Last-Token Self-Rewarding [54.72617309922891]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の推論能力を高めるためのコアパラダイムとして登場した。
従来、LLMは2つの異なるプロンプトテンプレートを使用してソリューションと自己検証をシーケンシャルに生成し、効率を大幅に低下させる必要があった。
本稿では,従来のRLVR損失をMSE損失で増大させるアルゴリズムであるLaSeR(Reinforcement Learning with Last-Token Self-Rewarding)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:55:11Z) - Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards [11.149294285483782]
我々は、検証不可能なタスクと検証可能な報酬のギャップを埋める統一的なRLVRベースのトレーニングパラダイムを提案する。
本稿では,GenRMとBootstrapped Relative Policy Optimization (BRPO)アルゴリズムを提案する。
提案手法は,LLMが微調整を監督せずに堅牢な書込み機能を開発する上で有効である。
論文 参考訳(メタデータ) (2025-05-30T14:34:57Z) - Learning to Reason without External Rewards [100.27210579418562]
RLVR(Reinforcement Learning with Verifiable Rewards)による複雑な推論のための大規模言語モデル(LLM)の訓練は、費用がかかるドメイン固有の監督に依存して効果的であるが制限されている。
内部フィードバックからの強化学習(Reinforcement Learning from Internal Feedback, RLIF)は、LLMが外部の報酬やラベル付きデータなしで本質的な信号から学習できるフレームワークである。
本稿では,モデル自身の信頼度を利用したRLIF手法であるIntuitorについて,その唯一の報奨信号として自己確実性(self-certainty)を提案する。
論文 参考訳(メタデータ) (2025-05-26T07:01:06Z) - Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards [67.86091419220816]
大規模言語モデル(LLM)は複雑な推論において非常に有望である。
一般的な問題は表面的な自己回帰であり、モデルが自身の出力をしっかりと検証できない。
本稿では、RISE(Reinforce Reasoning with Self-Verification)という新しいオンラインRLフレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-05-19T17:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。