論文の概要: The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning
- arxiv url: http://arxiv.org/abs/2608.21871v1
- Date: Sat, 22 Aug 2026 09:30:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.498118
- Title: The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning
- Title(参考訳): LLMのゼロデータ推論のためのセルフプレイ「Chase」
- Abstract要約: LUREでは、LLMエバーダが各環境の難易度軸に沿ってタスクを配置し、検証可能な相互作用を通じてタスクを追尾する追尾者の一歩先にとどまる。
追従者は、共進化を安定に維持するラウンドアンコールKLの下で、単調検証器の進行が終端捕捉と共同でグループ正規化される捕捉アンコール密プロセスクレジットを得る。
- 参考スコア(独自算出の注目度): 6.195031716121927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards has become the dominant recipe for improving large language model reasoning, yet it presumes large human-curated task collections. Zero-data self-play removes this dependency, but existing methods vet learnability only by probing candidates and rejecting post hoc, never learning where along an environment's difficulty axis to place a task, and credit the solver with sparse terminal rewards alone. We recast zero-data self-play as a pursuit-evasion game: in LURE, an LLM evader positions tasks along each environment's difficulty axis to stay one step ahead of a planner-executor pursuer that hunts it down through verifiable interaction. The evader is trained on a capture-frontier reward that peaks when the solver captures it on exactly half of its rollouts, turning barely catchable into a learned positioning strategy rather than a hand-tuned rejection band. The pursuer earns capture-anchored dense process credit, in which monotone verifier progress is group-normalized jointly with the terminal capture under a round-anchored KL that keeps the co-evolution stable. Across three verifiable reasoning environments and three backbone families, LURE outperforms advanced baselines under unified/specialist settings, while the unified model attains stronger aggregate OOD zero-shot accuracy than all trained baselines across nine held-out benchmarks from three task families.
- Abstract(参考訳): 検証可能な報酬を伴う強化学習は、大規模な言語モデル推論を改善する主要なレシピとなっているが、大規模な人為的なタスクコレクションが想定されている。
ゼロデータの自己プレイは、この依存関係を排除しますが、既存の方法は、候補を探したり、ポストホックを拒否したり、環境の難易度に沿ってタスクを配置する場所を学習したり、疎い端末の報酬だけで解決者を信用したりすることで、学習可能性に精通しています。
LUREでは、LLMの回避者は各環境の難易度軸に沿ってタスクを配置し、検証可能な相互作用を通じてそれを追尾するプランナー・実行者追尾者の一歩先にとどまる。
回避者は、手動で調整された拒絶バンドではなく、学習された位置決め戦略にほとんど変化せず、解凍器がちょうど半分のロールアウトでそれをキャプチャした時にピークとなるキャプチャ・フロンティアの報酬に基づいて訓練される。
追従者は、共進化を安定に維持するラウンドアンコールKLの下で、単調検証器の進行が終端捕捉と共同でグループ正規化される捕捉アンコール密プロセスクレジットを得る。
3つの検証可能な推論環境と3つのバックボーンファミリーにわたって、LUREは統一/特殊主義的な設定の下で高度なベースラインを上回り、統一モデルは3つのタスクファミリからの9つのホールトアウトベンチマークでトレーニングされたベースラインのすべてよりも強力なOODゼロショット精度を達成する。
関連論文リスト
- Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents [3.3656546156010942]
強化学習(Reinforcement learning)は、エンド・オブ・タスクの検証のみで判断される長距離対話型タスクのための訓練後エージェントの自然な方法である。
最近の作業は、より密度の高い報酬、SFTプリエント、スキルライブラリ、キュレートされたメモリ、マルチエージェントオーケストレーションによるトレーニングの周辺を補っている。
我々は、CANOPYという、両者を直接攻撃する最小限のプロトコルを提示する: 自然信号が現れるまで、同じタスクの探索をスケールし、すべての更新を政治上、KLアンコールし、エージェント自身のアクショントークンに制限する。
論文 参考訳(メタデータ) (2026-09-01T13:44:40Z) - ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing [0.6372261626436676]
モチベーション・インタヴュー(MI)では、クライアントの持続的なトーク(現状に関する議論)が、カウンセラーに抵抗を伴って展開するよう呼びかけるが、これは2つの方法で失敗する可能性がある。
モチベーション型面接処理統合 (MITI) コード, ゴールパーシスタンス (GP) およびアテンション (RA) のカウンセラー応答の2軸評価を導入する。
優先最適化によって1つの障害を罰することは、転がり抵抗の反作用を引き起こすかどうかを問う。
論文 参考訳(メタデータ) (2026-07-30T20:16:03Z) - Group-Reflective Self-Distillation for Agentic Reinforcement Learning [8.041052886037766]
GRSD(Group-Reflective Self-Distillation)は、政策が検証したロールアウトから、能力の整合性と結果の差別的なガイダンスを導出する。
GRSDは競争ベースラインを一貫して上回り、目に見えないタスクをより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-30T11:49:46Z) - Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills [53.15216425100295]
本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2026-07-24T17:59:22Z) - Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning [12.363923974156636]
検証可能な報酬からの強化学習は、ロールアウト毎に1つのスカラーを割り当てる。
オンラインの自己蒸留は、特権情報に基づいて同じモデルを教師として振る舞うことでこの問題に対処する。
本研究では,教師がピアロールアウトに成功したことを条件に,HSD(Hindsight Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-06-14T03:37:27Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification [44.99719889905381]
強化学習は推論とエージェント能力の最近の進歩を促進するが、現在のアプローチは探索と搾取の両方で苦労している。
本稿では,R$3$L,Reflection-then-Retry Reinforcement Learning with Language-Guided Exploration,Pivotal Credit,Positive Amplificationを提案する。
エージェントおよび推論タスクの実験は、トレーニング安定性を維持しながら、ベースラインよりも5%から52%改善したことを示している。
論文 参考訳(メタデータ) (2026-01-07T09:04:52Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning [87.7836502955847]
本稿では,Large Language Model (LLM)推論を強化するための,自己回帰型強化学習フレームワークを提案する。
私たちのキーとなる洞察は、正しい応答はモデルの可能性の観点から一貫した軌道パターンを示すことが多いということです。
本稿では,安定度とボラティリティを,頑健なベクトル空間集約戦略を通じて統合する,本質的な報酬機構であるCoVoを紹介する。
論文 参考訳(メタデータ) (2025-06-10T12:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。