論文の概要: SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks
- arxiv url: http://arxiv.org/abs/2605.31433v1
- Date: Fri, 29 May 2026 15:28:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.700204
- Title: SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks
- Title(参考訳): SCOPE: オープンエンドタスクのための共進化型ポリシによるセルフプレイ
- Abstract要約: SCOPEはオープンエンドタスクのためのデータフリーなセルフプレイフレームワークである。
初期モデルの凍結したコピーが自己判断として機能する。
SCOPEは8つのベンチマークで最大10.4ポイントのオープンエンド性能を改善する。
- 参考スコア(独自算出の注目度): 19.215310903576533
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-play can train language models without external supervision. However, existing methods require rule-checkable answers, leaving open-ended tasks dependent on curated prompts or frontier-model judges. We introduce SCOPE, a data-free self-play framework for open-ended tasks that co-evolves two policies: a Challenger that generates document-grounded tasks, and a Solver that answers them through multi-turn retrieval. A frozen copy of the initial model serves as the self-judge, which writes task-specific rubrics from the source document and grades Solver responses against them. Across three 7-8B instruction-tuned models (Qwen2.5, Qwen3, OLMo-3), SCOPE improves open-ended performance by up to +10.4 points on eight benchmarks and matches or exceeds GRPO_data trained on ~9K curated prompts. Although trained only on open-ended tasks, SCOPE also improves held-out short-form QA by up to +13.8 points on seven held-out benchmarks, surpassing GRPO_data on all three models. Ablations show that co-evolving the Challenger is necessary to keep tasks near the Solver's frontier, that gains arise from improvements in both retrieval and synthesis with the relative contribution varying by task, and that rubric generation quality is the bottleneck for self-judging.
- Abstract(参考訳): セルフプレイは、外部の監督なしに言語モデルをトレーニングすることができる。
しかし、既存の手法ではルールチェック可能な答えが必要であり、オープンなタスクはキュレートされたプロンプトやフロンティアモデルの判断に依存する。
SCOPEはオープンエンドタスクのためのデータフリーなセルフプレイフレームワークで,文書基底タスクを生成するチャレンジャーと,マルチターン検索による解答を行うソルバーの2つのポリシーを共進化させる。
最初のモデルの凍結したコピーは、ソースドキュメントからタスク固有のルーリックを書き、それに対するSolverレスポンスを格付けするセルフジャッジとして機能する。
3つの7-8B命令チューニングモデル(Qwen2.5, Qwen3, OLMo-3)でSCOPEは8つのベンチマークで最大+10.4ポイントのオープンエンド性能を向上し、約9Kのキュレートプロンプトで訓練されたGRPO_dataを超えている。
SCOPEはオープンエンドタスクのみにトレーニングされているが、ホールドアウトショートフォームQAを7つのホールドアウトベンチマークで最大+13.8ポイント改善し、3つのモデルでGRPO_dataを上回っている。
アブレーションは、Solverのフロンティア付近でのタスクの維持にはチャレンジャーの共同進化が必要であることを示し、タスクによって異なる相対的なコントリビューションによる検索と合成の両方の改善から得られること、そして、ルーブリ生成の品質が自己判断のボトルネックであることを示している。
関連論文リスト
- SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams [55.90739575113059]
再利用の欠如は、関連するタスクのクラスタによって共有される解決手順であり、その周りでSkillGLoWを構築している、と我々は主張する。
4つのベンチマーク(数学的推論、端末の自動化、ソフトウェア修復、実施制御)と3つのモデルで、前者は平均17.2ポイント(ハード)を獲得している。
論文 参考訳(メタデータ) (2026-09-02T07:31:18Z) - SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning [14.505575259468053]
テスト時強化学習(TTRL)により、ラベル付きフィードバックなしで推論時に言語モデルを自己進化させることができる。
SERPOを導入し、回答投票をクローズドループに置き換え、レスポンスエビデンス、クエリトケン、ポリシーパラメータを共進化させる。
新しいアクターロールアウトはアーカイブとルーリックの両方をリフレッシュし、3方向の進化ループを閉じる。
論文 参考訳(メタデータ) (2026-07-29T13:03:07Z) - CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning [3.1368611610608856]
テキスト空間のタスクルーティングは、凍結されたCLIPテキストプロトタイプとコサイン類似のビジュアルガウスマッチングを置き換える。
視覚テキストの信頼度は、単一ガウスのクラスモデリングをK平均視覚プロトタイプとタスク校正しきい値の下でのクロスモーダルアライメントスコアに置き換える。
MTILベンチマークは118.7%と1201のクラスで74.2%のTransfer、80.5%のAverage、そして8のLast Under Order-Iを達成した。
論文 参考訳(メタデータ) (2026-05-25T11:09:48Z) - Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning [5.605622654870907]
ポストトレーニングは、言語モデルを有能な検索強化推論エージェントに変えるための主要なレシピとなっている。
そこで本稿では,バニラGRPOのみによる自己進化法である検索-E1を提案する。
Search-E1はQwen2.5-3Bで平均0.440EMに達し、両方のスケールですべてのオープンソースベースラインを超えた。
論文 参考訳(メタデータ) (2026-05-21T14:00:57Z) - EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics [86.49781345669436]
言語モデルは事前学習からかなりの評価知識を符号化する。
現在のポストトレーニング手法は、報酬信号を生成するために外部の監督に依存している。
EVOLMは、モデルの評価能力を明示的な識別的ルーブリックに構造化する手法である。
論文 参考訳(メタデータ) (2026-05-05T15:31:00Z) - OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis [98.43366988856592]
高品質なタスク命令とエージェントトラジェクトリを合成するオープンソースフレームワークであるOpenMobileについて述べる。
データに基づいてトレーニングされたエージェントは、3つの動的モバイルエージェントベンチマークで競合する結果を得る。
論文 参考訳(メタデータ) (2026-04-16T14:53:08Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation [65.3648667980258]
視覚言語モデル(VLM)に基づくGUIエージェントは複雑なタスクの自動化を約束するが、強化学習(RL)の適用において大きな課題に直面している。
異種モジュールを高度に非結合的に協調するGUIエージェントのための非結合エージェントRLトレーニングフレームワークであるDARTを提案する。
OSWorldのベンチマークでは、DART-GUI-7Bは42.13%のタスク成功率、14.61%の絶対ゲイン、オープンソースSOTAよりも7.34%高い。
論文 参考訳(メタデータ) (2025-09-28T13:19:20Z) - SPELL: Self-Play Reinforcement Learning for evolving Long-Context Language Models [79.01078135582127]
SPELLは、長文推論のためのスケーラブルでラベルなしの最適化を可能にする。
本稿では、文書長を徐々に向上させる自動カリキュラムと、モデルの進化する機能に質問の難しさを適応させる報奨関数を導入する。
論文 参考訳(メタデータ) (2025-09-28T13:08:10Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z) - Self-Prompting Large Language Models for Zero-Shot Open-Domain QA [67.08732962244301]
Open-Domain Question Answering (ODQA)は、背景文書を明示的に提供せずに質問に答えることを目的としている。
このタスクは、調整済みの検索リーダーモデルをトレーニングするデータがないゼロショット設定で顕著に困難になる。
本稿では,大規模言語モデルのパラメータに符号化された膨大な知識を明示的に活用するセルフプロンプトフレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-16T18:23:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。