論文の概要: ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.01058v1
- Date: Tue, 01 Sep 2026 10:54:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.589475
- Title: ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
- Title(参考訳): ARISE-RL:強化学習によるエージェントルブリック周囲の反復的自己進化
- Authors: Fanrui Zhang, Ruixue Ding, Qiang Zhang, Xi Chen, Boli Chen, Shihang Wang, Qiuchen Wang, Hongmin Zhan, Jinxin Bian, Li xingchao, Peijin Zheng, Hao cheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha,
- Abstract要約: ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
- 参考スコア(独自算出の注目度): 74.19730275669227
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training open-ended agents via reinforcement learning (RL) is hindered by the lack of verifiable gold answers and scalable rubrics. Moreover, even near the model's capability boundary, long-horizon open-ended agentic tasks often yield brittle and unstable rewards, resulting in weak or noisy rollout contrast that obscures fine-grained optimization signals for group-based policy learning. To address these challenges, we propose ARISE-RL, a novel full-cycle self-evolution framework that couples a task/rubric Generator and a reasoning Solver through rubric-mediated co-evolution. The Generator grounds tool-related rubric criteria in real tool observations and is rewarded for producing valid, intermediate-difficulty tasks aligned with the Solver's evolving capability boundary. The Solver, in turn, learns from fine-grained rubric satisfaction signals through multi-step reasoning and tool use. We further introduce Reward-Gated Self-Evolution Distillation (RG-SED), which selectively distills a memory-augmented variant of the same policy back into itself only when the memory yields empirical reward improvement, thereby reducing distribution mismatch and avoiding blind imitation of noisy guidance. Finally, to support rigorous evaluation, we present ECR-Bench, an expert-calibrated rubric benchmark suite covering single-tool deep research and multi-tool travel planning. Extensive experiments demonstrate that ARISE-RL consistently achieves robust and stable overall state-of-the-art performance across all evaluated benchmarks.
- Abstract(参考訳): 強化学習(RL)によるオープンエンドエージェントの訓練は、検証可能なゴールド回答とスケーラブルなルーリックの欠如によって妨げられる。
さらに、モデルの能力境界の近くでも、長い水平なオープンなエージェントタスクは不安定で不安定な報酬をもたらすことが多く、グループベースのポリシー学習のためのきめ細かい最適化信号が隠蔽されるような、弱い、またはノイズの多いロールアウトコントラストが生じる。
これらの課題に対処するために,タスク/ルーブリックジェネレータとソルバーをルーブリックによる共進化によって結合する新しいフルサイクル自己進化フレームワークであるARISE-RLを提案する。
ジェネレータは、ツール関連のルーリック基準を実際のツール観測に当てはめ、ソルバーの進化する能力境界に沿う有効な中間微分タスクを生成することに報いる。
次にSolverは、多段階の推論とツールの使用を通じて、きめ細かいルックス満足度信号から学習する。
さらに、メモリが経験的報酬改善をもたらす場合にのみ、同じポリシーのメモリ拡張版を選択的に蒸留するReward-Gated Self-Evolution Distillation (RG-SED)を導入し、分散ミスマッチを低減し、ノイズ誘導の盲目模倣を避ける。
最後に, 厳密な評価を支援するために, ECR-Benchについて述べる。
広範囲な実験により、ARISE-RLは全ての評価されたベンチマークにおいて、安定かつ堅牢な総合的なパフォーマンスを達成することが実証された。
関連論文リスト
- AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward [52.7128440950672]
我々はAlphaGRPOを提案し、追加のコールドスタートステージなしでマルチモーダル生成能力を向上する。
我々のアプローチは、高度な推論タスクを実行するためのモデルの本質的な可能性を解き放つ。
実世界のマルチモーダル世代を安定的に管理する上での課題に対処するために、DVReward(Decompositional Verifiable Reward)を導入する。
論文 参考訳(メタデータ) (2026-05-12T17:59:47Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning [75.73135757250806]
エージェント強化学習(ARL)は、複雑で多段階の対話的なタスクを解決するためのトレーニングエージェントにとって有望なパラダイムとして急速に注目を集めている。
初期の成果を奨励しているにもかかわらず、ARLは非常に不安定であり、しばしばトレーニングの崩壊につながる。
本稿では,制御された再現可能な環境下でのトレーニング安定性を検証した,安定したトレーニングレシピと系統的分析フレームワークであるARLArenaを提案する。
論文 参考訳(メタデータ) (2026-02-25T03:43:34Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning [29.778703252962092]
大規模言語モデル(LLM)の進化のための強力なパラダイムとして強化学習(RL)が登場した。
外部の監督なしに動作する新しいテストタイム報酬機構を開発した。
論文 参考訳(メタデータ) (2025-10-20T07:53:51Z) - RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents [43.806220882212386]
RLVMRは、検証可能なメタ推論の振る舞いに報いることによって、密集したプロセスレベルの監視をエンドツーエンドのRLに統合する。
挑戦的なALFWorldとScienceWorldのベンチマークでは、RLVMRが新たな最先端の結果を達成している。
論文 参考訳(メタデータ) (2025-07-30T17:00:48Z) - ReVeal: Self-Evolving Code Agents via Reliable Self-Verification [11.875519107421312]
自己検証とツールベースの評価を通じてコード生成を進化させる強化学習フレームワークであるReVealを紹介する。
推論において、この強化された自己検証により、3つしかトレーニングされていないLiveCodeBenchでは、自己構築されたテストとツールフィードバックを使用して、20ターン以上のコードを継続的に進化させることができる。
これらの調査結果は、RLトレーニングとテストタイムスケーリングのためのスケーラブルなパラダイムとしてのReVealの約束を強調し、より堅牢で自律的なAIエージェントへの道を開いた。
論文 参考訳(メタデータ) (2025-06-13T03:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。