論文の概要: Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents
- arxiv url: http://arxiv.org/abs/2609.01245v1
- Date: Tue, 01 Sep 2026 13:44:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.690608
- Title: Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents
- Title(参考訳): 長期的対話型エージェントのためのアウトカムオンリー強化学習
- Authors: Liming Pu, Xiaoxia Li, Yifu Liu, Teng Cao, Bin Yang,
- Abstract要約: 強化学習(Reinforcement learning)は、エンド・オブ・タスクの検証のみで判断される長距離対話型タスクのための訓練後エージェントの自然な方法である。
最近の作業は、より密度の高い報酬、SFTプリエント、スキルライブラリ、キュレートされたメモリ、マルチエージェントオーケストレーションによるトレーニングの周辺を補っている。
我々は、CANOPYという、両者を直接攻撃する最小限のプロトコルを提示する: 自然信号が現れるまで、同じタスクの探索をスケールし、すべての更新を政治上、KLアンコールし、エージェント自身のアクショントークンに制限する。
- 参考スコア(独自算出の注目度): 3.3656546156010942
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning is a natural way to post-train LLM agents for long-horizon interactive tasks judged only by end-of-task verification, yet a shared belief holds that outcome-only RL soon hits a ceiling on small open models. Recent work therefore compensates around the training with denser rewards, SFT priors, skill libraries, curated memory, or multi-agent orchestration. We argue the ceiling is an artifact of two failures of common practice. Signal starvation: group-relative RL with sparse outcome-only rewards yields a gradient only when a task's rollout group mixes successes and failures, so under-scaled exploration silences exactly the hardest, most instructive tasks. Policy drift: squeezing many updates out of a small task pool degrades the policy itself, as an unanchored objective lets the sampling distribution collapse exactly when saturation has already made informative groups rare. We present CANOPY (Coverage-ANchored On-PolicY RL), a minimalist protocol attacking both directly: scale same-task exploration until the natural signal reappears, keep every update on-policy, KL-anchored, and confined to the agent's own action tokens, then cash in an enlarged interaction budget at test time. On AppWorld, a long-horizon interactive coding benchmark, a Qwen3-14B policy trained with CANOPY through environment interaction alone--without task-specific supervision, auxiliary credit signals, or elaborate agent scaffolding--topped the public leaderboard (Feb. 2026; Test-Normal TGC 86.9, Test-Challenge 67.6), and the same design principles lift Qwen3.5-9B on SWE-bench Verified by 16.6 points. Agentic RL alone thus internalizes long-horizon capability directly into a small open model; we plan to release the complete training stack at https://github.com/AlibabaResearch/SignalCoverageRL.
- Abstract(参考訳): 強化学習(Reinforcement learning)は、エンド・オブ・タスクの検証のみで判断される長距離対話タスクのためのLLMエージェントの訓練後処理の自然な方法である。
したがって、最近の作業は、より密度の高い報酬、SFTプリエント、スキルライブラリ、キュレートされたメモリ、マルチエージェントオーケストレーションによるトレーニングを補う。
私たちは、天井が2つの失敗の共通プラクティスの成果物であると主張している。
信号の飢餓: 粗末な結果のみの報酬を持つグループ相対的なRLは、タスクのロールアウトグループが成功と失敗を混ぜた場合にのみ勾配をもたらす。
政策の漂流: 小さなタスクプールから多くの更新を抽出することで、ポリシー自体が劣化する。
我々は、CANOPY(Coverage-ANchored On-PolicY RL)という、両者を直接攻撃する最小限のプロトコルを提示します。
長期にわたる対話型コーディングベンチマークであるAppWorldでは、CANOPYでトレーニングされたQwen3-14Bポリシが、タスク固有の監督、補助的なクレジット信号、あるいは詳細なエージェントスキャフォールディングなしで-公開リーダボード(2月2026年2月、Test-Normal TGC 86.9、Test-Challenge 67.6)を上回り、同じ設計原則がSWE-benchのQwen3.5-9Bを16.6ポイント向上させた。
Agentic RLだけで、長い水平機能を直接小さなオープンモデルに内部化し、https://github.com/AlibabaResearch/SignalCoverageRLで完全なトレーニングスタックをリリースする予定です。
関連論文リスト
- The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning [6.195031716121927]
LUREでは、LLMエバーダが各環境の難易度軸に沿ってタスクを配置し、検証可能な相互作用を通じてタスクを追尾する追尾者の一歩先にとどまる。
追従者は、共進化を安定に維持するラウンドアンコールKLの下で、単調検証器の進行が終端捕捉と共同でグループ正規化される捕捉アンコール密プロセスクレジットを得る。
論文 参考訳(メタデータ) (2026-08-22T09:30:29Z) - Training Small LLMs as Spatial Multi-Agent Policies [17.254137262162505]
空間的協調ゲームでは両スレッドを取り上げ、小さな凍結LDMは低レベル動作で失敗し、報酬はゼロとなる。
我々は,各ゲームに,記号プランナーによって実行される,型付けされた,状態対応可能な,短期水平動作という,象徴的な入力のライブラリを装備する。
各エージェントのLCMはオプションに対するポリシーとして機能し、エージェントごとのLORAアダプタはマルチエージェントGRPOのエージェントごとの変種によって訓練される。
論文 参考訳(メタデータ) (2026-08-02T18:14:40Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning [42.74142065376427]
本稿では,Z-Perturbation Reinforcement Learning (ZPRL)を提案する。
現実世界では、ZPRLは模倣ベースポリシーよりも4つのタスクの平均成功率を33.7%向上させる。
論文 参考訳(メタデータ) (2026-05-19T14:43:26Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning [125.96848846966087]
対話型エージェントとしての大規模言語モデル(LLM)のトレーニングには,ユニークな課題がある。
強化学習は静的タスクの進行を可能にする一方で、マルチターンエージェントRLトレーニングは未探索のままである。
本稿では、軌道レベルのエージェントRLのための一般的なフレームワークであるStarPOを提案し、LLMエージェントのトレーニングと評価のためのモジュールシステムであるRAGENを紹介する。
論文 参考訳(メタデータ) (2025-04-24T17:57:08Z) - Same State, Different Task: Continual Reinforcement Learning without
Interference [21.560701568064864]
連続学習(CL)における主な課題は破滅的な忘れことであり、これは新しいタスクを学ぶ際に、以前にマスターされたタスクのパフォーマンスが低下したときに生じる。
干渉の有無で共有再生バッファを持つ単一ニューラルネットワーク予測器をベースとした既存のCL法が失敗することを示す。
本稿では,この課題に対処する簡単な方法であるOWLを提案する。OWLは,共有特徴抽出層を用いて因子化ポリシーを学習するが,それぞれが新しいタスクを専門とする分離ヘッドを学習する。
論文 参考訳(メタデータ) (2021-06-05T17:55:10Z) - Room Clearance with Feudal Hierarchical Reinforcement Learning [2.867517731896504]
本稿では,RL研究を軍事分析に有用な方向に進めるためのシナリオ構築ツールとして,新しいシミュレーション環境「it」を紹介した。
そこでは、青いエージェントのチームが建物を通り抜け、すべての部屋が敵のレッドエージェントから取り除かれるようにしなければなりません。
封建的階層型RLのマルチエージェント版を実装し、より上位の指揮官が命令を下級の複数のエージェントに送信するコマンド階層を導入する。
このような方法でタスクを壊すことで、私たちはそれを可能にすることに気付きました。
論文 参考訳(メタデータ) (2021-05-24T15:05:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。