論文の概要: Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs
- arxiv url: http://arxiv.org/abs/2609.19636v1
- Date: Thu, 17 Sep 2026 03:27:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.08894
- Title: Reach or Solve? Attributing Agentic RL Gains with Checkpoint Handoffs
- Title(参考訳): リーチか解決か : チェックポイントハンドオフによるエージェントRLゲインの獲得
- Abstract要約: 強化学習は、現在、言語モデルエージェントを訓練している。
SFTチェックポイントとRLチェックポイントは、同じタスクでも異なる状態からスコアされる。
ハンドオフは、あるチェックポイントの履歴を別のチェックポイントで再生できることだけを要求するので、長い水平評価はエンドポイントの成功の横で到着と完了を報告できる。
- 参考スコア(独自算出の注目度): 4.563659781189804
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning now trains language-model agents that act over dozens of steps in live environments. The gains are large, and they are read as better decision-making. An agent in a closed loop writes its own inputs. Each observation follows from its own earlier actions, so the states it meets late in an episode are partly of its own making. An SFT checkpoint and an RL checkpoint are then scored from different states, even on identical tasks. Endpoint success mixes two changes: where the agent arrives, and what it does once it is there. Restricting the comparison to states both policies reach does not separate them. That restriction selects on an outcome, and in our data it flips the sign of the effect. We introduce checkpoint handoff, an evaluation protocol that clones a state one released checkpoint reached and hands it to another, with no retraining. Crossing a reacher role and a solver role over SFT and RL splits an endpoint gain into REACH and SOLVE. REACH is how often a policy arrives at a state the environment confirms is a fixed number of actions from success. SOLVE is how often it finishes from an identical cloned state. Across two benchmarks and two independently released pipelines, the reacher by solver interaction is positive in all five conditions. An RL history is worth more to an RL solver than the same history is to an SFT solver. On ALFWorld, RL improves both terms, and the SFT solver never succeeds where the RL solver fails. Independent REACH and SOLVE gaps predict the aggregate interaction. Handoff asks only that one checkpoint's history can be replayed under another, so long-horizon evaluation can report arrival and completion beside endpoint success.
- Abstract(参考訳): 強化学習は、現在、言語モデルエージェントを訓練している。
利益は大きいので、より良い意思決定として読まれます。
クローズドループのエージェントは、自身の入力を書き込む。
それぞれの観察は、自分自身の以前の行動から従うため、エピソードの後半に遭遇する状態は、部分的には自作である。
SFTチェックポイントとRLチェックポイントは、同じタスクでも異なる状態からスコアされる。
エンドポイントの成功は、エージェントが到着した場所と、それがそこに着くと何をするかという2つの変化を混ぜ合わせます。
両政策が到達した州との比較を制限することは、それらを分離しない。
この制限は結果を選択し、私たちのデータでは効果のサインを反転させます。
これは、リリースした1つのチェックポイントが到達した状態をクローンし、それを別のチェックポイントに渡し、再トレーニングすることなく、評価プロトコルである。
リーチャーロールとSFTおよびRL上のソルバロールを交差させることで、エンドポイントゲインをREACHとSOLVEに分割する。
REACHは、環境が確認した状態にポリシーが到着する頻度は、成功からの一定の回数のアクションである。
SOLVEは、同じクローン状態から終了する頻度である。
2つのベンチマークと2つの独立したパイプラインで、ソルバ相互作用によるリーチは5つの条件すべてで正である。
RLの歴史は、同じ歴史よりもRLソルバの方がSFTソルバに価値がある。
ALFWorldでは、RLは両方の項を改善し、SFTソルバはRLソルバが失敗しても成功しない。
独立したREACHとSOLVEギャップは、集合的相互作用を予測する。
ハンドオフは、あるチェックポイントの履歴を別のチェックポイントで再生できることだけを要求するので、長い水平評価はエンドポイントの成功の横で到着と完了を報告できる。
関連論文リスト
- Iris: Climbing to the Search Frontier [21.066541702697112]
我々は35B-A3Bスケールと397B-A17Bスケールでトレーニングされた2つの検索エージェントであるIris-miniとIris-proを紹介する。
論文 参考訳(メタデータ) (2026-09-03T17:51:01Z) - Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents [3.3656546156010942]
強化学習(Reinforcement learning)は、エンド・オブ・タスクの検証のみで判断される長距離対話型タスクのための訓練後エージェントの自然な方法である。
最近の作業は、より密度の高い報酬、SFTプリエント、スキルライブラリ、キュレートされたメモリ、マルチエージェントオーケストレーションによるトレーニングの周辺を補っている。
我々は、CANOPYという、両者を直接攻撃する最小限のプロトコルを提示する: 自然信号が現れるまで、同じタスクの探索をスケールし、すべての更新を政治上、KLアンコールし、エージェント自身のアクショントークンに制限する。
論文 参考訳(メタデータ) (2026-09-01T13:44:40Z) - Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World [0.0]
LLMルータは、各要求を最も安価な適切なモデルに合わせることで効率を約束し、マルチステップエージェント内のステップごとに適用されるようになっている。
しかし、エージェントルータはシングルターンルータのように評価され、ログ付きトラジェクトリを再生し、他のモデルの出力を置換することで評価される。
我々は,SWE-benchエージェントを制御点にフォークし,環境を再構築し,各フォークを異なるモデルで継続し,サンプリングと再生を分離する同モデル制御フォークと比較する。
論文 参考訳(メタデータ) (2026-08-08T17:07:11Z) - CAST: Game Solvers as Turn-Level Teachers for LLM Agents [78.2379284312811]
大きな言語モデル(LLM)を訓練して、長距離ゲームで動作させることは、ジェネラリストの意思決定に向けた有望なステップである。
デンサープロセスの信号はこのターンレベルの信用を欠く可能性があるが、既存の情報源は安価で正確な情報を維持することは難しい。
本稿では,ゲームソルバの状態値の変化をデザイナの利点に変換し,ターンレベルの信号としてRLVRに注入するCASTを提案する。
論文 参考訳(メタデータ) (2026-07-28T05:39:01Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - OpenClaw-RL: Train Any Agent Simply by Talking [54.06773485601523]
次状態信号は普遍的であり、ポリシーはそれらすべてから同時に学習することができる。
個人的な会話、端末の実行、GUIインタラクション、SWEタスク、ツールコールトレースは、別個のトレーニング問題ではない。
OpenClaw-RLは、エージェントを単に使用することで改善し、ユーザのリクエリ、修正、明示的なフィードバックから会話信号を復元する。
論文 参考訳(メタデータ) (2026-03-10T18:59:01Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - MALT: Improving Reasoning with Multi-Agent LLM Training [67.76186488361685]
MALT(Multi-Agent LLM Training)は、推論プロセスを生成、検証、改善ステップに分割する、新しいポストトレーニング戦略である。
MATH、GSM8K、CSQAでは、MALTは、それぞれ15.66%、7.42%、9.40%の相対的な改善で同じベースラインLLMを上回っている。
論文 参考訳(メタデータ) (2024-12-02T19:30:36Z) - Does Zero-Shot Reinforcement Learning Exist? [11.741744003560095]
ゼロショットRLエージェント(ゼロショットRL agent)は、任意のRLタスクを、追加の計画や学習なしで即座に解決できるエージェントである。
これは報酬中心のRLパラダイムから"制御可能な"エージェントへのシフトを表している。
近似ゼロショットRLの戦略は、後続特徴(SF)や前方表現(FB)を用いて提案されている。
論文 参考訳(メタデータ) (2022-09-29T16:54:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。