論文の概要: AdaStep: Adaptive Step Credit Weighting for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.03223v1
- Date: Fri, 02 Oct 2026 12:38:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.371284
- Title: AdaStep: Adaptive Step Credit Weighting for Agentic Reinforcement Learning
- Title(参考訳): AdaStep: エージェント強化学習のための適応的なステップクレジットウェイト
- Abstract要約: 本稿では,各グループ由来の局所的優位性が軌道レベルの信号にどの程度強く依存するかを制御する適応ステップ重み付け手法を提案する。
AdaStepは軽量なスカラー計算しか必要とせず、批判もロールアウトも追加のモデル推論も不要である。
ALFWorld、WebShop、ScienceWorldの3つのモデルバックボーンによる実験では、低い計算コストでベースラインよりも一貫した改善が見られた。
- 参考スコア(独自算出の注目度): 41.82249291285459
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon LLM agents are typically trained with sparse outcome rewards, making trajectory-level objectives too coarse to distinguish the contribution of individual decisions. Step-level credit assignment provides finer-grained supervision, but its estimates can be unreliable because observed returns also depend on subsequent actions, environment transitions, and trajectory length. We propose AdaStep, an Adaptive Step-credit weighting method that controls how strongly each group-derived local advantage modifies the trajectory-level signal. We formulate this weighting as a mean-squared-error estimation problem for the latent step advantage and, under an explicit conditional sampling assumption, derive an optimal per-state shrinkage coefficient. The coefficient admits a signal-to-total-variance interpretation: it preserves local credit when return variation is attributable to the selected action and suppresses it when variation is dominated by downstream randomness. AdaStep requires only lightweight scalar computation, with no critic, additional rollouts, or extra model inference. Experiments with three model backbones on ALFWorld, WebShop, and ScienceWorld show consistent improvements over baselines at low computational cost.
- Abstract(参考訳): ロングホライゾン LLM エージェントは通常、粗末な結果報酬で訓練され、個々の決定の貢献を区別するには軌跡レベルの目標が大きすぎる。
ステップレベルの信用割当はよりきめ細かい監督を提供するが、観測されたリターンはその後の行動、環境遷移、軌道長にも依存するため、その推定は信頼できない。
本稿では,AdaStepを提案する。AdaStepはアダプティブステップ重み付け方式で,各グループ由来の局所的優位性が軌道レベルの信号にどの程度強く依存するかを制御する。
我々は、この重み付けを、遅延ステップの利点に対する平均二乗誤差推定問題として定式化し、明示的な条件付きサンプリング仮定の下で、最適状態当たりの収縮係数を導出する。
この係数は信号と対位差の解釈を許容し、リターン変動が選択された動作に起因する場合のローカルクレジットを保存し、下流のランダム性によって変動が支配される場合にはそれを抑制する。
AdaStepは軽量なスカラー計算しか必要とせず、批判もロールアウトも追加のモデル推論も不要である。
ALFWorld、WebShop、ScienceWorldの3つのモデルバックボーンによる実験では、低い計算コストでベースラインよりも一貫した改善が見られた。
関連論文リスト
- Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning [7.885980895039013]
我々は、正しい解決法は国家に依存していると論じ、不確実性に基づく臨界性プロキシに従って粒度が続く批判のない推定器であるGACAを提案する。
GACAは、自己のロールアウトがすでに記録している負のログライクな記録によって各ステップをスコアし、そのスコアで成長するステップ毎の重みと2つのアドバンテージをブレンドする。
ALFWorldとWebShopでは、GACAはGRPOとGiGPOよりも1.5Bと7Bのスケールでタスクの成功を改善する。
論文 参考訳(メタデータ) (2026-09-11T04:19:44Z) - FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience [18.64380706071327]
FlowBalanceは、完全応答上の正規化分布を学習する検証器による自己改善手法である。
オンラインの軌跡ごとに、同じポリシーの凍結されたトレーニングタイムビューは、特権付きコンテキストを使用してトークンレベルのログ確率ゲインを生成する。
分析では, 群内コントラスト保存, 最小値逆KL特性, 目標報酬の単調検証, 拒否応答に対する偽陽性自己誘導に対する正確な補正が確立された。
論文 参考訳(メタデータ) (2026-09-03T00:47:11Z) - Risk-Sensitive Reinforcement Learning with Smoothed Quantile Objectives [2.153824429735596]
モデルに基づく楽観的学習アルゴリズムを開発し、遷移カーネルの信頼セットと低バッファの量子化基準を用いて計画する。
チューリング時間短縮の下で, 正確な点量子化評価と, 正確な低バッファ化量子化評価がPPハードであることを証明する。
論文 参考訳(メタデータ) (2026-08-23T05:41:32Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood [0.0]
本稿では、有限ロールアウトされた代理対象の族であるRL2MLを、閉形式、正確に偏りのない勾配推定器で開発する。
代理目的の最良の選択は、最大可能性に近づいたり、人口レベルの重みだけで決められたりしないことを示す。
論文 参考訳(メタデータ) (2026-05-28T16:14:45Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models [90.45197506653341]
大規模推論モデルは最終回答を生成する前に中間的推論トレースを生成する。
LRMと人間の好みの整合性は、モデルデプロイメントにとって重要な前提条件であり、まだ過小評価されていない。
共通の回避策は1つのサンプル軌道を最適化し、トレースサンプリングからかなり勾配のばらつきをもたらす。
論文 参考訳(メタデータ) (2025-10-06T17:58:01Z) - Revisiting Essential and Nonessential Settings of Evidential Deep Learning [70.82728812001807]
Evidential Deep Learning (EDL) は不確実性推定の新しい手法である。
本報告では,EDLの簡易かつ効果的な拡張型であるRe-EDLを提案する。
論文 参考訳(メタデータ) (2024-10-01T04:27:07Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。