論文の概要: Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.04788v1
- Date: Wed, 05 Aug 2026 12:52:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.929095
- Title: Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation
- Title(参考訳): 観察校正自己蒸留によるエージェント強化学習
- Authors: Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng,
- Abstract要約: On-Policy Self-Distillation (OPSD)は、高密度のトークンレベルの監視を得るために、特権的なリプレイビューの下で生成されたトークンを再スコアする。
結果として得られるサポートは、リプレイビューに含まれる特権情報と、リプレイスキャフォールドによって誘導されるスコアシフトの両方を反映することができる。
本研究では, この問題点を解決するために, OCSD (Observatory-Calibrated Self-Distillation) を提案する。
- 参考スコア(独自算出の注目度): 18.20369971970953
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model agents are commonly trained through reinforcement learning with sparse trajectory-level rewards, which offer limited guidance on how strongly individual tokens should be updated. On-Policy Self-Distillation (OPSD) addresses this by re-scoring generated tokens under a privileged replay view to obtain dense, token-level supervision. However, we identify a confounding issue: the resulting support may reflect both the privileged information contained in the replay view and score shifts induced by the replay scaffold, making it difficult to attribute the support specifically to that information. This issue is especially pronounced when future environment observations serve as privileged information, since replaying them requires reconstructing an extended scaffold that itself perturbs token scores. To resolve this confounding, we propose Observation-Calibrated Self-Distillation (OCSD), which contrasts two structurally matched replay views, Full and Observation-Ablated, differing only in whether the actual future observation is present, to derive an observation residual that discounts score changes shared by the replay scaffold. OCSD then applies this residual to modulate token-level GRPO updates at high-uncertainty steps, while preserving the trajectory-level update direction. Experiments on ALFWorld, WebShop, and Search-QA across three Qwen3 model scales show that OCSD consistently outperforms strong baselines. Diagnostic analyses further confirm that the calibrated residual aligns better with local environment feedback. Our code is publicly available at https://github.com/yiy1x/OCSD.
- Abstract(参考訳): 大規模言語モデルエージェントは、個々のトークンの更新方法に関する限定的なガイダンスを提供する、低軌道レベルの報酬による強化学習を通じて、一般的に訓練される。
On-Policy Self-Distillation (OPSD)は、高密度のトークンレベルの監視を得るために、特権的なリプレイビューの下で生成されたトークンを再描画することで、この問題に対処する。
しかし,リプレイビューに含まれる特権情報と,リプレイスキャフォールドによって引き起こされるスコアシフトの両方を反映し,その情報に対するサポートの属性付けが困難になる。
この問題は、将来の環境観測が特権情報として機能する場合、特に顕著である。
そこで本研究では,2つの構造整合したリプレイビューであるフル・アンド・オブザーバ・アブリケート(FC)とフル・アンド・オブザーバ・アブリケート(OCSD)を対比して,リプレイ・スキャフォールドが共有するスコア変化を割引する観測残差を導出する手法を提案する。
OCSDはこの残余をトークンレベルのGRPO更新を高不確実なステップで変調し、軌跡レベルの更新方向を保存する。
ALFWorld、WebShop、Search-QAの3つのQwen3モデルスケールに対する実験は、OCSDが一貫して強力なベースラインを上回っていることを示している。
診断解析により, 局所的な環境フィードバックと調整後の残差がよく一致していることが確認された。
私たちのコードはhttps://github.com/yiy1x/OCSD.comで公開されています。
関連論文リスト
- Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation [0.0]
強化学習(Reinforcement Learning)は、環境フィードバックを用いて大規模言語モデルを訓練するために一般的に用いられる。
トレーニングフレームワークであるセルフレビュー強化学習を導入し、各RLエピソードに明確な自己レビューステップを組み込む。
ファーストパス応答が失敗すると、モデルが自己レビューを生成して、何がうまくいかなかったかを識別する。
論文 参考訳(メタデータ) (2026-07-06T18:24:16Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards [49.25249414962884]
能動検証リワードを用いた強化学習(RLAVR)を提案する。
RLAVRは、少数のサンプルの接地木ラベルを積極的に取得し、擬似ラベルと統合する。
これに基づいて、RLAVR(CARE)の補正認識信頼性推定を導入する。
論文 参考訳(メタデータ) (2026-05-25T13:55:12Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents [5.917866758929418]
検証可能な報酬(RLVR)からの強化学習は、長期的対話的タスクにおいて、大規模言語モデル(LLM)エージェントを改善するための有望なパラダイムである。
本稿では,構造化信念状態を明示的にモデル化したプロセスレベル強化学習アルゴリズムReBel(Reward Belief)を提案する。
我々は、ALFWorldやWebShopといった長軸ベンチマークに挑戦する上で、ReBelを評価する。
論文 参考訳(メタデータ) (2026-05-19T16:19:29Z) - AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment [39.63424981516754]
非対称メタ反射型自己蒸留(AMR-SD)
非対称なReLUゲートしきい値を持つ因果情報ゲイン(CIG)を導入し、これらの反射をスパースで高精度なトークンレベルの利点変調に変換する。
科学的、数学的、ツール使用のベンチマークによる実験は、AMR-SDが既存のベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-18T15:14:34Z) - Learning Uncertainty from Sequential Internal Dispersion in Large Language Models [52.29267172760918]
不確実性推定は、大規模言語モデルにおける幻覚を検出するための有望なアプローチである。
最近の手法は一般に不確実性を推定するために内部状態のモデルに依存する。
本稿では,教師付き幻覚検出フレームワークであるシークエンシャル内部変数表現(SIVR)を提案する。
論文 参考訳(メタデータ) (2026-04-17T06:31:29Z) - Dual-Stage Invariant Continual Learning under Extreme Visual Sparsity [8.16821029459195]
背景駆動の勾配は、連続的なドメインシフトの間、機能のバックボーンを不安定にすることを示す。
連成蒸留による二段階不変連続学習フレームワークを提案する。
高分解能空間ベース RSO 検出データセットの実験は、確立された連続物体検出法よりも一貫した改善を示す。
論文 参考訳(メタデータ) (2026-03-27T09:03:49Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Anticipating the Unseen Discrepancy for Vision and Language Navigation [63.399180481818405]
視覚言語ナビゲーションでは、エージェントは特定のターゲットに到達するために自然言語命令に従う必要がある。
目に見える環境と目に見えない環境の間に大きな違いがあるため、エージェントがうまく一般化することは困難である。
本研究では,テストタイムの視覚的整合性を促進することによって,未知の環境への一般化を学習する,未知の離散性予測ビジョンと言語ナビゲーション(DAVIS)を提案する。
論文 参考訳(メタデータ) (2022-09-10T19:04:40Z) - Robust Disentanglement of a Few Factors at a Time [5.156484100374058]
変分オートエンコーダ(VAE)の整合性向上のための人口ベーストレーニング(PBT)を導入する。
PBT-VAEトレーニングでは、教師なしのモデルスコアとしてUnsupervised Disentanglement Ranking (UDR)を使用し、この方法でトレーニングされたモデルが、生成因子のサブセットのみを一貫して切り離す傾向を示す。
複数のデータセットとメトリクスをまたいで、最先端の教師なしのアンハンジメント性能とロバストネスを著しく改善したことを示す。
論文 参考訳(メタデータ) (2020-10-26T12:34:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。