論文の概要: Group-Reflective Self-Distillation for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.28076v1
- Date: Thu, 30 Jul 2026 11:49:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.543687
- Title: Group-Reflective Self-Distillation for Agentic Reinforcement Learning
- Title(参考訳): エージェント強化学習のためのグループ反射型自己蒸留
- Authors: Binbin Zheng, Zijun Xie, Guanqun Zhao, Enlei Gong, Xing Ma, Xiaoliang Fu, Zeyu Chen,
- Abstract要約: GRSD(Group-Reflective Self-Distillation)は、政策が検証したロールアウトから、能力の整合性と結果の差別的なガイダンスを導出する。
GRSDは競争ベースラインを一貫して上回り、目に見えないタスクをより効果的に一般化する。
- 参考スコア(独自算出の注目度): 8.041052886037766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) is effective for training large language model agents. However, terminal rewards provide only coarse trajectory-level supervision, leaving successful behaviors, recurring mistakes, and incidental choices entangled in the same outcome signal. Existing agentic self-distillation methods enrich sparse supervision with natural-language skills, but skills retrieved externally or extracted from a single trajectory by stronger models may mismatch current experience, exceed the policy's capability, or remain path-specific. We propose Group-Reflective Self-Distillation (GRSD), which derives capability-aligned and outcome-discriminative guidance from the policy's own verified rollouts. For each prompt, the policy reflects on each verified trajectory in an on-policy group, and a stop-gradient snapshot contrasts the resulting reflections from successful and failed rollouts to construct group-level privileged guidance. Conditioned on this guidance, a self-teacher refines turn-level credit assignment by modulating outcome-based advantages while preserving the verifier-determined learning direction. Experiments across multiple agentic environments and model scales demonstrate that GRSD consistently outperforms competitive baselines and generalizes more effectively to unseen tasks.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルエージェントの訓練に有効である。
しかし、終末報酬は粗い軌道レベルの監視のみを提供し、成功した行動、繰り返し失敗、そして同じ結果信号に絡み合った偶発的な選択を残している。
既存のエージェントによる自己蒸留法は、自然言語のスキルと疎い監督を充実させるが、より強力なモデルによって1つの軌道から抽出されたスキルは、現在の経験を間違えたり、政策の能力を超えたり、パス固有のままである。
我々は,政策が検証したロールアウトから,能力整合性および結果差別的ガイダンスを導出するグループ反射型自己蒸留(GRSD)を提案する。
各プロンプトに対して、ポリシーは、オン・ポリティクス・グループにおける検証された各軌道を反映し、ストップ・グラディエント・スナップショットは、結果の反射と、成功し失敗したロールアウトとを比較して、グループレベルの特権的なガイダンスを構築する。
このガイダンスに基づき、自己学習者は、検証者決定学習の方向性を維持しつつ、結果に基づく優位性を調整することにより、ターンレベルの信用割当を洗練する。
複数のエージェント環境とモデルスケールにわたる実験により、GRSDは競争ベースラインを一貫して上回り、目に見えないタスクをより効果的に一般化することを示した。
関連論文リスト
- Contrastive Reinforced Policy Optimization via Privileged Self-Distillation [23.840537431318296]
対照的な学習の観点から,エージェント・オン・ポリシィ・セルフ・蒸留(OPSD)を再構成するCRPO(Contrastive Reinforced Policy Optimization)を導入する。
CRPOは、既存の強化学習と自己蒸留ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-07-30T11:14:11Z) - LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks [89.13372484640392]
LLM-as-a-JudgeからLLM-as-a-Coachへのフィードバックモデルを再利用した経験的学習(EL)を提案する。
ELは、保持された未確認のオープンエンドタスクにおいて、ルブリックベースのRLを一貫して上回る。
これらの知見は、検証不可能なタスクのポストトレーニングにおいて、より豊かでより一般化可能な学習信号として経験的知識を確立した。
論文 参考訳(メタデータ) (2026-07-20T16:08:49Z) - SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning [38.54413500261524]
アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T09:57:18Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation [71.16738415436458]
本稿では、生の障害フィードバックを補正管理のアクティブソースに変換するフレームワークであるReflection-Enhanced Self-Distillation(RESD)を紹介する。
RESDは、局所的なエラーを診断するために振り返りリフレクションを生成し、持続的なグローバルなプレイブックをキュレートすることで、障害の軌跡を解釈する。
複数の連続学習課題に対する実証的な評価は、RESDが標準の自己蒸留ベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-12T20:46:05Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning [87.7836502955847]
本稿では,Large Language Model (LLM)推論を強化するための,自己回帰型強化学習フレームワークを提案する。
私たちのキーとなる洞察は、正しい応答はモデルの可能性の観点から一貫した軌道パターンを示すことが多いということです。
本稿では,安定度とボラティリティを,頑健なベクトル空間集約戦略を通じて統合する,本質的な報酬機構であるCoVoを紹介する。
論文 参考訳(メタデータ) (2025-06-10T12:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。