論文の概要: Latent On-Policy Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.13040v1
- Date: Thu, 13 Aug 2026 10:05:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.471051
- Title: Latent On-Policy Self-Distillation
- Title(参考訳): 潜伏型オンポリシィ自己蒸留
- Authors: Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan,
- Abstract要約: On-policy Self-distillation (OPSD) は、特権的な自己教育者を用いて、生徒自身の軌跡を集中的に管理することにより、効果的な経路を提供する。
既存の方法はまだデザイナーが指定した特権的アーティファクトに大きく依存している。
本稿では,教師の特権的文脈自体を経験から学習可能なエンド・ツー・エンドにするため,LOPD(Latent On-Policy Self-Distillation)を導入する。
- 参考スコア(独自算出の注目度): 55.57800223145407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enabling agents to learn from experience and internalize it into their policy has become a central problem in self-evolving AI. On-policy self-distillation (OPSD) offers an effective pathway by using a privileged self-teacher to provide dense supervision on the student's own trajectories; however, existing methods still rely heavily on designer-specified privileged artifacts (e.g., answers, feedback, skills, or trajectories), limiting the end-to-end learnability and scalability required for continual self-improvement. In this work, we introduce Latent On-Policy Self-Distillation (LOPD), which, rather than proposing another hand-crafted OPSD variant with a newly prescribed form of privileged context, makes the teacher's privileged context itself learnable end-to-end from experience. Technically, LOPD retrieves relevant experiences and composes them into continuous latent tokens that condition a self-teacher, while the student generates trajectories from the task and interaction history and receives dense token-level supervision at every visited prefix. We further introduce a privileged-margin objective to stabilize and regulate the learning of latent context. Empirically, LOPD demonstrates (I) strong performance, outperforming RLVR and representative OPSD methods including OPSD, SDPO, and Skill-SD across both agentic tool use and code generation; and (II) high learning efficiency, surpassing GRPO and Skill-SD with less than 30% of their rollout budget. Ablation studies further provide direct evidence that making privileged context learnable is necessary for realizing these gains. Together, these results position LOPD as a step toward a more scalable and self-directed paradigm for agent evolution.
- Abstract(参考訳): エージェントを経験から学び、その方針に内在化させることは、自己進化型AIにおいて中心的な問題となっている。
On-policy Self-distillation (OPSD) は、特権的な自己教育者を用いて生徒自身の軌道を監督するが、既存の手法は、デザイナーが指定した特権的アーティファクト(例えば、回答、フィードバック、スキル、トラジェクトリ)に大きく依存しており、継続的な自己改善に必要なエンドツーエンドの学習性とスケーラビリティを制限している。
本研究では,新たに規定された特権的文脈の形式を手作りのOPSD変種として提案する代わりに,教師の特権的文脈自体を経験から学習可能なエンド・ツー・エンドにする,潜伏型自己蒸留(LOPD)を提案する。
技術的には、LOPDは関連する経験を抽出し、自己学習者を条件づけた連続した潜伏トークンに構成し、学生はタスクと相互作用履歴から軌跡を生成し、訪れた全ての接頭辞で密集したトークンレベルの監督を受ける。
さらに、潜在文脈の学習を安定させ、規制する特権有能な目的を導入する。
実証的に、LOPDは(I)強力なパフォーマンス、RLVR、OPSD、SDPO、Skill-SDといった代表的OPSDメソッドを、エージェントツールの使用とコード生成の両方で上回り、(II)高い学習効率を示し、GRPOとSkill-SDを30%未満の予算で上回ります。
アブレーション研究は、これらの利益を実現するためには特権的文脈を学べる必要があるという直接的な証拠を提供する。
これらの結果は、LOPDをエージェント進化のためのよりスケーラブルで自己指向的なパラダイムへのステップとして位置づけている。
関連論文リスト
- Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents [11.967142343676171]
自己蒸留と強化学習を組み合わせたBCSD(Bi Context Self-Distillation)を提案する。
ALFWorldとWebShopの実験では、BCSDがモデルスケール全体で最高の全体的なパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-08-10T12:53:06Z) - From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents [16.67357658768852]
我々は,OVCSD(Outcome-Verified Comparison Self-Distillation)を提案する。
OVCSDは失敗に終わった学生をプレフィックスツリーに配置し、学生が設定した状態からスキル条件の教師を適応的に呼び出す。
3つのモデルスケールにわたるALFWorldとWebShopの実験は、OVCSDがスキルのないRLと既存の自己蒸留ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-30T09:47:58Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - DOPD: Dual On-policy Distillation [59.65986569617147]
オンライン蒸留は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することで、優れた容量転送を提供する。
特権教師と特権学生の政策の間のトークンレベルの監督を動的にルーティングするアドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方の実験は、DOPDがバニラPDを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-29T17:55:53Z) - OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing [62.62736813348113]
大規模言語モデルの強化学習は、複雑な推論タスクにおいて深刻な報酬の分散によって妨げられることが多い。
我々は,フロンティア生成論理を教師側の特権的証拠として利用するフレームワークであるOmniOPSDを提案する。
MER-UniBenchの実験では、OmniOPSDは平均スコアが84.19ドルで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-06-14T16:51:22Z) - EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation [5.310892696470208]
On-Policy Distillation (OPD)はLLMポストトレーニングパラダイムとして広く注目を集めている。
このアプローチの課題は、特権情報によって、意図よりもモデル行動を変えることができることだ。
EviDence GuidEd On-Policy Distillation (EDGE-OPD)を提案する。
論文 参考訳(メタデータ) (2026-05-22T10:55:15Z) - SELF: Self-Evolution with Language Feedback [68.6673019284853]
SELF(Self-Evolution with Language Feedback)は、大規模言語モデルを進化させる新しいアプローチである。
LLMは、人間の学習プロセスと同様、自己回帰を通じて自己改善を可能にする。
数学および一般タスクにおける実験により,SELFは人間の介入なしにLLMの能力を高めることができることが示された。
論文 参考訳(メタデータ) (2023-10-01T00:52:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。