論文の概要: DAPD: Dual-Anchored Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.01735v1
- Date: Mon, 03 Aug 2026 06:00:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.378971
- Title: DAPD: Dual-Anchored Policy Distillation
- Title(参考訳): DAPD:デュアルアンコール型政策蒸留
- Abstract要約: オン・ポリシー(自己)蒸留(OPSD)は、言語モデル後訓練においてますます採用されている。
教師を特権情報で強化するが、特権錯覚を引き起こすことがある。
我々は、この非対称性を解決するために、DAPD(Dual-Anchored Policy Distillation)を提案する。
- 参考スコア(独自算出の注目度): 23.600341643801844
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy (self) distillation (OPSD) is increasingly adopted for language-model post-training. It strengthens the teacher with privileged information but can induce a privilege illusion: the student learns privilege-dependent behavior it cannot reproduce from its inference-time context, yet behaves as if the training-time privileged information remained available, ultimately degrading performance. In this paper, we identify information asymmetry between the privileged teacher and the student at inference as the root cause of this failure in OPSD. To resolve this asymmetry, we propose Dual-Anchored Policy Distillation (DAPD), a unified framework with two levels of anchoring. Dual-Path Anchoring (DPA) introduces a self-conditioned bridge and aligns reference and rollout behavior along two matched-information paths, preventing privilege-dependent behavior from being transferred to the inference-time student. Dual-Source Anchoring (DSA) applies these paths in both reference-to-rollout and rollout-to-reference directions, reducing reliance on privileged reference guidance while preserving correctness supervision. Extensive experiments show that DAPD significantly alleviates privilege illusion, outperforming OPSD on Qwen3-4B by +2.00 points on average across tasks. Notably, its gains persist across scales, reaching +2.69 at 4B and +2.78 at 32B.
- Abstract(参考訳): オン・ポリシー(自己)蒸留(OPSD)は、言語モデル後訓練においてますます採用されている。
学生は推論時から再現できない特権依存的な振る舞いを学習するが、訓練時特権情報が利用可能のままであるかのように振舞い、最終的には性能を低下させる。
本稿では,OPSDにおけるこの障害の根本原因として,特権教師と学生の推論における情報非対称性を同定する。
この非対称性を解決するために,2段階のアンカーを有する統合フレームワークであるDual-Anchored Policy Distillation (DAPD)を提案する。
Dual-Path Anchoring (DPA)は、自己条件のブリッジを導入し、2つの一致した情報経路に沿って参照とロールアウトの動作を調整する。
Dual-Source Anchoring (DSA) は、これらのパスをリファレンス・トゥ・ロールアウトとロール・トゥ・レファレンス方向の両方に適用し、正当性を保ちながら特権化された参照ガイダンスへの依存を減らす。
DAPDはQwen3-4B上のOPSDを平均2.00ポイント上回り、特権錯覚を著しく緩和することを示した。
特に、その利得はスケールにわたって持続し、4Bでは+2.69、32Bでは+2.78に達する。
関連論文リスト
- Latent On-Policy Self-Distillation [55.57800223145407]
On-policy Self-distillation (OPSD) は、特権的な自己教育者を用いて、生徒自身の軌跡を集中的に管理することにより、効果的な経路を提供する。
既存の方法はまだデザイナーが指定した特権的アーティファクトに大きく依存している。
本稿では,教師の特権的文脈自体を経験から学習可能なエンド・ツー・エンドにするため,LOPD(Latent On-Policy Self-Distillation)を導入する。
論文 参考訳(メタデータ) (2026-08-13T10:05:51Z) - Adaptive Supervised Anchoring for On-Policy Self-Distillation [15.445625053566244]
オンライン自己蒸留は、学生から採取した軌道上の凍結教師からの指導を蒸留することにより、言語モデルに適応する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
本稿では,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T05:46:32Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - DOPD: Dual On-policy Distillation [59.65986569617147]
オンライン蒸留は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することで、優れた容量転送を提供する。
特権教師と特権学生の政策の間のトークンレベルの監督を動的にルーティングするアドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方の実験は、DOPDがバニラPDを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-29T17:55:53Z) - Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation [9.745547158215905]
我々は、特権的監督を阻害するデュアルビューフレームワークであるAnchored Residual On-Policy Distillation (AR-OPD)を紹介する。
AR-OPDはフル特権のPDを2.3ポイント、SFTを7.9ポイント上回る。
論文 参考訳(メタデータ) (2026-06-09T03:51:41Z) - EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation [5.310892696470208]
On-Policy Distillation (OPD)はLLMポストトレーニングパラダイムとして広く注目を集めている。
このアプローチの課題は、特権情報によって、意図よりもモデル行動を変えることができることだ。
EviDence GuidEd On-Policy Distillation (EDGE-OPD)を提案する。
論文 参考訳(メタデータ) (2026-05-22T10:55:15Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes [10.319573084070578]
オンライン蒸留(OPD)とオンライン自己蒸留(OPSD)は,大規模言語モデルのための有望なポストトレーニング手法として出現している。
我々は、OPDとOPSDがいつ機能するか、いつ機能しないのか、なぜ機能しないのかについて、総合的な実証的研究を行った。
論文 参考訳(メタデータ) (2026-05-11T19:44:59Z) - SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting [17.504616835765617]
両経路適応型学習フレームワークを提案する。
SCOPEは、Avg@32で11.42%、Pass@32で7.30%の平均相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-04-12T15:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。