論文の概要: Trust Region Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.04751v1
- Date: Mon, 06 Jul 2026 07:43:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.073455
- Title: Trust Region Policy Distillation
- Title(参考訳): 信託地域政策蒸留
- Authors: Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang,
- Abstract要約: 信頼地域政策蒸留(TOP-D)は、教師を動的に構築することで、不安定で高分散のオン・ポリティ蒸留(OPD)を安定した訓練パラダイムに変換する。
経験的に、TOP-Dは、数学的推論タスクにおけるトレーニングの安定性、サンプル効率、最終的なパフォーマンスを劇的に向上させる。
さらに重要なことに、TOP-Dは計算オーバーヘッドをゼロにし、十分に確立されたPDパラダイムに代わる有望な代替品として位置づけている。
- 参考スコア(独自算出の注目度): 16.178737903095787
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Big goals are hard to achieve all at once; breaking them into small steps is wiser. We present Trust Region Policy Distillation (TOP-D), which transforms the notoriously unstable, high-variance On-Policy Distillation (OPD) into a stable training paradigm by dynamically constructing a proximal teacher. Theoretically, we establish a rigorous framework demonstrating that TOP-D inherently controls gradient variance. By providing a formal global convergence analysis alongside a monotonic improvement bound, we mathematically formalize the reliability and stability of the overall training dynamics. Empirically, TOP-D dramatically enhances training stability, sample efficiency, and final performance on mathematical reasoning tasks. More importantly, TOP-D introduces zero additional computational overhead, positioning itself as a promising alternative to the well-established OPD paradigm.
- Abstract(参考訳): 大きな目標を一度に達成するのは難しく、それらを小さなステップに分割する方が賢明です。
本稿では,TOP-D(Trust Region Policy Distillation, 信頼地域政策蒸留, TOP-D)を提案する。
理論的には、TOP-Dが本質的に勾配分散を制御していることを示す厳密な枠組みを確立する。
単調な改善境界とともに公式なグローバル収束解析を提供することにより、総合的なトレーニングダイナミクスの信頼性と安定性を数学的に定式化する。
経験的に、TOP-Dは、数学的推論タスクにおけるトレーニングの安定性、サンプル効率、最終的なパフォーマンスを劇的に向上させる。
さらに重要なことに、TOP-Dは計算オーバーヘッドをゼロにし、十分に確立されたPDパラダイムに代わる有望な代替品として位置づけている。
関連論文リスト
- Trust Region On-Policy Distillation [38.98697509635889]
On-Policy Distillation (OPD) は、大規模言語モデルの効率的なポストトレーニング手法である。
この研究は、信用割当戦略を通じて、信頼できるオン・ポリティクスのトークンレベルの監督に対処する。
実験の結果、TrOPDはSoTA OPDベースラインを一貫して上回ることがわかった。
論文 参考訳(メタデータ) (2026-05-31T14:04:51Z) - DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning [30.908304728142983]
クエリ適応信頼度ポリシー最適化(QUATRO)を提案する。
QUATROは、原則化された最適化を通じて、信頼領域の制約を直接実施する。
様々な数学的推論のベンチマークで実証的な検証を行ったところ、QUITROは政策安定度の増加の下で安定な振舞いを示す。
論文 参考訳(メタデータ) (2026-02-04T14:51:04Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones [3.7312377768685714]
本稿では,RL の目標,報酬,計算予算を変更することなく,高平均ステップへの勾配更新を動的に再配置する軽量なステップ選択戦略である Adaptive Trajectory Policy Optimization (ATPO) を提案する。
ATPOは、dLLM RLを進める上で、軌道動力学の活用が鍵であることを示し、ベンチマーク全体にわたって精度とトレーニング安定性の推論においてかなりの向上をもたらす。
論文 参考訳(メタデータ) (2025-11-19T07:59:34Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z) - Training Generative Adversarial Networks by Solving Ordinary
Differential Equations [54.23691425062034]
GANトレーニングによって引き起こされる連続時間ダイナミクスについて検討する。
この観点から、GANのトレーニングにおける不安定性は積分誤差から生じると仮定する。
本研究では,有名なODEソルバ(Runge-Kutta など)がトレーニングを安定化できるかどうかを実験的に検証する。
論文 参考訳(メタデータ) (2020-10-28T15:23:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。