論文の概要: Trapped by Their Own Rollouts: Understanding Aggregation--Rollout Feedback in Federated On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.32573v1
- Date: Sat, 26 Sep 2026 12:48:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 06:16:03.527923
- Title: Trapped by Their Own Rollouts: Understanding Aggregation--Rollout Feedback in Federated On-Policy Distillation
- Title(参考訳): 自家製ロールアウト--フェデレーションオン・ポリシィ蒸留における凝集-ロールアウトフィードバックの理解-
- Abstract要約: オンライン蒸留(OPD)は言語モデル適応への有望なアプローチである。
フェデレーションOPDについて検討し、学習速度の感度によってかなりのコラボレーションの利得が明らかになることを示した。
本稿では,FedAvg更新の規模をクライアントワイド予測変更制約に適応させるため,現在のトラジェクトリに対する教師のフィードバックを再利用するFedTOPSを提案する。
- 参考スコア(独自算出の注目度): 21.610540680175294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) is a promising approach to language-model adaptation, aligning teacher supervision with the student's own generated trajectories. When adaptation prompts are distributed across clients, can this process benefit from federated collaboration? We study federated OPD and find that substantial collaboration gains can be obscured by learning-rate sensitivity: FedAvg can perform no better than independent local training at a small learning rate, yet recover a clear advantage at a larger rate. We explain this phenomenon through the student's dual role as learner and generator of future training data. An aggregation-induced optimization lag can delay access to useful teacher supervision, which in turn slows subsequent learning. Our theory establishes this aggregation--rollout feedback in a solvable model with a common optimum and stable updates, and identifies two coupled roles of learning rate: learning from current supervision and reaching future supervision. Guided by this analysis, we propose FedTOPS (Federated Teacher-guided On-Policy Scaling), which reuses teacher feedback on current trajectories to adapt the FedAvg update magnitude under clientwise predictive-change constraints. Across six mathematical reasoning benchmarks, FedTOPS improves macro Avg@8 over FedAvg by 4.56--14.57 percentage points across the evaluated student models and local learning rates.
- Abstract(参考訳): オンライン蒸留(On-policy distillation,OPD)は,教師の指導を学生自身が生成した軌跡と整合させる,言語モデル適応への有望なアプローチである。
適応プロンプトがクライアントに分散されている場合、このプロセスは連携したコラボレーションの恩恵を受けますか?
FedAvgは、小さな学習率で独立したローカルトレーニングを行なえるが、より大きな学習率で明確な優位性を取り戻すことができる。
我々は,この現象を,将来の学習データの学習者および生成者としての学生の二重的役割を通して説明する。
集約によって引き起こされる最適化ラグは、有用な教師監督へのアクセスを遅らせ、結果としてその後の学習を遅らせる。
我々の理論は、このアグリゲーション-ロールアウトフィードバックを、共通の最適かつ安定した更新を伴う解決可能なモデルで確立し、学習率の2つの組み合わせの役割を同定する。
この分析で導かれたFedTOPS(Federated Teacher-Guided On-Policy Scaling)は,教師のフィードバックを現在のトラジェクトリに再利用し,FedAvg更新の規模をクライアント側の予測変化制約に適応させる。
6つの数学的推論ベンチマークで、FedTOPSはFedAvgよりもマクロAvg@8を4.56-14.57ポイント改善している。
関連論文リスト
- TIDE: Teacher-Student Transition via Informative Distillation and Exploration for Agentic RL [2.368125721547952]
マルチターンエージェントは、長い地平線上での情報収集、行動、フィードバックを調整する戦略を必要とする。
オンライン蒸留(OPD)によりRLを増強する最近の方法
潮流は教師の指導と報奨による更新を共同で調整する。
論文 参考訳(メタデータ) (2026-09-28T12:51:48Z) - What Shared Prefixes Hide: Trajectory Dropout for On-Policy Distillation [17.676705850864103]
共有プレフィックスがトークンレベルの更新を弱める可能性があることが分かりました。
生徒の信頼度の高さは、教師が反対しても補正勾配を弱めることがある。
我々はこれらの弱化信号を公開する簡単な訓練時間介入であるトラジェクトリ・ドロップアウトを提案する。
論文 参考訳(メタデータ) (2026-09-27T11:08:31Z) - Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation [41.854144563456046]
弱強一般化は、より弱いスーパーバイザーからより強力なモデルを学び、それらを上回ることができるかどうかを問う。
本稿では,教師の政策シフトを評価し,学生の検証者主導の政策勾配を増幅するOn-Policy Reverse Distillationを紹介する。
連続したモデル転送とマルチティーチンガー蒸留の両方において、OPRDは既存のRLや蒸留手法よりも学生更新が少なく、極めて高い性能を達成している。
論文 参考訳(メタデータ) (2026-09-08T14:26:35Z) - Learning from the Future: Privileged Self-Distillation for Sequential Recommendation [51.993699802866956]
本稿では,学習時間情報と推論時間情報とを分離するフレームワークを提案する。
Privileged Self-Distillation (PSD)は、学習時間情報を推論時間情報から分離する。
PSDは1つの段階でエンドツーエンドに最適化され、デプロイされたモデルと推論コストは変わらない。
論文 参考訳(メタデータ) (2026-07-29T15:47:22Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization [18.027254451537342]
既存の自己蒸留法は、文脈拡張型教師モデルに向けた学習をKLマッチングに大きく還元する。
textbfPreference-textbfBased textbfSelf-textbfDistillation (textbfPBSD)を提案する。
論文 参考訳(メタデータ) (2026-05-06T15:31:50Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。