論文の概要: DivOPD: Spread Wide, Look Close for Asynchronous On-Policy Distillation of Multi-turn Agents
- arxiv url: http://arxiv.org/abs/2609.34838v1
- Date: Mon, 28 Sep 2026 10:35:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:24:13.021688
- Title: DivOPD: Spread Wide, Look Close for Asynchronous On-Policy Distillation of Multi-turn Agents
- Title(参考訳): DivOPD: マルチターンエージェントの非同期on-policy蒸留に近づいた
- Abstract要約: DivOPDは単純な学習者側バッチ選択法であり、より多くのロールアウトに固定ターン予算を分散させる。
累積的な教師が生み出す経験でターンを優先する。
トレーニングトークンの1.84倍、バニラOPDの1.87倍のGPU時間を持つ、レポートされた設定固有のターゲットに到達する。
- 参考スコア(独自算出の注目度): 13.785021627723061
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) trains student agents through teacher supervision on their own interactions with an environment. However, in asynchronous multi-turn training, arrival-order batching can allow a few early or long rollouts to dominate learner updates while other valid rollouts become stale before being used, wasting already-generated experience. To address this problem, we introduce DivOPD, a simple learner-side batch-selection method that spreads a fixed turn budget across more rollouts and, within each rollout, prioritizes turns with larger cumulative teacher-student disagreement. Turns without usable teacher feedback are excluded. The per-turn loss and optimizer remain fixed; selection only changes which student-visited turns receive training weight. For no-progress rollouts, an optional extension briefly hands control to the teacher before returning it to the student. Across six teacher-student settings on the simulated ALFWorld, ScienceWorld, and WebShop benchmarks, with 1.5B-7B students, DivOPD raises cross-setting mean peak success rate from 77.4 to 84.4 and mean success over the last five evaluations from 71.5 to 78.6. It reaches all reported setting-specific targets with geometric-mean speedups of 1.84x in training tokens and 1.87x in learner GPU time relative to vanilla OPD. Teacher intervention further raises this last-five mean to 82.4 while retaining about 1.7x learner-GPU speedup over vanilla OPD. Code will be released at https://github.com/HanyangWang0418-oss/DivOPD.
- Abstract(参考訳): オンライン蒸留(On-policy distillation、OPD)は、教師が環境との相互作用を監督することで学生エージェントを訓練する。
しかし、非同期のマルチターントレーニングでは、到着順序のバッチ処理によって、いくつかの早期または長期のロールアウトが学習者の更新を支配し、他の有効なロールアウトが使用される前に古いものになり、すでに生成されたエクスペリエンスを無駄にすることができる。
この問題を解決するために、DivOPDという単純な学習者側バッチ選択方式を導入し、固定ターン予算をより多くのロールアウトに分散させ、各ロールアウトにおいて、より大きい累積教師/学生の不一致でターンを優先順位付けする。
教師のフィードバックがないターンは除外される。
ターン当たりの損失とオプティマイザは固定されており、選択は生徒が訪問したターンがトレーニング重量を受け取った場合だけに限られる。
プログレスなしのロールアウトの場合、オプション拡張は、生徒に返す前に、一時的に教師に制御を手渡す。
シミュレーションされたALFWorld、ScienceWorld、WebShopの6つの教師によるベンチマークでは、1.5B-7Bの学生が参加し、DivOPDはクロスセットの平均ピーク成功率を77.4から84.4に引き上げ、過去5回の評価を71.5から78.6に引き上げている。
トレーニングトークンの1.84倍、バニラOPDの1.87倍のGPU時間を持つ、レポートされた設定固有のターゲットに到達する。
教師の介入により、この最後の5つの平均値が82.4に上昇し、バニラPDよりも約1.7倍の学習者-GPUスピードアップを維持している。
コードはhttps://github.com/HanyangWang0418-oss/DivOPDでリリースされる。
関連論文リスト
- WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation [9.897015521661915]
オンライン蒸留(OPD)は、露光バイアスを減らすために学生モデルを自身のロールアウトで訓練する。
既存のカリキュラム学習手法は、学習の進捗に応じてどの程度の教師支援が使われているかを規定するが、いつ必要かは決定できない。
DASH-OPDは,実行者を適応的に双方向に切り替える新しいエージェントOPD法である。
論文 参考訳(メタデータ) (2026-07-31T06:57:17Z) - Pass the Baton: Trajectory-Relayed On-Policy Distillation [23.50689651536186]
オンライン蒸留は、学生自身の軌道におけるトークンレベルの監督を基礎としているが、プレフィックスの失敗に悩まされている。
Relay On-Policy Distillation (Relay-OPD)において、失敗プレフィックス上の教師-学生継続非対称性を特定し、ラベルなしハンドオフトリガに変換する。
トレーニング中、Relay-OPDは、教師が検出されたトリガーポイントを一時的に引き継ぎ、教師の足を生成し、その後、生徒が再開し、その結果の軌道に最適化することで、リレーの軌跡を構築する。
論文 参考訳(メタデータ) (2026-07-28T17:59:46Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - Multi-Turn On-Policy Distillation with Prefix Replay [73.10000453999088]
エージェントタスクに対するReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
ReOPDは、プレコンパイルされた教師の軌跡を再生プレフィックスとして再利用する。
OPDレベルの精度を保存または改善し、学生のトレーニング中にゼロツールコールを使用し、PDよりもトレーニングステップあたり最低4$times$高速である。
論文 参考訳(メタデータ) (2026-07-06T07:56:53Z) - Blockwise Policy-Drift Gating for On-Policy Distillation [14.61751557296924]
オンライン蒸留(OPD)は、学生自身によってサンプリングされた軌跡に基づいて計算された教師信号を用いて生徒の政策を訓練する。
本稿では,OPDをロールアウト再利用するための軽量な学生専用ドリフトコントローラであるブロックワイド・ポリシー・ドリフト・ゲーティングを紹介する。
論文 参考訳(メタデータ) (2026-06-23T02:58:16Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。