論文の概要: TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
- arxiv url: http://arxiv.org/abs/2607.05804v1
- Date: Tue, 07 Jul 2026 03:56:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.393672
- Title: TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
- Title(参考訳): TurnOPD: 効率的な長距離エージェント訓練のためのオンライン蒸留ターンアウェアの開発
- Abstract要約: オンライン蒸留(英語版) (OPD) は、生徒自身の軌道上の強い教師と一致することによって、生徒の政策を訓練する。
本研究では, 長期化剤の高効率蒸留のためのターンレベルの予算化戦略であるTurnOPDを提案する。
- 参考スコア(独自算出の注目度): 52.6661804966136
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.
- Abstract(参考訳): オンライン蒸留(英語版)(OPD)は、学生自身の軌道上で強い教師と一致することによって学生政策を訓練し、言語エージェント訓練のための有望な枠組みを提供する。
しかし、長距離エージェントタスクへの応用はいまだに不十分である。
筆者らはバニラ剤OPDの2つの重要な非効率性を同定した: 1) 完全水平ロールアウトは、弱いKLを監督する尾翼のウォールクロック資源を無駄にし、(2) 軌跡レベルのKL目的は、浅いトークンに損失の大部分を集中させ、初期動作が整うと、より深い決定が下方修正される。
これらの課題に対処するため, 長軸エージェントの高効率オンライン蒸留のためのターンレベルの予算化戦略であるTurnOPDを提案する。
TurnOPDは2つの予算制御器から構成される: 適応的なロールアウト深度予算計算は、ロールアウトの長さを決定するためにプローブベースのターン統計を使い、プログレッシブなターン正規化損失予算計算は、KL重み付けをトークンレベルからターンバランスの監督へと徐々にシフトする。
ALFWorld,WebShop,Multi-Hop Searchのタスク特化教師モデルによる実験により,TurnOPDは同等のウォールタイムトレーニング予算下で優れた検証精度を達成し,バニラPDを超える精度時間フロンティアを向上することが示された。
関連論文リスト
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents [6.4535223115254885]
長距離対話タスクのための小さな言語モデルエージェントの訓練には、高速な模倣と報酬駆動型改善が必要である。
我々は,この相補性を明示的に活用するハイブリッドオンライン蒸留アルゴリズムであるATOD(Annealed Turn-aware On-policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-06-26T07:56:32Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - Trust Region On-Policy Distillation [38.98697509635889]
On-Policy Distillation (OPD) は、大規模言語モデルの効率的なポストトレーニング手法である。
この研究は、信用割当戦略を通じて、信頼できるオン・ポリティクスのトークンレベルの監督に対処する。
実験の結果、TrOPDはSoTA OPDベースラインを一貫して上回ることがわかった。
論文 参考訳(メタデータ) (2026-05-31T14:04:51Z) - Are Full Rollouts Necessary for On-Policy Distillation? [63.18243901591995]
オンライン蒸留(OPD)は、学生が生み出すロールアウトに沿って密集した教師のフィードバックを提供する。
我々は、ロールアウトの地平線を、トレーニング効率に大きく影響を及ぼすOPDの重要なボトルネックとみなす。
本稿では,トレーニング中に徐々にロールアウト地平線を拡大するプログレッシブPDと,信頼性の高い切り抜きロールアウトで恒久的に蒸留を行うTrncated OPDの2つの簡単な水平制御戦略を提案する。
論文 参考訳(メタデータ) (2026-05-29T16:12:54Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling [29.182538022605627]
Branching Relative Policy Optimization (BranPO) は、高額な報酬なしで段階レベルのコントラスト管理を提供する価値のない手法である。
BranPOは尾部付近の軌跡を切断し、他の連続をサンプリングし、共有接頭辞の上に対照的な接尾辞を構成する。
さらに効率を向上し、トレーニングを安定させるために、タスク間の分岐周波数に適応する難易度分岐サンプリングと、不正な動作を抑制するために冗長なステップマスキングを導入する。
論文 参考訳(メタデータ) (2026-02-03T16:43:09Z) - Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。
数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文 参考訳(メタデータ) (2025-11-17T19:02:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。