論文の概要: Multi-Turn On-Policy Distillation with Prefix Replay
- arxiv url: http://arxiv.org/abs/2607.04763v1
- Date: Mon, 06 Jul 2026 07:56:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.080101
- Title: Multi-Turn On-Policy Distillation with Prefix Replay
- Title(参考訳): プレフィックス・リプレイによるマルチターンオン・ポリシィ蒸留
- Abstract要約: エージェントタスクに対するReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
ReOPDは、プレコンパイルされた教師の軌跡を再生プレフィックスとして再利用する。
OPDレベルの精度を保存または改善し、学生のトレーニング中にゼロツールコールを使用し、PDよりもトレーニングステップあたり最低4$times$高速である。
- 参考スコア(独自算出の注目度): 73.10000453999088
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study on-policy distillation (OPD) for agentic tasks, where an LLM agent interacts with an environment over multiple turns and a student imitates a teacher over these multi-turn interaction histories. Fully online OPD is costly because each update requires fresh student rollouts through the environment and teacher queries at visited histories. We propose Replayed-Prefix On-Policy Distillation (ReOPD), an off-environment alternative that reuses pre-collected teacher trajectories as replayed prefixes: the student acts at selected steps, while the teacher provides dense per-step supervision without executing new environment interactions. We show that multi-turn OPD introduces a prefix trap: making histories more student-on-policy improves relevance to the student, but can query the teacher on histories where its target is unreliable. This creates a two-sided distribution shift between student occupancy and teacher reliability. ReOPD addresses this by treating multi-turn OPD as a reliability-aware prefix distribution design and implements it with a simple step-decaying sampling schedule that emphasizes early, lower-shift prefixes. Across mathematical reasoning with Python and search environments over multiple teacher and student model scales, ReOPD preserves or improves OPD-level accuracy, uses zero tool calls during student training, and is at least 4$\times$ faster per training step than OPD. ReOPD therefore turns expensive agent-environment interaction into a reusable offline resource, enabling scalable distillation across tools, tasks, and environments.
- Abstract(参考訳): 本研究では, LLMエージェントが複数回にわたって環境と相互作用し, 学生がこれらのマルチターンインタラクション履歴に対して教師を模倣する, エージェントタスクのためのオンライン蒸留(OPD)について検討する。
フルオンラインPDは、各アップデートには、環境を通じて新しい学生のロールアウトと、訪れた履歴に教師が問い合わせる必要があるため、費用がかかる。
本稿では,教師が選択したステップで行動する一方で,教師が新たな環境相互作用を実行することなく,密集したステップごとの指導を行うという,事前選択された教師軌道を再生プレフィックスとして再利用する環境外代替案であるReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
我々は,マルチターンOPDにプレフィックストラップを導入することを示し,歴史をもっと学生に提供することで,学生との関係は向上するが,教師にその対象が信頼できない歴史について問い合わせることができることを示した。
これにより、学生の就学率と教師の信頼性の両面的な分布シフトが生じる。
ReOPDは、マルチターンPDを信頼性に配慮したプレフィックス配布設計として扱い、早期の低シフトプレフィックスを強調した単純なステップ遅延サンプリングスケジュールで実装することで、この問題に対処する。
複数の教師と生徒のモデルスケールでPythonや検索環境を数学的に推論することで、ReOPDはPDレベルの精度を保存または改善し、学生のトレーニング中にツールコールをゼロにし、PDよりも少なくとも4$\times$速くする。
そのため、ReOPDは高価なエージェント環境のインタラクションを再利用可能なオフラインリソースに変換し、ツール、タスク、環境間のスケーラブルな蒸留を可能にします。
関連論文リスト
- dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts [48.550535291129584]
Prefix-Guided On-Policy Distillation (PG-OPD) は、固定長プレフィックスを用いて、高価な長距離発生前に軌跡値を推定する単純なロールアウト・アロケーションフレームワークである。
AMC、AIME、HMMTベンチマークの様々な教師/学生の組み合わせで、PG-OPDはトレーニング時間を最大2.46倍にし、平均精度を4.80ポイントまで改善している。
論文 参考訳(メタデータ) (2026-06-20T11:18:34Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - CLaaS: Continual learning as a service for sample efficient online learning [1.7646568737734192]
エージェントが一連のシナリオから学習するオンライン連続学習環境について検討する。
本稿では、エージェントがデプロイ中に改善できるシステムである継続的学習・アズ・ア・サービス(CL)を提案する。
対向課題におけるCLの評価を行い,パラメトリックな更新によって前向き転送の精度が向上し,文脈内学習よりも忘れられることが実証された。
論文 参考訳(メタデータ) (2026-06-04T01:14:19Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Efficient Unsupervised Environment Design through Hierarchical Policy Representation Learning [28.99712640511788]
非教師なし環境設計(UED)は、自動化カリキュラムを通じて汎用エージェントを開発するための有望なアプローチとして登場した。
環境設計のための階層型マルコフ決定プロセス(MDP)フレームワークを提案する。
本手法は,教師と教師の交流を1エピソードで減らしながら,ベースラインのアプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-02-10T14:19:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。