論文の概要: Persistent Teacher Anchoring for Tool-Using Agents
- arxiv url: http://arxiv.org/abs/2609.04773v1
- Date: Fri, 04 Sep 2026 06:09:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.929252
- Title: Persistent Teacher Anchoring for Tool-Using Agents
- Title(参考訳): ツール・ユース・エージェントのための永続的教師登録
- Abstract要約: 本稿では,学生が指導するが教師が委託するロールアウト構造であるPTA(Persistent Teacher Anchoring)を提案する。
PTAはチャンクレベルの検証を保持し、ターンレベルのコミットメントを追加します。
PTAは、同じ下流のRL予算でOPKDを2.5倍、2.8ポイント改善し、ルックアヘッドはスループットを24%改善した。
- 参考スコア(独自算出の注目度): 7.833492747957308
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Distillation is common in LLM post-training, where on-policy knowledge distillation (OPKD) uses student-generated trajectories to prepare the student for downstream RL. At each state, the student matches a next-token distribution supplied by the teacher. As the rollout enters states the teacher would not visit, the teacher-student distribution gap can accumulate. In tool use, this gap becomes consequential because student-written calls execute before supervision and their observations shape later prefixes. Proposer-verifier generation addresses this drift by letting the teacher decide which student-proposed text is retained during generation. Existing formulations govern text but leave tool execution outside their scope. We propose Persistent Teacher Anchoring (PTA), a student-induced but teacher-committed rollout construction. PTA retains chunk-level verification and adds turn-level commitment, allowing a call to reach the environment only after the teacher has verified the entire turn. Treating verified chunks as atomic generation units, we introduce persistent lookahead, which fills idle rollout capacity by advancing future samples and carrying unfinished ones across student updates under the fixed verifier. Across Search-R1-style retrieval and DeepEyes-style perception RL, applying PTA before downstream RL improves macro best@4 by 2.5 and 2.8 points over OPKD under the same downstream RL budget, while lookahead improves throughput by 24%.
- Abstract(参考訳): LLMポストトレーニングでは蒸留が一般的であり、オンライン知識蒸留(OPKD)は学生が生み出す軌跡を利用して下流のRLに備える。
各状態において、生徒は教師が供給する次の生徒の配当にマッチする。
ロールアウトが入ると、教師が訪れない状態になり、教師と学生の分散ギャップが蓄積される。
ツール使用において、このギャップは、学生による呼び出しが監督の前に実行され、その観察形態が後にプレフィックスになるため、連続的に発生する。
Proposer-verifier 生成は、このドリフトに対処するため、教師が生成中にどの学生提案されたテキストが保持されているかを判断する。
既存の定式化はテキストを管理するが、ツールの実行はスコープ外に置いておく。
本稿では,学生が指導するが教師が委託するロールアウト構造であるPTA(Persistent Teacher Anchoring)を提案する。
PTAはチャンクレベルの検証を保持し、ターンレベルのコミットメントを追加します。
検証チャンクを原子生成単位として扱うことで、将来のサンプルを前進させ、固定検証器の下で未完成のものを運ぶことで、アイドルロールアウト容量を埋める永続的なルックアヘッドを導入する。
検索-R1スタイルの検索とDeepEyesスタイルの認識RLは、ダウンストリームRLの前にPTAを適用して、同じダウンストリームRL予算下でOPKD上のマクロベスト@4を2.5倍、2.8ポイント改善し、ルックアヘッドはスループットを24%改善する。
関連論文リスト
- Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation [37.73879161170101]
オンライン蒸留(OPD)は、学生自身のロールアウトにおいて、凍結した教師から密集したトークンレベルの監督を提供することによって、ポストトレーニングを加速する。
Vanilla OPDは、教師が各プロンプトに対して信頼できるかどうかを確認することなく、この監督をプロンプト全体に均一に適用する。
本稿では,教師の信頼性を高密度監督が認められる前に早期に検証すべきという原則に基づくTGOPD(Teacher-Gated On-Policy Distillation)を紹介する。
論文 参考訳(メタデータ) (2026-09-02T17:54:09Z) - Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation [97.02922768457239]
Context-Matched Distillation (CMD) は、教師の監督と、各ターゲットが生成される際に利用可能な情報とを整合させる因果的MDDフレームワークである。
Prefix Corruptionは、このターゲットコンテキストアライメントを維持しながら、トレーニングの初期段階で生成された信頼性の低いプレフィックスを摂動することで、トレーニングを安定化させる。
ショートビデオとロングビデオの両方のベンチマークで、自己回帰手法における最先端の集約性能を実証した。
論文 参考訳(メタデータ) (2026-08-13T15:51:31Z) - PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation [1.1440940588722308]
On-policy Self-distillation (OPSD) は、特権教師を用いて、自身のロールアウトからサンプリングされたプレフィックスの推論モデルを監督する。
PAST(Privleged Adaptation from Students Trajectories)を紹介する。
PASTは、学生の蒸留プレフィックスをそのまま残しながら、各学生軌跡をOPSD教師に追加の特権情報として扱う。
論文 参考訳(メタデータ) (2026-08-09T14:20:12Z) - Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation [18.893534946567218]
オンライン蒸留(On-policy distillation、OPD)は、学生が訪れた州を教師が監督する制度である。
本稿では,教師の短い橋渡しを行うFutureBridge-OPD(FTB)を提案する。
Qwen3-32Bの主教師がQwen3-1.7Bの学生設定で、FTBはバニラOPDとTCODを平均16.6点、7.6点で上回っている。
論文 参考訳(メタデータ) (2026-08-03T09:25:42Z) - Multi-Turn On-Policy Distillation with Prefix Replay [73.10000453999088]
エージェントタスクに対するReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
ReOPDは、プレコンパイルされた教師の軌跡を再生プレフィックスとして再利用する。
OPDレベルの精度を保存または改善し、学生のトレーニング中にゼロツールコールを使用し、PDよりもトレーニングステップあたり最低4$times$高速である。
論文 参考訳(メタデータ) (2026-07-06T07:56:53Z) - Trajectory-Refined Distillation [25.346810464266497]
トラジェクトリ精製蒸留(Trjectory-Refined Distillation, TRD)は、教師指導下で生徒のロールアウトをオンライン支援中に修正するトラジェクトリレベルの補正法である。
TRDは、特権情報に規定された学生モデルを教師として使用するパラメータ共有型である、オンライン自己蒸留(OPSD)にも適用することができる。
論文 参考訳(メタデータ) (2026-06-07T03:17:25Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。