論文の概要: Graph-Conditioned On-Policy Agent Distillation from Off-the-Shelf Teachers
- arxiv url: http://arxiv.org/abs/2609.37522v1
- Date: Tue, 29 Sep 2026 13:12:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.534001
- Title: Graph-Conditioned On-Policy Agent Distillation from Off-the-Shelf Teachers
- Title(参考訳): オフザシェルフ教師のグラフ記述型オン・ポリシィ・エージェント蒸留
- Abstract要約: オンライン蒸留(OPD)は、生徒が生み出す軌跡に対する教師のフィードバックで、コンパクトな言語エージェントを訓練する。
教師の採点状況と実行証拠を充実させるGC-OPD(Graph-Conditioned On-Policy Agent Distillation)を導入する。
GC-OPDは、現在の参照や過去の代替品を取得し、学生の視線と組み合わせて、オリジナルの思考アクショントークンをスコアする。
- 参考スコア(独自算出の注目度): 36.72804395570285
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) trains compact language agents with teacher feedback on student-generated trajectories. In multi-turn tasks, compounding errors can move students beyond the teacher's effective supervision. We introduce Graph-Conditioned On-Policy Agent Distillation (GC-OPD), which enriches an off-the-shelf teacher's scoring context with execution evidence. A graph indexes repeated teacher executions by shared states while preserving complete successful and failed histories. After each student episode, GC-OPD retrieves current-state references or historical alternatives and combines them with student hindsight to score the original thought-action tokens. Using the same original teachers, GC-OPD improves mean success over vanilla OPD from 24.70% to 48.78% on ScienceWorld (4B student), from 53.36% to 85.26% on ALFWorld Unseen, and from 29.10% to 37.65% on WebShop. At matched student sizes, it also achieves higher mean success than every evaluated OPD baseline using GRPO-trained teachers on ScienceWorld and ALFWorld; the strongest such ScienceWorld 4B baseline reaches 46.66%. GC-OPD requires no task-specific teacher optimization.
- Abstract(参考訳): オンライン蒸留(OPD)は、生徒が生み出す軌跡に対する教師のフィードバックで、コンパクトな言語エージェントを訓練する。
マルチターンタスクでは、複合的なエラーが生徒を教師の効果的な監督から遠ざける。
教師の採点状況と実行証拠を充実させるGC-OPD(Graph-Conditioned On-Policy Agent Distillation)を導入する。
グラフは、完全な成功と失敗の履歴を保持しながら、共有状態によって繰り返し教師の実行をインデックスする。
各学生エピソードの後、GC-OPDは現在の基準や過去の代替品を回収し、学生の視線と組み合わせてオリジナルの思考行動トークンをスコアする。
同じ教師を用いて、GC-OPDは、バニラOPDを24.70%から48.78%に、ALFWorld Unseenで53.36%から85.26%に、WebShopで29.10%から37.65%に改善した。
一致した学生数では、GRPOで訓練されたScienceWorldとALFWorldの教師を用いて評価された全てのPDベースラインよりも平均的な成功を達成し、最も強力なScienceWorld 4Bベースラインは46.66%に達した。
GC-OPDはタスク固有の教師最適化を必要としない。
関連論文リスト
- PR-OPD: Privileged Representation On-policy Self-Distillation for Agentic Reinforcement Learning [15.701641295904054]
プリビリード表現オン政治自己蒸留(PR-OPD)を提案する。
PR-OPDは、各軌跡に対する後見スキルを書き、そのスキルを停止段階の教師として、自身の応答を再読し、その隠れた状態を、報酬目的に沿ったすべての階層の教師のものと整合させる。
ALFWorldとWebShopには2つのバックボーンがある。
論文 参考訳(メタデータ) (2026-09-29T03:46:52Z) - DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation [21.879988758181312]
DuoOPDは、より強い教師からのトークンレベルのフィードバックで、生徒に独自のレスポンスでトレーニングする。
教師のみが成功すると、その正解は学生の失敗する反応を評価する文脈となる。
1つのルールはタスク固有の設定なしで4つの結果の組み合わせをカバーします。
論文 参考訳(メタデータ) (2026-09-27T16:15:02Z) - Trajectory Learnability for Offline On-Policy Distillation with Imperfect Teachers [2.6641834518599303]
そこで我々は,教師が抱える問題から,各学習者の気道におけるトークンの確率がどう変化するかを測定した。
継続に基づく推定とは異なり、学習容易性は追加生成を必要とせず、格納された軌跡やモデルチェックポイントから一度計算できる。
論文 参考訳(メタデータ) (2026-09-16T08:41:16Z) - Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation [18.893534946567218]
オンライン蒸留(On-policy distillation、OPD)は、学生が訪れた州を教師が監督する制度である。
本稿では,教師の短い橋渡しを行うFutureBridge-OPD(FTB)を提案する。
Qwen3-32Bの主教師がQwen3-1.7Bの学生設定で、FTBはバニラOPDとTCODを平均16.6点、7.6点で上回っている。
論文 参考訳(メタデータ) (2026-08-03T09:25:42Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。