論文の概要: From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.27937v1
- Date: Thu, 30 Jul 2026 09:47:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.493087
- Title: From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents
- Title(参考訳): Scoring から Acting: Outcome-Verified Comparison Self-Distillation for LLM Agents (特集 バイオサイバネティックスとバイオサイバネティックス)
- Abstract要約: 我々は,OVCSD(Outcome-Verified Comparison Self-Distillation)を提案する。
OVCSDは失敗に終わった学生をプレフィックスツリーに配置し、学生が設定した状態からスキル条件の教師を適応的に呼び出す。
3つのモデルスケールにわたるALFWorldとWebShopの実験は、OVCSDがスキルのないRLと既存の自己蒸留ベースラインを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 16.67357658768852
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work on LLM agents is shifting from external capability elicitation to capability internalization, enabling agents to retain useful skills without retrieval at inference time. On-policy self-distillation (OPSD) offers a promising direction, but many existing methods typically supervise students by scoring actions along student-generated trajectories. Such supervision has two limitations: teacher preferences are not validated by environment outcomes, and action-level scores underuse information from student rollouts, teacher rollouts, and their behavioral relationship. We therefore advocate outcome-verified teacher supervision and comparative learning over teacher-student trajectories. Based on this view, we propose Outcome-Verified Comparative Self-Distillation (OVCSD). OVCSD organizes failed student rollouts into a prefix tree, adaptively invokes a skill-conditioned teacher from student-reached states, and retains only outcome-verified successful continuations. It then applies localized comparative learning at the first state-aligned divergence and distills the post-divergence teacher suffix to transfer completion behavior. Experiments on ALFWorld and WebShop across three model scales show that OVCSD consistently outperforms skill-free RL and existing self-distillation baselines, achieving up to 29.7 and 5.4 absolute success-rate gains over the strongest baselines on ALFWorld and WebShop, respectively, while adding less than 3% privileged interaction during training.
- Abstract(参考訳): LLMエージェントの最近の研究は、外部能力の解放から能力の内在化へと移行しており、エージェントは推論時に検索することなく有用なスキルを維持できる。
On-policy Self-distillation (OPSD) は有望な方向性を提供するが、既存の多くの手法は学生が生成した軌道に沿って行動を評価することによって生徒を監督する。
教師の選好は環境効果によって検証されず、アクションレベルスコアは学生のロールアウト、教師のロールアウト、行動関係からの情報を利用する。
そこで我々は,教師教育における教師の指導と比較学習を実践する。
そこで本研究では,OVCSD(Outcome-Verified Comparison Self-Distillation)を提案する。
OVCSDは失敗に終わった学生をプレフィックスツリーに配置し、学生が設定した状態からスキル条件の教師を適応的に呼び出す。
次に、最初の状態整合性分岐において局所的な比較学習を適用し、分岐後の教師接尾辞を蒸留して完了挙動を伝達する。
3つのモデルスケールにわたるALFWorldとWebShopの実験では、OVCSDはスキルフリーのRLと既存の自己蒸留ベースラインを一貫して上回り、ALFWorldとWebShopの最大のベースラインに対して最大29.7と5.4の絶対的な成功率を達成し、トレーニング中に3%未満の特権的なインタラクションを追加した。
関連論文リスト
- CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction [12.346416465825627]
信頼できるオン・ポリシィ蒸留(CA-OPD)は、信頼性の高いロールアウト構築と適応的な監視を結合するフレームワークである。
GUIグラウンディングと光学文字認識のためのマルチ教師設定で評価され、CA-OPDはQwen3.5-0.8Bベースラインを大幅に改善する。
論文 参考訳(メタデータ) (2026-09-02T10:11:59Z) - Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall [79.59596652272923]
教師が自信を持つトークンを蒸留する簡易な中間訓練目的であるスイッチ蒸留を提案する。
標準的なNTPとは対照的に、推論性能は1.61-1.71x、知識と常識性能は1.13-1.19xである。
論文 参考訳(メタデータ) (2026-09-01T17:00:30Z) - Latent On-Policy Self-Distillation [55.57800223145407]
On-policy Self-distillation (OPSD) は、特権的な自己教育者を用いて、生徒自身の軌跡を集中的に管理することにより、効果的な経路を提供する。
既存の方法はまだデザイナーが指定した特権的アーティファクトに大きく依存している。
本稿では,教師の特権的文脈自体を経験から学習可能なエンド・ツー・エンドにするため,LOPD(Latent On-Policy Self-Distillation)を導入する。
論文 参考訳(メタデータ) (2026-08-13T10:05:51Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Multi-Rollout On-Policy Distillation via Peer Successes and Failures [31.731266689209914]
大規模な言語モデルは、しばしばスパース検証器の報酬で訓練後、サンプルの軌道が成功するかどうかを示すが、推論が成功するか失敗するかについての限られたガイダンスを提供する。
オンライン蒸留(OPD)は、学生が生み出す軌跡の訓練により、より密集したトークンレベルの監督を提供する。
我々は,学生のローカルロールアウトグループを用いて,より情報のある教師信号を構築する,ピアコンディショニング蒸留フレームワークであるMulti-Rollout On-Policy Distillation (MOPD)を紹介した。
論文 参考訳(メタデータ) (2026-05-12T18:57:44Z) - OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning [19.98950359294245]
本研究は,教師の特権分布を自己の自給自足軌道に沿って蒸留することにより,言語モデルによる推論能力の向上を図ることを目的とする。
OPSDの性能向上にもかかわらず,教師と生徒の反応のミスマッチがよく見過ごされがちである。
論文 参考訳(メタデータ) (2026-05-12T17:00:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents [24.99615788156812]
Skill-SDはエージェント自身の軌道を動的トレーニングのみの監視に変換するフレームワークである。
我々は, 重み付き逆KL損失を導出し, 勾配補正型トークンレベルの蒸留を行った。
エージェントベンチマークの実験結果は、Skill-SDが標準RLベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-04-12T14:57:52Z) - AdaSwitch: Adaptive Switching Generation for Knowledge Distillation [58.647880811071495]
スモール言語モデル(SLM)は、厳密な待ち時間と計算制約のあるアプリケーションには不可欠である。
トークンレベルでのオン・ポリティクスとオフ・ポリティクス・ジェネレーションを組み合わせた新しいアプローチであるAdaSwitchを提案する。
AdaSwitchは一貫して精度を向上し、SLMを蒸留するための実用的で効果的な方法を提供し、追加のオーバーヘッドを許容する。
論文 参考訳(メタデータ) (2025-10-09T06:38:37Z) - Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones? [58.80794196076336]
大型言語モデル(LLM)の蒸留は、教師による微調整(SFT)を通して教師モデルの応答を伝達するのが一般的である。
本稿では, 応答と報酬の両方を伝達する新しい蒸留パイプラインを提案する。
本手法は,教師と生徒の両方の反応の固有構造を利用した自己教師機構によって擬似回帰を生成する。
論文 参考訳(メタデータ) (2025-02-26T20:50:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。