論文の概要: SKILL-KD: Contrastive Skill Distillation for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.28048v1
- Date: Thu, 30 Jul 2026 11:27:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.527791
- Title: SKILL-KD: Contrastive Skill Distillation for LLM Agents
- Title(参考訳): SKILL-KD : LLM剤の対照的なスキル蒸留
- Abstract要約: スキルベースのプロンプトは、大規模言語モデル(LLM)エージェントを改善するための実践的なメカニズムとなっている。
既存のスキル獲得手法は、しばしば経験の要約、記憶のエントリ、あるいは成功例の直接的な要約として、スキルを扱います。
SKILL-KDは, 異なる能力を有するエージェント間での明示的な蒸留媒体として, スキルを扱える技術蒸留フレームワークである。
- 参考スコア(独自算出の注目度): 17.24178659841658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Skill-based prompting has become a practical mechanism for improving large language model (LLM) agents, yet existing skill acquisition methods often treat skills as experience summaries, memory entries, or direct summaries of successful demonstrations. This creates a mismatch for weaker student agents: when a student fails because it lacks task knowledge or operational strategy, its failed trajectory may not contain enough evidence to infer the missing behavior, while the teacher trajectory may be too implicit to be internalized as reusable guidance. We propose SKILL-KD, a contrastive skill distillation framework that treats skills as an explicit distillation medium between agents of different capabilities. Given a student failure and the teacher trajectory on the same task, SKILL-KD distills their actionable discrepancy into a textual skill patch, evaluates the patch by re-running the student, and iteratively refines the patch when the student still fails. To prevent repeated local updates from causing skill drift, SKILL-KD further maintains trace-linked edit histories and performs Drift-Aware Skill Consolidation, deciding whether each patch should add a new rule, delete or modify an existing rule, or be skipped. Across five agent benchmarks and two student settings, SKILL-KD consistently improves frozen student agents over fixed-model adaptation baselines.
- Abstract(参考訳): スキルベースのプロンプトは、大規模言語モデル(LLM)エージェントを改善するための実践的なメカニズムとなっているが、既存のスキル獲得手法は、しばしば経験要約、メモリエントリ、成功例の直接的な要約としてスキルを扱う。
学生がタスク知識や運用戦略を欠いているために失敗すると、その失敗軌道には不足した振る舞いを推測する十分な証拠が含まれず、教師軌道は再利用可能なガイダンスとして内部化されるには暗黙的すぎる。
SKILL-KDは, 異なる能力を有するエージェント間での明示的な蒸留媒体として, スキルを扱える技術蒸留フレームワークである。
SKILL-KDは、学生の障害と教師の軌跡を同一のタスクで与えると、動作可能な相違をテキストスキルパッチに蒸留し、学生を再実行してパッチを評価し、学生がまだ失敗したときにパッチを反復的に洗練する。
繰り返しローカル更新がスキルドリフトを引き起こすのを防ぐため、SKILL-KDはトレースリンク編集履歴をさらに維持し、Drift-Aware Skill Consolidationを実行する。
5つのエージェントベンチマークと2つの学生設定で、SKILL-KDは固定モデル適応ベースラインよりも凍結された学生エージェントを一貫して改善する。
関連論文リスト
- Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall [79.59596652272923]
教師が自信を持つトークンを蒸留する簡易な中間訓練目的であるスイッチ蒸留を提案する。
標準的なNTPとは対照的に、推論性能は1.61-1.71x、知識と常識性能は1.13-1.19xである。
論文 参考訳(メタデータ) (2026-09-01T17:00:30Z) - Agentic Reinforcement Learning with Self-Distilled Reward Shaping [12.091871903119698]
エージェント強化学習は、LLMエージェントが相互作用を通じて学ぶことを可能にするが、低軌道レベルの報酬は、どの中間決定が信用に値するかを特定せずに、成功を明らかにする。
本稿では,言語エージェントに対する返却関連トークンレベルクレジットを構築するためのフレームワークである,自己拡張型リワードシェーピングを用いたエージェント強化学習を紹介する。
実験の結果、ADRSは長い水平タスクのパフォーマンスを継続的に改善し、RLバックボーン、データ設定の削減、目に見えないタスク、トレーニングの拡張などを実現している。
論文 参考訳(メタデータ) (2026-08-04T06:56:47Z) - SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use [21.05387636058484]
SkillCoachは、エージェントのスキル使用を評価し、強化するための自己進化フレームワークである。
実際のロールアウトから熟練したプロセスルーブリックを導き、四次元に沿って軌道を評価する。
外部検証器を別個の結果信号として保持し、プロセス品質を偶然のタスク成功と区別できるようにする。
論文 参考訳(メタデータ) (2026-07-02T08:28:51Z) - Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning [60.37693496953694]
Embodied Continual Learning (ECL)は、ロボットが新たな操作タスクを継続的に取得できるようにすることを目的としている。
ECLはより深刻な破滅的な忘れ込みに悩まされる。
ECLの主な課題は、継続的に進化するタスクにおける構造化されたスキル再利用である。
論文 参考訳(メタデータ) (2026-06-14T09:02:49Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - AdaSwitch: Adaptive Switching Generation for Knowledge Distillation [58.647880811071495]
スモール言語モデル(SLM)は、厳密な待ち時間と計算制約のあるアプリケーションには不可欠である。
トークンレベルでのオン・ポリティクスとオフ・ポリティクス・ジェネレーションを組み合わせた新しいアプローチであるAdaSwitchを提案する。
AdaSwitchは一貫して精度を向上し、SLMを蒸留するための実用的で効果的な方法を提供し、追加のオーバーヘッドを許容する。
論文 参考訳(メタデータ) (2025-10-09T06:38:37Z) - Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling [81.00825302340984]
本研究では,高品質なトレーニングデータを生成するために,投機的知識蒸留(SKD)を導入する。
SKDでは、学生はトークンを提案し、教師はそれ自身の分布に基づいて低いランクのトークンを置き換える。
翻訳,要約,数学,指示文など,各種テキスト生成タスクにおけるSKDの評価を行った。
論文 参考訳(メタデータ) (2024-10-15T06:51:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。