論文の概要: Harness-Aware Distillation for Small Language Model Agents
- arxiv url: http://arxiv.org/abs/2610.02858v1
- Date: Fri, 02 Oct 2026 05:53:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.234904
- Title: Harness-Aware Distillation for Small Language Model Agents
- Title(参考訳): 小言語モデルエージェントのハーネス対応蒸留
- Abstract要約: ハーネスは言語モデルエージェントのコンテキスト、ツール、フィードバックを管理する。
標準蒸留は教師の完全な出力を模倣し、ハーネスを入力の一部として扱う。
本研究では,教師がハーネスを超えて付加するものに蒸留に焦点を当てたハーネス・アウェア蒸留(HAD)を提案する。
- 参考スコア(独自算出の注目度): 23.226663443494655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language model agents are deployed with a harness, the software around the model that manages its context, tools, and feedback. When such an agent is distilled into a smaller one, the harness stays in place, so the student mainly needs the teacher-specific abilities that the harness cannot provide, such as acting correctly on harness information. Standard distillation, however, imitates the teacher's full outputs and treats the harness as part of the input. We propose Harness-Aware Distillation (HAD), which focuses distillation on what the teacher adds beyond the harness. HAD complements on-policy distillation with two components: an action preference that contrasts the same teacher's actions with and without the harness information, scored after the student's own reasoning, and a validity check that drops preference pairs whose preferred action contradicts the harness records. We show that the contrast gives the student information that imitating the teacher alone cannot provide, and HAD needs no task rewards, success labels, or future information. Across multiple long-horizon agent benchmarks and models, HAD outperforms on-policy distillation baselines with the same fixed harness. Our analysis shows that HAD enters fewer unproductive loops and recovers from errors more often than the baselines, and suggests that it adaptively keeps learnable feedback in its weights while reading state information from the harness.
- Abstract(参考訳): 言語モデルエージェントは、コンテキスト、ツール、フィードバックを管理するモデルを取り巻くソフトウェアであるハーネスでデプロイされる。
このようなエージェントをより小さいものに蒸留する場合、ハーネスはそのまま残るため、学生はハーネス情報に対して正しく行動するなど、ハーネスが提供できない教師特有の能力が主に必要となる。
しかし、標準的な蒸留は教師の完全な出力を模倣し、ハーネスを入力の一部として扱う。
本研究では,教師がハーネスを超えて付加するものに蒸留に焦点を当てたハーネス・アウェア蒸留(HAD)を提案する。
HADは、政治上の蒸留を2つの要素で補完する: 同じ教師の行動とハーネス情報とを対比する行動選好と、学生自身の推論によって得られたハーネス情報とを対比する行動選好と、好む行動がハーネス記録と矛盾する選好ペアをドロップする妥当性チェックである。
このコントラストは,教師のみを模倣する生徒に提供できない情報を与え,HADは課題報酬や成功ラベル,将来的な情報を必要としないことを示す。
複数のロングホライゾンエージェントベンチマークとモデルで、HADは同一の固定ハーネスで、政治上の蒸留ベースラインを上回っている。
分析の結果,HADは非生産的ループを少なくし,ベースラインよりも頻繁にエラーから回復し,ハーネスからの状態情報を読みながら,学習可能なフィードバックを重みに適応的に維持することがわかった。
関連論文リスト
- Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis [0.5687154521897483]
エージェント的 "Continual Learning Harnesses" はサイバーセキュリティの価値が増大していることを示している。
しかし、それらの値はラベル付きベンチマークに対する利得によって測定される。
ラベル付きベンチマークを使わずに、エンドツーエンドの学習ハーネスを評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-11T15:51:37Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - Knowledge Distillation with Refined Logits [31.205248790623703]
本稿では,現在のロジット蒸留法の限界に対処するため,Refined Logit Distillation (RLD)を導入する。
我々のアプローチは、高性能な教師モデルでさえ誤った予測をすることができるという観察に動機づけられている。
本手法は,教師からの誤解を招く情報を,重要なクラス相関を保ちながら効果的に排除することができる。
論文 参考訳(メタデータ) (2024-08-14T17:59:32Z) - Unbiased Knowledge Distillation for Recommendation [66.82575287129728]
知識蒸留(KD)は推論遅延を低減するためにレコメンダシステム(RS)に応用されている。
従来のソリューションは、まずトレーニングデータから完全な教師モデルを訓練し、その後、その知識を変換して、コンパクトな学生モデルの学習を監督する。
このような標準的な蒸留パラダイムは深刻なバイアス問題を引き起こし、蒸留後に人気アイテムがより強く推奨されることになる。
論文 参考訳(メタデータ) (2022-11-27T05:14:03Z) - Exploring Inconsistent Knowledge Distillation for Object Detection with
Data Augmentation [66.25738680429463]
物体検出のための知識蒸留(KD)は、教師モデルから知識を伝達することで、コンパクトな検出器を訓練することを目的としている。
教師モデルの反直感的知覚に固有の知識を蒸留することを目的とした,一貫性のない知識蒸留(IKD)を提案する。
本手法は, 1段, 2段, アンカーフリーの物体検出器において, 最先端のKDベースラインより優れる。
論文 参考訳(メタデータ) (2022-09-20T16:36:28Z) - Unified and Effective Ensemble Knowledge Distillation [92.67156911466397]
知識蒸留は、複数の教師モデルから知識を抽出し、それを1人の学生モデルにエンコードする。
既存の多くの手法は、ラベル付きデータのみに基づいて学生モデルを学習し、蒸留する。
本研究では,教師モデルのアンサンブルから,ラベル付きデータとラベルなしデータの両方から単一学生モデルを蒸留する,統一的で効果的なアンサンブル知識蒸留法を提案する。
論文 参考訳(メタデータ) (2022-04-01T16:15:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。