論文の概要: Behavior Leverage Imbalance in Multi-Teacher On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.07050v1
- Date: Wed, 08 Jul 2026 06:26:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.305525
- Title: Behavior Leverage Imbalance in Multi-Teacher On-Policy Distillation
- Title(参考訳): マルチ教師のオンライン蒸留における行動レバレッジ不均衡
- Abstract要約: 複数教師によるオンライン蒸留は,集合的損失だけでは見えない行動変化を誘導できることを示す。
2教師用ツール使用設定では、バニラ一般化知識蒸留により、ツールコールリコールが改善されると同時に、オーバーコールに向けてモデルが移動される。
極端トークンレベルのJensen-Shannon発散を動的に圧縮する,トークンごとの発散校正法であるSoft Clampを提案する。
- 参考スコア(独自算出の注目度): 6.100373666222075
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic language models must learn when to call tools, when to consume tool responses, and when to answer directly. This makes multi-teacher on-policy distillation a natural training strategy: one teacher can specialize in tool calls, another in direct responses, and the student can learn from both on its own generated distribution. We show that this strategy can induce a behavior shift that is invisible from aggregate losses alone. In a two-teacher tool-use setting, vanilla generalized knowledge distillation improves tool-call recall but also moves the model toward over-calling, where it calls tools on examples that should be answered directly. Aggregate explanations are insufficient: tool-call samples do not receive more token exposure, and full-sequence per-token divergence is not larger for the tool-call teacher. We instead analyze behavior leverage imbalance: local token-level signals at mode- entry and structural positions, such as <tool_call> and function names, can have disproportionate control over the global generation mode. We propose Soft Clamp, a per-token divergence calibration method that dynamically compresses extreme token-level Jensen-Shannon divergence while preserving nonzero gradients. On APIGen-MT, Soft Clamp reduces over-calling from 13.7% to 9.0% relative to vanilla GKD while matching its decision accuracy. In a BFCL multi-turn diagnostic, it also lowers tool-call loops and repeated calls among GKD variants. These results suggest that multi-teacher OPD should monitor where teacher signals act, not only how large they are in aggregate.
- Abstract(参考訳): エージェント言語モデルは、いつツールを呼び出すか、いつツールのレスポンスを消費するか、そしていつ直接答えるかを学ばなければならない。
一人の教師がツールコールを専門にし、もう一人の教師が直接反応し、生徒は両方が生成した分布から学ぶことができる。
この戦略は,集合的損失だけでは見えない行動変化を誘発できることを示す。
2段階のツール使用設定では、バニラ一般化された知識蒸留により、ツールコールリコールが改善されるだけでなく、モデルがオーバーコール(over-calling)へと移動し、直接答えるべき例でツールを呼び出す。
ツールコールのサンプルはトークンの露出を多く受け取らず、ツールコールの教師にとってはフルシーケンスの発散はそれほど大きくない。
モード入力時の局所トークンレベル信号と<tool_call>や関数名などの構造位置は,グローバルな生成モードに対して不均等に制御できる。
非ゼロ勾配を保ちながら極端トークンレベルのJensen-Shannon発散を動的に圧縮する,トークンごとの発散校正法であるSoft Clampを提案する。
APIGen-MTでは、Vanilla GKDと比較してオーバーコールを13.7%から9.0%に削減し、判定精度を満足する。
BFCLのマルチターン診断では、GKDの変種間でツールコールループと繰り返しコールを低下させる。
以上の結果から,マルチ教師のOPDは,教師の信号がどれだけ大きいかだけでなく,どこに振る舞うかをモニタすべきであることが示唆された。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - Tunable Tool-Call Rates in LLM Agents via Representation Steering [45.332672398938136]
本研究では,モデル自身のツール使用嗜好信号からトレーニングを受けずに抽出した残ストリーム内の1つの直線方向でツールを制御できることを示す。
また、その方向は、特定のツールの選択を好まずに、各ツール自身の方向と同等の強度で、見えないツールに一般化されていることも示しています。
論文 参考訳(メタデータ) (2026-08-25T22:35:18Z) - Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection [13.409515289348532]
VulAgentRLは、コードプロパティグラフ(CPG)上に構築された、相互の脆弱性検出のためのフレームワークである。
VulAgentRLは、フロンティアモデルを含む最先端のベースラインを厳密なペアワイズ補正基準で上回り、より少ないツールコールを発行する。
論文 参考訳(メタデータ) (2026-07-29T09:16:54Z) - Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It [23.538941671680806]
ツールの使用により、大きな言語モデルで複雑なタスクを実行できる。
近年のエージェント強化学習法では, モデル能力の向上が期待できる。
いくつかのモデルは破滅的な崩壊を示し、パフォーマンスが突然低下し、ツール呼び出し構造が失敗する。
論文 参考訳(メタデータ) (2026-06-24T16:55:56Z) - OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification [21.095025092772257]
On-Policy Distillation (OPD)は、強力な教師からの密集したトークンレベルフィードバックの下で、生徒モデルを自身の生成軌道上で訓練する。
OmniOPDはロジットフリーでチャンクレベルの監視信号を通じて両方の制限に対処する新しいフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T22:31:15Z) - SOD: Step-wise On-policy Distillation for Small Language Model Agents [32.49707795291693]
ツール統合推論は、小さな言語モデルにスケールすることが難しい。
近年,教師から密集したトークンレベルの監督を施すことで,オンライン蒸留が普及している。
スモールランゲージモデルエージェントのための段階的オンライン蒸留フレームワークであるSODを提案する。
論文 参考訳(メタデータ) (2026-05-08T13:30:42Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors [66.18091962164219]
既存のメトリクスは、タスクの成功に必要な義務的な振る舞いと、モデルの自律的な嗜好を反映した命令的でないパターンを区別することができない。
言語アライメントのための textbfResponse Pattern similarity (RPS) と、有向グラフとしてモデル化されたツール使用習慣のための textbfAction Graph similarity (AGS) である。
論文 参考訳(メタデータ) (2026-04-23T03:48:56Z) - Distillation Traps and Guards: A Calibration Knob for LLM Distillability [54.90137955363471]
そこで本研究では,教師の蒸留性を制御するためのポストホック校正法を提案する。
我々の目標は、タスクユーティリティ、KLアンカー、およびクロストケナイザーキャリブレーション報酬を組み合わせることである。
実験により、蒸留可能な教師から蒸留した学生は、SFTおよびKDベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-04-21T01:22:35Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - HSFM: Hard-Set-Guided Feature-Space Meta-Learning for Robust Classification under Spurious Correlations [25.503211313768062]
本稿では,特徴空間で直接拡張を行う二段階メタラーニング手法を提案する。
ピクセル空間ではなくバックボーン出力で操作することで、この手法は非常に効率的で安定であり、1つのGPUで数分のトレーニングしか必要としない。
論文 参考訳(メタデータ) (2026-03-31T06:32:56Z) - Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes [31.95045602299568]
オンライン蒸留(OPD)は,教師の学習履歴ではなく,学生が生み出すロールアウトに対するフィードバックを評価するため,大規模言語モデル(LLM)のポストトレーニングにアピールしている。
推定器と実装側からOPDを再検討する。
不均衡な1-token信号、学生が生成した接頭辞に対する教師の信頼できない指導、トークン化器や特殊-tokenミスマッチによる歪みの3つの失敗モードを同定する。
論文 参考訳(メタデータ) (2026-03-26T15:35:59Z) - DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation [68.19756761027351]
拡散大言語モデル(dLLM)は自己回帰(AR)モデルの魅力的な代替品である。
本研究は,それらの認知過程と強化学習手法について考察する。
我々の研究は、dLLM生成のメカニズムについて深い洞察を与え、効果的な拡散ネイティブなRLトレーニングフレームワークを提供します。
論文 参考訳(メタデータ) (2025-06-25T17:35:47Z) - Multi-Granularity Semantic Revision for Large Language Model Distillation [66.03746866578274]
LLM蒸留における多粒性セマンティックリビジョン法を提案する。
シーケンスレベルでは、シーケンス修正と再生戦略を提案する。
トークンレベルでは、蒸留目的関数として、Kulback-Leibler損失を補正する分布適応クリッピングを設計する。
スパンレベルでは、シーケンスのスパン前処理を利用して、スパン内の確率相関を計算し、教師と学生の確率相関を一貫性に制約する。
論文 参考訳(メタデータ) (2024-07-14T03:51:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。