論文の概要: When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.03632v1
- Date: Tue, 04 Aug 2026 13:17:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.204032
- Title: When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
- Title(参考訳): 教師が過ちを犯したとき: 清潔なシグナルを意識したオン・ポリティクス蒸留
- Authors: Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li,
- Abstract要約: On-Policy Distillation (OPD) は、高密度のトークンレベルの教師信号で学生サンプルの軌跡を監督することにより、教師の能力を伝達する。
Spurious-Signal-Aware On-Policy DistillationフレームワークであるSA-OPDを提案する。
- 参考スコア(独自算出の注目度): 47.38632303827905
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-Policy distillation (OPD) transfers teacher capabilities by supervising student-sampled trajectories with dense token-level teacher signals. Recent selective OPD methods improve this process by prioritizing signals that are confident, informative, or learnable. However, the assumptions overlook a fundamental failure mode of language models: their token-level judgments can be driven by input-agnostic language priors, formatting conventions, or stereotyped reasoning templates rather than task-specific evidence. We refer to such optimization-relevant but weakly input-grounded supervision as spurious signals in OPD, which may produce large gradients while contributing little task-improving direction. To mitigate this issue, we propose SA-OPD, a Spurious-Signal-Aware On-Policy Distillation framework that identifies and filters misleading token-level supervision based on input-groundedness and optimization impact. SA-OPD introduces a lightweight input-groundedness proxy estimating whether a token-level distillation signal truly depends on the input. It then filters only tokens that simultaneously exhibit low input-groundedness and extreme distillation divergence, thereby removing high-impact spurious updates and achieving fine-grained OPD optimization. Extensive experiments on both large language model (LLM) and vision-language model (VLM) settings demonstrate that SA-OPD consistently outperforms Vanilla OPD and competitive selective methods. These results establish input-groundedness as a key dimension for OPD supervision selection and offer a simple, effective strategy for mitigating spurious updates.
- Abstract(参考訳): On-Policy distillation (OPD) は、高密度のトークンレベルの教師信号で学生サンプルの軌跡を監督することにより、教師の能力を伝達する。
最近の選択的PD法は、自信、情報的、あるいは学習可能な信号の優先順位付けによって、このプロセスを改善している。
しかし、これらの仮定は言語モデルの基本的な失敗モードを見落としている。トークンレベルの判断は、入力に依存しない言語事前、フォーマット規約、あるいはタスク固有の証拠ではなくステレオタイプ推論テンプレートによって駆動することができる。
我々は、最適化関連であるが弱い入力地上監視をOPDの刺激信号と呼び、タスク改善の方向性をほとんど示さず、大きな勾配を生じさせる可能性がある。
この問題を軽減するために,入力接地性と最適化の影響に基づいて,トークンレベルの監視を誤導しフィルタするSpurious-Signal-Aware On-Policy DistillationフレームワークであるSA-OPDを提案する。
SA-OPDは、トークンレベルの蒸留信号が実際に入力に依存するかどうかを推定する軽量な入力基底性プロキシを導入する。
次に、低い入力接地性と極端な蒸留のばらつきを同時に示すトークンのみをフィルタリングし、高インパクトの急激な更新を除去し、きめ細かいOPD最適化を実現する。
大規模言語モデル (LLM) と視覚言語モデル (VLM) の両方に関する広範な実験により、SA-OPD がバニラOPD と競合選択的手法を一貫して上回っていることが示された。
これらの結果は,OPD監督選択の鍵となる入力接地性を確立し,素早い更新を緩和するためのシンプルで効果的な戦略を提供する。
関連論文リスト
- dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation [16.086812358369798]
大規模言語モデルにおけるオンライン蒸留(OPD)は、完全なKLの監督からより選択的な訓練パラダイムへと移行しつつある。
近年のOPD法では,どの軌跡から学ぶか,どのトークンが最も情報的か,どの信号が最も信頼できるかの選択に注目が集まっている。
本稿では,ファリコンFiRe-OPD(Filter, then Reweight)を提案する。
論文 参考訳(メタデータ) (2026-06-01T17:58:22Z) - Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models [53.15468578562038]
マルチモーダル大言語モデル(MLLM)のための不確実性を考慮した探索的直接参照最適化(UE-DPO)手法を提案する。
まず、与えられた画像にトークン予測を根拠にしなかったモデルの不確かさを定量化する。
次に、好ましいサンプルにおいて、視覚的に不足したトークンに対する学習のプレッシャーを高め、非推奨サンプルにおける有益な知識の過度な報酬化を緩和する。
論文 参考訳(メタデータ) (2026-05-06T13:08:12Z) - Token-Importance Guided Direct Preference Optimization [2.230951739798399]
本研究では,大規模言語モデルが人間の嗜好に沿った出力を生成することを保証するため,TI-DPO(Token-Importance Guided Direct Preference Optimization)を提案する。
実験の結果,TI-DPOは高い精度とより強力な生成多様性を達成し,より安定かつ計算効率の良い解を提供することがわかった。
論文 参考訳(メタデータ) (2025-05-26T08:11:24Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。