論文の概要: Temperature-Adaptive Transformed Teacher Matching
- arxiv url: http://arxiv.org/abs/2608.29099v1
- Date: Sat, 29 Aug 2026 07:08:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.837429
- Title: Temperature-Adaptive Transformed Teacher Matching
- Title(参考訳): 温度適応型教師マッチング
- Abstract要約: Transformed Teacher Matching (TTM) は, 教師分布にのみ適用することにより, 温度スケーリングの役割を明らかにする。
温度スケールの教師分布と生徒の予測とのKulback-Leiblerのばらつきを局所的に最小化することにより,TTMのサンプル単位の逆温度更新を行う。
- 参考スコア(独自算出の注目度): 0.42970700836450487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Temperature scaling is a core component of knowledge distillation, yet its role and effect are still not fully understood. Transformed Teacher Matching (TTM) clarifies the role of temperature scaling by applying it only to the teacher distribution and interpreting the resulting objective as standard distillation with an implicit Rényi entropy regularization on the student. However, TTM still relies on a fixed temperature and does not specify how the teacher-side temperature should be adapted for individual samples. In this paper, we introduce a sample-wise inverse-temperature update for TTM by locally minimizing the Kullback-Leibler divergence between the temperature-scaled teacher distribution and the student's prediction. We derive closed-form first and second derivatives with respect to the inverse temperature, and show that they can be expressed using variance and covariance statistics of centered teacher and student logits under the transformed teacher weighting. This yields an efficient curvature-aware update that requires one softmax evaluation and a constant number of class-wise weighted sums. Experiments on standard image classification distillation benchmarks show that our temperature adaptation generally improves TTM and WTTM, while remaining competitive with or outperforming prior temperature-adaptive distillation baselines.
- Abstract(参考訳): 温度のスケーリングは知識蒸留の核となる要素であるが、その役割と効果は未だ完全には理解されていない。
Transformed Teacher Matching (TTM)は、教師分布にのみ適用し、その結果の目的を、暗黙のRényiエントロピー正規化による標準蒸留として解釈することで、温度スケーリングの役割を明らかにする。
しかし、TTMは依然として一定の温度に依存しており、個々のサンプルに対して教師側の温度をどのように適応させるべきかは定かではない。
本稿では,教師の温度スケール分布と生徒の予測とのKulback-Leibler分散を局所的に最小化することにより,TTMのサンプル単位の逆温度更新を提案する。
逆温度に関する閉形式第1および第2微分を導出し,教師の重み付けによる教師と学生のログの分散と共分散の統計値を用いて表現できることを示す。
これにより、1つのソフトマックス評価と一定数のクラスワイド和を必要とする効率的な曲率対応更新が得られる。
標準画像分類蒸留ベンチマーク実験では, 温度適応はTTMとWTTMを概ね改善するが, 従来の温度適応蒸留ベースラインとの競争力や競争力は保たれている。
関連論文リスト
- TeMo: Temperature Modulation for Multimodal Contrastive Learning [69.50376336775496]
対照的な学習アプローチは、類似のサンプルを分離しながら、類似のサンプルを近接させる訓練モデルにより、強いパフォーマンスを達成する。
本稿では,TeMo,温度変調フレームワークを導入し,その類似性に応じて各正負対の温度を適応的に調整する類似性に基づく変調手法を提案する。
本手法は, 温度変調型マルチモーダル損失と非モーダル損失を, 段階的に遷移することで, 標準マルチモーダルコントラスト損失とシームレスに統合する。
論文 参考訳(メタデータ) (2026-09-07T14:23:02Z) - Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting [57.75750707482832]
本稿では,モード再重み付けを保ちながら分散インフレーションをキャンセルし,ネットワークをシフトタイムステップでクエリし,その結果のスコアを$$でスケールするトレーニング不要な修正である分散補正時間シフトを導入する。
DiT, 安定拡散モデル, 運動拡散モデルにまたがる品質と条件の忠実度を, 最小限のコストで一貫したゲインを示す。
論文 参考訳(メタデータ) (2026-07-12T17:32:29Z) - Consistently Informative Soft-Label Temperature for Knowledge Distillation [6.328321206328517]
知識蒸留(KD)は,その予測分布を一致させて,高能力の教師からコンパクトな学生に知識を伝達する。
標準の固定温度設計は本質的にサンプルに依存しない。
CIST(Consistently Informative Soft-label Temperature)を提案する。
論文 参考訳(メタデータ) (2026-05-19T18:11:54Z) - MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data [64.78447637450937]
マルチモーダル温度とマージンスケジューリング(MM-TS)を提案し、一様温度スケジューリングの概念をマルチモーダルコントラスト学習に拡張する。
本手法はトレーニング中のコントラスト損失の温度を動的に調整し,マルチモーダル環境でのアトラクションと反発力を調節する。
論文 参考訳(メタデータ) (2026-03-09T10:29:50Z) - Optimal Attention Temperature Enhances In-Context Learning under Distribution Shift [8.135786025034626]
本論文は,分布シフト中のICLの注意温度に関する最初の理論的,実証的研究である。
入力共分散やラベルノイズのシフトはICLを著しく損なうが、この誤差を最小限に抑える最適な注意温度が存在することを証明した。
本研究は,プリトレーニングトランスにおけるICLのロバスト性向上のための原理的かつ強力な機構として,注目温度を確立した。
論文 参考訳(メタデータ) (2025-11-03T07:18:27Z) - Analytical Softmax Temperature Setting from Feature Dimensions for Model- and Domain-Robust Classification [0.0]
ディープラーニングに基づく分類タスクでは、温度パラメータ$T$が出力分布と全体的な性能に重大な影響を与える。
本研究は, 最適温度$T*$が特徴表現の次元性によって一意に決定されるという新しい理論的知見を提示する。
我々は,クラス数とタスク複雑性に基づいて,$T*$を改良する修正スキームを導入しながら,追加のトレーニングを伴わずに$T*$を推定する実験式を開発した。
論文 参考訳(メタデータ) (2025-04-22T05:14:38Z) - Warmup-Distill: Bridge the Distribution Mismatch between Teacher and Student before Knowledge Distillation [84.38105530043741]
本稿では, 学生の蒸留を教員の蒸留と整合させて, 蒸留に先立って行うワームアップ蒸留法を提案する。
7つのベンチマークの実験は、ウォームアップ・ディスティルが蒸留に適したウォームアップの学生を提供することを示した。
論文 参考訳(メタデータ) (2025-02-17T12:58:12Z) - Calibrating Language Models with Adaptive Temperature Scaling [58.056023173579625]
本稿では,各トークンの温度スケーリングパラメータを予測するポストホックキャリブレーション法であるAdaptive Temperature Scaling (ATS)を紹介する。
ATSは、以前のキャリブレーション法と比較して、3つの下流自然言語評価ベンチマークで10-50%以上のキャリブレーションを改善する。
論文 参考訳(メタデータ) (2024-09-29T22:54:31Z) - Logit Standardization in Knowledge Distillation [83.31794439964033]
教師と学生の共用温度の仮定は、ロジット範囲と分散の点で、ロジット間の厳密な一致を暗示している。
温度をロジットの重み付け標準偏差として設定し、ロジット標準化のプラグアンドプレイZスコア前処理を実行することを提案する。
我々の前処理により、学生はマグニチュードマッチを必要とせず、教師の本質的なロジット関係に集中することができ、既存のロジットベースの蒸留法の性能を向上させることができる。
論文 参考訳(メタデータ) (2024-03-03T07:54:03Z) - Knowledge Distillation Based on Transformed Teacher Matching [4.567223151852012]
変換型教師マッチング(TTM)と呼ばれる知識蒸留(KD)の結果として生じる変異について検討する。
温度スケーリングを確率分布のパワー変換として再解釈することにより、TTMが目的関数に固有のR'enyiエントロピー項を持つことを示す。
実験結果から、TTMは、元のKDよりも優れた一般化の訓練を受けた学生に導かれることが示された。
論文 参考訳(メタデータ) (2024-02-17T00:28:06Z) - Knowledge distillation via adaptive instance normalization [52.91164959767517]
本稿では,教師から生徒への特徴統計の伝達に基づく新しい知識蒸留法を提案する。
本手法は,教師に類似する生徒の平均と分散を強制する標準的な方法を超えている。
以上の結果から, 蒸留法は他の蒸留法よりも高い性能を示した。
論文 参考訳(メタデータ) (2020-03-09T17:50:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。