論文の概要: Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization
- arxiv url: http://arxiv.org/abs/2604.03192v1
- Date: Fri, 03 Apr 2026 17:06:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.547871
- Title: Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization
- Title(参考訳): 低資源抽象要約のための信頼性向上型マルチテラー蒸留
- Authors: Dipto Sumit, Ankan Kumar Roy, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Yousuf Sadeque,
- Abstract要約: 信頼性を考慮した低資源抽象要約のための多教師知識蒸留について検討した。
EWADは,教師間の合意に基づいて,教師の蒸留と金の監督をルートするトークンレベル機構である。
ロージットレベルのKDが最も信頼性の高いゲインを提供するのに対し、より複雑な蒸留は短いサマリーのセマンティックな類似性を向上するが、より長い出力を劣化させる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study multiteacher knowledge distillation for low resource abstractive summarization from a reliability aware perspective. We introduce EWAD (Entropy Weighted Agreement Aware Distillation), a token level mechanism that routes supervision between teacher distillation and gold supervision based on inter teacher agreement, and CPDP (Capacity Proportional Divergence Preservation), a geometric constraint on the student position relative to heterogeneous teachers. Across two Bangla datasets, 13 BanglaT5 ablations, and eight Qwen2.5 experiments, we find that logit level KD provides the most reliable gains, while more complex distillation improves semantic similarity for short summaries but degrades longer outputs. Cross lingual pseudo label KD across ten languages retains 71-122 percent of teacher ROUGE L at 3.2x compression. A human validated multi judge LLM evaluation further reveals calibration bias in single judge pipelines. Overall, our results show that reliability aware distillation helps characterize when multi teacher supervision improves summarization and when data scaling outweighs loss engineering.
- Abstract(参考訳): 信頼性を考慮した低資源抽象要約のための多教師知識蒸留について検討した。
EWAD(Entropy Weighted Agreement Aware Distillation)は,教師間の合意に基づいて,教師の蒸留と金監督の監督を行うトークンレベル機構であり,不均一な教師に対して,生徒の位置を幾何的に制約するCPDP(Capacity Proportional Divergence Preservation)を導入する。
2つのバングラデータセット、13のバングラT5アブレーション、8つのQwen2.5実験において、ロジットレベルKDが最も信頼性の高いゲインを提供するのに対し、より複雑な蒸留は短い要約のセマンティックな類似性を改善するが、より長い出力を劣化させる。
10言語にわたる言語間擬似ラベルKDは、教師ROUGE Lの71-122%を3.2倍の圧縮で保持している。
人間の検証されたマルチジャイアントLLM評価は、単一ジャイアントパイプラインにおけるキャリブレーションバイアスをさらに明らかにする。
以上の結果から,マルチ教師の指導が要約を改善し,データスケーリングが損失工学を上回った場合には,信頼性に配慮した蒸留が有効であることが示唆された。
関連論文リスト
- Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding [6.759788796474815]
R-MSD(Reliable Multi-Sample Distillation)は、教師によるサンプリングの分散をモデル化し、蒸留安定性を高めるフレームワークである。
本手法は, 対向蒸留目標に適合する品質認識信号を統合することにより, 知識伝達を最大化しながら教師の雑音を効果的にフィルタする。
論文 参考訳(メタデータ) (2026-03-12T01:30:37Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - SGD-Based Knowledge Distillation with Bayesian Teachers: Theory and Guidelines [82.00660447875266]
知識蒸留(英: Knowledge Distillation, KD)は、大きな教師ネットワークから、しばしばソフト確率出力を利用して、より小さな学生モデルに知識を伝達する中心的なパラダイムである。
グラディエント・Descent (SGD) を訓練した学生の収束行動の厳密に分析する。
分析の結果,BCPからの学習は分散の低減と収束境界の近傍項の除去に寄与することがわかった。
これらの知見に触発されて、我々は、通常、KDの教師として、BCPの見積もりを改善するベイズ深層学習モデルの使用を提唱する。
論文 参考訳(メタデータ) (2026-01-04T11:09:49Z) - Don't Throw Away Data: Better Sequence Knowledge Distillation [60.60698363739434]
本稿では,知識蒸留訓練において,最小ベイズリスク(MBR)の復号化をより厳密に行うことを目的とする。
英語からドイツ語,英語,日本語への翻訳実験では,強いベースライン法よりも一貫した改善が見られた。
論文 参考訳(メタデータ) (2024-07-15T06:11:18Z) - Faithful Knowledge Distillation [75.59907631395849]
i) 教師と学生は、正しく分類されたデータセットのサンプルに近い点で意見が一致しないか、(ii) 蒸留した学生は、データセットのサンプルに関する教師と同じくらい自信があるか、という2つの重要な質問に焦点をあてる。
これらは、安全クリティカルな設定の中で、堅牢な教師から訓練された小さな学生ネットワークを配置することを考えると、重要な問題である。
論文 参考訳(メタデータ) (2023-06-07T13:41:55Z) - Towards Effective Collaborative Learning in Long-Tailed Recognition [16.202524991074416]
現実世界のデータは通常、少数民族が著しく過小評価されている厳しい階級不均衡と長い尾の分布に悩まされる。
近年の研究では、マイノリティにおけるモデルの不確実性を緩和するために、マルチエキスパートアーキテクチャを利用するのが好ましい。
本稿では,クラス分布の観点から専門家間の知識伝達が不均衡であり,マイノリティクラスの性能改善が限定されていることを観察する。
論文 参考訳(メタデータ) (2023-05-05T09:16:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。