論文の概要: Accurate Knowledge Distillation with n-best Reranking
- arxiv url: http://arxiv.org/abs/2305.12057v1
- Date: Sat, 20 May 2023 01:53:03 GMT
- ステータス: 処理完了
- システム内更新日: 2023-05-24 01:05:25.979004
- Title: Accurate Knowledge Distillation with n-best Reranking
- Title(参考訳): n-best再分類による正確な知識蒸留
- Authors: Hendra Setiawan
- Abstract要約: 我々は,教師モデルのトップ1仮説とトップn-best仮説を検討するために,n-bestの再評価によるシーケンスレベルの知識蒸留(Kim and Rush, 2016)の拡張を提案する。
提案手法は,学生モデルのトレーニングにおいて,より正確な擬似ラベルを提供するために,公開可能な大規模事前学習モデルを含む多種多様なモデルを利用する。
- 参考スコア(独自算出の注目度): 1.52292571922932
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose extending the Sequence-level Knowledge Distillation (Kim and Rush,
2016) with n-best reranking to consider not only the top-1 hypotheses but also
the top n-best hypotheses of teacher models. Our approach leverages a diverse
set of models, including publicly-available large pretrained models, to provide
more accurate pseudo-labels for training student models. We validate our
proposal on the WMT21 German-English translation task and demonstrate that our
student model achieves comparable accuracy to a large translation model with
4.7 billion parameters from (Tran et al., 2021) while having two orders of
magnitude fewer parameters.
- Abstract(参考訳): 我々は,トップ1仮説だけでなく教師モデルの上位n-best仮説も検討するため,シーケンスレベルの知識蒸留(Kim and Rush, 2016)をn-bestで拡張することを提案する。
提案手法は,学生モデルのトレーニングにおいて,より正確な擬似ラベルを提供するために,公開可能な大規模事前学習モデルを含む多種多様なモデルを利用する。
我々は,WMT21ドイツ語翻訳タスクにおける提案提案を検証し,我々の学生モデルが,Tranらによる470億のパラメータを持つ大規模翻訳モデルに匹敵する精度を達成し,桁違いのパラメータが2桁少ないことを実証した。
関連論文リスト
- Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning [73.73967342609603]
トラクションエラーを最小限に抑えるための予測-相関学習フレームワークを提案する。
また、高次予測器を強化するために、指数関数的移動平均ベース係数学習法を提案する。
我々のモデルは3.8BのDeepNetを平均2.9のSacreBLEUで上回り、1/3のパラメータしか使用していない。
論文 参考訳(メタデータ) (2024-11-05T12:26:25Z) - Uncertainty Aware Learning for Language Model Alignment [97.36361196793929]
異なるタスクシナリオのモデルアライメントを改善するために,不確実性認識学習(UAL)を提案する。
トレーニングのラベルの平滑化値を個々のサンプルの不確実性に応じて適応的に設定する。
広く使われているベンチマーク実験では、我々のUALは標準教師あり微調整よりも著しく優れています。
論文 参考訳(メタデータ) (2024-06-07T11:37:45Z) - GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators [45.49880507108965]
GenTranslate"は、N-bestリストの多種多様な翻訳バージョンからより良い結果を生成するために、大きな言語モデルの上に構築されている。
我々の新しいパラダイムは、より高品質な翻訳結果を生成するために、N-best候補にリッチな情報を統合することができる。
論文 参考訳(メタデータ) (2024-02-10T07:20:49Z) - Uncertainty-aware Parameter-Efficient Self-training for Semi-supervised
Language Understanding [38.11411155621616]
我々は,主に半教師あり学習の手法として,自己学習について研究している。
我々は,新しい不確かさを意識した自己学習フレームワークであるUPETを紹介する。
UPETは性能と効率の面で大幅に向上したことを示す。
論文 参考訳(メタデータ) (2023-10-19T02:18:29Z) - A Multi-dimensional Evaluation of Tokenizer-free Multilingual Pretrained
Models [87.7086269902562]
サブワードベースのモデルは、多くの設定において依然として最も実用的な選択肢であることを示している。
我々は,新しいモデルを設計し,評価する際のこれらの要因を検討するために,トークンフリーな手法の今後の取り組みを奨励する。
論文 参考訳(メタデータ) (2022-10-13T15:47:09Z) - A Lagrangian Duality Approach to Active Learning [119.36233726867992]
トレーニングデータのサブセットのみをラベル付けするバッチアクティブな学習問題を考察する。
制約付き最適化を用いて学習問題を定式化し、各制約はラベル付きサンプルにモデルの性能を拘束する。
数値実験により,提案手法は最先端の能動学習法と同等かそれ以上に機能することを示した。
論文 参考訳(メタデータ) (2022-02-08T19:18:49Z) - An Application of Pseudo-Log-Likelihoods to Natural Language Scoring [5.382454613390483]
比較的少ないパラメータとトレーニングステップを持つ言語モデルは、最近の大規模なデータセットでそれを上回るパフォーマンスを得ることができる。
二項選択タスクにおける常識推論のための絶対的最先端結果を生成する。
より小さなモデルの堅牢性は、構成性の観点から理解されるべきである。
論文 参考訳(メタデータ) (2022-01-23T22:00:54Z) - Few-shot Instruction Prompts for Pretrained Language Models to Detect
Social Biases [55.45617404586874]
我々は、事前訓練された言語モデル(LM)を誘導する数ショットの命令ベース手法を提案する。
大規模なLMは、微調整モデルとよく似た精度で、異なる種類の細粒度バイアスを検出できることを示す。
論文 参考訳(メタデータ) (2021-12-15T04:19:52Z) - Comparing Test Sets with Item Response Theory [53.755064720563]
我々は,18の事前学習トランスフォーマーモデルから予測した29のデータセットを個別のテスト例で評価した。
Quoref、HellaSwag、MC-TACOは最先端のモデルを区別するのに最適である。
また、QAMRやSQuAD2.0のようなQAデータセットに使用されるスパン選択タスク形式は、強いモデルと弱いモデルとの差別化に有効である。
論文 参考訳(メタデータ) (2021-06-01T22:33:53Z) - A Systematic Evaluation of Transfer Learning and Pseudo-labeling with
BERT-based Ranking Models [2.0498977512661267]
BERTに基づく5つの英語データセット間のニューラルランキングモデルの転送性を評価する。
各コレクションには膨大な数のクエリがあり、フルショット評価モードを可能にします。
擬似ラベルのトレーニングは、転送学習と比較して、競争力や優れたモデルを生み出すことができる。
論文 参考訳(メタデータ) (2021-03-04T21:08:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。