Fugu-MT 論文翻訳(概要): Aligned Cross Entropy for Non-Autoregressive Machine Translation

論文の概要: Aligned Cross Entropy for Non-Autoregressive Machine Translation

arxiv url: http://arxiv.org/abs/2004.01655v1
Date: Fri, 3 Apr 2020 16:24:47 GMT
ステータス: 翻訳完了
システム内更新日: 2022-12-17 03:44:31.765663
Title: Aligned Cross Entropy for Non-Autoregressive Machine Translation
Title（参考訳）: 非自己回帰機械翻訳のためのアライメントクロスエントロピー
Authors: Marjan Ghazvininejad, Vladimir Karpukhin, Luke Zettlemoyer, Omer Levy
Abstract要約: 非自己回帰モデルの学習における代替的損失関数としてアライメントクロスエントロピー(AXE)を提案する。 AXEに基づく条件付きマスキング言語モデル(CMLM)のトレーニングは、主要なWMTベンチマークの性能を大幅に向上させる。
参考スコア（独自算出の注目度）: 120.15069387374717
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Non-autoregressive machine translation models significantly speed up decoding by allowing for parallel prediction of the entire target sequence. However, modeling word order is more challenging due to the lack of autoregressive factors in the model. This difficultly is compounded during training with cross entropy loss, which can highly penalize small shifts in word order. In this paper, we propose aligned cross entropy (AXE) as an alternative loss function for training of non-autoregressive models. AXE uses a differentiable dynamic program to assign loss based on the best possible monotonic alignment between target tokens and model predictions. AXE-based training of conditional masked language models (CMLMs) substantially improves performance on major WMT benchmarks, while setting a new state of the art for non-autoregressive models.
Abstract（参考訳）: 非自己回帰機械翻訳モデルは、ターゲットシーケンス全体の並列予測を可能にしてデコードを大幅に高速化する。しかし,モデルに自己回帰因子が欠如しているため,単語順のモデル化は困難である。このことは、単語順の小さなシフトを高いペナルティ化できるクロスエントロピー損失の訓練中に複雑化する。本稿では,非自己回帰モデルの学習のための代替的損失関数としてアライメントクロスエントロピー(AXE)を提案する。 axeは微分可能な動的プログラムを使用して、ターゲットトークンとモデル予測の間の最善のモノトニックアライメントに基づいて損失を割り当てる。 axeベースの条件付きマスキング言語モデル(cmlms)のトレーニングでは、主要なwmtベンチマークのパフォーマンスが大幅に向上すると同時に、非自己回帰モデルのための新しい状態を設定する。

関連論文リスト

Learning-Order Autoregressive Models with Application to Molecular Graph Generation [52.44913282062524]
本稿では,データから逐次推定される確率的順序付けを用いて高次元データを生成するARMの変種を紹介する。提案手法は,画像およびグラフ生成において有意義な自己回帰順序を学習できることを実験的に実証した。
論文参考訳（メタデータ） (2025-03-07T23:24:24Z)
Autoregressive model path dependence near Ising criticality [0.0]
2次元イジングモデルにおける臨界相関の再構成について検討した。有限サイズ2次元格子に課される多数の異なる1次元自己回帰列のトレーニング性能を比較した。
論文参考訳（メタデータ） (2024-08-28T11:21:33Z)
Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines [74.42485647685272]
GMLM(Generative Masked Language Models)に焦点を当てる。我々は,マルコフ連鎖の入力として使用されるマスキングにより,データ分布の条件付き確率に適合するモデルを訓練し,モデルからサンプルを抽出する。我々は,T5モデルを並列デコーディングに適応させ,最小品質の犠牲を伴って機械翻訳における2～3倍の高速化を実現した。
論文参考訳（メタデータ） (2024-07-22T18:00:00Z)
Autoregressive Speech Synthesis without Vector Quantization [135.4776759536272]
テキストから音声合成(TTS)のための新しい連続値トークンに基づく言語モデリング手法であるMELLEを提案する。 MELLEはテキスト条件から直接連続メル-スペクトログラムフレームを自動回帰生成する。
論文参考訳（メタデータ） (2024-07-11T14:36:53Z)
Non-autoregressive Sequence-to-Sequence Vision-Language Models [63.77614880533488]
本稿では,デコーダ内の複数の推論経路をマージする並列デコードシーケンス・ツー・シーケンス・ビジョン言語モデルを提案する。このモデルは最先端の自己回帰モデルと同等のパフォーマンスを実現するが、推論時間では高速である。
論文参考訳（メタデータ） (2024-03-04T17:34:59Z)
SequenceMatch: Imitation Learning for Autoregressive Sequence Modelling with Backtracking [60.109453252858806]
MLE(Maxum-likelihood)の目的は、高品質なシーケンスを自動回帰的に生成する下流のユースケースと一致しない。我々は、模倣学習(IL)問題としてシーケンス生成を定式化する。これにより、自己回帰モデルによって生成されるシーケンスの分布とデータセットからのシーケンスとの差異を最小化できる。得られた手法であるSequenceMatchは、敵の訓練やアーキテクチャの変更なしに実装できる。
論文参考訳（メタデータ） (2023-06-08T17:59:58Z)
Order-Agnostic Cross Entropy for Non-Autoregressive Machine Translation [28.800695682918757]
非自己回帰的翻訳(NAT)モデルに対して、注文非依存的クロスエントロピー(OaXE)と呼ばれる新たなトレーニング目標を提案する。 OaXEは、モデル予測とターゲットトークンの最適なアライメントに基づいて、クロスエントロピー損失を計算する。主要なWMTベンチマークの実験により、OaXEは翻訳性能を大幅に改善することが示された。
論文参考訳（メタデータ） (2021-06-09T14:15:12Z)
Fast Sequence Generation with Multi-Agent Reinforcement Learning [40.75211414663022]
機械翻訳では、すべての単語を並列に生成することで推論時間を高速化するノンオートレグレッシブデコードが提案されている。我々は,非自己回帰的シーケンス生成(NAG)のための新しい訓練パラダイムを用いた簡易かつ効率的なモデルを提案する。 MSCOCOイメージキャプションベンチマークでは、NAG法は最先端のオートレグレッシブモデルに匹敵するパフォーマンスを実現し、13.9倍のデコード高速化を実現します。
論文参考訳（メタデータ） (2021-01-24T12:16:45Z)
Semi-Autoregressive Training Improves Mask-Predict Decoding [119.8412758943192]
本研究では,マスク予測の半自己回帰動作を模倣した条件付きマスキング言語モデルSMARTを提案する。 SMARTでトレーニングされたモデルは、マスク予測デコードを使用すると高品質な変換を生成し、完全な自己回帰モデルで残りの性能ギャップを効果的に閉じる。
論文参考訳（メタデータ） (2020-01-23T19:56:35Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。