論文の概要: Exploration of Masked and Causal Language Modelling for Text Generation
- arxiv url: http://arxiv.org/abs/2405.12630v1
- Date: Tue, 21 May 2024 09:33:31 GMT
- ステータス: 処理完了
- システム内更新日: 2024-05-22 13:49:12.101129
- Title: Exploration of Masked and Causal Language Modelling for Text Generation
- Title(参考訳): テキスト生成のためのマスケと因果言語モデリングの探索
- Authors: Nicolo Micheletti, Samuel Belkadi, Lifeng Han, Goran Nenadic,
- Abstract要約: 本稿では,テキスト生成タスクにおける因果言語モデリング手法の広範な比較を行う。
まず、定量的な指標を用いて、コヒーレンスと文法的正当性を分析する定性的な人的評価を行う。
その結果、すべてのデータセットでテキスト生成において、CLMは一貫して上回っていることがわかった。
- 参考スコア(独自算出の注目度): 6.26998839917804
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large Language Models (LLMs) have revolutionised the field of Natural Language Processing (NLP) and have achieved state-of-the-art performance in practically every task in this field. However, the prevalent approach used in text generation, Causal Language Modelling (CLM), which generates text sequentially from left to right, inherently limits the freedom of the model, which does not decide when and where each token is generated. In contrast, Masked Language Modelling (MLM), primarily used for language understanding tasks, can generate tokens anywhere in the text and any order. This paper conducts an extensive comparison of MLM and CLM approaches for text generation tasks. To do so, we pre-train several language models of comparable sizes on three different datasets, namely 1) medical discharge summaries, 2) movie plot synopses, and 3) authorship verification datasets. To assess the quality of the generations, we first employ quantitative metrics and then perform a qualitative human evaluation to analyse coherence and grammatical correctness. In addition, we evaluate the usefulness of the generated texts by using them in three different downstream tasks: 1) Entity Recognition, 2) Text Classification, and 3) Authorship Verification. The results show that MLM consistently outperforms CLM in text generation across all datasets, with higher quantitative scores and better coherence in the generated text. The study also finds \textit{no strong correlation} between the quality of the generated text and the performance of the models in the downstream tasks. With this study, we show that MLM for text generation has great potential for future research and provides direction for future studies in this area.
- Abstract(参考訳): 大規模言語モデル(LLM)は自然言語処理(NLP)の分野に革命をもたらし、この分野のあらゆるタスクにおいて最先端のパフォーマンスを達成した。
しかし、テキスト生成でよく使われるアプローチであるコーサル言語モデリング(CLM)は、左から右へ連続的にテキストを生成するが、本質的には、各トークンがいつどこで生成されるかは決定しないモデルの自由を制限する。
対照的に、主に言語理解タスクに使用されるMasked Language Modelling (MLM)は、テキストや任意の順序でトークンを生成することができる。
本稿では,テキスト生成タスクに対するMLMとCLMのアプローチを広範囲に比較する。
そのために、3つの異なるデータセット、すなわち3つの異なるデータセットで、同等の大きさの言語モデルを事前訓練する。
1) 退院要約
2)映画プロットのシナプス、及び
3)オーサシップ検証データセット。
代々の質を評価するために,まず定量的指標を用いて,コヒーレンスと文法的正当性を解析するための定性的な人的評価を行う。
さらに、生成されたテキストを3つのダウンストリームタスクで使用することで、その有用性を評価する。
1)エンティティ認識
2)テキスト分類,及び
3) 著者確認。
その結果、MLMはテキスト生成において、高い定量的スコアと、生成したテキストのコヒーレンスにより、CLMを一貫して上回っていることがわかった。
また、生成されたテキストの品質と下流タスクにおけるモデルの性能との間には、‘textit{no strong correlation}’がある。
本研究では,テキスト生成のためのMLMが今後の研究に大きな可能性を秘めており,今後の研究の方向性を示す。
関連論文リスト
- Peering into the Mind of Language Models: An Approach for Attribution in Contextual Question Answering [9.86691461253151]
大規模言語モデル(LLM)の隠れ状態表現を利用した文脈質問応答における帰属手法を提案する。
提案手法は,より詳細な属性を提供し,生成した回答の質を保ちながら,広範囲なモデル再訓練および検索モデルオーバーヘッドの必要性を回避している。
本稿では,LLM世代に対するトークンレベルのアノテーションを文脈質問応答設定に有する属性データセットであるVerifiability-granularを提案する。
論文 参考訳(メタデータ) (2024-05-28T09:12:44Z) - Exploring Precision and Recall to assess the quality and diversity of LLMs [82.21278402856079]
我々はtextscLlama-2 や textscMistral のような大規模言語モデル (LLM) のための新しい評価フレームワークを提案する。
このアプローチにより、コーパスの整合を必要とせず、生成したテキストの品質と多様性を微妙に評価できる。
論文 参考訳(メタデータ) (2024-02-16T13:53:26Z) - Generative AI Text Classification using Ensemble LLM Approaches [0.12483023446237698]
大規模言語モデル(LLM)は、さまざまなAIや自然言語処理タスクで素晴らしいパフォーマンスを示している。
本研究では,異なる学習済みLLMから確率を生成するアンサンブルニューラルモデルを提案する。
AIと人間の生成したテキストを区別する最初のタスクとして、私たちのモデルは第5位と第13位にランクされた。
論文 参考訳(メタデータ) (2023-09-14T14:41:46Z) - MURMUR: Modular Multi-Step Reasoning for Semi-Structured Data-to-Text
Generation [102.20036684996248]
多段階推論を用いた半構造化データからテキストを生成するための,ニューロシンボリックなモジュラーアプローチであるMURMURを提案する。
WebNLG や LogicNLG のような2つのデータ・テキスト生成タスクについて実験を行った。
論文 参考訳(メタデータ) (2022-12-16T17:36:23Z) - On Advances in Text Generation from Images Beyond Captioning: A Case
Study in Self-Rationalization [89.94078728495423]
近年のモダリティ,CLIP画像表現,言語モデルの拡張は,マルチモーダル入力によるタスクのマルチモーダル自己調整を一貫して改善していないことを示す。
画像キャプションを超えて画像やテキストからテキストを生成するために構築可能なバックボーンモデリング手法が提案されている。
論文 参考訳(メタデータ) (2022-05-24T00:52:40Z) - Attend, Memorize and Generate: Towards Faithful Table-to-Text Generation
in Few Shots [58.404516361586325]
Few-shot table-to-text generation は、限られたデータを用いてテーブル内容を伝えるために、流動的で忠実な文を構成するタスクである。
本稿では,人間のテキスト生成プロセスに触発された新しい手法,覚醒と生成(AMG)を提案する。
論文 参考訳(メタデータ) (2022-03-01T20:37:20Z) - A Survey of Pretrained Language Models Based Text Generation [97.64625999380425]
テキスト生成は、入力データから人間の言語で可読で読みやすいテキストを生成することを目的としている。
ディープラーニングは、ニューラルジェネレーションモデル、特に事前学習言語モデル(PLM)のパラダイムにより、この分野を大幅に進歩させた。
PLM上でのテキスト生成は、学術と産業の両方において有望な方向と見なされている。
論文 参考訳(メタデータ) (2022-01-14T01:44:58Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Pretrained Language Models for Text Generation: A Survey [46.03096493973206]
本稿では、テキスト生成のための事前学習言語モデル(PLM)のトピックにおいて達成された大きな進歩について概説する。
我々は、既存のPLMを異なる入力データに適応させ、生成したテキストの特別な特性を満たす方法について論じる。
論文 参考訳(メタデータ) (2021-05-21T12:27:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。