論文の概要: Small Language Model as Data Prospector for Large Language Model
- arxiv url: http://arxiv.org/abs/2412.09990v1
- Date: Fri, 13 Dec 2024 09:23:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-12-16 15:04:14.045160
- Title: Small Language Model as Data Prospector for Large Language Model
- Title(参考訳): 大規模言語モデルのためのデータプロスペクタとしての小型言語モデル
- Authors: Shiwen Ni, Haihong Wu, Di Yang, Qiang Qu, Hamid Alinejad-Rokny, Min Yang,
- Abstract要約: textttNUGGETSは、大規模なデータセットから高品質なデータを特定し、選択する。
textttSuperNUGGETSは、大きな言語モデル(LLM)の代わりに小さな言語モデル(SLM)を使用して、優れたワンショットインスタンスのためにデータをフィルタリングする。
実験の結果, textttSuperNUGGETS は textttNUGGETS に比べて 1-2% しか低下しないが, 効率は58。
- 参考スコア(独自算出の注目度): 22.659698878699032
- License:
- Abstract: The quality of instruction data directly affects the performance of fine-tuned Large Language Models (LLMs). Previously, \cite{li2023one} proposed \texttt{NUGGETS}, which identifies and selects high-quality quality data from a large dataset by identifying those individual instruction examples that can significantly improve the performance of different tasks after being learnt as one-shot instances. In this work, we propose \texttt{SuperNUGGETS}, an improved variant of \texttt{NUGGETS} optimised for efficiency and performance. Our \texttt{SuperNUGGETS} uses a small language model (SLM) instead of a large language model (LLM) to filter the data for outstanding one-shot instances and refines the predefined set of tests. The experimental results show that the performance of \texttt{SuperNUGGETS} only decreases by 1-2% compared to \texttt{NUGGETS}, but the efficiency can be increased by a factor of 58. Compared to the original \texttt{NUGGETS}, our \texttt{SuperNUGGETS} has a higher utility value due to the significantly lower resource consumption.
- Abstract(参考訳): 命令データの質は、微調整された大言語モデル(LLM)の性能に直接影響する。
以前は \cite{li2023one} が提案していた \texttt{NUGGETS} は,大規模なデータセットから高品質なデータを特定し,選択するものだ。
本研究では,効率と性能を最適化した改良版である \texttt{SuperNUGGETS} を提案する。
我々の \texttt{SuperNUGGETS} は、大きな言語モデル(LLM)の代わりに小さな言語モデル(SLM)を使用して、優れたワンショットインスタンスのためにデータをフィルタリングし、事前定義されたテストセットを洗練します。
実験の結果, \texttt{SuperNUGGETS} の性能は \textt{NUGGETS} と比較して 1-2% しか低下しないことがわかったが, 効率は58。
元の \texttt{NUGGETS} と比較して、我々の \texttt{SuperNUGGETS} は、リソース消費が著しく少ないため、より有効性が高い。
関連論文リスト
- NeKo: Toward Post Recognition Generative Correction Large Language Models with Task-Oriented Experts [57.53692236201343]
提案するマルチタスク補正MOEでは,専門家が音声・テキスト・言語・テキスト・視覚・テキスト・データセットの「専門家」になるよう訓練する。
NeKoはマルチタスクモデルとして文法とポストOCR補正を競合的に実行している。
論文 参考訳(メタデータ) (2024-11-08T20:11:24Z) - Rephrasing natural text data with different languages and quality levels for Large Language Model pre-training [12.29061850090405]
既存の結果をC4で複製し、最適化されたリフレーズパイプラインで拡張することで、以前の作業の上に構築します。
私たちのパイプラインは、単言語と多言語の両方のセットアップにおける標準評価ベンチマークのパフォーマンス向上につながります。
論文 参考訳(メタデータ) (2024-10-28T07:30:05Z) - Improving Text Embeddings for Smaller Language Models Using Contrastive Fine-tuning [0.9561495813823734]
我々はNLIデータセットに対して対照的な微調整を行う。
MiniCPMは、平均56.33%のパフォーマンス向上の最も重要な改善を示している。
論文 参考訳(メタデータ) (2024-08-01T16:31:35Z) - Enhancing Embedding Performance through Large Language Model-based Text Enrichment and Rewriting [0.0]
本稿では,大規模な言語モデル(LLM)を活用して埋め込み処理前に入力テキストを豊かに書き直しすることで,埋め込み性能を向上させる新しい手法を提案する。
このアプローチの有効性は、Banking77 Classification、TwitterSemEval 2015、Amazon Counter-factual Classificationの3つのデータセットで評価されている。
論文 参考訳(メタデータ) (2024-04-18T15:58:56Z) - Language Models for Text Classification: Is In-Context Learning Enough? [54.869097980761595]
最近の基礎言語モデルでは、ゼロショットや少数ショットの設定で多くのNLPタスクで最先端のパフォーマンスが示されている。
より標準的なアプローチよりもこれらのモデルの利点は、自然言語(prompts)で書かれた命令を理解する能力である。
これにより、アノテーション付きインスタンスが限られているドメインのテキスト分類問題に対処するのに適している。
論文 参考訳(メタデータ) (2024-03-26T12:47:39Z) - RIFF: Learning to Rephrase Inputs for Few-shot Fine-tuning of Language Models [4.085425430499285]
本稿では,パラメータ効率のよい微調整手法と合わせて,元のタスクの入力テキストを変更することの影響について検討する。
入力テキストの書き直しを効果的に行うため,最大辺縁類似度を目標とした数発のパラフレーズモデルを訓練する。
本研究では, パラメータ効率のよい微調整だけで達成できることを超えて, 列車におけるパラフレーズとテスト時間によるデータ豊か化により, 性能が向上することを示す。
論文 参考訳(メタデータ) (2024-03-04T17:58:09Z) - One-Shot Learning as Instruction Data Prospector for Large Language Models [108.81681547472138]
textscNuggetsはワンショット学習を使用して、広範なデータセットから高品質な命令データを選択する。
我々は,textscNuggets がキュレートした例の上位1%による命令チューニングが,データセット全体を用いた従来の手法よりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2023-12-16T03:33:12Z) - Making Retrieval-Augmented Language Models Robust to Irrelevant Context [55.564789967211844]
ALMの重要なデシプラタムは、検索された情報が関連する場合のパフォーマンスをモデル化するのに役立つことである。
近年の研究では、検索の増大がパフォーマンスに悪影響を及ぼすことが示されている。
論文 参考訳(メタデータ) (2023-10-02T18:52:35Z) - Few-shot Text Classification with Dual Contrastive Consistency [31.141350717029358]
本稿では,事前学習した言語モデルを用いて,数ショットのテキスト分類を行う方法について検討する。
ラベル付きデータが少ない場合の教師付きコントラスト学習と、ラベルなしデータの一貫性と規則化を採用する。
論文 参考訳(メタデータ) (2022-09-29T19:26:23Z) - BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and
Semantic Parsing [55.058258437125524]
本稿では,制約付きLanguage Model Parsingを評価するベンチマークであるBenchCLAMPを紹介する。
APIを通じてのみ利用可能な2つのGPT-3変種を含む8つの言語モデルをベンチマークする。
実験により,エンコーダ-デコーダ事前学習言語モデルでは,モデル出力が有効であると制約された場合に,構文解析や意味解析の最先端手法を超えることができることがわかった。
論文 参考訳(メタデータ) (2022-06-21T18:34:11Z) - Improving Pre-trained Language Model Fine-tuning with Noise Stability
Regularization [94.4409074435894]
本稿では,LNSR(Layerwise Noise Stability Regularization)という,新規かつ効果的な微調整フレームワークを提案する。
具体的には、標準ガウス雑音を注入し、微調整モデルの隠れ表現を正規化することを提案する。
提案手法は,L2-SP,Mixout,SMARTなど他の最先端アルゴリズムよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-06-12T04:42:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。