論文の概要: Contrastive Learning and Mixture of Experts Enables Precise Vector Embeddings
- arxiv url: http://arxiv.org/abs/2401.15713v3
- Date: Tue, 17 Dec 2024 20:58:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-12-19 16:47:21.148718
- Title: Contrastive Learning and Mixture of Experts Enables Precise Vector Embeddings
- Title(参考訳): 精密ベクトル埋め込みを可能にするエキスパートのコントラスト学習と混合
- Authors: Logan Hallee, Rohan Kapur, Arjun Patel, Jason P. Gleghorn, Bohdan Khomtchouk,
- Abstract要約: 本稿では,類似度指標として共引用を用いてニッチデータセットを組み立てることにより,科学的テキストのベクトル埋め込みを改善する。
本研究では,複数層のパーセプトロン区間を拡大し,複数の異なる専門家にコピーする,新たなMixture of Experts(MoE)拡張パイプラインを事前訓練されたBERTモデルに適用する。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: The advancement of transformer neural networks has significantly elevated the capabilities of sentence similarity models, but they still struggle with highly discriminative tasks and may produce sub-optimal representations of important documents like scientific literature. With the increased reliance on retrieval augmentation and search, representing diverse documents as concise and descriptive vectors is crucial. This paper improves upon the vectors embeddings of scientific text by assembling niche datasets using co-citations as a similarity metric, focusing on biomedical domains. We apply a novel Mixture of Experts (MoE) extension pipeline to pretrained BERT models, where every multi-layer perceptron section is enlarged and copied into multiple distinct experts. Our MoE variants perform well over $N$ scientific domains with $N$ dedicated experts, whereas standard BERT models excel in only one domain at a time. Notably, extending just a single transformer block to MoE captures 85% of the benefit seen from full MoE extension at every layer. This holds promise for versatile and efficient One-Size-Fits-All transformer networks for numerically representing diverse inputs. Our methodology marks advancements in representation learning and holds promise for enhancing vector database search and compilation.
- Abstract(参考訳): トランスフォーマーニューラルネットワークの進歩は文類似モデルの能力を大幅に向上させたが、それでも高い差別的なタスクに苦慮し、科学文献のような重要な文書の準最適表現を生み出す可能性がある。
検索の強化と検索への依存度が高まるにつれ、多種多様な文書を簡潔かつ記述的なベクトルとして表現することが重要である。
本稿では, バイオメディカル領域に着目した類似度指標として共引用を用いたニッチデータセットを組み込むことにより, 科学的テキストのベクトル埋め込みを改善する。
本研究では,複数層のパーセプトロン区間を拡大し,複数の異なる専門家にコピーする,新たなMixture of Experts(MoE)拡張パイプラインを事前訓練されたBERTモデルに適用する。
私たちのMOEの変種は、N$の専門知識を持つ科学ドメインよりも優れていますが、標準的なBERTモデルは、一度に1つのドメインでしか排他的ではありません。
注目すべきなのは、単一のトランスフォーマーブロックをMoEに拡張するだけで、すべてのレイヤで完全なMoE拡張で見られるメリットの85%をキャプチャできることだ。
これは、多種多様な入力を数値的に表現する汎用的で効率的なワンサイズ・フィッツ・オール変圧器ネットワークを約束する。
提案手法は表現学習の進歩を示すものであり,ベクトルデータベース検索とコンパイルの強化を約束する。
関連論文リスト
- Utilizing BERT for Information Retrieval: Survey, Applications,
Resources, and Challenges [4.588192657854766]
本調査は、情報検索(IR)にBERTのような事前訓練されたトランスフォーマーエンコーダを適用するアプローチに焦点を当てる。
i) 長文処理, (ii) 意味情報の統合, (iii) 有効性と効率のバランス, (iv) 用語の重み付け予測, (v) クエリ拡張, (vi) 文書拡張の6つの高レベルカテゴリに分類した。
特定のタスクに対して、細かな調整されたBERTエンコーダは依然としてパフォーマンスが良く、デプロイメントコストも低いことが分かりました。
論文 参考訳(メタデータ) (2024-02-18T23:22:40Z) - A Comprehensive Survey on Applications of Transformers for Deep Learning
Tasks [60.38369406877899]
Transformerは、シーケンシャルデータ内のコンテキスト関係を理解するために自己認識メカニズムを使用するディープニューラルネットワークである。
Transformerモデルは、入力シーケンス要素間の長い依存関係を処理し、並列処理を可能にする。
我々の調査では、トランスフォーマーベースのモデルのためのトップ5のアプリケーションドメインを特定します。
論文 参考訳(メタデータ) (2023-06-11T23:13:51Z) - Hybrid Transformer with Multi-level Fusion for Multimodal Knowledge
Graph Completion [112.27103169303184]
マルチモーダル知識グラフ(MKG)は、視覚テキストの事実知識を整理する。
MKGformerは、マルチモーダルリンク予測、マルチモーダルRE、マルチモーダルNERの4つのデータセット上でSOTA性能を得ることができる。
論文 参考訳(メタデータ) (2022-05-04T23:40:04Z) - Hierarchical Transformer Model for Scientific Named Entity Recognition [0.20646127669654832]
名前付きエンティティ認識のためのシンプルで効果的なアプローチを提案する。
提案手法の主な考え方は、入力サブワードシーケンスをBERTのような事前学習された変換器で符号化することである。
科学的NERのための3つのベンチマークデータセットに対するアプローチを評価した。
論文 参考訳(メタデータ) (2022-03-28T12:59:06Z) - META: Mimicking Embedding via oThers' Aggregation for Generalizable
Person Re-identification [68.39849081353704]
Domain Generalizable (DG) Person Re-identification (ReID)は、トレーニング時に対象のドメインデータにアクセスすることなく、見えないドメインをまたいでテストすることを目的としている。
本稿では,DG ReID のための OThers' Aggregation (META) を用いた Mimicking Embedding という新しい手法を提案する。
論文 参考訳(メタデータ) (2021-12-16T08:06:50Z) - Transferring BERT-like Transformers' Knowledge for Authorship
Verification [8.443350618722562]
著者確認作業におけるBERT様変圧器の有効性について検討した。
我々はPAN-2020の新しいスプリットを提供し、不連続なトピックや著者からトレーニングデータとテストデータをサンプリングする。
これらの分割は、新しい、かなり異なるデータセット上で知識を伝達するモデルの能力を高めることができることを示す。
論文 参考訳(メタデータ) (2021-12-09T18:57:29Z) - Few-Shot Named Entity Recognition: A Comprehensive Study [92.40991050806544]
マルチショット設定のモデル一般化能力を向上させるための3つの手法を検討する。
ラベル付きデータの比率の異なる10の公開nerデータセットについて経験的比較を行う。
マルチショットとトレーニングフリーの両方の設定で最新の結果を作成します。
論文 参考訳(メタデータ) (2020-12-29T23:43:16Z) - Pretrained Transformers for Text Ranking: BERT and Beyond [53.83210899683987]
このサーベイは、トランスフォーマーとして知られるニューラルネットワークアーキテクチャによるテキストランキングの概要を提供する。
トランスフォーマーと自己教師型事前学習の組み合わせは、自然言語処理のパラダイムシフトの原因となっている。
論文 参考訳(メタデータ) (2020-10-13T15:20:32Z) - Transformer Based Multi-Source Domain Adaptation [53.24606510691877]
実践的な機械学習設定では、モデルを予測しなければならないデータは、トレーニングされたデータとは異なる分布から生まれることが多い。
本稿では、複数のソースドメインからラベル付きデータに基づいてモデルを訓練し、ラベル付きデータが見られないドメイン上で予測を行う、教師なしマルチソースドメイン適応の問題について検討する。
本研究では,大規模な事前学習型変圧器を用いたドメインエキスパートの予測が極めて均質であることを示し,それらの予測を混在させる効果的な関数の学習を困難にしている。
論文 参考訳(メタデータ) (2020-09-16T16:56:23Z) - MT-BioNER: Multi-task Learning for Biomedical Named Entity Recognition
using Deep Bidirectional Transformers [1.7403133838762446]
異なるスロットタイプをカバーする複数のデータセットを用いたスロットタグの訓練をマルチタスク学習問題として検討する。
生物医学領域における実験結果から,提案手法は従来のスロットタグシステムよりも優れていることが示された。
論文 参考訳(メタデータ) (2020-01-24T07:16:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。