論文の概要: From Artificially Real to Real: Leveraging Pseudo Data from Large
Language Models for Low-Resource Molecule Discovery
- arxiv url: http://arxiv.org/abs/2309.05203v3
- Date: Tue, 5 Mar 2024 10:51:23 GMT
- ステータス: 処理完了
- システム内更新日: 2024-03-07 02:38:11.440251
- Title: From Artificially Real to Real: Leveraging Pseudo Data from Large
Language Models for Low-Resource Molecule Discovery
- Title(参考訳): 人工現実から現実へ:低リソース分子発見のための大規模言語モデルからの疑似データ活用
- Authors: Yuhan Chen, Nuwa Xi, Yanrui Du, Haochun Wang, Jianyu Chen, Sendong
Zhao, Bing Qin
- Abstract要約: 分子発見のためのクロスモーダル技術は、しばしばデータ不足の問題に遭遇し、その性能と応用を妨げる。
我々は,高品質な擬似データを構築するための検索ベースのプロンプト戦略を導入し,この擬似データを効果的に活用するための最適手法を探る。
実験により、ドメイン適応のための擬似データの使用は、既存のすべてのメソッドより優れており、モデルスケールが小さく、データサイズが小さく、トレーニングコストも低いことが示されている。
- 参考スコア(独自算出の注目度): 35.5507452011217
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Molecule discovery serves as a cornerstone in numerous scientific domains,
fueling the development of new materials and innovative drug designs. Recent
developments of in-silico molecule discovery have highlighted the promising
results of cross-modal techniques, which bridge molecular structures with their
descriptive annotations. However, these cross-modal methods frequently
encounter the issue of data scarcity, hampering their performance and
application. In this paper, we address the low-resource challenge by utilizing
artificially-real data generated by Large Language Models (LLMs). We first
introduce a retrieval-based prompting strategy to construct high-quality pseudo
data, then explore the optimal method to effectively leverage this pseudo data.
Experiments show that using pseudo data for domain adaptation outperforms all
existing methods, while also requiring a smaller model scale, reduced data size
and lower training cost, highlighting its efficiency. Furthermore, our method
shows a sustained improvement as the volume of pseudo data increases, revealing
the great potential of pseudo data in advancing low-resource cross-modal
molecule discovery. Our code and data are available at
https://github.com/SCIR-HI/ArtificiallyR2R.
- Abstract(参考訳): 分子発見は多くの科学分野の基盤となり、新しい材料や革新的な医薬品の設計を加速させた。
近年のシリカ分子発見は、分子構造を記述的アノテーションで橋渡しするクロスモーダル手法の有望な成果を浮き彫りにした。
しかし、これらのクロスモーダルメソッドは、しばしばデータ不足の問題に遭遇し、パフォーマンスとアプリケーションを妨げる。
本稿では,Large Language Models (LLM) が生成する人工現実データを活用することで,低リソースの課題に対処する。
まず,質の高い疑似データを構築するための検索に基づくプロンプト戦略を導入し,この疑似データを効果的に活用するための最適な方法を検討する。
実験によると、ドメイン適応のための擬似データの使用は、既存のすべてのメソッドよりも優れており、モデルスケールの縮小、データサイズ削減、トレーニングコストの削減、効率の向上も必要である。
さらに,疑似データ量の増加に伴い,低リソースのクロスモーダル分子の発見において,疑似データの潜在能力が著しく向上することを示す。
私たちのコードとデータはhttps://github.com/scir-hi/artificiallyr2rで入手できます。
関連論文リスト
- ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs [60.81649785463651]
ExaRanker-Openを導入し、オープンソース言語モデルを適用して、説明を生成する。
以上の結果から,LLMのサイズが大きくなるにつれて,説明の組み込みが神経ランク付けを継続的に促進することが明らかとなった。
論文 参考訳(メタデータ) (2024-02-09T11:23:14Z) - TwinBooster: Synergising Large Language Models with Barlow Twins and
Gradient Boosting for Enhanced Molecular Property Prediction [0.0]
本研究では, 微調整された大規模言語モデルを用いて, テキスト情報に基づく生物学的アッセイを統合する。
このアーキテクチャは、測定情報と分子指紋の両方を使用して、真の分子情報を抽出する。
TwinBoosterは最先端のゼロショット学習タスクを提供することで、目に見えないバイオアッセイや分子の性質の予測を可能にする。
論文 参考訳(メタデータ) (2024-01-09T10:36:20Z) - ArSDM: Colonoscopy Images Synthesis with Adaptive Refinement Semantic
Diffusion Models [69.9178140563928]
大腸内視鏡検査は臨床診断や治療に不可欠である。
注釈付きデータの不足は、既存の手法の有効性と一般化を制限する。
本稿では, 下流作業に有用な大腸内視鏡画像を生成するために, 適応Refinement Semantic Diffusion Model (ArSDM)を提案する。
論文 参考訳(メタデータ) (2023-09-03T07:55:46Z) - Objective-Agnostic Enhancement of Molecule Properties via Multi-Stage
VAE [1.3597551064547502]
変異オートエンコーダ(VAE)は医薬品発見の一般的な方法であり、その性能を改善するために様々なアーキテクチャやパイプラインが提案されている。
VAEアプローチは、データが高次元の周囲空間に埋め込まれた低次元多様体上にあるとき、多様体の回復不良に悩まされることが知られている。
本稿では, 合成データセット上での多様体回復を向上する多段階VAEアプローチを創薬分野に適用することを検討する。
論文 参考訳(メタデータ) (2023-08-24T20:22:22Z) - DEL-Dock: Molecular Docking-Enabled Modeling of DNA-Encoded Libraries [1.290382979353427]
我々は、リガンドベースの記述子とドッキングされたタンパク質-リガンド複合体の3次元空間情報を組み合わせた新しいパラダイムDEL-Dockを導入する。
本モデルでは,分子富化スコアを予測するために,DELカウントデータを効果的にデノベートできることを示す。
論文 参考訳(メタデータ) (2022-11-30T22:00:24Z) - IDLat: An Importance-Driven Latent Generation Method for Scientific Data [12.93181915755184]
本稿では,領域的関心を持つ科学的データ可視化と分析を容易にするために,新しい重要性駆動型潜伏表現を提案する。
空間的重要度マップを用いて、様々な科学的関心を表現し、特徴変換ネットワークの入力として、潜在世代を導く。
論文 参考訳(メタデータ) (2022-08-05T18:23:22Z) - Data-Efficient Learning via Minimizing Hyperspherical Energy [48.47217827782576]
本稿では,少数の代表データを用いたスクラッチからのデータ効率学習の問題について考察する。
我々は,MHEに基づくアクティブラーニング(MHEAL)アルゴリズムを提案し,MHEALの包括的な理論的保証を提供する。
論文 参考訳(メタデータ) (2022-06-30T11:39:12Z) - MoleHD: Ultra-Low-Cost Drug Discovery using Hyperdimensional Computing [2.7462881838152913]
分子特性予測のための脳誘発超次元計算(HDC)に基づくMoleHDを提案する。
MoleHDは、ランダムスプリットとスキャフォールドスプリットで、平均3つのデータセットでROC-AUCスコアを達成している。
私たちの知る限りでは、この方法が初めてHDCベースの薬物発見法である。
論文 参考訳(メタデータ) (2021-06-05T13:33:21Z) - Reprogramming Language Models for Molecular Representation Learning [65.00999660425731]
本稿では,分子学習タスクのための事前学習言語モデルに対して,辞書学習(R2DL)による表現再プログラミングを提案する。
対比プログラムは、k-SVDソルバを用いて、高密度ソースモデル入力空間(言語データ)とスパースターゲットモデル入力空間(例えば、化学および生物学的分子データ)との間の線形変換を学習する。
R2DLは、ドメイン固有のデータに基づいて訓練されたアート毒性予測モデルの状態によって確立されたベースラインを達成し、限られたトレーニングデータ設定でベースラインを上回る。
論文 参考訳(メタデータ) (2020-12-07T05:50:27Z) - MolTrans: Molecular Interaction Transformer for Drug Target Interaction
Prediction [68.5766865583049]
薬物標的相互作用(DTI)予測は、シリコ薬物発見の基本的な課題である。
近年、DTI予測におけるディープラーニングの進歩が期待されている。
これらの制約に対処する分子間相互作用変換器(TransMol)を提案する。
論文 参考訳(メタデータ) (2020-04-23T18:56:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。