論文の概要: Can LLMs Reliably Annotate Bioassay Metadata to Improve Data Readiness?
- arxiv url: http://arxiv.org/abs/2610.01616v1
- Date: Thu, 01 Oct 2026 12:54:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.136757
- Title: Can LLMs Reliably Annotate Bioassay Metadata to Improve Data Readiness?
- Title(参考訳): LLMはバイオアッセイメタデータを信頼してデータ準備を改善できるか?
- Abstract要約: バイオアッセイオントロジー(BAO)アッセイフォーマットと物理検出法フィールドにおいて,PubChemに欠落するアノテーションの程度を定量化する。
本稿では,オープンソースおよびプロプライエタリな大規模言語モデル (LLM) がメタデータアノテーションを直接評価し,評価できるかどうかを検討する。
- 参考スコア(独自算出の注目度): 10.76939143622156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The emergence of foundation models for molecular property prediction requires a high degree of AI data readiness, including reliable metadata annotation. However, both public repositories and industrial screening databases suffer from missing, inconsistent, or conflated assay annotations. In this work, we quantify the extent of missing annotations in PubChem for the BioAssay Ontology (BAO) assay format and physical detection method fields and investigate whether open-source and proprietary large language models (LLMs) can reliably predict and audit metadata annotations directly from the assay text. In our assessment, we found that the annotation coverage across PubChem's $\sim$2 million bioassays is critically sparse, 36\% lacking an assay format, 89\% a BioAssay type, and >99.9\% any BAO-mapped assay format or detection technology term. This motivates the need for automated test-metadata curation. Using evaluation sets derived from PubChem and ChEMBL, we assess the agreement of seven open-source and proprietary LLMs with existing silver labels. Recall is at least 0.96 for biochemical and cell-based assay formats, with a similar pattern for detection technology, although disagreements increase on under-represented classes. Manual inspection shows that many of these disagreements trace back to inconsistencies between silver sources rather than to LLM error. Moreover, in a qualitative study with a senior industrial curator, LLM-generated evidence prompted the expert to revise some of their own labels, showing LLMs can flag potentially mislabeled assays. Across the study, performance differences between proprietary and open-source models were small. Together, these results suggest LLMs can support the large-scale annotation and auditing of assay metadata, though per-class reliability estimates and targeted human review remain necessary before such labels enter downstream ML pipelines.
- Abstract(参考訳): 分子特性予測のための基礎モデルの出現には、信頼できるメタデータアノテーションを含む高度なAIデータ準備が必要である。
しかし、パブリックリポジトリとインダストリアルスクリーニングデータベースの両方が、欠落、矛盾、あるいは混在したアッセイアノテーションに悩まされている。
本研究では,BioAssay Ontology (BAO) assayフォーマットと物理検出手法フィールドのPubChemにおけるアノテーション不足の程度を定量化し,オープンソースおよびプロプライエタリな大規模言語モデル(LLM)がメタデータアノテーションを直接アッセイテキストから確実に予測し,監査することができるかどうかを検討する。
評価の結果,PubChemの$\sim$200M(200万ドル)バイオアッセイのアノテーションカバレッジは極めて低く,36.%はアッセイフォーマットが欠如しており,89.%はバイオアッセイタイプであり,99.9%はBAOマッピングされたアッセイフォーマットや検出技術用語であることがわかった。
これは自動テストメタタキュレーションの必要性を動機付けている。
PubChemとChEMBLから得られた評価セットを用いて、7つのオープンソースおよびプロプライエタリなLCMと既存の銀ラベルとの一致を評価した。
リコールは、生化学的および細胞ベースのアッセイ用として少なくとも0.96であり、検出技術に類似したパターンがあるが、表現不足のクラスでは不一致が増加する。
手動検査では、これらの不一致の多くはLLMエラーよりも銀源間の矛盾に遡ることを示している。
さらに、シニア・インダストリアル・キュレーターとの質的研究において、LSMが生み出した証拠は、専門家に自身のラベルのいくつかを改訂するよう促し、LSMが誤検査の可能性を示唆している。
調査全体では、プロプライエタリモデルとオープンソースモデルのパフォーマンスの違いは小さい。
これらの結果から,LSMは大規模なアノテーションやアサージメタデータの監査をサポートすることができるが,クラスごとの信頼性評価や対象とする人間によるレビューは,下流MLパイプラインに入る前に必要であることがわかった。
関連論文リスト
- Beyond Manual Curation: Augmenting Targeted Protein Degradation Databases via Agentic Literature Extraction Workflows [4.363171757159274]
バイオメディシンの予測モデルは、一次出版物のテキスト、表、サプリメントにロックされた構造化されたアッセイデータに依存する。
このボトルネックは、特にターゲットタンパク質分解(TPD)において、各アッセイレコードは、複合アイデンティティ、分解ターゲット、リクルーザー、アッセイコンテキスト、セクション、テーブル、補足ファイル間で報告されるエンドポイント値を組み合わせる必要がある。
ドメイン固有のキュレーションタスクとしてPDデータベース抽出を定式化し、ループ内LPMワークフローを提案する。
我々は、TPDデータキュレーションとAI支援科学キュレーションのためのリソースとして、ワークフロー、プロンプト、評価コード、抽出データセットをより広範囲にリリースする。
論文 参考訳(メタデータ) (2026-05-11T20:33:04Z) - Can Large Language Models Detect Methodological Flaws? Evidence from Gesture Recognition for UAV-Based Rescue Operation Based on Deep Learning [0.0]
我々は、人間中心の小さなデータセット上で、ほぼ完璧な精度を報告しているジェスチャー認識紙を分析した。
評価プロトコルは、非独立的なトレーニングとテストの分割により、主観レベルのデータ漏洩と整合性を示す。
次に、この欠陥が6つの最先端LCMによって独立に検出できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-03-23T11:39:16Z) - Variance-Aware LLM Annotation for Strategy Research: Sources, Diagnostics, and a Protocol for Reliable Measurement [0.3228822469249803]
大規模言語モデル(LLM)は、戦略研究者が大規模にテキストを注釈付けするための強力なツールを提供する。
しかし、LCM生成ラベルを決定論的見落としとして扱うことは、かなり不安定である。
我々は,構成仕様,インターフェース効果,モデル嗜好,出力抽出,システムレベルの集約という,5つのばらつき源を診断する。
論文 参考訳(メタデータ) (2025-12-02T18:02:20Z) - Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection Assumptions [20.51842378080194]
大規模言語モデル(LLM)は、様々なベンチマークで優れた性能を示し、汎用的なタスクソルバとしての可能性を示している。
LLMは典型的には大量のデータに基づいて訓練されるため、その評価において重要な関心事はデータ汚染である。
データ汚染検出に関する50の論文を体系的にレビューし、基礎となる仮定を分類し、厳格に検証されたかどうかを評価する。
論文 参考訳(メタデータ) (2024-10-24T17:58:22Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z) - A New Benchmark and Reverse Validation Method for Passage-level
Hallucination Detection [63.56136319976554]
大きな言語モデル(LLM)は幻覚を発生させ、ミッションクリティカルなタスクにデプロイすると大きなダメージを与える可能性がある。
本稿では,逆検証に基づく自己チェック手法を提案し,ゼロリソース方式で事実誤りを自動的に検出する。
提案手法と既存のゼロリソース検出手法を2つのデータセット上で実証的に評価した。
論文 参考訳(メタデータ) (2023-10-10T10:14:59Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。