論文の概要: Benchmarking Literature Retrieval for a Model Organism: A Dictyostelium Case Study
- arxiv url: http://arxiv.org/abs/2610.03130v1
- Date: Fri, 02 Oct 2026 10:50:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.337073
- Title: Benchmarking Literature Retrieval for a Model Organism: A Dictyostelium Case Study
- Title(参考訳): モデル生物の文献検索のベンチマーク--Dctyostelium のケーススタディ
- Abstract要約: 細胞および発生生物学のモデル生物であるDictyosteliumのdictyBaseからの検索ベンチマークを紹介する。
ニッチな生物学的検索における3つの要因について検討した。
- 参考スコア(独自算出の注目度): 5.80358413513655
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Biological literature retrieval systems are often developed and evaluated using broad biomedical corpora and general-purpose search tasks. However, many curated knowledge bases operate in narrower model-organism domains, where the literature is sparse and terminology is organism-specific. We introduce a retrieval benchmark from dictyBase for Dictyostelium, a model organism in cell and developmental biology. The benchmark consists of curator-generated biological queries linked to PubMed-indexed articles, together with structured gene annotations. Using this benchmark, we study three factors in niche biological retrieval: cross-encoder reranking, gene-aware query expansion, and abstract-only versus full-text retrieval. We report that reranking and gene-aware query expansion improve retrieval selectively: reranking is most useful when the model is well suited to biological evidence matching, whereas curated annotations help clarify compact biological queries by reducing vocabulary mismatch. Full-text chunks substantially improve retrieval when abstracts omit supporting evidence, increasing both candidate recall and top-rank performance, although these cases are harder than queries supported by abstracts. Data and code are publicly available at https://github.com/fulaibaowang/dictycite, and the benchmark dataset is additionally archived on Zenodo.
- Abstract(参考訳): 生物文献検索システムは,広範囲なバイオメディカルコーパスと汎用検索タスクを用いて開発・評価されることが多い。
しかし、多くのキュレートされた知識基盤はより狭いモデル-有機体領域で活動しており、文献は希少であり、用語は生物特有のものである。
細胞および発生生物学のモデル生物であるDictyosteliumのdictyBaseからの検索ベンチマークを紹介する。
このベンチマークは、構造化された遺伝子アノテーションとともに、PubMedでインデックスされた記事にリンクされたキュレーター生成の生物学的クエリで構成されている。
本ベンチマークを用いて,ニッチな生物学的検索の3つの要因について検討した。
提案手法は, 生物学的エビデンスマッチングに適している場合において, 再分類と遺伝子認識によるクエリ拡張が検索を選択的に改善するのに対し, キュレートされたアノテーションは語彙ミスマッチを減らし, コンパクトな生物学的クエリを明確にするのに役立つ。
完全テキストチャンクは、エビデンスを省略し、候補リコールとトップランクパフォーマンスの両方を向上するが、これらのケースは抽象によってサポートされているクエリよりも困難である。
データとコードはhttps://github.com/fulaibaowang/dictyciteで公開されている。
関連論文リスト
- PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning [10.873172077806798]
PlantMarkerBenchは、フルテキストの生物学的論文から文献的な植物マーカーのエビデンスを解釈するベンチマークである。
4つの植物種にまたがり、5,550件の文章レベルのエビデンス・インスタンスが含まれており、マーカーのエビデンス、エビデンス・タイプ、サポートの強さを示す。
種々にわたる多様なオープンソースおよびクローズドソースの言語モデルをベンチマークし、戦略を推進します。
論文 参考訳(メタデータ) (2026-05-11T05:57:15Z) - DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery [45.28140700804044]
DeepTaxonは、種同定と発見を統一する検索強化フレームワークである。
我々は、合成検索強化データに基づく教師付き微調整により、このフレームワークを訓練する。
大規模な分布内ベンチマークと6つの分布外データセットの実験は、識別と発見の両方において一貫した改善を示している。
論文 参考訳(メタデータ) (2026-04-27T04:30:54Z) - FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases [10.00386797940562]
本研究では,FlyBenchを用いて,エンドツーエンドのエージェントキュレーションにおけるAIエージェントの評価を行う。
遺伝子記号のみが与えられた場合、エージェントは構造化アノテーションを生成するために16,898のフルテキスト文書のコーパスを検索して読み込まなければならない。
このベンチマークには、FlyBaseから引き出された100の遺伝子にまたがる、専門家による7,397のアノテーションが含まれている。
論文 参考訳(メタデータ) (2026-02-09T20:12:38Z) - Generative vector search to improve pathology foundation models across multimodal vision-language tasks [0.0]
本稿では,検索性能を向上させるためにクエリ条件付き埋め込みをサンプリングする生成ベクトル探索手法であるLatent Matching(STHLM)を提案する。
STHLMは、科学的文献、臨床ノート、組織像を含む様々なベンチマークにおいて、古典的ベクトル検索よりも重要な改善を示す。
論文 参考訳(メタデータ) (2025-12-22T12:59:23Z) - Improving Retrieval in Theme-specific Applications using a Corpus
Topical Taxonomy [52.426623750562335]
ToTER (Topical Taxonomy Enhanced Retrieval) フレームワークを紹介する。
ToTERは、クエリとドキュメントの中心的なトピックを分類学のガイダンスで識別し、そのトピックの関連性を利用して、欠落したコンテキストを補う。
プラグイン・アンド・プレイのフレームワークとして、ToTERは様々なPLMベースのレトリバーを強化するために柔軟に使用できる。
論文 参考訳(メタデータ) (2024-03-07T02:34:54Z) - Dense X Retrieval: What Retrieval Granularity Should We Use? [56.90827473115201]
しばしば見過ごされる設計選択は、コーパスが索引付けされる検索単位である。
本稿では,高密度検索のための新しい検索ユニット,命題を提案する。
実験により、提案のような細粒度単位によるコーパスのインデックス付けは、検索タスクにおける通過レベル単位を著しく上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2023-12-11T18:57:35Z) - CorpusBrain: Pre-train a Generative Retrieval Model for
Knowledge-Intensive Language Tasks [62.22920673080208]
単一ステップ生成モデルは、検索プロセスを劇的に単純化し、エンドツーエンドで最適化することができる。
我々は、事前学習された生成検索モデルをCorpsBrainと名付け、コーパスに関する全ての情報が、追加のインデックスを構築することなく、そのパラメータにエンコードされる。
論文 参考訳(メタデータ) (2022-08-16T10:22:49Z) - EBOCA: Evidences for BiOmedical Concepts Association Ontology [55.41644538483948]
本論文は,生物医学領域の概念とそれらの関連性を記述するオントロジーであるEBOCAと,それらの関連性を支持するエビデンスを提案する。
DISNETのサブセットから得られるテストデータとテキストからの自動アソシエーション抽出が変換され、実際のシナリオで使用できる知識グラフが作成されるようになった。
論文 参考訳(メタデータ) (2022-08-01T18:47:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。