論文の概要: Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework
- arxiv url: http://arxiv.org/abs/2605.17261v1
- Date: Sun, 17 May 2026 05:03:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.813996
- Title: Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework
- Title(参考訳): 2次元RAGフレームワークによるロバストタンパク質問合せ解答のための生物学的ワークフローのアンロック
- Authors: Li Ding, Duanyu Feng, Chen Huang, Yangshuai Wang, Yang Li, Wenqiang Lei, See-Kiong Ng,
- Abstract要約: タンパク-テキスト質問回答(QA)は、自然言語による生物学的配列の解釈に不可欠である。
2D-ProteinRAGは,大規模言語モデル(LLM)を金本位生物研究ワークフロー内で動作させる新しいフレームワークである。
本研究では,2D-Proteinが常に最先端の性能を達成し,微調整ベースラインや他のRAG法よりも優れた性能を発揮することを示す。
- 参考スコア(独自算出の注目度): 60.82334952881798
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Protein-Text Question Answering (QA) is crucial for interpreting biological sequences through natural language. The integration of Large Language Models (LLMs) with Retrieval-Augmented Generation (RAG) that efficiently leverages biological databases and facilitates reasoning offers a potent approach for it. However, constrained by the standard RAG pipeline, these models often rely on curated, static datasets instead of expert-proven biological workflows, lacking the fine-grained information processing and struggling to generalize to novel (OOD) proteins. To bridge this gap, we propose 2D-ProteinRAG, a novel framework that empowers LLMs to operate within the gold-standard biological research workflow (BLAST). To further extract high-quality information from noisy retrieval contexts, we introduce a dual-dimensional (2D) filtering strategy following the expert analytical paradigms. Horizontal Fine-grained Attribute Alignment utilizes a lightweight, intent-aware discriminative filter to prune irrelevant metadata and align database entries with specific user queries. Vertical Homology-based Semantic Denoising resolves functional contradictions and redundancy across multiple homologs via hierarchical clustering. Extensive evaluations on both In-Distribution and diverse biological OOD benchmarks demonstrate that 2D-ProteinRAG consistently achieves state-of-the-art performance, outperforming fine-tuned baselines and other RAG methods. Our results validate the framework's robustness and scalability, providing a practical solution for interpreting protein functions in real-world scientific scenarios.
- Abstract(参考訳): タンパク-テキスト質問回答(QA)は、自然言語による生物学的配列の解釈に不可欠である。
大規模言語モデル(LLM)とRAG(Retrieval-Augmented Generation)の統合は、生物学的データベースを効率的に活用し、推論を容易にする。
しかしながら、標準的なRAGパイプラインに制約されているこれらのモデルは、専門家が提案する生物学的ワークフローではなく、キュレートされた静的データセットに依存しており、微細な情報処理が欠如し、新規(OOD)タンパク質への一般化に苦慮している。
このギャップを埋めるために2D-ProteinRAGを提案する。これは、LDMが金標準生物研究ワークフロー(BLAST)内で動作できるようにする新しいフレームワークである。
ノイズの多い検索コンテキストから高品質な情報をさらに抽出するために、専門家分析パラダイムに従って2次元(2次元)フィルタリング戦略を導入する。
Horizontal Fine-fine Attribute Alignmentは、軽量で意図対応の識別フィルタを使用して、無関係なメタデータをプルークし、データベースエントリを特定のユーザクエリにアライメントする。
垂直ホモロジーに基づくSemantic Denoisingは、階層的クラスタリングを通じて複数のホモログにまたがる機能的矛盾と冗長性を解決する。
In-Distributionと多様な生物学的OODベンチマークの広範な評価は、2D-ProteinRAGが一貫して最先端のパフォーマンスを達成し、微調整されたベースラインやその他のRAG法よりも優れていることを示している。
このフレームワークの堅牢性とスケーラビリティを検証し,現実の科学シナリオにおいてタンパク質機能を理解するための実用的なソリューションを提供する。
関連論文リスト
- From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models [73.72877445629383]
Interpretability-Guided Data Selection (IGDS) は、まず周波数リコールと干渉フィルタリングによって因果タスクの特徴を識別するフレームワークである。
我々は,数学的推論,要約,翻訳タスクに関するIGDSをGemma-2,LLaMA-3.1,Qwen3モデルで検証する。
論文 参考訳(メタデータ) (2026-04-28T03:16:24Z) - Reasoning-Aware AIGC Detection via Alignment and Reinforcement [55.09684020007737]
REVEALは、分類の前に解釈可能な推論チェーンを生成するフレームワークである。
複数のベンチマークで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-04-21T07:29:55Z) - Multi-Task LLM with LoRA Fine-Tuning for Automated Cancer Staging and Biomarker Extraction [6.53191669778827]
本研究では,腫瘍リンパ節転移(TNM)のステージング,組織学的グレード,バイオマーカーの抽出を自動化するためのパラメータ効率,マルチタスクフレームワークを提案する。
Llama-3-8B-Instruct encoderをLoRA(Lo-Rank Adaptation)を用いて10,677のレポートをキュレートして検証した。
論文 参考訳(メタデータ) (2026-04-14T22:26:30Z) - Interpretability-Guided Bi-objective Optimization: Aligning Accuracy and Explainability [0.0]
IGBOがDAG(Directed Acyclic Graph)として特徴重要階層を符号化
中心極限定理に基づくDAGの構成は、エッジ方向の決定の統計的妥当性を保証する。
DAG制約を最小限の精度で強制するIGBOの有効性は、標準正規化基準よりも優れていた。
論文 参考訳(メタデータ) (2026-01-02T11:32:00Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z) - RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG [0.0]
Retrieval-Augmented Generation (RAG) は、LLM(Large Language Models)を実際に証明するための重要な手法である。
既存の評価フレームワークは多くの場合、ドメイン固有のニュアンスをキャプチャできないメトリクスに依存します。
本稿では,RAGalystについて紹介する。RAGalystは,ドメイン固有のRAGシステムの厳密な評価を目的とした,人力による自動エージェントフレームワークである。
論文 参考訳(メタデータ) (2025-11-06T16:22:52Z) - LLM Ensemble for RAG: Role of Context Length in Zero-Shot Question Answering for BioASQ Challenge [0.03437656066916039]
大規模言語モデル (LLM) は情報検索に使用できる。
ゼロショットモデルのアンサンブルは、ドメイン固有のYes/No QAタスクで最先端のパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2025-09-10T13:50:49Z) - PRING: Rethinking Protein-Protein Interaction Prediction from Pairs to Graphs [88.98041407783502]
PRINGは、タンパク質とタンパク質の相互作用予測をグラフレベルで評価する最初のベンチマークである。
PRINGは、21,484タンパク質と186,818の相互作用からなる高品質な多種PPIネットワークデータセットをキュレートする。
論文 参考訳(メタデータ) (2025-07-07T15:21:05Z) - Rethinking Text-based Protein Understanding: Retrieval or LLM? [35.322164434180365]
タンパク質テキストモデルは、タンパク質の生成と理解において大きな注目を集めている。
現在のアプローチでは、タンパク質関連の知識を、継続した事前学習とマルチモーダルアライメントを通じて、大きな言語モデルに統合することに重点を置いている。
そこで本研究では,タンパク質間テキスト生成のための微調整LDMを著しく上回り,学習不要シナリオにおける精度と効率性を示す検索強化手法を提案する。
論文 参考訳(メタデータ) (2025-05-26T06:25:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。