論文の概要: Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks
- arxiv url: http://arxiv.org/abs/2607.23975v1
- Date: Mon, 27 Jul 2026 03:55:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.301294
- Title: Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks
- Title(参考訳): Plato-Bio: 時間的再検討と構造的ベンチマークによる検証初となる生物学的新規性スクリーニング
- Authors: Stefan G. Creadore,
- Abstract要約: オープンなPlato/Denarioアーキテクチャの拡張であるPlato-Bioを開発した。
Plato-Bioは明示的なワークフローステートを、プロファイランスレコード、引用チェック、クレーム・ツー・エビデンスリンク、スコープドファイル書き込み、パブリッシュゲートと結合する。
現在のクリーンリビジョンでは、完全なPythonスイートが931パス、6スキップ、エラーやエラーは発生しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model research agents can connect literature retrieval, analysis code, and manuscript preparation, but coherent output does not establish scientific validity. We developed Plato-Bio, a biology-routed extension of the open Plato/Denario architecture that couples explicit workflow states with provenance records, citation checks, claim-to-evidence links, scoped file writes, and publication gates. A source audit identified and repaired three defects that could distort evaluation: loss of task domain in the default factory, omission of declared method signals from scoring, and evidence sidecars that lacked the drafted-claim denominator. On the current clean revision, the full Python suite completed with 931 passes, six skips, and no failures or errors; targeted biology, genomics, evidence/citation, and adversarial-safety suites likewise completed without failure. We evaluated two narrow use cases. In a frozen historical rediscovery task, independent pre-1986 literature bridges ranked the later-studied relation between fish oil and Raynaud phenomenon first; TF-IDF ranked it second and corpus frequency third. This single curated task measures retrospective ranking, not prospective discovery. In a separate comparison of AlphaFold models with experimental structures for 15 human proteins, 11 targets had high-confidence-core C-alpha RMSD below 1 Angstrom (median 0.501 Angstrom). Four targets exceeded 2 Angstrom, and confidence masking reduced the SUMO1 discrepancy from 16.61 to 2.58 Angstrom over 74 residues. The workflow emitted 27 traceable discrepancy regions, all retained as unvalidated hypotheses. Plato-Bio therefore provides reproducible software contracts and auditable screening baselines; broader claims of agent efficacy or biological novelty require preregistered evaluation, independent review, and prospective validation.
- Abstract(参考訳): 大規模言語モデル研究エージェントは、文献検索、分析コード、原稿作成を接続することができるが、一貫性のある出力は科学的妥当性を確立できない。
オープンなPlato/Denarioアーキテクチャの拡張であるPlato-Bioを開発した。これは、明示的なワークフロー状態を前例記録、引用チェック、クレーム・ツー・エビデンスリンク、スコープドファイル書き込み、パブリッシュゲートと組み合わせるものだ。
ソース監査では、デフォルトの工場でのタスクドメインの喪失、宣言されたメソッドシグナルのスコアの削除、ドラフトされた定義の分母を欠いた証拠サイドカーの3つの欠陥を特定し、修復した。
現在のクリーンリビジョンでは、完全なPythonスイートが931パス、スキップ6回、エラーやエラーはない。
狭義の2症例について検討した。
凍結した歴史的再発見作業において、1986年以前の独立した文学橋は、後に調査された魚油とレイノー現象の関係を第1位、TF-IDFは第2位、コーパス周波数は第3位にランク付けした。
この単一のキュレートされたタスクは、予測された発見ではなく、ふりかえりのランキングを測定します。
Angstrom (median 0.501 Angstrom) 以下の高信頼コアC-alpha RMSDをターゲットとしたAlphaFoldモデルと15個のヒトタンパク質の実験構造の比較を行った。
4つの目標が2アングストロームを超え、信頼性マスキングによりSUMO1の差は74個の残基で16.61から2.58アングストロームに減少した。
ワークフローは27個のトレーサブルな不一致領域を放出し、すべて無効な仮説として保持された。
そのため、Platto-Bioは再現可能なソフトウェア契約と監査可能なスクリーニングベースラインを提供しており、エージェントの有効性や生物学的新奇性の幅広い主張には、事前登録された評価、独立したレビュー、そして将来的な検証が必要である。
関連論文リスト
- Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture [0.3823356975862005]
検証を伴うアーキテクチャペア生成を3つの原則に基づいて記述する。
この決定論的な分割は、整合性のある分類として組織化され、中核的な貢献である。
MedSci Skillsは、43のスキルのオープンソースツールキットで、21の決定論的階層を持ち、3つのパブリックデータセットパイプラインで評価されている。
論文 参考訳(メタデータ) (2026-06-08T13:51:04Z) - AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing [9.271196825503417]
大きな言語モデル(LLM)は、脆弱性検出にますます採用されているが、その推論は基本的には正しくない。
AEGISは、未解決の投機から、クローズドな事実ベース上の法医学的検証へ、検出をシフトする新しいマルチエージェントフレームワークである。
これは、主要なベースラインと比較して偽陽性率を最大54.40%削減し、1サンプルあたりの平均コストはタスク固有のトレーニングなしで0.09ドルである。
論文 参考訳(メタデータ) (2026-03-21T04:12:04Z) - Negation is Not Semantic: Diagnosing Dense Retrieval Failure Modes for Trade-offs in Contradiction-Aware Biomedical QA [1.0330395403064265]
大言語モデル (LLMs) は質問応答において強い能力を示してきたが、検証不可能なクレームを生成する傾向は、臨床環境において重大なリスクをもたらす。
これらのリスクを軽減するため、TREC 2025 BioGenトラックは、矛盾する証拠を明示的に提示する根拠のついた回答を義務付けている。
本稿では、SciFactデータセットを用いて、検索アーキテクチャを体系的に最適化するプロキシベースの開発フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-18T10:35:44Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z) - Beyond Memorization: Reasoning-Driven Synthesis as a Mitigation Strategy Against Benchmark Contamination [77.69093448529455]
本稿では,arXiv論文から直接研究レベルのQAを合成するために,無限にスケーラブルなフレームワークを用いて実証的研究を行う。
各種サイズ,開発者,リリース日といったモデルについて,知識カットオフ日に近い性能劣化の欠如を評価した。
合成パイプラインで要求される多段階の推論は、浅い記憶よりも深い複雑さをもたらしたと仮定する。
論文 参考訳(メタデータ) (2025-08-26T16:41:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。