論文の概要: GraphRareBench: An Auditable Graph-Evidence Benchmark for Phenotype-Driven Rare-Disease Diagnosis
- arxiv url: http://arxiv.org/abs/2607.24878v1
- Date: Mon, 27 Jul 2026 07:58:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.565748
- Title: GraphRareBench: An Auditable Graph-Evidence Benchmark for Phenotype-Driven Rare-Disease Diagnosis
- Title(参考訳): GraphRareBench: Phenotype-Driven Rare-Disease診断のための監査可能なグラフエビデンスベンチマーク
- Authors: Guiling Guo, Jia Yang, Jiahao Xu, Shuyuan Zheng, Zhonghai Sun, Qiyuan Li,
- Abstract要約: GraphRareBenchは、2,365のケースと18,093のターゲット-共同創業者ペアを含む、実績保存ベンチマークである。
Agents-A1とDeepSeek-V4-Flashでインスタンス化されたエージェントはそれぞれ0.746と0.718である。
その結果, モデル行動の相補的な側面を捉え, フルプール検索, ハードコンファウンデーション識別, および観測可能なエビデンスアクセスが得られた。
- 参考スコア(独自算出の注目度): 4.608113014528089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Phenotype-driven diagnostic benchmarks usually report the rank of the reference disease, but they rarely reveal which plausible alternatives are ranked above it or what evidence a tool-using model examines before making its decision. We introduce GraphRareBench, a provenance-preserving benchmark containing 2,365 ontology-derived cases and 18,093 target-confounder pairs. Each case includes a coarsened HPO query, a fixed candidate pool, graph-defined hard confounders, and source-linked evidence records. On the 237-case gene-component-disjoint test split, supervised rankers using a shared 21-feature interface achieved MRRs ranging from 0.640 to 0.740 and case-averaged target-over-confounder accuracies ranging from 0.898 to 0.916. Agents instantiated with Agents-A1 and DeepSeek-V4-Flash achieved MRRs of 0.746 and 0.718, respectively. Their paired MRR difference was not statistically significant, whereas their target-evidence coverage differed by 0.561. Together with the observation that 22.1% to 43.7% of selected Hit@10 successes still ranked at least one graph-defined hard confounder above the target, these results indicate that full-pool retrieval, hard-confounder discrimination, and observable evidence access capture complementary aspects of model behavior. GraphRareBench therefore provides a foundation for more transparent and evidence-aware evaluation of phenotype-driven diagnostic systems. Code and data are available at https://github.com/GUI0609/GraphRareBench.
- Abstract(参考訳): フェノタイプ駆動診断ベンチマークでは、基準疾患のランクが報告されるが、どの選択肢が上位にランクされているか、あるいはツールを使用するモデルが判断する前にどの証拠を検査するかを明らかにすることは滅多にない。
GraphRareBenchは、2,365のオントロジー由来のケースと18,093のターゲット/共同創設者ペアを含む証明保存ベンチマークである。
それぞれのケースには、粗いHPOクエリ、固定候補プール、グラフ定義のハード共同創設者、ソースリンクエビデンス記録が含まれている。
237ケースの遺伝子組換えテスト分割では、共有された21機能インターフェースを用いた教師付きランクが0.640から0.740までのMRRと0.898から0.916までの平均的なターゲット・オーバー・コンファウンデーションのアキュラティを達成した。
Agents-A1とDeepSeek-V4-Flashでインスタンス化されたエージェントはそれぞれ0.746と0.718である。
MRR差は統計的に有意差は認められなかったが, 対象範囲は0.561。
選ばれたHit@10の成功の22.1%から43.7%は、目標よりも少なくとも1つのグラフ定義のハード・共同創設者をランク付けしており、これらの結果はフルプール検索、ハード・コンファウンデーション、および観測可能なエビデンス・アクセスがモデル行動の補完的な側面を捉えていることを示している。
それゆえ、GraphRareBenchは表現型駆動診断システムのより透明でエビデンスに配慮した評価の基礎を提供する。
コードとデータはhttps://github.com/GUI0609/GraphRareBench.orgで公開されている。
関連論文リスト
- FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses [0.0]
FailureScopeは、クロスモデルパス/フェイルパターンによる評価プローブをクラスタ化する行動診断手法である。
通常、シングルターン・ベンチマーク、マルチターン・ダイアログ、敵エージェント・アタックの3つのレシスタンスに対して安定かつ解釈可能な障害をもたらすことを示す。
論文 参考訳(メタデータ) (2026-06-03T01:28:00Z) - When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors [66.18091962164219]
既存のメトリクスは、タスクの成功に必要な義務的な振る舞いと、モデルの自律的な嗜好を反映した命令的でないパターンを区別することができない。
言語アライメントのための textbfResponse Pattern similarity (RPS) と、有向グラフとしてモデル化されたツール使用習慣のための textbfAction Graph similarity (AGS) である。
論文 参考訳(メタデータ) (2026-04-23T03:48:56Z) - Medical thinking with multiple images [44.04557445622649]
我々はMedThinkVQAを紹介した。MedThinkVQAは、複数の画像で考えるためのエキスパートアノテーション付きベンチマークである。
データセットは720のテストケースを含む8,067ケースを含み、1ケースあたり平均6.62イメージである。
テストセットでは、最高のクローズドソースモデルであるClaude-4.6-Opus、Gemini-3-Pro、GPT-5.2-xhighは57.2%、55.3%、54.9%の精度しか達成できなかった。
論文 参考訳(メタデータ) (2026-04-14T18:51:07Z) - ORACAL: A Robust and Explainable Multimodal Framework for Smart Contract Vulnerability Detection with Causal Graph Enrichment [0.754973258028456]
本稿では,制御フローグラフ,データフローグラフ,コールグラフを統合したグラフ学習フレームワークORACALを提案する。
ORACALは、レトリーバル拡張生成(RAG)とLarge Language Models(LLM)から専門家レベルのセキュリティコンテキストを持つ重要なサブグラフを選択的に強化する
透明性のために、このフレームワークはPGExplainerを採用して、脆弱性トリガーパスを特定するサブグラフレベルの説明を生成する。
論文 参考訳(メタデータ) (2026-03-30T07:46:59Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study [5.740397289924559]
普遍的な勝者は存在せず、検出器のランキングはかなり不安定である。
我々の発見は、全能検出器のパラダイムに挑戦した。
論文 参考訳(メタデータ) (2026-02-08T04:36:13Z) - MeCaMIL: Causality-Aware Multiple Instance Learning for Fair and Interpretable Whole Slide Image Diagnosis [40.3028468133626]
MIL(Multiple Case Learning)は、コンピュータ病理学における全スライド画像(WSI)解析の主流パラダイムとして登場した。
因果関係を意識したMILフレームワークである textbfMeCaMIL は、構造化因果グラフを通じて、階層的共同創設者を明示的にモデル化する。
MeCaMILは優れた公正性を達成する -- 人口格差の分散は、属性全体の平均で65%以上減少する。
論文 参考訳(メタデータ) (2025-11-14T06:47:21Z) - Diagnosing Human-object Interaction Detectors [42.283857276076596]
本稿では,HOI検出モデルの定量的なブレークダウン解析を行うための診断ツールボックスを提案する。
我々は8つの最先端HOI検出モデルを分析し、今後の研究を促進する貴重な診断洞察を提供する。
論文 参考訳(メタデータ) (2023-08-16T17:39:15Z) - Homophily Outlier Detection in Non-IID Categorical Data [43.51919113927003]
この研究は、新しい外れ値検出フレームワークとその2つのインスタンスを導入し、カテゴリデータの外れ値を特定する。
まず、分布に敏感な外部因子とその相互依存性を値値グラフベースの表現に定義し、組み込む。
学習した値の外れ度は、直接の外れ値検出または特徴選択の除外を可能にする。
論文 参考訳(メタデータ) (2021-03-21T23:29:33Z) - Chest x-ray automated triage: a semiologic approach designed for
clinical implementation, exploiting different types of labels through a
combination of four Deep Learning architectures [83.48996461770017]
本研究では,異なる畳み込みアーキテクチャの後期融合に基づく深層学習手法を提案する。
公開胸部x線画像と機関アーカイブを組み合わせたトレーニングデータセットを4つ構築した。
4つの異なるディープラーニングアーキテクチャをトレーニングし、それらのアウトプットとレイトフュージョン戦略を組み合わせることで、統一されたツールを得ました。
論文 参考訳(メタデータ) (2020-12-23T14:38:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。