論文の概要: ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science
- arxiv url: http://arxiv.org/abs/2607.26155v1
- Date: Tue, 28 Jul 2026 18:01:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.444419
- Title: ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science
- Title(参考訳): ClinLens: 縦型多モード臨床データ科学のための長距離符号化エージェントを目指して
- Abstract要約: 5つのMIMICリソース上で200の実行可能なタスクのベンチマークであるCLINLENSを紹介する。
4 x 5の分類法は、5つの分析能力を持つ4つの患者時間範囲を横断する。
- 参考スコア(独自算出の注目度): 7.082987704102009
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clinical data-science agents must transform heterogeneous longitudinal records into auditable analyses, yet existing benchmarks largely isolate medical question answering, structured-table reasoning, or generic scientific repositories. We introduce CLINLENS, a benchmark of 200 executable tasks over five linked MIMIC resources spanning structured electronic health records, notes, electrocardiograms, chest radiographs, and echocardiograms. A 4 x 5 taxonomy crosses four patient-time scopes with five analysis capabilities. Program-first reverse synthesis pairs each bounded semi-raw package with an evaluator-private reference workflow and checks required artifacts, cohort and temporal semantics, and the final answer. On a fixed 126-task suite, the strongest of 24 standardized model-scaffold configurations achieves 56.3% scope-macro STRICTPASS despite 100% EXECSUCCESS. For reference, a separately configured coding agent solves 83 of 126 tasks, while five biomedical systems adapted to GPT-4o-mini reach at most 2.9% scope-macro STRICTPASS. These results expose a substantial gap between runnable submissions and correct clinical analyses.
- Abstract(参考訳): 臨床データ科学のエージェントは、異質な経時記録を監査可能な分析に変換する必要があるが、既存のベンチマークは、主に医学的質問応答、構造化テーブル推論、または一般的な科学的リポジトリを分離する必要がある。
CLINLENSは、構造化された電子健康記録、ノート、心電図、胸部X線写真、心エコー図にまたがる5つのMIMICリソースにまたがる200の実行可能なタスクのベンチマークである。
4 x 5の分類法は、5つの分析能力を持つ4つの患者時間範囲を横断する。
プログラムファーストのリバースシンセサイザーは、それぞれ境界付きセミローパッケージと評価器プライベートな参照ワークフローを組み合わせ、必要なアーティファクト、コホートと時間的セマンティクス、そして最終的な答えをチェックする。
固定126タスクスイートでは、100%EXECSUCCESSにもかかわらず、24の標準モデルスキャフォールド構成で56.3%のスコープマクロSTRICTPASSを実現している。
参考までに、個別に構成されたコーディングエージェントは126のタスクのうち83を解決し、GPT-4o-miniに適合した5つのバイオメディカルシステムは、少なくとも2.9%のスコープマクロSTRICTPASSに到達する。
これらの結果は, 実行可能な提案と適切な臨床分析との間に大きなギャップを生じさせる。
関連論文リスト
- Primary ICD Category Prediction using LLM-based Probing [7.948368617192842]
ICD-10符号10個のうち13,645個のMIMIC-IVコホートを構築した。
我々は,5つの変圧器層から隠れた状態を抽出し,非構造的,非構造的,複合的な入力に対して線形プローブを訓練した。
組み合わせたプローブはMIMIC-IV(87.69%の厳格さ、91.45%の医療的精度)で最高性能を達成し、単一モードのプローブとベースラインを上回った。
論文 参考訳(メタデータ) (2026-06-27T08:10:05Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - Verifiable Benchmarking of Long-Horizon Spatial Biology [0.0]
SpaceBench-Longは、長距離空間生物学のベンチマークである。
複雑な空間測定から正確な科学的結論を導き出すために、AIエージェントが手続き分析の実行を超えて移動できるかどうかをテストする。
Gemini 3.5 Flash / Pi端末の符号化ハーネス、GPT-5.5 / Pi、GPT-5.5 / OpenAI Codexの3つのモデルハーネスペアが8/72で接続される(11.1%)。
論文 参考訳(メタデータ) (2026-05-27T07:19:18Z) - CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents [17.491888826944074]
我々は,LLMエージェントが再利用可能な臨床スキルを合成・構成できるかどうかを評価するためのベンチマークであるCodeClinicを紹介する。
本稿では,自然言語臨床ガイドラインを再利用し,検証したPythonスキルライブラリに変換するオフラインオートフォーマル化パイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-10T17:45:01Z) - CNSight: Evaluation of Clinical Note Segmentation Tools [3.673249612734457]
また,MIMIC-IVから得られた1000音符のキュレートデータセットを用いて,ルールベースベースベースライン,ドメイン固有トランスフォーマーモデル,および臨床ノートセグメンテーションのための大規模言語モデルの評価を行った。
GPT-5-miniは文レベルと自由テキストセグメンテーションで平均72.4のF1に達する。
論文 参考訳(メタデータ) (2025-12-28T05:40:15Z) - Unlocking Electronic Health Records: A Hybrid Graph RAG Approach to Safe Clinical AI for Patient QA [1.9615061725959186]
大規模言語モデルは、データ処理の変換可能性を提供するが、臨床環境では制限に直面している。
現在のソリューションは通常、構造化データ(Text2Cypher)や非構造化セマンティックサーチに焦点を当てた検索方法を分離するが、両方を同時に統合することができない。
この研究は、このギャップを埋める新しいハイブリッドグラフRAGシステムであるMediGRAFを提示する。
論文 参考訳(メタデータ) (2025-11-27T16:08:22Z) - EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis [62.00431604976949]
EndoBenchは、内視鏡的プラクティスの全スペクトルにわたるMLLMを評価するために特別に設計された最初の包括的なベンチマークである。
我々は、汎用、医療特化、プロプライエタリMLLMを含む23の最先端モデルをベンチマークする。
私たちの実験では、プロプライエタリなMLLMは、オープンソースや医療専門のモデルよりも優れていますが、それでも人間の専門家を追い越しています。
論文 参考訳(メタデータ) (2025-05-29T16:14:34Z) - How Well Can Modern LLMs Act as Agent Cores in Radiology Environments? [54.36730060680139]
RadA-BenchPlatは、放射線学環境での大規模言語モデル(LLM)のパフォーマンスをベンチマークする評価プラットフォームである。
また、エージェント駆動型タスク解決ツールの10のカテゴリを定義し、7つの主要なLCMを評価している。
論文 参考訳(メタデータ) (2024-12-12T18:20:16Z) - GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI [67.09501109871351]
LVLM(Large Vision-Language Model)は、画像、テキスト、生理学的信号などの多様なデータタイプを扱うことができる。
GMAI-MMBenchは、よく分類されたデータ構造と、これまででもっとも包括的な一般医療用AIベンチマークである。
38の医療画像モダリティ、18の臨床関連タスク、18の部門、視覚質問回答(VQA)フォーマットの4つの知覚的粒度からなる284のデータセットで構成されている。
論文 参考訳(メタデータ) (2024-08-06T17:59:21Z) - Self-supervised Answer Retrieval on Clinical Notes [68.87777592015402]
本稿では,ドメイン固有パスマッチングのためのトランスフォーマー言語モデルをトレーニングするためのルールベースのセルフスーパービジョンであるCAPRを紹介する。
目的をトランスフォーマーベースの4つのアーキテクチャ、コンテキスト文書ベクトル、ビ-、ポリエンコーダ、クロスエンコーダに適用する。
本稿では,ドメイン固有パスの検索において,CAPRが強いベースラインを上回り,ルールベースおよび人間ラベル付きパスを効果的に一般化することを示す。
論文 参考訳(メタデータ) (2021-08-02T10:42:52Z) - Multilabel 12-Lead Electrocardiogram Classification Using Gradient
Boosting Tree Ensemble [64.29529357862955]
我々は,心電図の診断を分類するために,形態や信号処理機能に適合した勾配強化木のアンサンブルを用いたアルゴリズムを構築した。
各リードについて、心拍変動、PQRSTテンプレート形状、全信号波形から特徴を導出する。
各クラスに属するECGインスタンスの確率を予測するため、全12項目の特徴と合わせて、勾配を増す決定ツリーの集合に適合する。
論文 参考訳(メタデータ) (2020-10-21T18:11:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。