論文の概要: OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories
- arxiv url: http://arxiv.org/abs/2609.32810v2
- Date: Tue, 29 Sep 2026 07:50:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.621323
- Title: OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories
- Title(参考訳): OpenTumorBoard: マルチディシプリナ腫瘍ボードのリアルタイムベンチマーク
- Abstract要約: 複数の学際的な腫瘍ボードは、専門的な議論を通じて、多段階の臨床観察と縦断的な患者の履歴を統合している。
OpenTumorBoardは、611の患者と19,157の議論が10の専門職にまたがるベンチマークです。
ベンチマークは2つの設定を評価する: SPECIALIST TURN, LLMは実際の議論中に提示された臨床的に重要な質問に応答する。
- 参考スコア(独自算出の注目度): 14.545703089565386
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multidisciplinary tumor boards integrate multimodal clinical observations and longitudinal patient histories through specialist discussions, yet benchmarks rarely capture these real-world trajectories. We introduce OpenTumorBoard, a benchmark with 611 patient cases and 19,157 discussion turns across ten specialist roles, transcribed from 12,534 minutes of publicly available tumor board recordings on YouTube. The benchmark evaluates two settings: SPECIALIST TURN, in which an LLM responds to a clinically significant question posed during a real discussion, and BOARD SIMULATION, in which it generates an entire back-and-forth discussion and reaches a consensus on therapy recommendations, surgical plans, next actions and clinical trial matching. Evaluation of 14 general-purpose frontier and medical LLMs reveals substantial limitations: the best models score 3.43 out of 5 in clinical equivalence to specialist answers and 2.78 out of 5 in alignment with recorded board conclusions. Supervised finetuning and reinforcement learning improve performance on a held-out test set, suggesting that real-world discussion trajectories can support model adaptation. Three M.D. experts review a subset of the benchmark, finding high information coverage and factuality of patient cases and strong fidelity of extracted consensus conclusions. We will release OpenTumorBoard and its automated curation pipeline to support the development and evaluation of LLMs for multidisciplinary, personalized cancer decision-making.
- Abstract(参考訳): 多分野の腫瘍ボードは、専門的な議論を通じて、多段階の臨床観察と縦断的な患者の履歴を統合するが、これらの現実世界の軌跡をベンチマークで捉えることはめったにない。
われわれはOpenTumorBoardを紹介した。これは611人の患者と19,157人の議論が、YouTubeで公開されている12,534分間の腫瘍ボード記録から書き起こされた10の専門的役割を振り返るベンチマークである。
SPECIALIST TURNは、LLMが実際の議論中に提示された臨床的に重要な質問に応答し、BOARD SIMULATIONは、バック・アンド・フォース・ディスカッション全体を生成し、治療の推奨、手術計画、次のアクション、臨床試験のマッチングに関する合意に達する。
14の汎用フロンティアと医療用LDMの評価は、臨床同値で5点中3.43点、専門的回答で5点中2.78点、記録された結論で5点中2.78点という、かなりの限界を呈している。
改良された微調整と強化学習により、保持されたテストセットのパフォーマンスが向上し、実際の議論の軌跡がモデル適応をサポートすることが示唆された。
3人のM.D.の専門家がベンチマークのサブセットをレビューし、患者の高い情報カバレッジと事実性、抽出された結論の強い忠実さを発見した。
われわれはOpenTumorBoardとその自動キュレーションパイプラインをリリースし、多分野のパーソナライズされたがん意思決定のためのLSMの開発と評価を支援する。
関連論文リスト
- Fathom-Vaidya: Advancing Medical Reasoning with Rubric-Based Rewards [5.563127320625537]
医療における大規模言語モデル(LLM)は、2つの相補的な側面にわたる堅牢なパフォーマンスを必要とする。
HealthBenchやMedXpertQAといった最近のベンチマークでは、両方の領域で永続的な弱点が明らかになっている。
合成データとルーブリックに基づく強化学習を用いて、これらのファセットをターゲットとしたシーケンシャルなトレーニングフレームワークを導入する。
論文 参考訳(メタデータ) (2026-09-21T12:19:50Z) - MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences [50.71326426975699]
MedArenaは医療用大規模言語モデル(LLM)のためのインタラクティブな評価プラットフォームである。
MedArenaは、2つのランダムに選択されたモデルからの応答を表示し、ユーザが好みのレスポンスを選択するように要求する。
2025年11月1日までに12台のLLMで収集された1571の選好のうち、ジェミニ2.0フラッシュシンキング、ジェミニ2.5プロ、GPT-4oがブラッドリー・テリーのレーティングで上位3モデルとなった。
論文 参考訳(メタデータ) (2026-03-13T22:30:26Z) - OMGs: A multi-agent system supporting MDT decision-making across the ovarian tumour care continuum [51.97232679580821]
卵巣腫瘍管理はMDT(multidisciplinary tumour board)の審議にますます依存している。
世界中のほとんどの患者は、タイムリーな専門家のコンセンサスにアクセスできない。
ここでは,多エージェントAIフレームワークであるOMG(Ovarian tumour Multidisciplinary intelligent aGent System)を紹介する。
論文 参考訳(メタデータ) (2026-02-14T14:13:10Z) - MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement [63.82954136824963]
医療ビジョンランゲージモデルでは、現実世界のシナリオで必要とされる複雑な臨床推論を伴う知覚タスクが優れている。
本稿ではドメイン固有の適応とガイドライン強化を通じてこれらの課題に対処する新しい推論MedVLMを提案する。
論文 参考訳(メタデータ) (2026-01-16T02:32:07Z) - MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models [15.91764739198419]
5,200件の患者と6万件以上のきめ細粒度評価ルーブリックからなる新規なベンチマークであるMedDialogRubricsについて紹介する。
本フレームワークでは,実世界の電子的健康記録にアクセスすることなく,現実的な患者記録と主訴を合成するマルチエージェントシステムを採用している。
論文 参考訳(メタデータ) (2026-01-06T13:56:33Z) - DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs [54.8829900010621]
MLLM (Multimodal Large Language Models) は、医学的応用を約束するが、限られたトレーニングデータ、狭いタスクカバレッジ、臨床現場での監督の欠如により、皮膚科の遅れが進行する。
これらのギャップに対処するための包括的なフレームワークを提示します。
まず,211,243のイメージと72,675のトラジェクトリを5つのタスク形式に分けた大規模形態素解析コーパスであるDermo Instructを紹介する。
第二にDermoBenchは、4つの臨床軸(形態学、診断、推論、フェアネス)にまたがる11のタスクを評価する厳密なベンチマークで、3600の挑戦的なサブセットを含む。
論文 参考訳(メタデータ) (2026-01-05T07:55:36Z) - Demo: Healthcare Agent Orchestrator (HAO) for Patient Summarization in Molecular Tumor Boards [7.69748973216707]
分子腫瘍ボード(MTB)の正確かつ包括的な患者要約を生成するための医療エージェントオーケストラ(HAO)について紹介する。
予測された患者要約を真実に対して評価することは、様式的変動、順序付け、同義語の使用、表現の違いによる追加的な課題を提示する。
本稿では,生成された要約の包括性と簡潔さを評価するためのモデル・アズ・ア・ジャッジのフレームワークTBFactを提案する。
論文 参考訳(メタデータ) (2025-09-08T12:15:53Z) - A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models [57.88111980149541]
Asclepiusは、Med-MLLMの異なる医学的特長と診断能力で評価する、新しいMed-MLLMベンチマークである。
3つの基本原則に基づいて、アスクレピウスは15の医療専門分野を包括的に評価する。
また、6つのMed-MLLMの詳細な分析を行い、3人の専門家と比較した。
論文 参考訳(メタデータ) (2024-02-17T08:04:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。