論文の概要: Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints
- arxiv url: http://arxiv.org/abs/2608.06265v1
- Date: Thu, 06 Aug 2026 16:56:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.969525
- Title: Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints
- Title(参考訳): 実用性制約下における総合的臨床ベンチマークの現実性向上
- Abstract要約: 実際に使用されている下流ユーティリティチェックを壊さずに、このようなベンチマークを改善する方法について検討する。
我々は、このアイデアを、電子健康記録を用いて運動したSynthea生成患者から得られたケアギャップベンチマークでインスタンス化する。
結果から, 実用性は現実主義の十分な証拠としてではなく, 一つの制約として扱うことで, ベンチマーク品質を明示的に最適化することが示唆された。
- 参考スコア(独自算出の注目度): 4.279036558565347
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic clinical benchmarks for enterprise AI agents can pass existing utility checks and still remain structurally unrealistic, especially in privacy-sensitive healthcare settings where operational data are hard to access. We study how to improve such benchmarks without breaking the downstream utility checks already used in practice. We formulate benchmark revision as utility-constrained realism improvement: dataset changes should increase realism while staying above an operational utility floor. We instantiate this idea on a care-gap benchmark derived from Synthea-generated patients exercised through demonstration electronic health record workflows and then processed by the same downstream pipeline as operational data. Realism is measured through missingness structure, simplicity, structural plausibility, and population alignment. The baseline benchmark is extremely thin: sampled-pair missingness is 79.44%, only 12.75% of rows are actionable, 38.94% of patients have zero actionable measures, and top-three token concentration reaches 100.0%. Two deterministic revisions improve these panels while remaining above the current utility floor, whereas a naive densification control preserves unrealistic templating. We further show that internal benchmark realism and source fidelity to an aggregate operational reference are related but distinct objectives. These results suggest that synthetic benchmark quality should be optimized explicitly, with utility treated as one constraint rather than as sufficient evidence of realism.
- Abstract(参考訳): エンタープライズAIエージェントの総合的な臨床ベンチマークは、既存のユーティリティチェックをパスでき、特に運用データがアクセスしづらいプライバシーに敏感な医療環境では、構造的に非現実的である。
実際に使用されている下流ユーティリティチェックを壊さずに、このようなベンチマークを改善する方法について検討する。
データセットの変更は、運用上のユーティリティフロアの上にとどまりながら、リアリズムを増加させるべきである。
我々は、このアイデアを、Syntheaが生成した患者が電子健康記録ワークフローを実践し、操作データと同じ下流パイプラインで処理したケアギャップベンチマークでインスタンス化する。
現実主義は、欠落構造、単純さ、構造的可視性、人口のアライメントを通じて測定される。
サンプルペアの欠如は79.44%、行の12.75%のみが動作可能であり、38.94%の患者は反応不可能であり、上位3つのトークン濃度は100.0%に達する。
2つの決定論的修正は、これらのパネルを現在のユーティリティフロアの上にとどまりながら改善し、一方、非現実的な密度制御は非現実的なテンプレートを保存する。
さらに、内部ベンチマークリアリズムと、集約された操作参照に対するソースの忠実度は、関連性はあるが、異なる目的であることを示す。
これらの結果から, 実用性は現実主義の十分な証拠としてではなく, 一つの制約として扱われることが示唆された。
関連論文リスト
- StabilityBench: Benchmarking Instability in LLMs [5.633712097504611]
本論文では,シングルターンベンチマークをマルチターンインタラクション履歴に変換するベンチマーク演算子であるStable Benchを提案する。
本研究では, 数学的推論, 健康質問応答, 安全性の4つのベンチマークに適用し, 9つの大言語モデルを評価する。
以上の結果から,これらのインジェクションのモデル性能は安定的に不安定であり,4つのベンチマークのうち3つに対してかなりの性能劣化が認められた。
論文 参考訳(メタデータ) (2026-07-17T16:09:37Z) - Recovering Clinical Utility Under Differential Privacy: Empirical Validation of Adaptive Federated Aggregation on Heterogeneous Cardiovascular Datasets [0.06372261626436676]
本研究は、FedCVRフレームワークを利用可能な5つのリアル心臓血管データセット上で検証することで、このギャップに対処する。
その結果、FedCVRは実データに対する適応的な優位性を維持しており、F1スコアは79.2%、AUCは0.96であることがわかった。
実データ上で測定されたプライバシーコストは、合成実験で観察された優雅な劣化パターンを確認する。
論文 参考訳(メタデータ) (2026-07-07T18:51:13Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Beyond Binary Success: A Diagnostic Meta-Evaluation Framework for Fine-Grained Manipulation [98.79811866787263]
診断メタ評価フレームワークであるMetaFineを紹介する。
局所的な空間構造を保存できる視覚エンコーダの能力は,きめ細かな精度の鍵となるボトルネックである。
評価をランキングから診断にシフトすることで、MetaFineは、ベンチマークを実際の物理デキスタリティに基づく階層化された能力の修復のための実行可能なコンパスに変換する。
論文 参考訳(メタデータ) (2026-05-19T15:25:13Z) - Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare [0.0]
医療AIの主な課題は、パフォーマンスのみではなく、実際の状況下での信頼性、安全性、臨床関連性を測定する体系的な方法がないことである。
現在のベンチマークでは、モデルが知っていることをテストしています。
高いベンチマークスコアは、デプロイの準備ができているという誤った感覚を与え、パフォーマンスとユーティリティのギャップを正確に広げる。
論文 参考訳(メタデータ) (2026-05-08T20:12:14Z) - Evaluating Uplift Modeling under Structural Biases: Insights into Metric Stability and Model Robustness [8.135022024189306]
パーソナライズされたマーケティングにおいて、アップリフトモデルは、代替的な治療の下で顧客行動がどのように変化するかをモデル化することによって、漸進的な効果を推定する。
実世界のデータは、選択バイアス、こぼれ効果、未観測の混ざりなど、しばしばバイアスを示す。
論文 参考訳(メタデータ) (2026-03-21T11:54:25Z) - How NOT to benchmark your SITE metric: Beyond Static Leaderboards and Towards Realistic Evaluation [11.33816414982401]
伝達可能性推定メトリクスは、与えられた目標タスクに対して高い性能の事前訓練されたモデルを見つけるために使用される。
このようなメトリクスの開発に対する関心が高まっているにもかかわらず、彼らの進捗を測るベンチマークは、ほとんど検討されていない。
これらの指標が評価されるベンチマークには、根本的な欠陥がある、と我々は主張する。
論文 参考訳(メタデータ) (2025-10-07T20:38:12Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z) - Test-Time Adaptation Induces Stronger Accuracy and Agreement-on-the-Line [65.14099135546594]
最近のテスト時間適応 (TTA) 法は, モデルに非常に弱い相関関係を示すシフトであっても, ACL と AGL の傾向を大幅に強化する。
この結果から,TTAとAGLに基づく推定手法を組み合わせることで,より広い分布シフトの集合に対する高精度なモデルOOD性能を推定できることが示唆された。
論文 参考訳(メタデータ) (2023-10-07T23:21:25Z) - On the Practicality of Deterministic Epistemic Uncertainty [106.06571981780591]
決定論的不確実性法(DUM)は,分布外データの検出において高い性能を達成する。
DUMが十分に校正されており、現実のアプリケーションにシームレスにスケールできるかどうかは不明だ。
論文 参考訳(メタデータ) (2021-07-01T17:59:07Z) - Causal Feature Selection for Algorithmic Fairness [61.767399505764736]
データ管理の統合コンポーネントにおける公平性について検討する。
本稿では,データセットの公平性を保証する特徴のサブコレクションを同定する手法を提案する。
論文 参考訳(メタデータ) (2020-06-10T20:20:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。