論文の概要: MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection
- arxiv url: http://arxiv.org/abs/2607.15166v1
- Date: Thu, 16 Jul 2026 16:16:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.173735
- Title: MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection
- Title(参考訳): MedFailBench: 医療AIの安全性境界検査のためのオープンソースベンチマーク
- Abstract要約: 我々は,医療用AIエラーを重度(1~5)と安全ゲートタイプ(緊急エスカレーション,安全でない遠隔操作,安全でない退院保証,エビデンス作成,安全でないプロトコル実行,ソースサポートギャップを欠いた)によってラベル付けする,臨床用合成ベンチマークと障害アトラスを提案する。
現在のパブリックリリースには、重度アノテーションを備えた44のクリニカルレビューされた合成ケース、ライブのHuggingFaceリーダーボードプレビュー、安全ゲート分類、臨床重度ルーリック、およびモデル応答スクリーニング実行をアーカイブするための自動パイプラインが含まれている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most medical AI benchmarks measure whether a model knows the correct answer. MedFailBench asks a different question: which safety boundary failed? We present a clinician-built synthetic benchmark and failure atlas that labels medical AI errors by severity (1--5) and safety gate type (missed urgent escalation, unsafe remote dosing, unsafe discharge reassurance, evidence fabrication, unsafe protocol execution, source support gap). The current public release (v0.2.1) contains 44 clinician-reviewed synthetic cases with severity annotations, a live HuggingFace leaderboard preview, a safety gate taxonomy, a clinical severity rubric, and an automated pipeline for archiving model-response screening runs. No patient data, clinical validation claims, or model rankings are included. MedFailBench is released under Apache-2.0 and CC-BY-4.0 and carries the Zenodo DOI 10.5281/zenodo.21205535.
- Abstract(参考訳): ほとんどの医療AIベンチマークは、モデルが正しい答えを知っているかどうかを測定する。
MedFailBench氏は別の質問をしている。
本稿では,医療用AIエラーを重度(1~5)と安全ゲートタイプ(緊急エスカレーション,安全でない遠隔操作,安全でない退院保証,エビデンス生成,安全でないプロトコル実行,ソースサポートギャップを欠いた)によってラベル付けする,臨床用合成ベンチマークと障害アトラスを提案する。
現在のパブリックリリース(v0.2.1)には、重度アノテーション、ライブHuggingFaceリーダーボードプレビュー、安全ゲート分類、臨床重度ルーブリック、およびモデル応答スクリーニング実行をアーカイブするための自動パイプラインを含む、44の臨床レビュー済みの合成ケースが含まれている。
患者データ、臨床検証のクレーム、モデルランキングは含まれていない。
MedFailBenchはApache-2.0とCC-BY-4.0でリリースされ、Zenodo DOI 10.5281/zenodo.21205535を搭載。
関連論文リスト
- MedSNIP: Building and Benchmarking Snippet-Level Granularity for Medical Fact Verification [50.13873960887466]
我々はスニペットレベルの医療事実検証のベンチマークであるMedSNIP-Benchを紹介する。
また,自動スニペット生成パイプラインであるMedSNIPを導入する。
MedSNIP-Bench、HealthFC、MedHallu全体で、スニペットレベルの検証は偽クラスF1を保存または改善する。
論文 参考訳(メタデータ) (2026-09-11T14:08:44Z) - PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents [5.247635961504091]
patientAgentBenchは、患者が直面するエージェント医療をベンチマークする。
シミュレーションされた患者と会話しながら、医療ツールのサンドボックスでエージェントにラップされた基礎モデルを評価する。
同じ1200のシナリオで、同じ4つのファミリーで10のモデルをベンチマークし、臨床的なギャップを見つけました。
論文 参考訳(メタデータ) (2026-07-28T09:24:04Z) - Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B [0.0]
オープンウェイト医療言語モデルは、患者向けおよび臨床支援アプリケーションの基礎として、ますます利用されている。
MedGemma-4B-itの技術的洗練を必要としない攻撃におけるギャップを定量化する。
論文 参考訳(メタデータ) (2026-07-09T18:31:43Z) - Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops [0.07249400282852114]
大規模言語モデル(LLM)は、医療現場にますます導入されているが、臨床上の決定が関与すると、幻覚を引き起こす傾向が生じる。
本研究は, LLMが最近, 臨床的疑問に答える際に, 薬剤の投与を推奨するか, 中止を推奨するかを検討するものである。
LLMバックボーンを用いた5エージェント"Trust but verify"システムを開発した。
論文 参考訳(メタデータ) (2026-06-12T06:21:19Z) - MedCTA: A Benchmark for Clinical Tool Agents [47.47354499871572]
MedCTA(MedCTA)は,臨床医が有する段階的作業における医療ツールエージェントの評価のためのベンチマークである。
MedCTAは、実世界の107の臨床的タスクと、臨床者が検証した5つのデプロイツール以上の実行可能な軌道から構成される。
我々は18のオープンソースおよびクローズドソースマルチモーダルモデルをベンチマークし、フロンティアシステムでさえもマルチステップ臨床ツールの使用において脆弱であることを発見した。
論文 参考訳(メタデータ) (2026-06-10T06:26:52Z) - When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries [35.893190386172854]
textscMedHarmは、リスクの高い医療安全ベンチマークであり、10の安全クリティカルなカテゴリに1100の医療的根拠のあるクエリがある。
textscMedHarmは、直接的な助けではなく、拒絶、注意、安全なリダイレクトを必要とする現実的な臨床、教育、技術的プロンプトをターゲットにしている。
論文 参考訳(メタデータ) (2026-05-26T14:39:18Z) - When RAG Chatbots Expose Their Backend: An Anonymized Case Study of Privacy and Security Risks in Patient-Facing Medical AI [0.0]
AI支援開発は、それらを構築するための障壁を低くするが、それでも厳格なセキュリティ、プライバシ、ガバナンスコントロールを必要としている。
公衆アクセス可能な医療用RAGチャットボットの匿名化,非破壊的セキュリティ評価を報告する。
論文 参考訳(メタデータ) (2026-05-01T17:29:09Z) - Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context [82.32380418146656]
Health-ORSC-Benchは、医療におけるtextbfOver-Refusalと textbfSafe Completionの品質を測定するために設計された最初の大規模ベンチマークである。
私たちのフレームワークは、人間の検証を備えた自動パイプラインを使用して、さまざまなレベルの意図の曖昧さでモデルをテストします。
Health-ORSC-Benchは、次世代の医療AIアシスタントを調整するための厳格な標準を提供する。
論文 参考訳(メタデータ) (2026-01-25T01:28:52Z) - InvisibleBench: A Deployment Gate for Caregiving Relationship AI [0.0]
InvisibleBenchは、介護関連AIのためのデプロイメントゲートである。
安全、コンプライアンス、トラウマ・インフォームド・デザイン、長期/文化的適合性、メモリの5つの次元にわたる3~20以上のターンインタラクションを評価している。
論文 参考訳(メタデータ) (2025-11-25T14:09:45Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs [7.597770587484936]
医療における大規模言語モデル(LLM)の安全性を評価するためのベンチマークであるCARES(Clinical Adversarial Robustness and Evaluation of Safety)を紹介する。
CARESには、8つの医療安全原則にまたがる18,000以上のプロンプト、4つの有害レベル、4つのプロンプトスタイルがあり、悪意のあるユースケースと良心的なユースケースの両方をシミュレートしている。
我々の分析によると、多くの最先端のLSMは、有害なプロンプトを微妙に言い換えるジェイルブレイクに対して脆弱でありながら、安全で非典型的なクエリを過剰に再利用している。
論文 参考訳(メタデータ) (2025-05-16T16:25:51Z) - Which Client is Reliable?: A Reliable and Personalized Prompt-based Federated Learning for Medical Image Question Answering [51.26412822853409]
本稿では,医学的視覚的質問応答(VQA)モデルのための,パーソナライズド・フェデレーションド・ラーニング(pFL)手法を提案する。
提案手法では,学習可能なプロンプトをTransformerアーキテクチャに導入し,膨大な計算コストを伴わずに,多様な医療データセット上で効率的にトレーニングする。
論文 参考訳(メタデータ) (2024-10-23T00:31:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。