論文の概要: Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors
- arxiv url: http://arxiv.org/abs/2607.13411v1
- Date: Wed, 15 Jul 2026 03:21:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.630645
- Title: Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors
- Title(参考訳): 自律的臨床セキュリティ監査者としてのフロンティアAIエージェントの評価
- Abstract要約: 本稿では、フロンティアAIエージェントが、構造化された臨床AIセキュリティ監査を自律的に実施できるかどうかをテストする評価タスクを提案する。
事前訓練された臨床予測モデル、患者データセット、手書きの指示が与えられた場合、各エージェントは擬似コードから4つの攻撃を実行する必要がある。
私たちは3つのフロンティアモデルに対して54回の評価を行い、1変種ごとに3回の評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical AI models can expose patients to harm when adversarial vulnerabilities go undetected, yet formal security auditing requires statistical expertise, specialized tools, and significant time. We present an open evaluation task, built on METR Task Standard v0.3.0, that tests whether frontier AI agents can autonomously implement a structured clinical AI security audit. Given a pre-trained clinical prediction model, a patient dataset, and written instructions, each agent must implement four attacks from pseudocode, compute a Security Posture Score covering FGSM robustness, membership inference resistance, expected calibration error, and boundary attack resistance, and write a structured JSON report in a Docker container using only a bash interface and no scaffolding code. Six variants span the Wisconsin Diagnostic Breast Cancer and MIMIC-IV ICU mortality datasets across three model architectures with increasing defense strength, with reference scores from 55.60 to 90.41. We ran 54 evaluations across three frontier models, with three runs per variant. Claude Sonnet 4.6 and GPT-4.1 completed all 18 runs and received perfect evaluator scores. GPT-4o completed 61 percent of runs and used about five times the per-run token count of Claude, although provider tokenization differs. Total API costs were 8 US dollars for GPT-4.1, 12 US dollars for Claude Sonnet 4.6, and 27 US dollars for GPT-4o. GPT-4o failures involved premature session termination, an aggregation error, and an empty submission file. The task, scoring infrastructure, and Wisconsin Breast Cancer assets are publicly released; MIMIC-IV variants require separate PhysioNet access.
- Abstract(参考訳): 臨床AIモデルは、敵の脆弱性が検出されない場合に患者を害する可能性があるが、正式なセキュリティ監査には統計的専門知識、専門的なツール、重要な時間が必要である。
本稿では,METRタスク標準v0.3.0に基づいて,フロンティアAIエージェントが構造化された臨床AIセキュリティ監査を自律的に実施できるかどうかを検証するオープン評価タスクを提案する。
トレーニング済みの臨床予測モデル、患者データセット、手書きの命令が与えられた場合、各エージェントは、擬似コードからの4つの攻撃を実装し、FGSMの堅牢性、メンバシップ推論抵抗、キャリブレーションエラー、バウンダリ攻撃抵抗をカバーするSecurity Posture Scoreを計算し、bashインターフェースと足場コードのみを使用して、構造化されたJSONレポートをDockerコンテナに記述しなければならない。
6つの変種がウィスコンシン診断乳がんとMIMIC-IV ICUの死亡率データセットを3つのモデルアーキテクチャに分散し、防御力は55.60から90.41に増加した。
私たちは3つのフロンティアモデルに対して54回の評価を行い、1変種ごとに3回の評価を行った。
クロード・ソネット4.6とGPT-4.1は全18戦で完走し、完全な評価点を得た。
GPT-4oは61%のランを完了し、Claudeの1ラン当たりのトークン数を約5倍使用したが、プロバイダのトークン化が異なる。
APIの総費用は、GPT-4.1で8USドル、Claude Sonnet 4.6で12USドル、GPT-4oで27USドルであった。
GPT-4oの故障には、初期セッション終了、アグリゲーションエラー、空のファイルが含まれていた。
このタスク、スコアリングインフラ、ウィスコンシン乳がんの資産は公開されており、MIMIC-IVの派生型は別のPhyloNetアクセスを必要とする。
関連論文リスト
- Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B [0.0]
オープンウェイト医療言語モデルは、患者向けおよび臨床支援アプリケーションの基礎として、ますます利用されている。
MedGemma-4B-itの技術的洗練を必要としない攻撃におけるギャップを定量化する。
論文 参考訳(メタデータ) (2026-07-09T18:31:43Z) - Privacy-Preserving Federated Autoencoder for ECG Anomaly Detection on Edge Devices [1.8676286428302982]
連続心電図(ECG)は心血管イベントにエスカレートする前に異常を呈する可能性がある。
システムは3つの要件を同時に満たさなければならない。法的グレードのプライバシ(ROC)、制約付きエッジハードウェアの推論、検出品質である。
教師なし異常検出のためのエンドツーエンドのフェデレーションシステムの設計と評価を行う。
本研究の主な貢献は、これらのメカニズムがどのように構成されるかの実証的特徴、実用的なDP固有の勧告、臨床的に敏感な設定のための技術およびセキュリティ上の洞察である。
論文 参考訳(メタデータ) (2026-06-10T01:33:20Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - TRUST: A Framework for Decentralized AI Service v.0.1 [47.384270414446604]
大規模推論モデル (LRM) とマルチエージェントシステム (MAS) は, 信頼性の高い検証を必要とする。
TRUST(Transparent, Robust, and Unified Services for Trustworthy AI)は,3つのイノベーションを備えた分散フレームワークである。
我々は、悪質な俳優が損失を被っている間、正直な監査人の利益を確実に確保する安全利益理論を証明する。
論文 参考訳(メタデータ) (2026-04-29T19:32:58Z) - Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw [87.97230960702274]
本稿では,OpenClawの安全性評価について紹介する。
エージェントの永続状態を3次元に統一するCIK分類法を導入する。
評価では、ライブOpenClawインスタンス上の12のアタックシナリオをカバーしています。
論文 参考訳(メタデータ) (2026-04-06T15:27:05Z) - Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security? [10.248746359119625]
EVMbenchは、スマートコントラクトセキュリティに関するAIエージェントのための最初の大規模なベンチマークである。
その成果は、完全に自動化されたAI監査が到達範囲内にあるという期待を後押しした。
これらの発見は、完全に自動化されたAI監査が差し迫っているという物語に挑戦する。
論文 参考訳(メタデータ) (2026-03-11T14:07:16Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks [0.0]
Agentic AIは、従来のLLMセーフガードが対処できないセキュリティ脆弱性を導入する。
エージェントAIシステムの最初の体系的テストと比較評価を行う。
新たな「ハロシントコンプライアンス」戦略を含む6つの防衛行動パターンを同定する。
論文 参考訳(メタデータ) (2025-12-16T19:22:50Z) - InvisibleBench: A Deployment Gate for Caregiving Relationship AI [0.0]
InvisibleBenchは、介護関連AIのためのデプロイメントゲートである。
安全、コンプライアンス、トラウマ・インフォームド・デザイン、長期/文化的適合性、メモリの5つの次元にわたる3~20以上のターンインタラクションを評価している。
論文 参考訳(メタデータ) (2025-11-25T14:09:45Z) - Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis [39.89241412792336]
我々は,畳み込みニューラルネットワークに対するアーキテクチャ攻撃,大規模言語モデル,強化学習エージェントの4つのカテゴリの8つの攻撃シナリオを分析した。
以上の結果から,100~500サンプルしかアクセスできないアタッカーは,データセットのサイズに関わらず,医療AIを侵害する可能性が示唆された。
我々は、必要な敵検定、アンサンブルに基づく検出、プライバシー保護セキュリティ機構、AIセキュリティ標準に関する国際調整を含む多層防御を推奨する。
論文 参考訳(メタデータ) (2025-11-14T07:16:16Z) - Deep Omni-supervised Learning for Rib Fracture Detection from Chest
Radiology Images [41.62893318123283]
ディープラーニング(DL)に基づくリブ骨折検出は、死亡を予防し、患者の予後を改善する上で重要な役割を担っている。
DLベースのオブジェクト検出モデルは、大量のバウンディングボックスアノテーションを必要とします。
医用データの注釈付けは時間がかかり専門知識が要求されるため、大量の細かい注釈を得られることは極めて不可能である。
我々は,ORF-Netv2という新しいオブジェクト検出ネットワークを提案する。
論文 参考訳(メタデータ) (2023-06-23T05:36:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。