論文の概要: MedImageOSWorld: Benchmarking GUI Agents for Medical Image Consoles
- arxiv url: http://arxiv.org/abs/2610.04800v1
- Date: Sat, 03 Oct 2026 22:56:09 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:41:12.519744
- Title: MedImageOSWorld: Benchmarking GUI Agents for Medical Image Consoles
- Title(参考訳): MedImageOSWorld: 医療画像コンソール用のGUIエージェントベンチマーク
- Abstract要約: MedImageOSWorldは, シミュレーションCT, MR, 超音波コンソールでこの機能を評価するためのベンチマークである。
スクリーンショットとマウスとキーボードのアクションを使用して、エージェントはプロトコルを設定し、取得を計画し、得られた画像を検査し、修正調整を行う。
11個のオープンウェイトエージェントのうち、成功率は0-100スケールで3.0から25.0の範囲であり、ワークフロープログレスレートは21.5-74.5である。
- 参考スコア(独自算出の注目度): 1.5632754424046598
- License:
- Abstract: Graphical consoles offer a practical interface for medical acquisition assistance, allowing agents to work through the controls and visual feedback used by human operators. Reliable assistance requires linking on-screen anatomy to acquisition decisions that determine what image evidence becomes available next. We introduce MedImageOSWorld, a benchmark for evaluating this capability in simulated CT, MR, and ultrasound consoles. Using screenshots and mouse-and-keyboard actions, agents configure protocols, plan acquisitions, inspect the resulting images, and make corrective adjustments across seven capability levels, from console operation to feedback-driven control. Evaluation combines task-specific workflow checks with hidden anatomical ground truth to assess procedural completion and acquisition outcomes separately. A common evaluation protocol specifies episode conditions and interaction budgets, while recorded trajectories support analysis of how agents observe, act, and respond to acquisition feedback. Across eleven open-weight agents, success rates range from 3.0 to 25.0 on a 0-100 scale while workflow-progress rates reach 21.5-74.5: agents complete much of the console workflow but rarely acquire the intended anatomy. Success collapses between perception and planning, from 79-90% at the lowest three levels for the best agent to at most 12% for millimetre-level planning and 0% for closed-loop control among open-weight agents. Two proprietary agents reach success rates of about 34 and exceed the best open-weight agent mainly in acquisition quality (61 versus 42). MedImageOSWorld provides a controlled setting for studying whether general-purpose GUI agents can translate visual observations into effective medical acquisition decisions.
- Abstract(参考訳): グラフィカルコンソールは、医療買収支援のための実用的なインターフェースを提供しており、エージェントは人間のオペレーターが使用する制御と視覚的フィードバックを通じて作業することができる。
信頼性の高い補助のためには、画面上の解剖学を画像証拠が次に手に入るかを決定するための買収決定にリンクする必要がある。
MedImageOSWorldは, シミュレーションCT, MR, 超音波コンソールでこの機能を評価するためのベンチマークである。
スクリーンショットとマウスとキーボードのアクションを使用して、エージェントはプロトコルを設定し、取得を計画し、結果のイメージを検査し、コンソール操作からフィードバック駆動制御までの7つの機能レベルの修正を行う。
タスク固有のワークフローチェックと隠された解剖学的根拠の真実を組み合わせることで、手続き的な完了と獲得の結果を別々に評価する。
共通評価プロトコルはエピソード条件とインタラクション予算を規定し、記録されたトラジェクトリは、エージェントの観察、行動、獲得フィードバックに対する応答の仕方の分析を支援する。
11個のオープンウェイトエージェントのうち、成功率は0-100スケールで3.0から25.0の範囲であり、ワークフロープログレスレートは21.5-74.5である。
成功は知覚と計画の間に崩壊し、最高のエージェントでは79-90%が最低3レベル、ミリメートルレベルのプランニングでは12%、オープンウェイトエージェントでは0%がクローズドループコントロールである。
2つのプロプライエタリなエージェントが34の成功率に達し、主に買収品質(61対42)で最高のオープンウェイトエージェントを超える。
MedImageOSWorldは、汎用GUIエージェントが視覚観察を効果的な医学的取得決定に変換することができるかどうかを研究するための制御された設定を提供する。
関連論文リスト
- CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation [55.1660787557339]
CodeActionBenchは、エージェント的なCode-as-Policyを通じてこの機能を評価する25の操作タスクのベンチマークである。
共有ロボットAPIは、RGB観測、校正された幾何学的操作、ロボットのフィードバック、および有界運動を提供し、タスク依存の判断を評価対象に残す。
9つの構成と675の試行で大規模な評価が行われ、成功率は2.7%から73.3%である。
最も強力な構成であるGPT-6 Astra with Codex CLIは、3回の試行で少なくとも25タスクのうち22タスクを解決した。
論文 参考訳(メタデータ) (2026-09-27T17:59:31Z) - VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control [57.5995346750474]
VA-Benchを導入し、完全なオブザーバ・レアソン・アクト・リビジョンループを評価する。
汎用MLLMは、RGBのみのデモンストレーションから手続き的コンテキストを学習する。
モデルには特権オブジェクトのポーズ、オラクルの軌跡、学習されたアクションヘッドは含まれない。
論文 参考訳(メタデータ) (2026-09-17T01:24:51Z) - CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows? [150.84850629123287]
現実的な医療業務のエンドツーエンドの自動化は、現在のベンチマークで不足している3つの機能を強調します。
$-Benchは3つのドメインにわたる長期医療のベンチマークである。
30以上のエージェントハーネス/モデル構成で、最高のエージェントはタスクの28.0%しか解決せず、厳格なパス3では20%をクリアし、単一のセッションですべてのタスクを実行するとパフォーマンスは3.8%に低下する。
論文 参考訳(メタデータ) (2026-05-15T22:34:31Z) - EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents [75.01735520608075]
既存のベンチマークは、直観的信念を問うことで、主にリテラル・オブ・マインド(ToM)をテストする。
EnactToMは, 3D 家庭で設定された300個のマルチエージェントタスクの進化ベンチマークである。
ハードスプリットでは、7つの評価されたフロンティアモデルすべてが機能的なタスク完了時に0.0%のPass3を獲得し、リテラルな信念プローブでは平均45.0%であった。
論文 参考訳(メタデータ) (2026-05-11T00:04:19Z) - RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography [8.642043084168817]
視覚言語モデル(VLM)は、CT(Computed Tomography)などの医用画像のAI駆動による解釈と報告を著しく進歩させた。
しかし、既存の手法は、臨床医を最終出力の受動的観察者に還元し、彼らが検査、検証、精査するための解釈可能な推論の痕跡を提供しない。
我々は,段階的かつ解釈可能なプロセスを通じてCTレポートを生成するツール使用AIエージェントであるRadAgentを紹介する。
論文 参考訳(メタデータ) (2026-04-16T17:09:30Z) - MedOpenClaw: Auditable Medical Imaging Agents Reasoning over Uncurated Full Studies [43.17392932337315]
現在、医療画像タスクにおける視覚言語モデル(VLM)の評価は、事前に選択された2D画像に頼ることで、臨床上の現実を過度に単純化している。
本稿では,標準医療ツールやビューア内でVLMを動的に動作させるための監査可能なランタイムであるMEDOPENCLAWを提案する。
我々はまた,脳MRIと肺CT/PETのフルスタディな医療画像ベンチマークであるMEDFLOWBENCHを紹介した。
論文 参考訳(メタデータ) (2026-03-25T17:33:58Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services [49.70819009392778]
大規模言語モデル (LLM) とマルチエージェントシステム (MAS) は、ディスパッチを増強する機会を提供する。
本研究の目的は,現実的なシナリオをシミュレートする分類基盤型マルチエージェントシステムの開発と評価である。
論文 参考訳(メタデータ) (2025-10-24T08:01:21Z) - Automated ARAT Scoring Using Multimodal Video Analysis, Multi-View Fusion, and Hierarchical Bayesian Models: A Clinician Study [1.0463644684200606]
脳卒中リハビリテーションにおける上肢評価のための行動研究アームテスト(ARAT)のマニュアルスコアリングは時間集約的かつ変動的である。
マルチモーダルビデオ解析をSlowFast, I3D, Transformerベースのモデルと統合した自動ARATスコアリングシステムを提案する。
この研究は、クリニカルバリデーションを備えたスケーラブルで解釈可能なソリューションを提供することで、自動リハビリテーションを進める。
論文 参考訳(メタデータ) (2025-05-03T04:00:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。