論文の概要: Understanding From Human Perspective: A Multi-agent System for Interactive Egocentric Medical Image Segmentation
- arxiv url: http://arxiv.org/abs/2607.17341v1
- Date: Sun, 19 Jul 2026 17:05:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.432482
- Title: Understanding From Human Perspective: A Multi-agent System for Interactive Egocentric Medical Image Segmentation
- Title(参考訳): 人間の視点からの理解:インタラクティブなエゴセントリックな医療画像セグメンテーションのためのマルチエージェントシステム
- Abstract要約: EgoMed-Agentは、人間の視点からターゲットを理解するマルチエージェントシステムである。
EgoMed-Agent の平均 Dice は71.34% に達し、最高のテキストプロンプトベースライン(11.70%) をはるかに上回っている。
- 参考スコア(独自算出の注目度): 12.04301517097086
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Interactive egocentric medical image segmentation (IEMIS) plays an important role in smart-glasses-assisted medical image review, segmenting the medical targets a clinician refers to from their egocentric view. Once it succeeds, the object-level visual evidence it provides strengthens the review and underpins fine-grained analysis and clinical decision-making. However, the instruction and the video both come from the user's egocentric perspective, which poses two challenges. (1) Semantic ambiguity leaves the model unable to confirm the user-intended target. (2) Visual variability makes the segmentation jump from frame to frame. In this paper, we propose EgoMed-Agent, a multi-agent system that understands the target from the human perspective through two workflows. (1) The \textit{Target Confirmation Workflow} grounds the instruction against candidate targets with a reliability score, confirming the target when the grounding is reliable and asking the user to clarify when it is not, thereby confirming the segmentation target. (2) The \textit{Localization-Guided Propagation Workflow} couples mask propagation with per-frame target localization, using the localized target to correct the propagated mask whenever the two diverge, so the segmentation stays on the target across the egocentric video. Extensive experiments show that EgoMed-Agent reaches 71.34\% average Dice, far above the best text-prompted baseline (11.70\%). Our code is available at \href{https://github.com/wdyyyyyy/EgoMed-Agent}{our project page}.
- Abstract(参考訳): IEMIS(Interactive Egocentric Medical Image segmentation)は、スマートグラスを用いた医療画像レビューにおいて重要な役割を担っている。
それが成功すると、それが提供するオブジェクトレベルの視覚的証拠は、レビューを強化し、きめ細かい分析と臨床的意思決定を支えます。
しかし、インストラクションとビデオはどちらもユーザの自我中心的な視点から来ているため、2つの課題が生じる。
1) セマンティックな曖昧さは、ユーザが意図した目標を確認することができないモデルを残します。
2) 視覚的変動は、セグメント化をフレームからフレームへジャンプさせる。
本稿では,人間の視点から2つのワークフローを通してターゲットを理解するマルチエージェントシステムであるEgoMed-Agentを提案する。
1) \textit{Target Confirmation Workflow}は、候補対象に対する指示を信頼性スコアでグラウンドし、グラウンドが信頼されたときに目標を確認し、ユーザがその旨を明確にし、セグメンテーション目標を確認する。
2) <textit{Localization-Guided Propagation Workflow} では,各フレームごとのターゲット位置定位とマスクの伝搬を結合し,2つの発散するたびにプロパゲートマスクの補正を行う。
大規模な実験により、EgoMed-Agent は平均 71.34 % に達し、最高のテキストプロンプトベースライン(11.70 %)をはるかに上回っている。
私たちのコードは \href{https://github.com/wdyyyyyyy/EgoMed-Agent}{our project page} で利用可能です。
関連論文リスト
- ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation [19.691062682670378]
外科的ビデオセグメンテーションの参照には、自然言語の表現に従って、ビデオフレームをまたいで対象の機器または組織領域をセグメンテーションする必要がある。
最近のSegment Anything Model 2 (SAM2) ベースの2段階法 (ReSurgSAM2) は、最初に参照されたターゲットを初期または選択されたフレームに接地し、次に選択されたマスクを追跡によって伝播する。
Re-Ground-Surgは,SAM2をベースとした手術用ビデオセグメンテーションを改善するための軽量な信頼性誘導アンカーグラウンドディングフレームワークである。
論文 参考訳(メタデータ) (2026-08-25T15:08:24Z) - MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation [7.746295603410245]
Volumetric Reasoningは、フリーフォームの臨床クエリから、ターゲット領域を3Dの医療スキャンに分割することを目的としている。
既存の手法は、マスクの復号化と言語を結びつけるための特別なセグメンテーショントークンに依存している。
本稿では,VRSのための強化学習ベースのフレームワークであるMedVol-R1について述べる。
論文 参考訳(メタデータ) (2026-05-26T06:59:19Z) - Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention [58.05340906967343]
Egocentric Referring Video Object (Ego-RVOS)は、言語クエリで説明されているように、人間のアクションに積極的に関与する特定のオブジェクトを、一人称ビデオに分割することを目的としている。
既存の手法はしばしば苦労し、データセット内の歪んだオブジェクト-アクションのペアリングから急激な相関を学習する。
本稿では,強力なトレーニング済みRVOSをエゴセントリックドメインに適応させるプラグイン因果フレームワークであるCausal-Referring(CERES)を紹介する。
論文 参考訳(メタデータ) (2025-12-30T16:22:14Z) - RAU: Reference-based Anatomical Understanding with Vision Language Models [26.06602931463068]
視覚言語モデル(VLM)を用いた参照型解剖学的理解のためのフレームワークであるRAUを紹介する。
まず,VLMが参照画像と対象画像の相対的空間的推論により解剖学的領域の同定を学習することを示す。
次に, VLM由来の空間的手がかりをSAM2の細粒度セグメンテーション能力とシームレスに統合できることを実証した。
論文 参考訳(メタデータ) (2025-09-26T14:32:03Z) - CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation [32.48945636401865]
CRoss-modal Interaction と Semantic Prompting をベースとした CRISP-SAM2 という新しいモデルを提案する。
このモデルは、臓器のテキスト記述によって導かれる多臓器医療セグメンテーションへの有望なアプローチを示す。
我々の手法は、視覚的およびテキスト的入力を相互に文脈化されたセマンティクスに変換することから始まる。
論文 参考訳(メタデータ) (2025-06-29T07:05:27Z) - DuEDL: Dual-Branch Evidential Deep Learning for Scribble-Supervised Medical Image Segmentation [2.708515419272247]
我々はDuEDL(Dual-Branch Evi-dential Deep Learning)と呼ばれる新しいフレームワークを提案する。
提案手法は, 精度を犠牲にすることなく, モデルの信頼性と一般化能力を大幅に向上させる。
論文 参考訳(メタデータ) (2024-05-23T11:23:57Z) - Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding [72.18719355481052]
MRG(Messical Report Grounding)と呼ばれる新しい課題について紹介する。
MRGは医療報告から診断フレーズとその対応する接地箱を直接エンドツーエンドで識別することを目的としている。
マルチモーダルな大規模言語モデルを用いて診断フレーズを予測する,堅牢で信頼性の高いフレームワークである uMedGround を提案する。
論文 参考訳(メタデータ) (2024-04-10T07:41:35Z) - Explore In-Context Segmentation via Latent Diffusion Models [132.26274147026854]
インコンテキストセグメンテーションは、与えられた参照画像を使ってオブジェクトをセグメンテーションすることを目的としている。
既存のほとんどのアプローチでは、視覚的プロンプトと入力画像クエリの相関を構築するために、メトリックラーニングやマスク付きイメージモデリングを採用しています。
この研究は、新しい視点から問題にアプローチし、コンテキスト内セグメンテーションのための潜在拡散モデルの能力を解き放つ。
論文 参考訳(メタデータ) (2024-03-14T17:52:31Z) - DiffVein: A Unified Diffusion Network for Finger Vein Segmentation and
Authentication [50.017055360261665]
DiffVeinは、静脈分割と認証タスクを同時に処理する統合拡散モデルベースのフレームワークである。
これら2つのブランチ間の機能相互作用を改善するために,2つの特別なモジュールを導入する。
このようにして、我々のフレームワークは拡散とセグメンテーションの埋め込みの間の動的相互作用を可能にする。
論文 参考訳(メタデータ) (2024-02-03T06:49:42Z) - MedSegDiff-V2: Diffusion based Medical Image Segmentation with
Transformer [53.575573940055335]
我々は、MedSegDiff-V2と呼ばれるトランスフォーマーベースの拡散フレームワークを提案する。
画像の異なる20種類の画像分割作業において,その有効性を検証する。
論文 参考訳(メタデータ) (2023-01-19T03:42:36Z) - Self-Supervised Correction Learning for Semi-Supervised Biomedical Image
Segmentation [84.58210297703714]
半教師付きバイオメディカルイメージセグメンテーションのための自己教師付き補正学習パラダイムを提案する。
共有エンコーダと2つの独立デコーダを含むデュアルタスクネットワークを設計する。
異なるタスクのための3つの医用画像分割データセットの実験により,本手法の優れた性能が示された。
論文 参考訳(メタデータ) (2023-01-12T08:19:46Z) - CUTS: A Deep Learning and Topological Framework for Multigranular Unsupervised Medical Image Segmentation [8.307551496968156]
医用画像セグメンテーションのための教師なしディープラーニングフレームワークCUTSを提案する。
各画像に対して、画像内コントラスト学習と局所パッチ再構成による埋め込みマップを生成する。
CUTSは、様々な粒度の特徴をハイライトする粗い粒度のセグメンテーションを連続的に生成する。
論文 参考訳(メタデータ) (2022-09-23T01:09:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。