論文の概要: InstEditSeg: Instruction-Driven Image Editing for Polyp and Skin Lesion Segmentation
- arxiv url: http://arxiv.org/abs/2609.02004v1
- Date: Wed, 02 Sep 2026 02:28:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.031078
- Title: InstEditSeg: Instruction-Driven Image Editing for Polyp and Skin Lesion Segmentation
- Title(参考訳): InstEditSeg: ポリープと皮膚病変セグメンテーションのためのインストラクション駆動画像編集
- Abstract要約: InstEditSegは、医療セグメント化を命令駆動問題として再構成する統合生成フレームワークである。
マスクを出力する代わりに、モデルはテキスト命令で条件付けられた元の画像に色付きオーバーレイを描画する。
- 参考スコア(独自算出の注目度): 11.04143971119602
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate segmentation of polyps and skin lesions is pivotal for clinical diagnosis, yet existing methods struggle with low contrast, ambiguous boundaries, and cross-domain distribution discrepancies. Discriminative networks and most diffusion-based segmentation approaches predict standalone binary masks, leaving the visual priors of large-scale pretrained generative models largely unexploited. We propose InstEditSeg, a unified generative framework that reformulates medical segmentation as an instruction-driven image editing problem. Instead of emitting a mask, the model renders a color-coded overlay on the original image, conditioned on a textual instruction, so that the edited output aligns with the natural image distribution learned by latent diffusion models and mitigates the domain gap between natural and medical imagery. To recover fine anatomical structures, we introduce DINOv3 as an auxiliary visual encoder and a DINO Feature Guidance Block that builds a multi-scale feature pyramid. The pyramid is fused into the diffusion U-Net by channel concatenation and zero-initialized convolution so that hierarchical discriminative priors can be injected without perturbing the pretrained weights. A dual-branch classifier-free guidance strategy requiring only two forward passes per denoising step reduces inference cost. On polyp and skin lesion benchmarks the framework achieves accuracy competitive with strong discriminative baselines, and it further demonstrates concrete advantages of the generative formulation: notably better cross-domain generalization on unseen data, more complete multi-lesion segmentation, instruction-conditioned task control, and sampling flexibility. We also analyze the strengths and limitations of the paradigm, including its color sensitivity and unsupported attribute-conditioned selection. Code is available at: https://github.com/wincharm001/InstEditSeg.
- Abstract(参考訳): ポリープと皮膚病変の正確なセグメンテーションは、臨床診断において重要であるが、既存の手法では、低コントラスト、曖昧な境界、領域間分布の相違に苦慮している。
識別ネットワークとほとんどの拡散ベースセグメンテーションアプローチはスタンドアロンのバイナリマスクを予測し、大規模な事前訓練された生成モデルの視覚的先行性は明らかにされていない。
InstEditSegは、医用セグメンテーションを命令駆動画像編集問題として再構成する統合生成フレームワークである。
マスクを出力する代わりに、原画像上に色付きオーバーレイを描画し、テキスト命令で条件付けし、編集された出力が潜伏拡散モデルで学習した自然な画像分布と整合し、自然画像と医療画像の領域ギャップを緩和する。
微細な解剖学的構造を復元するために、補助視覚エンコーダとしてDINOv3とマルチスケールな特徴ピラミッドを構築するDINO Feature Guidance Blockを導入する。
ピラミッドは、チャネル結合とゼロ初期化畳み込みによって拡散U-ネットに融合し、予め訓練された重みを乱すことなく階層的識別前駆体を注入する。
二分岐型分類器フリー誘導戦略では、演示ステップ毎に2回だけ前方通過する必要があるため、推論コストが低減される。
ポリプおよび皮膚病変のベンチマークでは、このフレームワークは強力な差別的ベースラインと競合する精度を達成し、生成的定式化の具体的な利点として、特に目に見えないデータに対するクロスドメインの一般化、より完全なマルチリージョンセグメンテーション、命令条件付きタスク制御、サンプリング柔軟性を示す。
また,色感度や属性条件のない選択など,パラダイムの強みや限界も分析する。
コードは、https://github.com/wincharm001/InstEditSegで入手できる。
関連論文リスト
- Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge [59.247871132422006]
逆拡散法と拡散反転法は、未ペア画像から画像への変換を先進的に進めているが、それぞれが鍵となる制限に直面している。
本稿では,外部意味を拡散ブリッジモデルに統合する汎用フレームワークであるSelf-Supervised Semantic Bridge (SSB)を提案する。
我々のキーとなる考え方は、自己教師付き視覚エンコーダを活用して、外観変化に不変な表現を学習するが、幾何学的構造を捉えることである。
論文 参考訳(メタデータ) (2026-02-18T18:05:00Z) - ProGiDiff: Prompt-Guided Diffusion-Based Medical Image Segmentation [12.964514627034122]
本稿では,医用画像セグメンテーションのために既存の画像生成モデルを活用するProGiDiffという新しいフレームワークを提案する。
具体的には,イメージコンディショニングに適したカスタムエンコーダを備えた制御ネット型コンディショニング機構を提案する。
CT画像からの臓器の分節化実験は, 従来の方法と比較して高い性能を示し, プリンシパル・イン・ザ・ループ・セッティングの利点を大いに生かしている。
論文 参考訳(メタデータ) (2026-01-22T15:56:21Z) - LapFM: A Laparoscopic Segmentation Foundation Model via Hierarchical Concept Evolving Pre-training [39.51756689308245]
ラプFM(LapFM)は、大規模な未ラベルの手術画像から、堅牢なセグメンテーション能力を進化させるために設計された基礎モデルである。
本稿では,階層的一貫性に基づいて疑似ラベルを反復的に生成・フィルタリングする信頼駆動進化ラベルを提案する。
このプロセスは114Kのイメージマスク対からなる大規模ベンチマークであるLapBench-114Kを生成する。
論文 参考訳(メタデータ) (2025-12-09T10:09:31Z) - Diffusion Model in Latent Space for Medical Image Segmentation Task [0.0]
MedSegLatDiffは、変動オートエンコーダ(VAE)と遅延拡散モデルを組み合わせた拡散ベースのフレームワークで、効率的な医用画像分割を行う。
芸術または非常に競争の激しいDiceとIoUのスコアの状態を達成し、同時に多様なセグメンテーション仮説と信頼マップを生成する。
論文 参考訳(メタデータ) (2025-12-01T05:26:43Z) - Zero-shot Segmentation of Skin Conditions: Erythema with Edit-Friendly Inversion [0.27624021966289597]
本研究は, 拡散モデルにおける編集フレンドリーな逆転を用いたエロテマ(皮膚の赤み)の検出のためのゼロショット画像分割フレームワークを提案する。
この方法は、生成的編集により、エリスマのない同一患者の参照画像を合成し、これらの参照を元の画像と正確に整合させる。
論文 参考訳(メタデータ) (2025-08-02T12:00:35Z) - Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation [54.96563068182733]
セグメンテーションタスクのためのテキスト・ツー・イメージ拡散モデル(MADM)を用いたモダリティ適応を提案する。
MADMは、広範囲な画像とテキストのペアで事前訓練されたテキストと画像の拡散モデルを使用して、モデルの相互モダリティ能力を向上する。
我々は,MADMが画像から深度,赤外線,イベントのモダリティといった様々なモダリティタスクにまたがって,最先端の適応性能を実現することを示す。
論文 参考訳(メタデータ) (2024-10-29T03:49:40Z) - Dual-scale Enhanced and Cross-generative Consistency Learning for Semi-supervised Medical Image Segmentation [49.57907601086494]
医用画像のセグメンテーションはコンピュータ支援診断において重要な役割を担っている。
半教師型医用画像(DEC-Seg)のための新しいDual-scale Enhanced and Cross-generative consistency learning frameworkを提案する。
論文 参考訳(メタデータ) (2023-12-26T12:56:31Z) - Introducing Shape Prior Module in Diffusion Model for Medical Image
Segmentation [7.7545714516743045]
拡散確率モデル(DDPM)を利用したVerseDiff-UNetというエンドツーエンドフレームワークを提案する。
我々のアプローチは拡散モデルを標準のU字型アーキテクチャに統合する。
本手法はX線画像から得られた脊椎画像の1つのデータセットを用いて評価する。
論文 参考訳(メタデータ) (2023-09-12T03:05:00Z) - Lesion-aware Dynamic Kernel for Polyp Segmentation [49.63274623103663]
ポリープセグメンテーションのための障害対応動的ネットワーク(LDNet)を提案する。
従来のU字型エンコーダ・デコーダ構造であり、動的カーネル生成と更新スキームが組み込まれている。
この単純だが効果的なスキームは、我々のモデルに強力なセグメンテーション性能と一般化能力を与える。
論文 参考訳(メタデータ) (2023-01-12T09:53:57Z) - Self-Supervised Correction Learning for Semi-Supervised Biomedical Image
Segmentation [84.58210297703714]
半教師付きバイオメディカルイメージセグメンテーションのための自己教師付き補正学習パラダイムを提案する。
共有エンコーダと2つの独立デコーダを含むデュアルタスクネットワークを設計する。
異なるタスクのための3つの医用画像分割データセットの実験により,本手法の優れた性能が示された。
論文 参考訳(メタデータ) (2023-01-12T08:19:46Z) - BoxPolyp:Boost Generalized Polyp Segmentation Using Extra Coarse
Bounding Box Annotations [79.17754846553866]
我々は、正確なマスクと余分な粗いボックスアノテーションをフル活用するための強化されたBoxPolypモデルを提案する。
実際には、従来のポリプセグメンテーションモデルの過度に適合する問題を緩和するためにボックスアノテーションが適用される。
提案手法は従来の最先端手法よりも大きなマージンで優れていた。
論文 参考訳(メタデータ) (2022-12-07T07:45:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。