論文の概要: Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation
- arxiv url: http://arxiv.org/abs/2608.07176v1
- Date: Fri, 07 Aug 2026 12:47:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.498116
- Title: Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation
- Title(参考訳): Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation (特集:視覚・視覚)
- Abstract要約: 本稿では,これまでで最大の内視鏡形成基盤モデルであるREVEALを紹介する。
RevEALは、内視鏡的分布に直接事前訓練されたエンコーダを使用して、拡散潜伏剤とドメイン固有の視覚的特徴を一致させる。
RevEALは高忠実度画像を生成し、潜在空間編集において頑健な構造コヒーレンスを維持する。
- 参考スコア(独自算出の注目度): 9.107208576219668
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Developing foundation generative models for endoscopy is limited by the gap between natural and clinical images and the computational cost of training large Diffusion Transformers. Although representation alignment has improved efficiency in general computer vision, its role within the highly specialized endoscopic image space remains unclear. We introduce REVEAL (Representation-driven Endoscopic Visual Embedding Alignment), the largest generative foundation model for endoscopy to date, trained on GastroNet-5M (GN-5M), a multicenter dataset of 5 million endoscopic frames. Instead of depending on out-of-domain priors, REVEAL employs encoders pretrained directly on the endoscopic distribution to align diffusion latents with domain-specific visual features, preserving fine textures and intricate anatomical structures. Beyond image generation, REVEAL also serves as a powerful feature extractor; in multiple benchmarks, it delivers performance that is competitive with, and in several cases exceeds, endoscopic foundation models such as EndoViT and Endo-FM, specifically tuned for classification tasks, while demonstrating strong representation robustness under realistic imaging corruptions. REVEAL produces high-fidelity images and maintains robust structural coherence in latent-space edits such as inpainting and outpainting. This high-capacity backbone lowers the computational threshold for building specialized clinical tools, offering an open, versatile foundation for conditional synthesis, segmentation, and out-of-distribution detection in future intelligent gastroenterology systems.
- Abstract(参考訳): 内視鏡の基盤生成モデルの開発は、自然画像と臨床画像のギャップと、大規模な拡散変換器を訓練する際の計算コストによって制限される。
コンピュータビジョンにおける表現アライメントの効率は向上したが、高度に専門化された内視鏡画像空間におけるその役割はいまだ不明である。
本稿では,500万フレームの多施設データセットであるGastroNet-5M(GN-5M)をトレーニングし,これまでで最大の内視鏡基盤モデルであるREVEAL(Representation-drivenendoscopic Visual Embedding Alignment)を紹介する。
REVEALは、ドメイン外の先入観に依存する代わりに、内視鏡的分布に直接事前訓練されたエンコーダを使用して、拡散潜水剤をドメイン固有の視覚的特徴と整列させ、細かいテクスチャを保ち、複雑な解剖学的構造を保っている。
画像生成以外にも、REVEALは強力な特徴抽出器としても機能し、複数のベンチマークでは、競合するパフォーマンスを提供し、いくつかのケースでは、EndoViTやEndo-FMのような、分類タスク用に特別に調整された内視鏡的基礎モデルに勝る一方で、現実的な画像の破損下で強力な表現堅牢性を示す。
REVEALは高忠実度画像を生成し、インペイントやアウトペイントなどの潜在空間編集において頑健な構造コヒーレンスを維持している。
この高容量バックボーンは、特殊な臨床ツールを構築するための計算しきい値を低くし、将来のインテリジェントな胃腸科学システムにおける条件合成、セグメンテーション、およびアウト・オブ・ディストリビューション検出のためのオープンで汎用的な基盤を提供する。
関連論文リスト
- EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment [15.371433625713232]
EndoVLMは348K以上の内視鏡検査で事前訓練された新しい視覚言語FMである。
Anatomy-Guided Sparse Poolingメカニズムは、テキスト記述をクエリとして利用してスパース注意を喚起する。
プログレッシブ・セマンティック・アウェア・アライメント・ストラテジー(Progressive Semantic-Aware Alignment Strategy)は、構造化されたソフトターゲットを介して臨床分類(解剖学と病理学)をモデル化する。
Semantic-Concentrated Masked Autoencoderは、これらのセマンティックリッチなフレームにのみ適用され、低レベルの視覚的精度と堅牢な高レベルのセマンティック表現を統合する。
論文 参考訳(メタデータ) (2026-08-05T05:56:41Z) - ConvNeXt-FD: A Fractal-Based Deep Model for Robust Biomedical Image Segmentation [0.0]
本稿では,バイオメディカルイメージセグメンテーションのための新しいディープラーニングアーキテクチャであるConvNeXt-FDを紹介する。
提案手法は,Dice係数と境界対応正規化項を組み合わせたハイブリッド損失関数を統合する。
我々は6つの異なるバイオメディカルデータセット間でConvNeXt-FDを厳格に評価した。
論文 参考訳(メタデータ) (2026-05-21T04:58:24Z) - The Learnability Gap in Medical Latent Diffusion [10.504309161945065]
遅延拡散モデルによる生成データの増大は、医用画像におけるクラス不均衡に対処する上で有望な戦略である。
大規模事前学習型オートエンコーダは、医学的分類のための識別的特徴を忠実に符号化する。
画像空間モデルよりも64倍のスループットと120倍のメモリゲインを提供するFLM層と画像空間蒸留を用いた雑音条件付き潜時分類器を開発した。
論文 参考訳(メタデータ) (2026-05-16T17:07:54Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - MedVSR: Medical Video Super-Resolution with Cross State-Space Propagation [63.38824041721275]
低解像度(LR)医療ビデオは、ビデオ超解像度(VSR)モデルに固有の課題を提示する。
本稿では,医療用VSRのためのフレームワークであるMedVSRを提案する。
MedVSRは既存のVSRモデルよりも性能と効率が優れていることを示す。
論文 参考訳(メタデータ) (2025-09-25T14:56:59Z) - Large Language Model Evaluated Stand-alone Attention-Assisted Graph Neural Network with Spatial and Structural Information Interaction for Precise Endoscopic Image Segmentation [16.773882069530426]
本研究では,空間グラフと構造グラフを融合したFOCUS-Medを提案する。
FOCUS-Medは、Dual Graph Convolutional Network (Dual-GCN)モジュールを統合し、コンテキスト空間および位相構造上の依存関係をキャプチャする。
公開ベンチマークの実験では、FOCUS-Medが5つの主要な指標で最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2025-08-09T15:53:19Z) - EndoGen: Conditional Autoregressive Endoscopic Video Generation [51.97720772069513]
本研究では,最初の条件付き内視鏡映像生成フレームワークであるEndoGenを提案する。
具体的には、時空間グリッドフレームパターンを調整した自己回帰モデルを構築する。
高品質で条件付き内視鏡コンテンツ作成におけるフレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2025-07-23T10:32:20Z) - Efficient MedSAMs: Segment Anything in Medical Images on Laptop [69.28565867103542]
我々は,迅速な医用画像のセグメンテーションに特化した初の国際コンペを組織した。
トップチームは軽量なセグメンテーション基盤モデルを開発し、効率的な推論パイプラインを実装した。
最高のパフォーマンスのアルゴリズムは、臨床導入を促進するために、ユーザフレンドリーなインターフェースを備えたオープンソースソフトウェアに組み込まれている。
論文 参考訳(メタデータ) (2024-12-20T17:33:35Z) - CathFlow: Self-Supervised Segmentation of Catheters in Interventional Ultrasound Using Optical Flow and Transformers [66.15847237150909]
縦型超音波画像におけるカテーテルのセグメンテーションのための自己教師型ディープラーニングアーキテクチャを提案する。
ネットワークアーキテクチャは、Attention in Attentionメカニズムで構築されたセグメンテーショントランスフォーマであるAiAReSeg上に構築されている。
我々は,シリコンオルタファントムから収集した合成データと画像からなる実験データセット上で,我々のモデルを検証した。
論文 参考訳(メタデータ) (2024-03-21T15:13:36Z) - Unsupervised Domain Transfer with Conditional Invertible Neural Networks [83.90291882730925]
条件付き可逆ニューラルネットワーク(cINN)に基づくドメイン転送手法を提案する。
提案手法は本質的に,その可逆的アーキテクチャによるサイクル一貫性を保証し,ネットワークトレーニングを最大限効率的に行うことができる。
提案手法は,2つの下流分類タスクにおいて,現実的なスペクトルデータの生成を可能にし,その性能を向上する。
論文 参考訳(メタデータ) (2023-03-17T18:00:27Z) - Affinity Feature Strengthening for Accurate, Complete and Robust Vessel
Segmentation [48.638327652506284]
血管セグメンテーションは、冠動脈狭窄、網膜血管疾患、脳動脈瘤などの多くの医学的応用において重要である。
コントラストに敏感なマルチスケールアフィニティアプローチを用いて,幾何学的手法と画素単位のセグメンテーション特徴を連成的にモデル化する新しいアプローチであるAFNを提案する。
論文 参考訳(メタデータ) (2022-11-12T05:39:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。