論文の概要: LightMIS: Ultra-Lightweight Medical Image Segmentation Without a Stage-Wise Decoder
- arxiv url: http://arxiv.org/abs/2609.28327v2
- Date: Thu, 24 Sep 2026 21:26:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.047293
- Title: LightMIS: Ultra-Lightweight Medical Image Segmentation Without a Stage-Wise Decoder
- Title(参考訳): LightMIS: ステージワイズデコーダを使わずに超軽量の医用画像セグメンテーション
- Abstract要約: 2次元医用画像セグメンテーションのためのスケーラブルな超軽量畳み込みネットワークであるLightMISを提案する。
LightMISは5レベルエンコーダの出力をスケールアライズド・プロジェクションブロックを使って共通解像度に調整し、一度集約し、融合表現を洗練させる。
DRIVE, Kvasir-SEG, DSB18, BUSI, ISIC-2017, ISIC-2018 上の共通 nnU-Net v2.3.1 プロトコルの5倍のクロスバリデーションを用いた LightMIS-T, LightMIS-S, LightMIS の評価を行った。
- 参考スコア(独自算出の注目度): 48.15305702377315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present LightMIS, a scalable family of ultra-lightweight convolutional networks for 2D binary medical image segmentation without a learned stage-wise decoder. LightMIS aligns the outputs of a five-level encoder to a common resolution using Scale-Aligned Projection blocks, aggregates them once, and refines the fused representation with an Adaptive Fusion Cascade. The cascade combines Adaptive Kernel Fusion with the proposed Progressive Receptive Fusion module, which uses temporary channel expansion, complementary depthwise receptive fields, and progressive cross-branch information transfer. We evaluate LightMIS-T, LightMIS-S, and LightMIS using five-fold cross-validation under a common nnU-Net v2.3.1 protocol on DRIVE, Kvasir-SEG, DSB18, BUSI, ISIC-2017, and ISIC-2018. Full LightMIS contains 0.131 M parameters and requires 0.575 GFLOPs for a $3\times256\times256$ input, achieving modality-macro Dice and IoU scores of 86.71% and 78.99%, respectively. Mobile U-ViT obtains 86.75% Dice and 79.07% IoU, so the observed differences are 0.04 and 0.08 percentage points. Relative to Mobile U-ViT, nnWNet, and nnU-Net, LightMIS reduces parameter count by 90.58$-$99.61% and GFLOPs by 82.54$-$96.14%. On an Arm Mali-G52 MC2 GPU, all LightMIS variants achieve full GPU delegation, with median delegated latency ranging from 53.31 ms for LightMIS-T to 138.31 ms for LightMIS. These results demonstrate a favorable accuracy-complexity trade-off and on-device execution feasibility for the evaluated tasks. The code is publicly available at https://github.com/AndreiiArhire/LightMIS.
- Abstract(参考訳): 学習段階のデコーダを使わずに2次元の2次元医用画像セグメンテーションを実現するための,スケーラブルな超軽量畳み込みネットワークであるLightMISを提案する。
LightMISは5レベルエンコーダの出力をスケールアライズド・プロジェクションブロックを使って共通解像度に調整し、それらを一度集約し、アダプティブ・フュージョン・カスケードで融合表現を洗練する。
カスケードはAdaptive Kernel FusionとProgressive Receptive Fusionモジュールを組み合わせることで、一時的なチャネル拡張、補完的な奥行きの受容場、プログレッシブクロスブランチ情報転送を利用する。
DRIVE, Kvasir-SEG, DSB18, BUSI, ISIC-2017, ISIC-2018 上の共通 nnU-Net v2.3.1 プロトコルの5倍のクロスバリデーションを用いた LightMIS-T, LightMIS-S, LightMIS の評価を行った。
Full LightMIS は 0.131 M のパラメータを含み、それぞれ 3\times256\times256$ の入力に対して0.575 GFLOPs を必要とし、モダリティ・マクロ・ダイスと IoU のスコアは86.71% と78.99% である。
モバイルU-ViTは86.75%のDiceと79.07%のIoUを取得している。
モバイルU-ViT、nnWNet、nnU-Netとは対照的に、LightMISはパラメータ数を90.58$-99.61%、GFLOPsは82.54$-96.14%削減している。
Arm Mali-G52 MC2 GPUでは、すべてのLightMIS変種が完全なGPUデリゲートを達成し、LightMIS-Tでは53.31ms、LightMISでは138.31msである。
これらの結果は、評価されたタスクに対して、精度・複雑さのトレードオフとデバイス上での実行可能性を示す。
コードはhttps://github.com/AndreiiArhire/LightMIS.comで公開されている。
関連論文リスト
- Learning Spectral Allocation: A Fractional Diffusion Framework for Adaptive Volumetric Segmentation [0.14323566945483493]
軽量U字型アーキテクチャ(Light-UNETR)とコルモゴロフ・アルノルド混合器(KAN3D)における3次元医用画像セグメンテーションの適応計算に対処する。
我々は、FHEATを軽量なU字型アーキテクチャ(Light-UNETR)とKolmogorov-Arnoldミキサー(KAN3D)との組み合わせで、適応的合理的なアクティベーションを行い、FHEAT-Segを得る。
標準的な半教師付きプロトコルでは、FHEAT-SegはDiceスコア90.47%(左心房)、78.79%(パンクレアCT)、81.90%(Bra)に達する。
論文 参考訳(メタデータ) (2026-09-23T01:29:46Z) - An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography [1.3023698730561286]
大きな言語モデル(LLM)は、医学的画像解釈において有望であるが、幻覚、限られた精度、実行間不整合に悩まされている。
我々は、眼底写真から緑内障を検出するための特殊なディープラーニングツールとLLMを統合したエージェントAIフレームワークを開発し、検証した。
論文 参考訳(メタデータ) (2026-08-07T17:33:12Z) - Sparse-LiDAR Prompting of Monocular Geometry Foundations: An Empirical Study Toward Long-Range Driving Depth [10.469394868633234]
真に疎いLiDAR入力を受け入れるMoGe-2の最初の適応であるSLIMを提案する。
Virtual KITTIとCARLAでは、SLIMはMoGe-2ベースラインの絶対誤差を100-150mで約39-51%削減する。
論文 参考訳(メタデータ) (2026-05-26T02:12:15Z) - Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs [48.83701310501069]
大規模言語モデル(LLM)は、ニューラルアーキテクチャ生成の強力な可能性を示している。
既存のアプローチは、ゼロから完全なモデル実装を生成します。
我々はデルタ符号生成法を提案し、細調整されたLLMはコンパクトな統一差分を生成する。
論文 参考訳(メタデータ) (2026-05-06T13:32:05Z) - PanLUNA: An Efficient and Robust Query-Unified Multimodal Model for Edge Biosignal Intelligence [14.663411219312827]
PanLUNAは、単一の共有エンコーダ内でEEG、ECG、PSGを処理するコンパクトFMである。
TUAB異常脳波検出の精度は81.21%である。
論文 参考訳(メタデータ) (2026-04-05T22:35:42Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation [59.711744386226194]
モデル効率を実現するための軽量トランスであるLight-UNETRを提案する。
Light-UNETRは軽量次元減少(LIDR)モジュールを備えており、空間次元とチャネル次元を減少させる。
また,変換器のデータ効率向上を目的としたCSE学習戦略も導入した。
論文 参考訳(メタデータ) (2026-03-24T16:24:19Z) - JTok: On Token Embedding as another Axis of Scaling Law via Joint Token Self-modulation [46.64215658042213]
補助埋め込みテーブルから得られる変調ベクトルを用いてトランスフォーマー層を拡大するジョイント・トケン(JTok)とジョイント・トケン(JTok-M)の混合を導入する。
これらのベクトルは、軽量な要素演算によってバックボーンを変調し、無視可能なFLOPのオーバーヘッドを発生させる。
我々のアプローチは、検証損失を継続的に減らし、ダウンストリームタスクのパフォーマンスを大幅に改善します。
論文 参考訳(メタデータ) (2026-01-31T16:15:18Z) - MoCTEFuse: Illumination-Gated Mixture of Chiral Transformer Experts for Multi-Level Infrared and Visible Image Fusion [0.0]
我々は,MoCTEFuseと呼ばれる動的マルチレベル画像融合ネットワークを提案する。
MoCTEFuseはテクスチャの詳細とオブジェクトのコントラストをバランスよく適応的に保存する。
DroneVehicle、MSRS、TNO、RoadSceneのデータセットで実施された実験は、MoCTEFuseの優れた融合性能を示している。
論文 参考訳(メタデータ) (2025-07-27T08:54:16Z) - Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free Lunch [72.97553348776425]
スーパーバイザード・ファインチューニング (SFT) LMの能力に影響を与えることなく、ほとんどのデルタパラメータを設定するためにDAREを導入する。
次に、DAREを汎用プラグインとして使用し、複数のSFTモデルのデルタパラメータを分散し、それらを単一のモデルにマージする。
また、DAREを使用して、Open Leaderboardで70億のパラメータを持つモデルの中で、第1位にランクインした統合LMを作成します。
論文 参考訳(メタデータ) (2023-11-06T13:43:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。