論文の概要: MoEMambaMIL: Structure-Aware Selective State Space Modeling for Whole-Slide Image Analysis
- arxiv url: http://arxiv.org/abs/2603.06378v1
- Date: Fri, 06 Mar 2026 15:28:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-09 13:17:46.076964
- Title: MoEMambaMIL: Structure-Aware Selective State Space Modeling for Whole-Slide Image Analysis
- Title(参考訳): MoEMambaMIL:全スライディング画像解析のための構造を考慮した選択状態空間モデリング
- Abstract要約: MoEMambaMILは、全スライディング画像(WSI)解析のための構造認識フレームワークである。
エリアネスト選択走査とMix of-Experts(MoE)モデリングを統合している。
MoEMambaMILは、9つの下流タスクで最高のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 0.7898424058509471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Whole-slide image (WSI) analysis is challenging due to the gigapixel scale of slides and their inherent hierarchical multi-resolution structure. Existing multiple instance learning (MIL) approaches often model WSIs as unordered collections of patches, which limits their ability to capture structured dependencies between global tissue organization and local cellular patterns. Although recent State Space Models (SSMs) enable efficient modeling of long sequences, how to structure WSI tokens to fully exploit their spatial hierarchy remains an open problem.We propose MoEMambaMIL, a structure-aware SSM framework for WSI analysis that integrates region-nested selective scanning with mixture-of-experts (MoE) modeling. Leveraging multi-resolution preprocessing, MoEMambaMIL organizes patch tokens into region-aware sequences that preserve spatial containment across resolutions. On top of this structured sequence, we decouple resolution-aware encoding and region-adaptive contextual modeling via a combination of static, resolution-specific experts and dynamic sparse experts with learned routing. This design enables efficient long-sequence modeling while promoting expert specialization across heterogeneous diagnostic patterns. Experiments demonstrate that MoEMambaMIL achieves the best performance across 9 downstream tasks.
- Abstract(参考訳): スライドのギガピクセルスケールと、その固有の階層的多重解像度構造のために、WSI解析は困難である。
既存のMIL(Multiple Case Learning)アプローチは、WSIを無秩序なパッチのコレクションとしてモデル化することが多い。
近年のステート・スペース・モデル(SSM)は、長いシーケンスの効率的なモデリングを可能にするが、その空間的階層を完全に活用するためにWSIトークンをどう構成するかは未解決の問題であり、我々は、WSI分析のための構造を意識したSSMフレームワークであるMoEMambaMILを提案する。
マルチレゾリューション前処理を活用して、MoEMambaMILはパッチトークンを領域認識シーケンスに整理し、解像度の空間的包摂を保存する。
この構造的シーケンスの上に、静的な解像度特異的な専門家と学習ルーティングを持つ動的スパースの専門家を組み合わせることで、解像度認識符号化と領域適応型コンテキストモデリングを分離する。
この設計は、異種診断パターンをまたいだ専門家の専門化を推進しつつ、効率的な時系列モデリングを可能にする。
実験によると、MoEMambaMILは9つの下流タスクで最高のパフォーマンスを達成している。
関連論文リスト
- SP-MoMamba: Superpixel-driven Mixture of State Space Experts for Efficient Image Super-Resolution [99.56535031145211]
状態空間モデル(SSM)は、効率的な単一画像超解像(SR)のための強力なパラダイムとして登場した。
我々は、コンテント対応SRのための状態空間の専門家による超ピクセル駆動の混合である textbfSP-MoMamba を提案する。
私たちの中核となる考え方は、従来の剛性スキャンを、スーパーピクセルを基本単位として扱うことによって、テキストのセマンティックなレベルのインタラクションに変換することです。
論文 参考訳(メタデータ) (2026-05-25T14:19:59Z) - Geometry-Aware State Space Model: A New Paradigm for Whole-Slide Image Representation [8.483387656208363]
全スライド画像(WSI)は、組織標本をギガピクセル解像度でデジタル化する。
現在の方法では、パッチ表現を同質ユークリッド空間に暗黙的に埋め込む。
双対幾何学空間にWSI特徴を埋め込むハイブリッド双曲型ユークリッド表現を導入する。
論文 参考訳(メタデータ) (2026-05-06T17:33:30Z) - LayerTracer: A Joint Task-Particle and Vulnerable-Layer Analysis framework for Arbitrary Large Language Model Architectures [2.175079806379993]
本稿では,アーキテクチャに依存しないエンドツーエンド分析フレームワークであるLayerTracerを提案する。
隠れ状態を層ごとに抽出し,語彙的確率分布にマッピングすることにより,タスク粒子の局所化と層脆弱性の定量化を共同で解析する。
論文 参考訳(メタデータ) (2026-04-22T13:38:15Z) - MS-SSM: A Multi-Scale State Space Model for Efficient Sequence Modeling [60.648359990090846]
状態空間モデル(SSM)は、最近、計算コストのかかるシーケンスモデルに対する効率的な代替手段として注目されている。
本稿では,複数の解像度にまたがるシーケンスダイナミクスを表現するマルチスケールSSMフレームワークを提案し,各解像度を特殊な状態空間ダイナミクスで処理する。
論文 参考訳(メタデータ) (2025-12-29T19:36:28Z) - X-VMamba: Explainable Vision Mamba [0.0]
State Space Models (SSM) は、シーケンスモデリングのためのTransformerの強力な代替品として登場した。
本稿では,入力シーケンスの異なる部分(トークンやパッチ)がSSMの内部状態にどのように影響するかを定量化する,可制御性に基づく解釈可能性フレームワークを提案する。
我々のフレームワークは、すべてのドメインにわたるSSMの統一的で基礎的な解釈可能性パラダイムとして、制御可能性分析を確立します。
論文 参考訳(メタデータ) (2025-11-16T17:18:12Z) - GCRPNet: Graph-Enhanced Contextual and Regional Perception Network for Salient Object Detection in Optical Remote Sensing Images [68.33481681452675]
本稿では,GCRPNet(Graph-enhanced contextual and Regional Recognition Network)を提案する。
これはMambaアーキテクチャの上に構築され、長距離依存関係を同時にキャプチャし、地域的特徴表現を強化する。
マルチスケールの畳み込みによって処理される特徴マップに対して適応的なパッチスキャンを行い、リッチなローカル領域情報をキャプチャする。
論文 参考訳(メタデータ) (2025-08-14T11:31:43Z) - Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes [50.23625950905638]
メッシュサリエンシは、自然に視覚的注意を引き付ける領域を特定して強調することにより、3D視覚の適応性を高める。
状態空間モデル (SSM) に基づく統合唾液度予測モデルであるメッシュ・マンバを導入する。
Mesh Mambaは、トポロジカルフレームワークにテクスチャ機能をシームレスに組み込んだまま、メッシュの幾何学的構造を効果的に分析する。
論文 参考訳(メタデータ) (2025-04-02T08:22:25Z) - FACTS: A Factored State-Space Framework For World Modelling [24.08175276756845]
本研究では,時空間空間モデリングのための新しいリカレントフレームワークであるtextbfFACTored textbfState-space (textbfFACTS) モデルを提案する。
FACTSフレームワークは、置換可能なメモリ表現を学習するルーティング機構を備えたグラフメモリを構築する。
汎用的な世界モデリング設計にもかかわらず、常に最先端のモデルに勝ったり、マッチする。
論文 参考訳(メタデータ) (2024-10-28T11:04:42Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - MamMIL: Multiple Instance Learning for Whole Slide Images with State Space Models [56.37780601189795]
本稿では,WSI分析のためのフレームワークMamMILを提案する。
私たちは各WSIを非指向グラフとして表現します。
マンバが1次元シーケンスしか処理できない問題に対処するために、トポロジ対応の走査機構を提案する。
論文 参考訳(メタデータ) (2024-03-08T09:02:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。