論文の概要: VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis
- arxiv url: http://arxiv.org/abs/2608.04557v1
- Date: Wed, 05 Aug 2026 07:51:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.777303
- Title: VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis
- Title(参考訳): VoxStruct3D:Voxel空間3次元MRI合成のための構造学習フローマッチング
- Authors: Fang Li, Yang Gao, Shihao Zou, Weixin Si, Hongyu Wu, Qing Xia, Shuai Li, Aimin Hao,
- Abstract要約: 高忠実度3D MRI合成には、大域的なコヒーレントな解剖学と微細なボクセルレベルの詳細が必要である。
フル解像度MRIボリュームを直接モデル化するボクセル空間フローマッチングフレームワークであるVoxStruct3Dを提案する。
病理学的および健康的なT1強調脳MRIデータセットの実験では、VoxStruct3Dが全体的なパフォーマンスが最も高いことが示されている。
- 参考スコア(独自算出の注目度): 33.836541706312055
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-fidelity 3D MRI synthesis requires both globally coherent anatomy and fine-grained voxel-level detail. Although latent diffusion makes volumetric generation tractable, its image autoencoder introduces a reconstruction bottleneck that can limit the fine detail recoverable in the final volume. We present VoxStruct3D, a voxel-space flow-matching framework that directly models full-resolution MRI volumes using a clean-data prediction objective. Its Volumetric Voxel Generator (VVG) combines factorized 3D patch embedding with overlapping upsampling, time-modulated residual refinement, and skip fusion, enabling neighboring tokens to jointly reconstruct shared voxel regions and suppress patch-boundary artifacts. To complement direct voxel-space modeling with an explicit anatomical prior, we further introduce a Structure-First, Image-Follows (SFIF) strategy. A frozen pretrained 3D medical encoder and a StructVAE extract compact structure tokens that preserve dominant anatomy, while a structure-leading schedule keeps their trajectory ahead of the image trajectory. Patch-Aligned RoPE spatially aligns the unequal token grids, and asymmetric attention enforces one-way guidance from structure to image. Experiments on pathological and healthy T1-weighted brain MRI datasets show that VoxStruct3D achieves the strongest overall performance across feature-distribution alignment, sample diversity, and perceptual quality, producing anatomically coherent and visually realistic volumes.
- Abstract(参考訳): 高忠実度3D MRI合成には、大域的なコヒーレントな解剖学と微細なボクセルレベルの詳細が必要である。
遅延拡散はボリューム生成をトラクタブルにしますが、イメージオートエンコーダは、最終ボリュームで回復可能な細部を制限できる再構成ボトルネックを導入します。
本稿では,VoxStruct3Dを提案する。VoxStruct3Dは,クリーンなデータ予測目標を用いて,フル解像度MRIボリュームを直接モデル化するボクセル空間フローマッチングフレームワークである。
ボリュームヴォクセルジェネレータ(VVG)は、分解された3Dパッチの埋め込みと重なり合うアップサンプリング、時間変調された残留精錬、スキップ融合を組み合わせることで、近隣のトークンが共有ボクセル領域を共同で再構築し、パッチ境界アーティファクトを抑えることができる。
直接ボクセル空間のモデリングを明示的な解剖学的先行で補完するために、構造第一画像追跡(SFIF)戦略をさらに導入する。
凍結訓練された3D医療エンコーダとStructVAEは、支配的な解剖を保存するためのコンパクトな構造トークンを抽出する一方、構造をリードするスケジュールは、画像軌道よりも前方の軌道を保っている。
Patch-Aligned RoPEは不平等なトークングリッドを空間的に整列し、非対称な注意は構造から画像への片方向誘導を強制する。
病理学的および健康的なT1強調脳MRIデータセットの実験により、VoxStruct3Dは、特徴分布のアライメント、サンプルの多様性、知覚的品質にまたがる最も優れた総合的なパフォーマンスを達成し、解剖学的に一貫性があり、視覚的にもリアルなボリュームを生み出すことが示された。
関連論文リスト
- FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation [48.928051741750124]
本稿では,画像から3DGSまでのスケーラブルなフレームワークを提案し,生成時の表現学習と相互モーダルアライメントを向上する。
FLUX3Dは外観の忠実さを大幅に改善し、高品質な3DGSの資産を生み出すのに最先端(SOTA)の手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-06-23T17:52:21Z) - OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation [100.36917520403227]
本稿では,8つの代表領域にまたがる共有範囲画像表現において,LiDARスキャンを生成する統一テキスト条件拡散フレームワークを提案する。
パブリックな統合ベンチマークがなければ、実世界のスキャンと物理ベース気象シミュレーションとシステマティックビームリダクションを組み合わせた8ドメインデータセットを構築する。
論文 参考訳(メタデータ) (2026-05-13T17:42:20Z) - Structure-Adaptive Sparse Diffusion in Voxel Space for 3D Medical Image Enhancement [10.028882244604809]
3次元3D画像強調は,CT,PET,MRIの診断において重要である。
そこで本研究では,一様サブサンプリングタイムステップのコンパクトなセット上で,サンプルをトレーニングし,サンプルをサンプル化する,スパースボクセル空間拡散フレームワークを提案する。
我々のフレームワークは、圧縮を損なわずに微細な解剖学的詳細を保存しつつ、最大10倍のトレーニングアクセラレーションを実現している。
論文 参考訳(メタデータ) (2026-04-20T03:52:49Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - Extending 2D foundational DINOv3 representations to 3D segmentation of neonatal brain MR images [3.186130813218338]
グローバルMRIボリュームは、重複しない3Dウィンドウまたはサブキューブに分解され、それぞれが凍結した高忠実度機能の上に構築された別個のデコードアームを介して処理される。
提案手法は、1つの3Dウィンドウに対してDiceスコア0.65を達成する。
論文 参考訳(メタデータ) (2026-02-27T12:16:21Z) - ERGO: Excess-Risk-Guided Optimization for High-Fidelity Monocular 3D Gaussian Splatting [63.138778159026934]
本稿では,ERGOと呼ばれる過度のリスク分解によって導かれる適応最適化フレームワークを提案する。
ERGOはビュー固有の過剰リスクを動的に推定し、最適化中の損失重みを適応的に調整する。
Google Scanned ObjectsデータセットとOmniObject3Dデータセットの実験は、既存の最先端メソッドよりもERGOの方が優れていることを示している。
論文 参考訳(メタデータ) (2026-02-10T20:44:43Z) - Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction [65.67001243986981]
我々は,スケールワイド自己回帰モデルに基づく粗大なfMRI画像再構成フレームワークであるMindHierを提案する。
MindHierは、拡散ベースのベースラインよりも優れたセマンティック忠実さ、4.67倍高速な推論、より決定論的結果を達成する。
論文 参考訳(メタデータ) (2025-10-25T15:40:07Z) - Accelerating 3D Photoacoustic Computed Tomography with End-to-End Physics-Aware Neural Operators [74.65171736966131]
光音響計算トモグラフィ(PACT)は、光コントラストと超音波分解能を組み合わせることで、光拡散限界を超える深部像を実現する。
現在の実装では、高密度トランスデューサアレイと長い取得時間を必要とし、臨床翻訳を制限している。
本研究では,センサ計測からボリューム再構成まで,逆音響マッピングを直接学習する物理認識モデルであるPanoを紹介する。
論文 参考訳(メタデータ) (2025-09-11T23:12:55Z) - From Coarse to Continuous: Progressive Refinement Implicit Neural Representation for Motion-Robust Anisotropic MRI Reconstruction [15.340881123379567]
MRIでは、スライス・ツー・ボリュームの再構成は、2次元スライスから一貫した3次元脳の体積を回復するために重要である。
プログレッシブ改良型暗黙的ニューラル表現フレームワーク(PR-INR)を提案する。
我々のPR-INRは、幾何対応座標空間内での運動補正、構造改善、体積合成を統一する。
論文 参考訳(メタデータ) (2025-06-19T10:58:43Z) - $E(3) \times SO(3)$-Equivariant Networks for Spherical Deconvolution in
Diffusion MRI [4.726777092009554]
本稿では,各ボクセルが球面信号を含むボリュームのスパースデコンボリューションの枠組みを提案する。
この研究は、空間回転、反射、翻訳の対称性に関する同変深層を構成する。
論文 参考訳(メタデータ) (2023-04-12T18:37:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。