論文の概要: CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion
- arxiv url: http://arxiv.org/abs/2608.04655v1
- Date: Wed, 05 Aug 2026 10:12:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.820755
- Title: CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion
- Title(参考訳): CSGen:階層型マルチモーダル拡散によるマルチドメイン曲線構造生成モデル
- Authors: Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie,
- Abstract要約: キュビリニア構造解析はマルチメディアにおいて重要かつ基本的な課題である。
本稿では,複数の制御条件に正確に整合した高忠実度画像を合成する階層型多モード拡散モデルCSGenを提案する。
我々はCSGenを,多様なマルチメディアアプリケーションにおける複雑な曲線構造解析のためのスケーラブルでデータ中心のパラダイムであることを確認した。
- 参考スコア(独自算出の注目度): 12.844476044609513
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Curvilinear structure analysis is an important and fundamental task in multimedia. However, the controllable generation of images with precise curvilinear structure objects remains an open challenge. To address this, we propose CSGen, a hierarchical multimodal diffusion model that synthesizes high-fidelity images precisely aligned with multiple control conditions. The CSGen is built upon three key innovations: 1) We construct a multi-domain and multimodal dataset, including over 24K samples from 5 domains and 7 different types of annotations, to train the unified generation model. 2) We propose a novel hierarchical progressive control strategy that decouples topology clues from visual context by a phased signal injection, mitigating semantic drift while ensuring the topological integrity of sparse structures. 3) We design a sparsity-aware loss re-weighting mechanism to address the extreme sparsity of curvilinear structures, significantly enhancing the attention on thin and fragile structures during optimization. Extensive experiments demonstrate that CSGen generates images with superior structure accuracy and visual realism, significantly improving downstream segmentation performance while maintaining robustness across diverse prompts. Our results confirm CSGen as a scalable, data-centric paradigm for the analysis of complex curvilinear structures in diverse multimedia applications. Code and dataset are available at https://github.com/ShanZard/CSGen.
- Abstract(参考訳): キュビリニア構造解析はマルチメディアにおいて重要かつ基本的な課題である。
しかし、正確な曲線構造オブジェクトを持つ制御可能な画像の生成は、依然として未解決の課題である。
そこで我々は,複数の制御条件に正確に整合した高忠実度画像を合成する階層型多モード拡散モデルCSGenを提案する。
CSGenは3つの重要なイノベーションの上に構築されている。
1) 5つのドメインから24K以上のサンプルと7種類のアノテーションを含むマルチドメインおよびマルチモーダルデータセットを構築し、統一された生成モデルをトレーニングする。
2) 位相空間の位相的整合性を確保しつつ, 位相的ドリフトを緩和し, 位相的背景から位相的手がかりを分離する新しい階層的プログレッシブ制御手法を提案する。
3) カービリナー構造物の極端スペーサ性に対処するスペーサ・アウェア・ロス再重み付け機構を設計し, 最適化中の薄型・脆弱な構造物への注意を著しく高めている。
CSGenは、様々なプロンプト間の堅牢性を保ちながら、下流セグメンテーション性能を大幅に改善し、構造精度と視覚リアリズムの優れた画像を生成する。
我々はCSGenを,多様なマルチメディアアプリケーションにおける複雑な曲線構造解析のためのスケーラブルでデータ中心のパラダイムであることを確認した。
コードとデータセットはhttps://github.com/ShanZard/CSGen.comで入手できる。
関連論文リスト
- Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - UniG2U-Bench: Do Unified Models Advance Multimodal Understanding? [50.92401586025528]
統一マルチモーダルモデルは、最近強力な生成能力を示したが、生成が理解を改善したかどうかはまだ不明である。
提案するUniG2U-Benchは,G2U(Generation-to-understanding)評価を7つのシステマと30のサブタスクに分類する総合ベンチマークである。
論文 参考訳(メタデータ) (2026-03-03T18:36:16Z) - GMAC: Global Multi-View Constraint for Automatic Multi-Camera Extrinsic Calibration [1.3537117504260623]
GMACは、再構成ネットワークによって学習された暗黙的幾何学的表現に基づく、マルチカメラ外部推定フレームワークである。
GMACは、明確な3次元再構成や手動キャリブレーションなしで、正確で安定した外部推定を実現する。
論文 参考訳(メタデータ) (2026-02-01T05:38:27Z) - DiffusionSfM: Predicting Structure and Motion via Ray Origin and Endpoint Diffusion [53.70278210626701]
マルチビュー画像から3次元シーン形状とカメラポーズを直接推定するデータ駆動型マルチビュー推論手法を提案する。
我々のフレームワークであるDiffusionSfMは、シーン幾何学とカメラを、グローバルフレーム内のピクセルワイズ線源とエンドポイントとしてパラメータ化します。
我々は、DiffusionSfMを合成データセットと実データセットの両方で実証的に検証し、古典的および学習ベースのアプローチよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-05-08T17:59:47Z) - Expert Kernel Generation Network Driven by Contextual Mapping for Hyperspectral Image Classification [12.168520751389622]
ディープニューラルネットワークは、高次元データ、地上オブジェクトのスパース分布、スペクトル冗長性など、ハイパースペクトル画像分類においていくつかの課題に直面している。
本稿では,コンテキスト認識型マッピングネットワークと動的カーネル生成モジュールで構成される改良型3D-DenseNetモデルに基づくEKGNetを提案する。
提案手法は、IN, UP, KSCデータセット上での優れた性能を示し、主流のハイパースペクトル画像分類手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2025-04-17T16:00:06Z) - Spatial-Geometry Enhanced 3D Dynamic Snake Convolutional Neural Network for Hyperspectral Image Classification [12.168520751389622]
ディープニューラルネットワークは、ハイパースペクトル画像分類においていくつかの課題に直面している。
これには、複雑でスパースな地上オブジェクト分布、小さなクラスタ構造、細長いマルチブランチ機能が含まれる。
本稿では,改良された3次元DenseNetモデルに基づく空間幾何学拡張3次元ダイナミックスネークネットワーク(SG-DSCNet)を提案する。
論文 参考訳(メタデータ) (2025-04-06T12:21:39Z) - HKNAS: Classification of Hyperspectral Imagery Based on Hyper Kernel
Neural Architecture Search [104.45426861115972]
設計したハイパーカーネルを利用して,構造パラメータを直接生成することを提案する。
我々は1次元または3次元の畳み込みを伴う画素レベルの分類と画像レベルの分類を別々に行う3種類のネットワークを得る。
6つの公開データセットに関する一連の実験は、提案手法が最先端の結果を得ることを示した。
論文 参考訳(メタデータ) (2023-04-23T17:27:40Z) - Generating Diverse Structure for Image Inpainting With Hierarchical
VQ-VAE [74.29384873537587]
本稿では,異なる構造を持つ複数の粗い結果を第1段階で生成し,第2段階ではテクスチャを増補して各粗い結果を別々に洗練する,多彩な塗布用2段階モデルを提案する。
CelebA-HQ, Places2, ImageNetデータセットによる実験結果から,本手法は塗布ソリューションの多様性を向上するだけでなく,生成した複数の画像の視覚的品質も向上することが示された。
論文 参考訳(メタデータ) (2021-03-18T05:10:49Z) - Optimization-Inspired Learning with Architecture Augmentations and
Control Mechanisms for Low-Level Vision [74.9260745577362]
本稿では,GDC(Generative, Discriminative, and Corrective)の原則を集約する,最適化に着想を得た統合学習フレームワークを提案する。
フレキシブルな組み合わせで最適化モデルを効果的に解くために,3つのプロパゲーティブモジュールを構築した。
低レベル視覚タスクにおける実験は、GDCの有効性と適応性を検証する。
論文 参考訳(メタデータ) (2020-12-10T03:24:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。