論文の概要: Geodesic-informed Generative Diffusion Model For Topology-preserved Image Video Generation
- arxiv url: http://arxiv.org/abs/2609.08153v1
- Date: Tue, 08 Sep 2026 02:37:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.555933
- Title: Geodesic-informed Generative Diffusion Model For Topology-preserved Image Video Generation
- Title(参考訳): 位相保存画像生成のための測地的インフォームド生成拡散モデル
- Authors: Nian Wu, Nivetha Jayakumar, Jiarui Xing, Miaomiao Zhang,
- Abstract要約: 我々は、位相保存型測地学の原理を拡散に基づく生成プロセスに統合する新しいフレームワークIGGを紹介する。
IGGは、幾何学的物体の変化を与えられたテンプレート/ソース画像から滑らかで可逆な滑らかな写像として学習する測地変形空間内の様々なサンプルを学習し、合成する。
- 参考スコア(独自算出の注目度): 1.9547424271527587
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative diffusion models have emerged as a class of powerful techniques for various imaging applications, including but not limited to synthesis, reconstruction, and segmentation. Despite their success, current generative models pose two key limitations. First, they primarily rely on image intensity and texture information, with limited attention to underlying object geometry. As a result, they do not guarantee geometric or topological consistency during the generation process, which is a crucial requirement for high-stakes domains such as computational anatomy, biology, and robotics, where preserving object structure is critical. Second, existing models fail to explicitly learn or represent shape changes in the generative process. Such deformation dynamics remain occluded within network parameters; hence leaving the transformation process uninterpretable and physically uninformed. To address these challenges, we introduce IGG (Image Generation informed by Geodesic dynamics), a novel framework that integrates topology-preserving geodesic principles into the diffusion-based generative process. In contrast to conventional methods that operate in image intensity space, IGG learns and synthesizes diverse samples within geodesic deformation spaces, where geometric object changes are learned as smooth and invertible smooth mappings from a given template/source image. Our code is publicly available at https://github.com/nellie689/IGG.
- Abstract(参考訳): 生成拡散モデルは、合成、再構成、セグメンテーションに限らず、様々なイメージング応用のための強力な手法のクラスとして登場した。
その成功にもかかわらず、現在の生成モデルは2つの重要な制限を課している。
第一に、それらは主に画像の強度とテクスチャ情報に依存しており、下層のオブジェクト幾何学に限定している。
結果として、それらは生成過程における幾何学的あるいは位相的整合性を保証するものではない。これは、物体構造を保存することが不可欠である計算解剖学、生物学、ロボット工学のような高次元領域にとって重要な要件である。
第二に、既存のモデルは、生成過程における形状変化を明示的に学習または表現することができません。
このような変形のダイナミクスは、ネットワークパラメータに隠されているため、変換プロセスは解釈不能で物理的にインフォームされないままである。
これらの課題に対処するために、トポロジー保存型測地学原理を拡散に基づく生成プロセスに統合する新しいフレームワークIGG(画像生成:Geodes dynamics)を紹介する。
画像強度空間で動作する従来の手法とは対照的に、IGGはジオデシックな変形空間内で様々なサンプルを学習し、合成し、幾何学的物体の変化は与えられたテンプレート/ソース画像から滑らかで可逆な滑らかな写像として学習する。
私たちのコードはhttps://github.com/nellie689/IGG.comで公開されています。
関連論文リスト
- Video Generative Models as Geometry Learner [88.78682297429937]
幾何推定に対する最近の生成的アプローチは、事前訓練された画像拡散モデルに適応し、タスクを画像条件付き生成として扱う。
我々は、幾何学的推定のための統一的でデータ効率のよいフレームワークとして、事前訓練されたビデオ生成モデルを再利用する。
我々の手法であるGeoNeXtは、ビデオモデルから自然に構造化された知識とよりリッチな事前情報を継承し、画像と幾何学的対象の合同モデリングにさらに適応する。
論文 参考訳(メタデータ) (2026-08-28T17:25:31Z) - SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness [62.38746300197673]
本稿では、3次元幾何学的認識を統合画像生成モデルに内包する新しいフレームワークを提案する。
具体的には、まずMixture-of-Transformers (MoT)アーキテクチャを用いて、MLLMを並列空間変換器で拡張する。
自己注意をMLLMと共有することにより、空間変換器は、リッチなセマンティックコンテキストからターゲット画像の計量深度マップを導出することを学ぶ。
これらの明示的な幾何学的足場は、特殊深度アダプターを介して拡散バックボーンに注入される。
論文 参考訳(メタデータ) (2026-04-29T06:46:59Z) - Few-shot Image Generation via Information Transfer from the Built
Geodesic Surface [2.617962830559083]
構築地表面からの情報伝達法(ITBGS)を提案する。
FAGSモジュールでは、トレーニングデータセットからPre-Shape Spaceにイメージ機能を投影することで、擬似ソースドメインが生成される。
提案手法は,多種多様なセマンティックなデータセットにまたがって,最適な,あるいは同等な結果が得られることを実証する。
論文 参考訳(メタデータ) (2024-01-03T13:57:09Z) - GeoDeformer: Geometric Deformable Transformer for Action Recognition [22.536307401874105]
視覚トランスフォーマーは、近年、行動認識のための畳み込みネットワークの効果的な代替品として登場した。
本稿では,幾何学的理解を直接ViTアーキテクチャに組み込むことで,アクションビデオに固有の変動を捉えるための新しいアプローチであるGeoDeformerを提案する。
論文 参考訳(メタデータ) (2023-11-29T16:55:55Z) - GeoDiffusion: Text-Prompted Geometric Control for Object Detection Data
Generation [91.01581867841894]
様々な幾何学的条件をテキストプロンプトに柔軟に翻訳できるシンプルなフレームワークであるGeoDiffusionを提案する。
われわれのGeoDiffusionは、バウンディングボックスだけでなく、自動運転シーンのカメラビューのような余分な幾何学的条件もエンコードできる。
論文 参考訳(メタデータ) (2023-06-07T17:17:58Z) - Geo-SIC: Learning Deformable Geometric Shapes in Deep Image Classifiers [8.781861951759948]
本稿では,画像分類の性能向上のために,変形空間における変形可能な形状を学習する最初のディープラーニングモデルGeo-SICを提案する。
画像空間と潜時形状空間の両方から特徴を同時に導出する,クラス内変動の大きい新設計のフレームワークを提案する。
幾何学的形状表現の教師なし学習を取り入れた強化型分類網を開発した。
論文 参考訳(メタデータ) (2022-10-25T01:55:17Z) - SCALE: Modeling Clothed Humans with a Surface Codec of Articulated Local
Elements [62.652588951757764]
衣服のモデル化と再構成は、調音性、非剛性変形、衣服の種類や地形の変化などにより困難である。
最近の研究では、ニューラルネットワークを使ってローカルな表面要素をパラメータ化している。
まず、人間の体モデルに基づいて表面要素を変形させます。
第2に,局所的な特徴から局所的な幾何学を回帰させることにより,既存の神経表面要素の制限を解消する。
論文 参考訳(メタデータ) (2021-04-15T17:59:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。