論文の概要: UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception
- arxiv url: http://arxiv.org/abs/2606.30332v1
- Date: Mon, 29 Jun 2026 14:13:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.260099
- Title: UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception
- Title(参考訳): UniGP: 事前保存した統一生成と知覚のための拡散変換器
- Authors: Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu,
- Abstract要約: UniGPはMMDiT上に構築されたフレームワークで、制御可能な生成と高密度な予測を統一する。
異なる条件下での制御可能な生成と予測を学習することにより,画像幾何対の関節分布を効果的に把握する。
- 参考スコア(独自算出の注目度): 21.921528706051205
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in diffusion models have shown impressive performance in controllable image generation and dense prediction tasks. However, existing approaches typically treat diffusion-based controllable generation and dense prediction as separate tasks, overlooking the potential benefits of jointly modeling the heterogeneous distributions. In this work, we introduce UniGP, a framework built upon MMDiT, which unifies controllable generation and dense prediction through simple joint training, without the need for complex task-specific designs or losses, while preserving the backbone's versatile priors. By learning controllable generation and prediction under different conditions, our model effectively captures the joint distribution of image-geometry pairs. UniGP is capable of versatile controllable generation, dense prediction, and joint generation. Specifically, the proposed UniGP consists of DUGP and a unified dataset training strategy. The former, following the principle of Occam's razor, uses only a copied image branch of MMDiT to model dense distributions beyond RGB, while the latter integrates heterogeneous datasets into a unified training framework to jointly model generation and perception tasks. Extensive experiments demonstrate that our unified model surpasses prior unified approaches and performs on par with specialized methods. Furthermore, we demonstrate that multi-task joint training provides complementary benefits: generative priors enrich perceptual details, while perceptual learning improves structural alignment in generation.
- Abstract(参考訳): 拡散モデルの最近の進歩は、制御可能な画像生成と高密度予測タスクにおいて顕著な性能を示している。
しかし、既存のアプローチは拡散に基づく制御可能生成と密度予測を別のタスクとして扱い、不均一分布を共同でモデル化する潜在的な利点を見越す。
本稿では,MMDiTをベースとしたUniGPを紹介し,複雑なタスク固有の設計や損失を必要とせず,制御可能な生成と高密度な予測を単純なジョイントトレーニングで統一する。
異なる条件下での制御可能な生成と予測を学習することにより,画像幾何対の関節分布を効果的に把握する。
UniGPは、汎用的な制御可能な生成、密度予測、ジョイント生成が可能である。
具体的には、提案したUniGPはDUGPと統合データセットトレーニング戦略から構成される。
前者はOccamのカミソリの原理に従い、MMDiTのコピーされたイメージブランチのみを使用してRGBを超える密度分布をモデル化し、後者は異種データセットを統合トレーニングフレームワークに統合し、生成と知覚タスクを共同でモデル化する。
大規模な実験により、我々の統一モデルは従来の統一アプローチを超越し、特殊な手法と同等に機能することを示した。
さらに,多タスク共同訓練が相補的な利点をもたらすことを実証した: 生成的先行は知覚的詳細を豊かにし,知覚的学習は世代構造的アライメントを改善する。
関連論文リスト
- UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation [51.41441081823758]
インターリーブドジェネレーションが可能な統一モデルが有望なパラダイムとして登場している。
インターリーブ・ジェネレーションに適した統合強化学習フレームワークを提案する。
実験により,この統合学習レシピは推論による画像生成品質を著しく向上させることが示された。
論文 参考訳(メタデータ) (2026-03-24T17:59:17Z) - CMAD: Cooperative Multi-Agent Diffusion via Stochastic Optimal Control [40.52516377402657]
連続時間生成モデルは、画像の復元と合成において顕著な成功を収めた。
複数の事前訓練されたモデルの構成を制御することは、依然としてオープンな課題である。
論文 参考訳(メタデータ) (2026-02-11T15:12:43Z) - MMGRid: Navigating Temporal-aware and Cross-domain Generative Recommendation via Model Merging [22.681048070167765]
ジェネレーティブレコメンデーション(GR)はレコメンデーションシステム(RS)の新しいパラダイムとして登場した。
私たちは、現実世界のさまざまな文脈に特化して、生成的推奨者をマージする方法という、現実の世界における根本的な、未解明の課題に焦点を合わせます。
本稿では,さまざまなコンテキスト下で訓練されたモデルを整理する,GRチェックポイントの構造化されたコンテキストグリッドであるMMGRidを提案する。
論文 参考訳(メタデータ) (2026-01-22T13:09:16Z) - Single Domain Generalization with Model-aware Parametric Batch-wise Mixup [22.709796153794507]
単一ドメインの一般化は、マシンラーニングの分野において、依然として深刻な課題である。
本稿では,モデル認識型パラメトリックバッチ・ワイド・ミックスアップ(Parametric Batch-wise Mixup)と呼ばれる新しいデータ拡張手法を提案する。
機能間相関を利用することで、パラメータ化されたミックスアップジェネレータは、複数のインスタンスにまたがる機能の組み合わせにおいて、さらなる汎用性を導入する。
論文 参考訳(メタデータ) (2025-02-22T03:45:18Z) - A Simple Approach to Unifying Diffusion-based Conditional Generation [63.389616350290595]
多様な条件生成タスクを処理するための、シンプルで統一されたフレームワークを導入します。
提案手法は,異なる推論時間サンプリング方式による多目的化を実現する。
我々のモデルは、非親密なアライメントや粗い条件付けのような追加機能をサポートしています。
論文 参考訳(メタデータ) (2024-10-15T09:41:43Z) - Steering Masked Discrete Diffusion Models via Discrete Denoising Posterior Prediction [88.65168366064061]
本稿では,確率論的推論の課題として,事前学習したMDMを操る作業を行う新しいフレームワークであるDDPPを紹介する。
私たちのフレームワークは、3つの新しい目標のファミリーにつながります。
Wet-lab Validation(ウェット・ラブ・バリデーション)を用いて,報酬最適化タンパク質配列の過渡的発現を観察する。
論文 参考訳(メタデータ) (2024-10-10T17:18:30Z) - InterHandGen: Two-Hand Interaction Generation via Cascaded Reverse Diffusion [53.90516061351706]
両手インタラクションに先立って生成を学習する新しいフレームワークであるInterHandGenを提案する。
サンプリングにアンチペネティフィケーションと合成フリーガイダンスを組み合わせることで、プラウシブルな生成を可能にする。
本手法は, 妥当性と多様性の観点から, ベースライン生成モデルよりも有意に優れていた。
論文 参考訳(メタデータ) (2024-03-26T06:35:55Z) - Fast Ensemble Learning Using Adversarially-Generated Restricted
Boltzmann Machines [0.0]
Restricted Boltzmann Machine (RBM)は近年注目され、データ確率分布をモデル化するエネルギーベースの構造に依存している。
本稿では,事前学習した重み行列がGAN入力として機能するAdversarial Learningを用いて,RBMを人工的に生成することを提案する。
画像再構成および画像分類タスクにおける提案手法の有効性を実験的に検証した。
論文 参考訳(メタデータ) (2021-01-04T16:00:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。