論文の概要: MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing
- arxiv url: http://arxiv.org/abs/2502.21291v4
- Date: Sun, 27 Jul 2025 05:54:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-07-29 14:15:45.639606
- Title: MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing
- Title(参考訳): MIGE:マルチモーダルなインストラクションベースの画像生成と編集を相互に強化
- Abstract要約: MIGEはマルチモーダル命令を使ってタスク表現を標準化する統合フレームワークである。
まず、対象駆動生成を空白キャンバス上の生成として扱い、命令ベースの編集を既存の画像の修正として扱う。
MIGEは、命令ベースの主観的編集の新しいタスクにSOTAを設定しながら、主観的生成と命令に基づく編集の両面で優れている。
- 参考スコア(独自算出の注目度): 25.118495616895597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite significant progress in diffusion-based image generation, subject-driven generation and instruction-based editing remain challenging. Existing methods typically treat them separately, struggling with limited high-quality data and poor generalization. However, both tasks require capturing complex visual variations while maintaining consistency between inputs and outputs. Inspired by this, we propose MIGE, a unified framework that standardizes task representations using multimodal instructions. It first treats subject-driven generation as creation on a blank canvas and instruction-based editing as modification of an existing image, establishing a shared input-output formulation, then introduces a novel multimodal encoder that maps free-form multimodal instructions into a unified vision-language space, integrating visual and semantic features through a feature fusion mechanism. This unification enables joint training of both tasks, providing two key advantages: (1) Cross-Task Enhancement: by leveraging shared visual and semantic representations, joint training improves instruction adherence and visual consistency in both subject-driven generation and instruction-based editing. (2) Generalization: learning in a unified format facilitates cross-task knowledge transfer, enabling MIGE to generalize to novel compositional tasks, including instruction-based subject-driven editing. Experiments show that MIGE excels in both subject-driven generation and instruction-based editing while setting a SOTA in the new task of instruction-based subject-driven editing. Code and model have been publicly available at https://github.com/Eureka-Maggie/MIGE.
- Abstract(参考訳): 拡散ベース画像生成の大幅な進歩にもかかわらず、主観駆動生成と命令ベース編集は依然として困難である。
既存の手法は、通常、それらを別々に扱い、限られた高品質のデータと低い一般化に苦しむ。
しかし、どちらのタスクも入力と出力の整合性を維持しながら複雑な視覚的変化を捉える必要がある。
そこで本研究では,マルチモーダル命令を用いてタスク表現を標準化する統合フレームワークMIGEを提案する。
まず、対象駆動生成を空白キャンバス上の生成として扱い、命令ベースの編集を既存の画像の修正として扱い、共有入力出力の定式化を確立し、続いて、自由形式のマルチモーダル命令を統一された視覚言語空間にマッピングし、特徴融合機構を通じて視覚的特徴と意味的特徴を統合する、新しいマルチモーダルエンコーダを導入する。
1)クロスタスク強化:共有された視覚的表現と意味的表現を活用することで、共同トレーニングは、主観的生成と命令ベースの編集の両方において、命令の順守と視覚的一貫性を改善する。
2) 一般化: 総合的な形式での学習は、クロスタスクな知識伝達を促進するため、MIGEは、命令ベースの主題駆動編集を含む新しい構成課題に一般化することができる。
実験の結果,MIGEは主観的生成と命令的編集の両方に優れており,命令に基づく主観的編集の新しいタスクにSOTAを設定していることがわかった。
コードとモデルはhttps://github.com/Eureka-Maggie/MIGE.comで公開されている。
関連論文リスト
- TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation [30.09687573502619]
拡散変換器はビデオ生成と編集の急速な進歩を促しているが、これらの機能は依然としてタスク固有のモデルで処理されている。
命令ベースの編集,参照誘導編集,マルチ参照生成を統合した統合フレームワークであるTIDEを提案する。
論文 参考訳(メタデータ) (2026-06-06T17:11:13Z) - Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking [14.173267480504842]
スクリブル誘導画像編集により、ユーザーは単純なスクリブルアノテーションとテキストプロンプトを組み合わせることで、画像の編集場所と編集方法の両方を指定できる。
既存のモデルは、特にマルチタスクシナリオにおいて、このパラダイムの下で不安定なパフォーマンスを示す。
オープンソース編集モデルを用いて実証的研究を行い、一般化における非対称性を明らかにする。
論文 参考訳(メタデータ) (2026-05-25T08:20:23Z) - Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning [43.870883813242166]
我々は,Uniified Multimodal Models チューニングの最初の汎用タスクとして機能する,インテリジェントな画像編集タスクである Uni-Edit を提案する。
複雑な混合パイプラインとは異なり、Uni-Editは1つのタスク、1つのトレーニングステージ、1つのデータセットを使用して、3つの機能すべてのパフォーマンスを一度に改善する。
我々は,Uni-Editのみをチューニングすることで,補助的な操作を伴わずに,3つの機能にまたがる包括的な拡張を実現することを示す。
論文 参考訳(メタデータ) (2026-05-20T17:59:42Z) - WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing [103.68419705566146]
WeEditは、スケーラブルなデータ構築パイプラインと2つのベンチマーク、2段階のトレーニング戦略を含む、システマティックなソリューションである。
具体的には、多様な編集操作と15言語をカバーする330Kのトレーニングペアを生成するHTMLベースの新しい自動編集パイプラインを提案する。
アルゴリズム面では、グリフ誘導による微調整を用いて、空間的および内容的事前の明示を注入し、次いで、命令の順守、テキストの明瞭さ、背景の保存と、生成を整合させる多目的強化学習ステージを用いる。
論文 参考訳(メタデータ) (2026-03-12T06:25:09Z) - Instruction-based Image Editing with Planning, Reasoning, and Generation [52.0364486403062]
以前の作業では、大きな言語モデル、オブジェクトセグメンテーションモデル、このタスクのためのモデル編集の連鎖を利用していた。
我々は、命令ベースの画像編集モデルにインテリジェントな能力を提供する新しいマルチモーダリティモデルにより、理解と生成をブリッジすることを目指している。
本手法は,複雑な実世界の画像に対して,競合する編集能力を有する。
論文 参考訳(メタデータ) (2026-02-26T04:56:02Z) - MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance [16.97760861651234]
MCIE-E1は、大規模言語モデル駆動の複雑な命令画像編集手法である。
空間対応のクロスアテンションモジュールとバックグラウンド一貫性のクロスアテンションモジュールの2つの重要なモジュールを統合している。
それは、定量評価と定性評価の両方において、従来の最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-08T14:40:54Z) - DreamOmni2: Multimodal Instruction-based Editing and Generation [77.997848231822]
マルチモーダルな命令ベースの編集と生成という2つの新しいタスクを提案する。
これらのタスクはテキストとイメージの命令の両方をサポートし、具体的概念と抽象概念の両方を含むようにスコープを拡張する。
データ合成パイプラインは,(1)抽象的概念と具体的概念の両方の抽出データを作成するための特徴混合法,(2)編集と抽出モデルを用いたマルチモーダル命令ベースの編集訓練データを生成すること,(3)抽出モデルを適用してマルチモーダル命令ベースの編集のためのトレーニングデータを生成すること,の3つのステップで構成されている。
論文 参考訳(メタデータ) (2025-10-08T06:07:14Z) - Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling [54.54513714247062]
OmniGenのような統合画像生成モデルの最近の進歩により、単一のフレームワーク内で多様な画像生成および編集タスクの処理が可能になった。
テキスト命令が複数のサブインストラクションを含む場合,テキスト命令の無視に悩まされることがわかった。
本稿では,サブインストラクション毎に注意力の活性化を動的にスケールするために,自己適応型注意スケーリングを提案する。
論文 参考訳(メタデータ) (2025-07-22T05:25:38Z) - Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions [20.617718631292696]
我々は、広く利用可能な膨大なテキストイメージ対を利用する命令駆動画像編集のための新しいパラダイムを開発する。
本手法では,編集プロセスのローカライズとガイドを行うために,マルチスケールの学習可能な領域を導入する。
画像とそのテキスト記述のアライメントを監督・学習として扱い,タスク固有の編集領域を生成することにより,高忠実で高精度かつ命令一貫性のある画像編集を実現する。
論文 参考訳(メタデータ) (2025-05-25T22:40:59Z) - MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection [13.467269066605452]
MLLMと事前学習拡散モデルを組み合わせたエンドツーエンド画像編集フレームワークであるMIND-Editを提案する。
MIND-Editは,(1)MLLMからの意味的推論に基づく曖昧なユーザ指示を明確化するテキスト命令最適化戦略,(2)MLLMの本質的な視覚的理解能力を明示的に活用して編集意図を推測するMLLM洞察駆動型編集戦略,の2つの補完戦略を導入している。
大規模な実験により、MIND-Editは、特に複雑で困難なシナリオにおいて、定量的メトリクスと視覚的品質の両方において、最先端の画像編集方法より優れていることが示された。
論文 参考訳(メタデータ) (2025-05-25T13:54:31Z) - Task-Adapter++: Task-specific Adaptation with Order-aware Alignment for Few-shot Action Recognition [33.22316608406554]
本稿では,画像エンコーダとテキストエンコーダのパラメータ効率を両立させる手法を提案する。
具体的には,画像エンコーダのタスク固有の適応を設計し,特徴抽出時に最も識別性の高い情報をよく認識できるようにする。
我々は,視覚的特徴を意味的記述と同じ時間的段階に存在するように積極的にマッピングする,革新的な細粒度クロスモーダルアライメント戦略を開発した。
論文 参考訳(メタデータ) (2025-05-09T12:34:10Z) - Insert Anything: Image Insertion via In-Context Editing in DiT [19.733787045511775]
本稿では,参照画像からのオブジェクトをフレキシブルかつユーザ指定の制御ガイダンスの下でシームレスに統合する参照ベース画像挿入のための統一的なフレームワークを提案する。
私たちのアプローチは、新しいAnyInsertionデータセット(人、オブジェクト、衣服の挿入など、さまざまなタスクをカバーする120Kプロンプトイメージペア)で一度トレーニングされます。
論文 参考訳(メタデータ) (2025-04-21T10:19:12Z) - UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing [59.590505989071175]
テキスト・ツー・イメージ(T2I)拡散モデルでは、ユーザのプロンプトに従って視覚的に魅力的な画像を生成するという印象的な結果が示されている。
我々は,一組の重みで多様な画像生成タスクをサポートする汎用拡散モデルUniVGを紹介する。
論文 参考訳(メタデータ) (2025-03-16T21:11:25Z) - DreamOmni: Unified Image Generation and Editing [51.45871494724542]
本稿では,画像生成と編集の統一モデルであるDream Omniを紹介する。
訓練のためにドリーム・オムニはT2I世代と下流のタスクを共同で訓練する。
このコラボレーションは、編集性能を大幅に向上させる。
論文 参考訳(メタデータ) (2024-12-22T17:17:28Z) - BrushEdit: All-In-One Image Inpainting and Editing [79.55816192146762]
BrushEditは、インペイントベースの命令誘導画像編集パラダイムである。
本研究では,MLLMとデュアルブランチ画像の描画モデルを統合することで,自由形式の命令編集を可能にするシステムを提案する。
本フレームワークは,MLLMとインパインティングモデルを効果的に組み合わせ,7つの指標で優れた性能を実現する。
論文 参考訳(メタデータ) (2024-12-13T17:58:06Z) - A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models [117.77807994397784]
画像編集は、ユーザーが特定の要求を満たすために、与えられた合成画像または実際の画像を編集することを目的としている。
この分野での最近の顕著な進歩は、テキスト・ツー・イメージ(T2I)拡散モデルの開発に基づいている。
T2Iベースの画像編集手法は、編集性能を大幅に向上させ、マルチモーダル入力でガイドされたコンテンツを修正するためのユーザフレンドリーなインタフェースを提供する。
論文 参考訳(メタデータ) (2024-06-20T17:58:52Z) - Unified Editing of Panorama, 3D Scenes, and Videos Through Disentangled Self-Attention Injection [60.47731445033151]
本稿では,基本的な2次元画像テキスト・ツー・イメージ(T2I)拡散モデルのみを利用して,両手法の長所を結合した新しい統合編集フレームワークを提案する。
実験結果から,3次元シーン,ビデオ,パノラマ画像など,様々なモダリティの編集が可能であることが確認された。
論文 参考訳(メタデータ) (2024-05-27T04:44:36Z) - Unified Diffusion-Based Rigid and Non-Rigid Editing with Text and Image
Guidance [15.130419159003816]
本稿では,厳密な編集と非厳密な編集の両方を実行できる多用途画像編集フレームワークを提案する。
我々は、多種多様な編集シナリオを扱うために、デュアルパスインジェクション方式を利用する。
外観と構造情報の融合のための統合自己認識機構を導入する。
論文 参考訳(メタデータ) (2024-01-04T08:21:30Z) - Instruct-Imagen: Image Generation with Multi-modal Instruction [90.04481955523514]
Instruct-imagenは、不均一な画像生成タスクに取り組み、目に見えないタスクを一般化するモデルである。
画像生成のための*multi-modal instruction*を導入する。
画像生成データセットの人間による評価では、インストラクション・イメージはドメイン内の以前のタスク固有のモデルと一致するか、超えている。
論文 参考訳(メタデータ) (2024-01-03T19:31:58Z) - SmartEdit: Exploring Complex Instruction-based Image Editing with
Multimodal Large Language Models [91.22477798288003]
本稿では,命令ベースの画像編集の新しいアプローチであるSmartEditを紹介する。
MLLM(Multimodal Large Language Models)を利用して、その理解と推論能力を強化する。
我々は,より複雑な命令に対して,SmartEditの編集機能を効果的に刺激することのできる,少量の複雑な命令編集データを示す。
論文 参考訳(メタデータ) (2023-12-11T17:54:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。