論文の概要: Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2607.19344v1
- Date: Tue, 21 Jul 2026 17:59:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.526738
- Title: Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
- Title(参考訳): 出現ポインター-拡散変圧器のマルチモーダル領域制御
- Abstract要約: Diffusion Transformer (DiT) はテキストや画像から生じる異種トークンを取り込みます。
出現ポインター, コンパクトトークンを導入し, 正確な空間位置の出現キューに向けてDiTsを誘導する。
提案手法では, ベースモデルをスクラッチからトレーニングすることなく, DiT 内の局所化制御のための最初のモダリティ非依存インタフェースを導入する。
- 参考スコア(独自算出の注目度): 16.07355154214678
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Controllable image generation remains challenging for creative professionals, who often require precise regional control over materials, object identities, and spatial arrangements that cannot be reliably achieved through text prompting alone. Diffusion Transformers (DiTs) can natively ingest heterogeneous tokens stemming from texts and images, but they lack mechanisms for determining where and how these tokens should influence the output. We introduce appearance pointers, compact tokens that guide DiTs toward the correct appearance cues at the correct spatial locations by aligning text or image inputs with user-specified masks. Appearance pointers are produced by a region correspondence network and refined through a spatial aggregation mechanism, enabling the model to handle multiple regional descriptions without significantly increasing token load. Our approach introduces the first modality-agnostic interface for localized multimodal control in a DiT without retraining the base model from scratch. Across a range of metrics, our single model reaches or surpasses the performance of modality-specific state of the art methods, offering a simple and extensible path toward precise, region-aware, multimodal guidance in generative image synthesis.
- Abstract(参考訳): コントロール可能な画像生成は、テキストのプロンプトだけでは確実に達成できない素材、オブジェクトのアイデンティティ、空間的アレンジメントの正確な地域制御を必要とするクリエイティブなプロにとって、依然として困難である。
Diffusion Transformer (DiT) はテキストや画像から生じる異種トークンをネイティブに摂取することができるが、これらのトークンが出力にどのような影響を及ぼすかを決定するメカニズムが欠如している。
テキストや画像入力をユーザ指定のマスクと整列させることで,DiTsを正しい空間位置へ誘導するコンパクトトークンである外見ポインタを導入する。
出現ポインタは、領域対応ネットワークによって生成され、空間集約機構によって洗練され、トークン負荷を大幅に増大させることなく、複数の地域記述を処理することができる。
提案手法では, ベースモデルをスクラッチからトレーニングすることなく, 局所化マルチモーダル制御のための最初のモダリティ非依存インタフェースを提案する。
様々な指標において、我々の単一モデルは、画像合成における精度、領域認識、マルチモーダルガイダンスへのシンプルで拡張可能な経路を提供する、モダリティ固有の最先端手法の性能に到達または超越している。
関連論文リスト
- One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting [51.09550363815034]
シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
SPaTS はフロンティアのクローズドソースMLLM と OCR MLLM の両方で一貫した性能を示し,その性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-07-30T09:17:48Z) - MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation [2.5925656171325127]
相乗的マルチモーダル顔合成のための統合デュアルストリーム拡散変換器MMFace-DiTを導入する。
その中核的な特徴は、空間(マスク/スケッチ)と意味(テキスト)トークンを並列に処理するデュアルストリームトランスフォーマーブロックにある。
MMFace-DiTは、6つの最先端マルチモーダル顔生成モデルに対して、視覚的忠実度を40%向上させ、迅速なアライメントを実現する。
論文 参考訳(メタデータ) (2026-03-30T21:44:18Z) - Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection [53.789057575175065]
領域認識型prompt Augmentation(RAPTA)とAttention-Driven Multimodal Copy Detection(ADMCD)を示す。
RAPTAはオブジェクト検出器を使用して、正常な領域を見つけ、それらを意味論的に接地したプロンプトの変種に変換する。
ADMCDは、ローカルパッチ、グローバルセマンティック、テクスチャキューを軽量トランスフォーマーで集約し、融合表現を生成する。
実験により、RAPTAは高い合成品質を維持しながら過度な適合を減少させ、ADMCDはコピーを確実に検出し、単一モードの指標より優れることが示された。
論文 参考訳(メタデータ) (2026-03-13T15:16:27Z) - Localized Control in Diffusion Models via Latent Vector Prediction [2.4923006485141284]
本稿では,画像のユーザ定義領域を正確に局所的に制御する手法を提案する。
本手法は,局所条件を制御した高品質な画像を効果的に合成する。
論文 参考訳(メタデータ) (2026-02-02T11:47:48Z) - Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers [56.76198904599581]
テキストと画像の拡散モデルは、言語翻訳において優れているため、モーダル間の注意機構を通じて暗黙的に概念を基礎づける。
近年のマルチモーダル拡散トランスフォーマーでは, 共用画像とテキストトークンを導入し, よりリッチでスケーラブルなクロスモーダルアライメントを実現している。
MM-DiTの注意構造を分析するための体系的フレームワークであるSeg4Diffを導入し,テキストから画像への意味情報の伝達方法に着目した。
論文 参考訳(メタデータ) (2025-09-22T17:59:54Z) - ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation [108.69315278353932]
可変多層透明画像の直接生成を容易にするAnonymous Region Transformer(ART)を導入する。
正確な制御とスケーラブルなレイヤ生成を可能にすることで、ARTはインタラクティブなコンテンツ作成のための新しいパラダイムを確立します。
論文 参考訳(メタデータ) (2025-02-25T16:57:04Z) - Scale-wise Bidirectional Alignment Network for Referring Remote Sensing Image Segmentation [12.893224628061516]
リモートセンシング画像セグメンテーション(RRSIS)の目的は、自然言語表現を用いて、空中画像内の特定のピクセルレベル領域を抽出することである。
本稿では,これらの課題に対処するため,SBANet(Scale-wise Bidirectional Alignment Network)と呼ばれる革新的なフレームワークを提案する。
提案手法は,RRSIS-DとRefSegRSのデータセットにおける従来の最先端手法と比較して,優れた性能を実現する。
論文 参考訳(メタデータ) (2025-01-01T14:24:04Z) - Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for Control [73.6361029556484]
身体的なAIエージェントは、視覚的および言語入力を介して、物理的な世界を詳細に理解する必要がある。
テキストプロンプトから画像を生成するために明示的に最適化された事前学習されたテキスト画像拡散モデルについて検討する。
安定度制御表現により,OVMM上での最先端性能を示す学習ポリシーが実現可能であることを示す。
論文 参考訳(メタデータ) (2024-05-09T15:39:54Z) - SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form
Layout-to-Image Generation [68.42476385214785]
本稿では,レイアウトから派生した特徴写像を用いた空間意味マップガイド(SSMG)拡散モデルを提案する。
SSMGは,従来の研究に比べて空間的,意味的な制御性に優れた生成品質を実現する。
また,RSA(Relation-Sensitive Attention)機構とLSA(Location-Sensitive Attention)機構を提案する。
論文 参考訳(メタデータ) (2023-08-20T04:09:12Z) - ITA: Image-Text Alignments for Multi-Modal Named Entity Recognition [38.08486689940946]
MNER(Multi-modal Named Entity Recognition)は多くの注目を集めている。
画像やテキスト表現などのインタラクションを,それぞれのモダリティのデータに基づいて個別に訓練することは困難である。
本稿では,画像特徴をテキスト空間に整列させるため,bf Image-bf text bf Alignments (ITA)を提案する。
論文 参考訳(メタデータ) (2021-12-13T08:29:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。