論文の概要: Training-Free Inpainting Across Domains with a Frozen Text-to-Image Diffusion Model
- arxiv url: http://arxiv.org/abs/2609.00862v1
- Date: Tue, 01 Sep 2026 07:57:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.44329
- Title: Training-Free Inpainting Across Domains with a Frozen Text-to-Image Diffusion Model
- Title(参考訳): 凍結テキスト・画像拡散モデルによる領域間の無塗布訓練
- Authors: Zhenhuan Wang, Fengyi Yuan,
- Abstract要約: そこで本研究では,フリーズドジェネリックテキスト・ツー・イメージ拡散モデルを用いて,3つの評価された自然画像領域に対して条件付きインペインティングを行うことができることを示す。
Step-PIは、境界間遅延フィードバック、永続的なPI状態、および4フィールドリリーススケジュールを備えた既知の領域プロジェクションを強化する。
- 参考スコア(独自算出の注目度): 0.8716913598251385
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We show that a frozen generic text-to-image diffusion model can perform conditional inpainting across three evaluated natural-image domains with one fixed controller configuration, without inpainting-specific weight training, dataset-specific weight adaptation, or learned inpainting-specific conditioning channels. Step-PI augments known-region projection with boundary-interior latent feedback, persistent PI state, and a predefined four-field release schedule that modulates controller signals along the reverse trajectory. Developed only on Main35-disjoint CelebA-HQ pilots, the controller transfers unchanged to AFHQ and Places2. Across two field-identical comparisons on the same 3,500 cases, adding persistent state and replacing uniform release with the predefined schedule each improve all 15 dataset-metric cells; 95% bootstrap intervals exclude zero for all five metrics in both comparisons. In descriptive native-route comparisons, Step-PI leads LanPaint and PILOT (the closest evaluated training-free baselines using vanilla SD1.5) on all five equal-dataset macro metrics. Inpainting-trained systems retain the absolute metric leads but rely on substantial inpainting-specific offline optimization. Our method provides a complementary approach for repurposing a frozen generic text-to-image model for cross-domain inpainting through test-time latent control.
- Abstract(参考訳): 凍結した汎用テキスト・画像拡散モデルでは,1つの固定されたコントローラ構成で3つの評価された自然画像領域に条件付きインペイントを行うことができる。
Step-PIは、境界間遅延フィードバック、永続PI状態、および逆軌道に沿ってコントローラ信号を変調する予め定義された4フィールドリリーススケジュールにより、既知の領域プロジェクションを増強する。
Main35から分離したCelebA-HQのパイロットでのみ開発されたこのコントローラーはAFHQとPlaces2に異動する。
同じ3500のケースで2つのフィールドIDの比較を行い、永続的な状態を追加し、均一なリリースを事前定義されたスケジュールで置き換えた。
記述的なネイティブ-ルート比較では、Step-PIがLanPaintとPILOT(バニラSD1.5を使用した最も評価の高いトレーニングフリーベースライン)を5つの同じデータセットのマクロメトリクスでリードする。
塗装訓練されたシステムは絶対値のリードを保持するが、塗装固有のオフライン最適化に依存している。
本手法は,テスト時間潜時制御によるクロスドメイン・インペインティングのためのフリーズ・ジェネリック・テキスト・ツー・イメージ・モデルを再構築するための補完的アプローチを提供する。
関連論文リスト
- Generative Semantic Segmentation via an Observable Semantic-Image Interface and Hierarchical Generator Evidence Alignment [1.6199400106794555]
生成的セマンティックセグメンテーションは、構造化された予測を画像として公開するが、直接カラーデコーディングは、色ドリフトと境界ミキシングの影響を受けやすい。
本稿では,セマンティック・プリズム(Semantic Prism)を提案する。
論文 参考訳(メタデータ) (2026-08-12T01:00:04Z) - Tensor-Based Batch Fuzzing with Adaptive Perturbation Scaling for Deep Neural Networks [7.190532917825181]
適応的な摂動スケーリングを備えた仕様対応バッチファジリングフレームワークを提案する。
我々のフレームワークは、同じ時間予算の下で、シーケンシャルベースラインよりも最大40倍高いスループットと4倍の違反を達成する。
当社のフレームワークは,TrafficSigns,Cifar100,TinyImageNetにまたがる6つのネットワークと400以上の仕様を網羅する3つのベンチマークで広く評価している。
論文 参考訳(メタデータ) (2026-06-23T23:56:21Z) - Surflo: Consistent 3D Surface Flow Model with Global State [57.57234680235885]
Surfloは、方向付けられた3次元表面点を、ノイズからフローマッチングを通じて独立して表面へ輸送することでデコードする。
独立なポイント単位の復号化に固有の局所的不整合を抑制するために、光度勾配を注入することにより、推定時間誘導項が近傍の点と相関する。
Surfloは、サーフェスメトリクスのフィードフォワードベースラインにマッチし、数百のビューを必要とする最適化ベースのメソッドよりも桁違いに高速に動作し、グローバルなラテントと任意の解像度のデコーディングを組み合わせた唯一のフィードフォワードアプローチである。
論文 参考訳(メタデータ) (2026-06-11T17:48:38Z) - SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization [64.6372217552272]
公開編集データセットには、IMLトレーニングサンプルと構造的に同一(オリジナル、編集)のペアが数百万個含まれており、ピクセルレベルのマスクのみが欠如している。
本稿では,視覚基盤のバックボーンにおいて意味・特徴の相違を行うSIGMAを提案する。
1.1M IMLトレーニングセットを生成し、5つのデータセットに対して+18.34%のF1で6つの多様な検出器を改善する。
論文 参考訳(メタデータ) (2026-05-27T03:55:13Z) - OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation [100.36917520403227]
本稿では,8つの代表領域にまたがる共有範囲画像表現において,LiDARスキャンを生成する統一テキスト条件拡散フレームワークを提案する。
パブリックな統合ベンチマークがなければ、実世界のスキャンと物理ベース気象シミュレーションとシステマティックビームリダクションを組み合わせた8ドメインデータセットを構築する。
論文 参考訳(メタデータ) (2026-05-13T17:42:20Z) - Mitigating Long-Tail Bias via Prompt-Controlled Diffusion Augmentation [36.94429692322632]
本稿では,ドメイン構成とセマンティック構成の両方を明示的に制御し,ペア付きラベルサンプルを合成する,プロンプト制御拡散増強フレームワークを提案する。
遠隔センシングセグメンテーションにおける長期バイアスを軽減するための実践的メカニズムとして,マイノリティクラスに集中したゲインを示し,都市・農村の一般化を改善した。
論文 参考訳(メタデータ) (2026-02-04T16:49:16Z) - XD-MAP: Cross-Modal Domain Adaptation using Semantic Parametric Mapping [5.609281438287908]
本稿では,センサ固有の知識を画像データセットからLiDARに転送する手法を提案する。
我々のXD-MAPは、カメラ画像上のニューラルネットワークからの検出を活用して意味的パラメトリックマップを作成する。
その結果,手動ラベリングを使わずにLiDARデータに対して高い性能を実現する手法の有効性が示された。
論文 参考訳(メタデータ) (2026-01-20T21:00:26Z) - Dynamic Classifier-Free Diffusion Guidance via Online Feedback [53.54876309092376]
ワンサイズオール"アプローチは、異なるプロンプトの多様な要件に適応できない。
動的CFGスケジューリングのためのフレームワークを提案する。
我々は,小型モデルと最先端のImagen 3におけるアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2025-09-19T16:27:19Z) - Leveraging Semantic Attribute Binding for Free-Lunch Color Control in Diffusion Models [53.73253164099701]
拡散モデルにおいて、微調整なしで正確なRGBレベルの色制御を実現する、トレーニング不要なアプローチであるColorWaveを導入する。
我々は、カラーウェーブが、構造化された、色一貫性の拡散に基づく画像合成のための新しいパラダイムを確立することを実証した。
論文 参考訳(メタデータ) (2025-03-12T21:49:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。