論文の概要: SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing
- arxiv url: http://arxiv.org/abs/2606.13041v1
- Date: Thu, 11 Jun 2026 08:21:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.670395
- Title: SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing
- Title(参考訳): SeamEdit: 大規模な画像セマンティック編集のためのブラックボックスVLM非依存パイプライン
- Authors: Xiangyu Lyu, Dan Lei,
- Abstract要約: SeamEditはトレーニング不要でモデルに依存しないパイプラインで、任意のVLMをブラックボックスのオラクルとして塗装能力で扱う。
そこで本論文では,任意のVLMをブラックボックスオラクルとして塗装能力で処理する,トレーニングフリーでモデルに依存しないパイプラインであるSeamEditについて述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic region editing for large images must satisfy two requirements at the same time: high generative quality and natural integration with surrounding content. Some related methods rely on white-box models and leave the strong generation capability of closed-source models underexplored. Directly applying closed-source models to tiled editing, however, introduces several failure modes: semantic deformation, canvas-level alignment drift, and visible seam artifacts. This paper presents SeamEdit, a training-free and model-agnostic pipeline that treats any VLM with inpainting capability as a black-box oracle. SeamEdit mitigates these issues through a five-stage post-hoc pipeline: overlay-based tile decomposition, black-box VLM inpainting, geometric and color-consistency correction, seam-risk-based multi-candidate ranking, and dynamic-programming curved seam fusion. The pipeline reduces seam visibility and supports semantic modification of arbitrary tile regions.
- Abstract(参考訳): 大きな画像に対する意味領域の編集は、高い生成品質と周囲のコンテンツとの自然な統合という2つの要件を同時に満たさなければならない。
いくつかの関連する手法はホワイトボックスモデルに依存しており、探索されていないクローズドソースモデルの強力な生成能力を残している。
しかし、テンプレート編集に直接クローズドソースモデルを適用すると、セマンティックな変形、キャンバスレベルのアライメントドリフト、目に見えるシームアーティファクトなど、いくつかの障害モードが導入される。
そこで本論文では,任意のVLMをブラックボックスオラクルとして塗装能力で処理する,トレーニング不要でモデルに依存しないパイプラインであるSeamEditについて述べる。
SeamEditは、オーバーレイベースのタイル分解、ブラックボックスのVLMインペインティング、幾何学的および色の整合性補正、Seam-riskベースのマルチ候補ランキング、動的プログラム型シーム融合という5段階のポストホックパイプラインを通じてこれらの問題を緩和する。
パイプラインはシームの可視性を低減し、任意のタイル領域のセマンティックな変更をサポートする。
関連論文リスト
- OmniColor: A Unified Framework for Multi-modal Lineart Colorization [12.417479154389751]
マルチモーダル線形色化のための統一フレームワークであるOmniColorを提案する。
誘導信号は空間的に整合した条件と意味的参照条件の2つのタイプに分類する。
実験により、OmniColorは優れた制御性、視覚的品質、時間的安定性を実現することが示された。
論文 参考訳(メタデータ) (2026-03-29T05:46:18Z) - Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency [65.75215546331243]
我々は,UnKnown Areas prior (ASUKA) を用いたアラインド安定塗装の枠組みを紹介する。
不要なオブジェクト挿入を減らすために、生成モデルを誘導するために、再構成に基づく原則付きプリエントを用いる。
色の不整合に対処するため,ローカルタスクとして遅延画像デコーディングを定式化する専用VAEデコーダを設計する。
論文 参考訳(メタデータ) (2026-01-21T17:57:18Z) - Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition [73.43121650616804]
単一のRGB画像を複数の意味的不整合RGBA層に分解するエンドツーエンド拡散モデルである textbfQwen-Image-Layered を提案する。
本手法は,分解品質の既存手法を大幅に上回り,一貫した画像編集のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-12-17T17:12:42Z) - CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion [62.04833878126661]
統合拡散フレームワークにおける映像理解と制御可能な映像生成という2つの課題に対処する。
CtrlVDiffは、Hybrid Modality Control Strategy(HMCS)で訓練された統合拡散モデルであり、深度、正規度、セグメンテーション、エッジ、グラフィックベースの内在性(アルベド、粗さ、金属)から特徴を導出し、融合する。
理解と生成のベンチマーク全体にわたって、CtrlVDiffは優れた制御性と忠実さを提供し、レイヤワイズな編集(リライティング、材料調整、オブジェクト挿入)と最先端のベースラインを越えながら、いくつかのモダリティが利用できない場合の堅牢性を維持している。
論文 参考訳(メタデータ) (2025-11-26T07:27:11Z) - MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting [24.950822394526554]
MTADiffusionは,物体塗布のためのマスクテキスト配向拡散モデルである。
MTAPipelineをベースとして,500万の画像と2500万のマスクテキストペアからなる新しいMTAデータセットを構築した。
スタイル整合性を促進するために,事前学習したVGGネットワークとGram行列を用いた新しいスタイル整合性損失を提案する。
論文 参考訳(メタデータ) (2025-06-30T03:06:54Z) - Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation [54.96563068182733]
セグメンテーションタスクのためのテキスト・ツー・イメージ拡散モデル(MADM)を用いたモダリティ適応を提案する。
MADMは、広範囲な画像とテキストのペアで事前訓練されたテキストと画像の拡散モデルを使用して、モデルの相互モダリティ能力を向上する。
我々は,MADMが画像から深度,赤外線,イベントのモダリティといった様々なモダリティタスクにまたがって,最先端の適応性能を実現することを示す。
論文 参考訳(メタデータ) (2024-10-29T03:49:40Z) - RecDiffusion: Rectangling for Image Stitching with Diffusion Models [53.824503710254206]
画像縫合整形のための新しい拡散学習フレームワーク textbfRecDiffusion を提案する。
このフレームワークは運動拡散モデル(MDM)を組み合わせて運動場を生成し、縫合された画像の不規則な境界から幾何学的に修正された中間体へ効果的に遷移する。
論文 参考訳(メタデータ) (2024-03-28T06:22:45Z) - Towards Enhanced Image Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency [78.0488707697235]
ASUKA(Aigned Stable Inpainting with UnKnown Areas)と呼ばれるポストプロセッシングアプローチは、インパインティングモデルを改善する。
Masked Auto-Encoder (MAE) は、オブジェクト幻覚を緩和する。
ローカルタスクとしてラテント・ツー・イメージ・デコーディングを扱う特殊なVAEデコーダ。
論文 参考訳(メタデータ) (2023-12-08T05:08:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。