論文の概要: PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising
- arxiv url: http://arxiv.org/abs/2606.30968v1
- Date: Mon, 29 Jun 2026 23:09:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.028324
- Title: PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising
- Title(参考訳): PhotoQuilt:Bootstrapped Tiled Denoisingによるトレーニング不要な任意分解型フォトモザイク
- Authors: Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati,
- Abstract要約: PhotoQuiltは、任意の解像度でフォトモザイクを生成する、トレーニング不要のフレームワークである。
我々はまず,低解像度でグローバルな構成を生成し,レイアウトを修正し,遅延空間でスケールアップし,生成能力を回復するためにノイズを再注入する。
固定タイル内でDenoisingが進行するので、それぞれが独自のイメージを形成し、共有グローバル構造がそれらを1つのレイアウトで保持する。
- 参考スコア(独自算出の注目度): 1.5889411586232436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Photomosaics are large images whose local regions are seen as independent tiles while their overall arrangement forms a coherent scene. Generating them at high resolution, with every tile convincing in its own right, is computationally expensive, since the canvas must hold many detailed tiles at once. We present PhotoQuilt, a training-free framework that generates photomosaics at arbitrary resolution. Diffusion models struggle to satisfy both scales at once, as direct high-resolution generation is costly and tends toward one smooth image rather than a mosaic, while patch-based tiling keeps local detail but loses global structure. PhotoQuilt resolves this with a bootstrapped tiled denoising procedure. We first produce a global composition at low resolution to fix the layout, then upscale it in latent space and re-inject noise to restore generative capacity. Denoising proceeds within fixed tiles, so each forms its own image while the shared global structure holds them in one layout. Because tile generation is handled separately, PhotoQuilt scales to large canvases without quadratic attention cost. Experiments show that PhotoQuilt outperforms current baselines on both global structure and local realism.
- Abstract(参考訳): 光モザイク(英: Photomosaics)は、地域が独立したタイルと見なされる大きな画像である。
それらを高解像度で生成し、すべてのタイルをそれ自身で納得させることができ、キャンバスは多数の詳細なタイルを同時に保持しなければならないため、計算コストがかかる。
任意の解像度でフォトモザイクを生成する訓練不要のフレームワークであるPhotoQuiltを提案する。
拡散モデルは両方のスケールを同時に満たすのに苦労するが、直接高解像度生成はコストが高く、モザイクではなく1つのスムーズなイメージに傾向があり、パッチベースのタイリングは局所的な詳細を維持するが、グローバルな構造を失う。
PhotoQuiltは、ブートストラップ付きタイル付き装飾手順でこれを解決している。
我々はまず,低解像度でグローバルな構成を生成し,レイアウトを修正し,遅延空間でスケールアップし,生成能力を回復するためにノイズを再注入する。
固定タイル内でDenoisingが進行するので、それぞれが独自のイメージを形成し、共有グローバル構造がそれらを1つのレイアウトで保持する。
タイル生成は別々に処理されるため、PhotoQuiltは二次的な注意を払わずに大きなキャンバスにスケールする。
実験により、PhotoQuiltは、グローバル構造と局所リアリズムの両方において、現在のベースラインを上回っていることが示された。
関連論文リスト
- FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion [46.49480145234397]
本稿ではFrescoDiffusionについて紹介する。FrescoDiffusionは1つの画像からコヒーレントな大フォーマットI2V生成のためのトレーニング不要な手法である。
4K 生成では,タイルごとの雑音予測を計算し,この基準を拡散時間毎にフューズする。
VBench-I2Vデータセットと提案したフレスコI2Vデータセットの実験により,タイル付きベースラインに対するグローバルな一貫性と忠実度が改善された。
論文 参考訳(メタデータ) (2026-03-18T10:02:37Z) - PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement [52.21370023312275]
PixPerfectは、さまざまなLCMアーキテクチャやタスクにまたがるシームレスで高忠実なローカル編集を提供するピクセルレベルの精細化フレームワークである。
インペイント、オブジェクト除去、挿入ベンチマークの実験により、PixPerfectは知覚の忠実度と下流編集性能を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2025-12-02T21:35:57Z) - RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization [50.75654397516163]
様々な解像度とモダリティに対応する統一フレームワークであるRelayFormerを提案する。
RelayFormerは、入力を固定サイズのサブイメージに分割し、Global-Local Relay(GLR)トークンを導入する。
これにより、セマンティックや時間的一貫性などのグローバルなキューを効率よく交換でき、きめ細かいアーティファクトを保存できる。
論文 参考訳(メタデータ) (2025-08-13T03:35:28Z) - GLoD: Composing Global Contexts and Local Details in Image Generation [0.0]
Global-Local Diffusion (textitGLoD)は、グローバルコンテキストとローカル詳細の同時制御を可能にする新しいフレームワークである。
複数のグローバルなプロンプトとローカルなプロンプトを対応するレイヤに割り当て、ノイズを発生させるプロセスのガイドとして構成する。
本フレームワークは,グローバルなプロンプト内のオブジェクトをローカルなプロンプトで条件付けし,他の未特定なアイデンティティを保存しながら,複雑なグローバルなローカルなコンポジションを実現する。
論文 参考訳(メタデータ) (2024-04-23T18:39:57Z) - Learning Enriched Features via Selective State Spaces Model for Efficient Image Deblurring [0.0]
Image Deblurringは、高品質な画像を、それに対応するぼやけた画像から復元することを目的としている。
本稿では、選択状態空間モデルを利用して、リッチで正確な特徴を集約する効率的な画像デブロアリングネットワークを提案する。
実験により,提案手法は広く用いられているベンチマークにおいて,最先端の手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2024-03-29T10:40:41Z) - Exposure Bracketing Is All You Need For A High-Quality Image [50.822601495422916]
マルチ露光画像は、デノイング、デブロアリング、高ダイナミックレンジイメージング、超解像において相補的である。
本研究では,これらの課題を組み合わせ,高品質な画像を得るために露光ブラケット写真を活用することを提案する。
特に時間変調リカレントネットワーク(TMRNet)と自己教師あり適応手法を提案する。
論文 参考訳(メタデータ) (2024-01-01T14:14:35Z) - Any-resolution Training for High-resolution Image Synthesis [55.19874755679901]
生成モデルは、様々な大きさの自然画像であっても、一定の解像度で動作します。
すべてのピクセルが重要であり、そのネイティブ解像度で収集された可変サイズのイメージを持つデータセットを作成する、と我々は主張する。
ランダムなスケールでパッチをサンプリングし、可変出力解像度で新しいジェネレータを訓練するプロセスである。
論文 参考訳(メタデータ) (2022-04-14T17:59:31Z) - InfinityGAN: Towards Infinite-Resolution Image Synthesis [92.40782797030977]
任意の解像度画像を生成するinfinityganを提案する。
少ない計算資源でパッチバイパッチをシームレスに訓練し、推論する方法を示す。
論文 参考訳(メタデータ) (2021-04-08T17:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。