論文の概要: RegionCache: Semantic-Aware Region Reuse for Efficient Multi-Turn Image Generation
- arxiv url: http://arxiv.org/abs/2608.29809v1
- Date: Sun, 30 Aug 2026 14:21:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.081751
- Title: RegionCache: Semantic-Aware Region Reuse for Efficient Multi-Turn Image Generation
- Title(参考訳): RegionCache: 効率的なマルチTurn画像生成のためのセマンティック・アウェアなリージョン再利用
- Abstract要約: RegionCacheは、マルチターン画像編集のためのセマンティックな再利用フレームワークである。
異なる領域からの拡散状態を選択的に再利用する。
1.43x--2.55xの画像品質を維持しながら、エンドツーエンドのスピードアップを実現している。
- 参考スコア(独自算出の注目度): 10.261275777311633
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world image generation often involves multi-turn editing, where users iteratively modify small regions while most image content remains unchanged. However, existing diffusion transformer (DiT)-based editing pipelines recompute the entire image at every turn, causing substantial redundant computation. Existing DiT acceleration methods further ignore semantic correspondence across prompts, leading to unnecessary recomputation or unsafe reuse that harms editing quality. To address this, we propose RegionCache, a semantic-aware reuse framework for multi-turn image editing that selectively reuses diffusion states from unchanged regions. RegionCache detects reusable regions through semantic overlap between consecutive prompts and cross-attention localization, and adopts an adaptive reuse schedule based on prompt similarity and contextual consistency. Experiments on PixArt-alpha demonstrate that RegionCache achieves 1.43x--2.55x end-to-end speedup while maintaining comparable image quality. Code is available at https://github.com/hebutBryant/RegionCache.
- Abstract(参考訳): 実世界の画像生成はしばしばマルチターン編集を伴い、ユーザーは小さな領域を反復的に修正するが、ほとんどの画像コンテンツは変わらない。
しかし、既存の拡散変換器(DiT)ベースの編集パイプラインは毎回画像全体を再計算し、かなりの冗長な計算を引き起こす。
既存のDiTアクセラレーションメソッドはさらにプロンプト間のセマンティック対応を無視し、不要な再計算や編集品質を損なうアンセーフな再利用につながる。
そこで本研究では,異なる領域からの拡散状態を選択的に再利用するマルチターン画像編集のためのセマンティック・アウェア・リユース・フレームワークであるRegionalCacheを提案する。
RegionCacheは、連続的なプロンプトと横断的なローカライゼーションのセマンティックオーバーラップを通じて再利用可能なリージョンを検出し、プロンプトの類似性とコンテキスト整合性に基づいて、適応的な再利用スケジュールを採用する。
PixArt-alphaの実験では、RereaCacheは画像品質を同等に保ちながら、1.43x--2.55xのエンドツーエンドのスピードアップを実現している。
コードはhttps://github.com/hebutBryant/RegionCacheで入手できる。
関連論文リスト
- WorldCache: Content-Aware Caching for Accelerated Video World Models [50.7543797435026]
我々はPerception-Constrained Dynamic CaCacheフレームワークであるtextbfWorldCacheを紹介する。
WorldCacheは、機能をいつ、どのように再利用するかを改善します。
PAI-Benchで評価されたCosmos-2.5-2Bでは、WorldCacheはtextbf$2.3times$推論スピードアップを実現し、textbf99.4%のベースライン品質を維持している。
論文 参考訳(メタデータ) (2026-03-23T17:59:54Z) - SpotEdit: Selective Region Editing in Diffusion Transformers [66.44912649206553]
SpotEditは、修正されたリージョンのみを選択的に更新する、トレーニング不要な拡散編集フレームワークである。
不要な計算を削減し、未修正領域で高い忠実性を維持することにより、SpotEditは効率よく正確な画像編集を実現する。
論文 参考訳(メタデータ) (2025-12-26T14:59:41Z) - RegionE: Adaptive Region-Aware Generation for Efficient Image Editing [28.945176886517448]
RegionEは、追加のトレーニングなしでIIEタスクを加速する適応型、リージョン対応の生成フレームワークである。
フレームワークは,1)適応領域分割,2)領域認識生成,3)適応速度劣化キャッシュの3つの主要コンポーネントから構成される。
我々はRereaEをStep1X-Edit、FLUX.1 Kontext、Qwen-Image-Editといった最先端IIEベースモデルに適用した。
論文 参考訳(メタデータ) (2025-10-29T14:58:37Z) - Training-free Geometric Image Editing on Diffusion Models [53.38549950608886]
画像内の物体が再配置、再配向、あるいは再形成されるような幾何学的画像編集の課題に取り組む。
本稿では、オブジェクト変換、ソース領域のインペイント、ターゲット領域の洗練を分離する分離パイプラインを提案する。
塗装と精錬は、トレーニングフリーの拡散アプローチであるFreeFineを使って実装されている。
論文 参考訳(メタデータ) (2025-07-31T07:36:00Z) - EEdit: Rethinking the Spatial and Temporal Redundancy for Efficient Image Editing [47.68813248789496]
本稿では,効率的な画像編集を実現するためのフレームワークであるEEditを提案する。
実験では、幅広い編集タスクのパフォーマンス低下なしに平均2.46ドルの加速を実証している。
論文 参考訳(メタデータ) (2025-03-13T11:26:45Z) - SmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformers [4.7170474122879575]
Diffusion Transformer (DiT)は、画像、ビデオ、音声合成など、様々なタスクのための強力な生成モデルとして登場した。
本稿では,DiTアーキテクチャのモデルに依存しない推論高速化手法であるSmoothCacheを紹介する。
我々の実験は、SmoothCacheが71%のスピードアップを実現し、多様なモダリティをまたいだ生成品質の維持や改善を実現していることを示している。
論文 参考訳(メタデータ) (2024-11-15T16:24:02Z) - FastDrag: Manipulate Anything in One Step [20.494157877241665]
本稿では,FastDragというワンステップのドラッグベースの画像編集手法を導入し,編集プロセスの高速化を図る。
この革新は1段階の遅延セマンティック最適化を実現し、編集速度を大幅に向上させる。
私たちのFastDragはDragBenchデータセットで検証されています。
論文 参考訳(メタデータ) (2024-05-24T17:59:26Z) - Accelerating Text-to-Image Editing via Cache-Enabled Sparse Diffusion
Inference [36.73121523987844]
本稿では,高速画像セマンティック編集 (FISEdit) を導入し,効率的なテキスト・画像編集のためのキャッシュ付きスパース拡散モデル推論エンジンを提案する。
FISEditは、入力テキスト上の小さな変更と出力画像上の影響を受ける領域の間の意味マッピングを使用する。
テキスト編集ステップ毎に、FISEditは影響を受ける画像領域を自動で識別し、キャッシュされた未変更領域の特徴マップを利用して推論プロセスを高速化する。
論文 参考訳(メタデータ) (2023-05-27T09:14:03Z) - Region-Aware Diffusion for Zero-shot Text-driven Image Editing [78.58917623854079]
本稿では,エンティティレベルの画像編集のための領域認識拡散モデル(RDM)を提案する。
画像の忠実度と推論速度のバランスをとるために,集中拡散パイプラインを設計する。
その結果、RDMは、視覚的品質、全体的な調和、非編集領域のコンテンツ保存、テキストイメージのセマンティック一貫性において、従来のアプローチよりも優れていた。
論文 参考訳(メタデータ) (2023-02-23T06:20:29Z) - Zero-shot Image-to-Image Translation [57.46189236379433]
手動のプロンプトを使わずに元の画像を保存できる画像から画像への変換法であるpix2pix-zeroを提案する。
本稿では,拡散過程全体を通して入力画像の相互注意マップを維持することを目的とした,相互注意誘導を提案する。
本手法では,これらの編集のための追加のトレーニングを必要とせず,既存のテキスト・画像拡散モデルを直接使用することができる。
論文 参考訳(メタデータ) (2023-02-06T18:59:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。