論文の概要: ProgressNet: Sketching and Prompting with a Frozen Text-to-Image Model
- arxiv url: http://arxiv.org/abs/2610.03512v1
- Date: Fri, 02 Oct 2026 16:05:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.469217
- Title: ProgressNet: Sketching and Prompting with a Frozen Text-to-Image Model
- Title(参考訳): ProgressNet: 凍結したテキスト-画像モデルによるスケッチとプロンプト
- Abstract要約: イメージジェネレータは通常、完了したスケッチを取得し、1回のパスで画像を生成する。
ProgressNetはフリーのフレームワークで、凍結されたテキスト・ツー・イメージのモデルを描画セッションに追従できるようにします。
- 参考スコア(独自算出の注目度): 46.740539029913016
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humans draw progressively: a few strokes, a look at the result, a stroke erased, a prompt revised. Image generators do not work this way. They typically take a finished sketch and produce the image in a single pass, so every edit starts the picture again, and the models that do keep state across turns are driven by text, cannot take a stroke, and are too slow to draw with. We present ProgressNet, a training-free framework that lets a frozen text-to-image model follow a drawing session as it unfolds: strokes are added and erased, the prompt is revised, and the image keeps up at about a second per turn. It needs no new parameters because the frozen model already has what a progressive generator needs, a pathway through which the previous turn can be remembered, layers that can carry appearance forward without freezing structure, and an internal signal of how far to trust an unfinished sketch; three inference-time mechanisms (Previous-Concept Memory, Layer-Selective K/V Injection and Banded Adaptive Control) use each in turn. As a sketch fills in, every existing method degrades, the FID of the FLUX+ControlNet baseline doubling between 10% and 100% completion on FS-COCO, while ProgressNet's barely moves; it maintains strong fidelity and progressive coherence across three sketch domains and is preferred by users over five competitors, most widely on erasure.
- Abstract(参考訳): 数回のストローク、結果を見ること、ストロークを消去すること、即時修正すること。
イメージジェネレータはこのようには機能しない。
通常、完成したスケッチを1枚のパスで生成するので、各編集が再び画像を起動し、ターンをまたいで状態を保つモデルはテキストで駆動され、ストロークを取ることができず、描画が遅すぎる。
ProgressNetはフリーのフレームワークで、フリーのテキスト・ツー・イメージモデルで描画セッションが展開され、ストロークが追加され、削除され、プロンプトが修正され、画像が1ターンに約1秒上昇する。
フリーズモデルには、すでにプログレッシブジェネレータが必要とするもの、前のターンを記憶できるパス、凍結構造なしで外観を前方に運べるレイヤ、未完成のスケッチをどれだけ信頼するかという内部信号、そして3つの推論時メカニズム(Previous-Concept Memory、Layer-Selective K/V Injection、Banded Adaptive Control)が、それぞれに順番に使用されるため、新しいパラメータは必要ない。
スケッチが終わると、既存のすべてのメソッドが劣化し、FLUX+ControlNetベースラインのFIDは、FS-COCOで10%から100%完了する一方、ProgressNetはほとんど動きません。
関連論文リスト
- SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space [9.378039371407114]
我々は、最適輸送(OT)理論とフローマッチングに根ざした、新しい生成フレームワークであるSketchFlowを提案する。
事前学習したCLIPモデルを利用することで、連続写像問題としてクロスモーダルアライメントを定式化する。
実験により、SketchFlowは、視覚的品質と自然な人間の描画スタイルへの固執において、既存のベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-08-21T22:02:23Z) - Imagine Before You Draw: Visual Prompt Engineering for Image Generation [67.81347924426714]
内部フレームワークにシームレスに統合可能なVisual Prompt Engineering (VPE)を提案する。
我々は,クラス条件生成,テキスト・ツー・イメージ生成,画像編集にまたがってVPEを検証する。
その結果, VPEはコンバージェンスを加速し, 天井の質を高め, 内部統合により, 編集保存性を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-06-03T05:01:36Z) - DrawMotion: Generating 3D Human Motions by Freehand Drawing [64.44582376360027]
本稿では,多条件シナリオ用に設計された効率的な拡散ベースのフレームワークであるDrawMotionを紹介する。
我々は,1)フリーハンドドローイング条件,2)マルチコンディション融合,3)トレーニングフリーガイダンスの3つの視点から,きめ細かな動作生成タスクに取り組む。
実験とユーザスタディにより、フリーハンドドローイングアプローチは、イマジネーションに沿った動きを生成すると、ユーザ時間を約46.7%削減することが示された。
論文 参考訳(メタデータ) (2026-05-20T09:43:50Z) - Generating Sketches in a Hierarchical Auto-Regressive Process for Flexible Sketch Drawing Manipulation at Stroke-Level [8.928752302757106]
最近の研究では、ストローク埋め込みの値を条件として編集することで、ストロークレベルのスケッチ特性を制御している。
本稿では,階層的な自動回帰スケッチ生成プロセスを提案する。
露出した編集可能なストローク埋め込みを調整することにより、世代間いつでもストロークレベルのスケッチ描画を操作できる。
論文 参考訳(メタデータ) (2025-11-11T06:40:12Z) - CoProSketch: Controllable and Progressive Sketch Generation with Diffusion Model [18.5540421907361]
スケッチ編集は、絵画アーティストのためのピクセルレベルのRGB画像編集よりも簡単で直感的であるため、芸術作品の基本的な青写真として機能する。
拡散モデルを用いたスケッチ生成のための顕著な制御性と詳細を提供する新しいフレームワークであるCoProSketchを提案する。
実験では、ベースラインよりもセマンティックな一貫性と制御性が向上し、ユーザフィードバックを生成モデルに統合するための実用的なソリューションを提供する。
論文 参考訳(メタデータ) (2025-04-11T05:11:17Z) - SwiftSketch: A Diffusion Model for Image-to-Vector Sketch Generation [57.47730473674261]
我々は,画像条件付きベクトルスケッチ生成モデルであるSwiftSketchを紹介した。
SwiftSketchは、ガウス分布からサンプリングされたストローク制御ポイントを段階的に復調することによって動作する。
ControlSketchは、深度認識制御ネットを通じて正確な空間制御を組み込むことで、SDSベースの技術を強化する方法である。
論文 参考訳(メタデータ) (2025-02-12T18:57:12Z) - T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Generation [56.054622766743414]
本研究では,Sketch-to-Scene (T3-S2S) 生成のためのトレーニング不要トリプルトチューニングを提案する。
プロンプトバランスモジュールによるキーワード表現を強化し、クリティカルなインスタンスが欠落するリスクを低減する。
実験により,既存のスケッチ・ツー・イメージモデルの性能が大幅に向上することが確認された。
論文 参考訳(メタデータ) (2024-12-18T04:01:32Z) - Block and Detail: Scaffolding Sketch-to-Image Generation [65.56590359051634]
アーティストの反復的な洗練プロセスと整合する新しいスケッチ・ツー・イメージ・ツールを提案する。
私たちのツールは、ブロックされたストロークをスケッチして、オブジェクトの配置や形を粗く表現し、詳細なストロークを表現して、形やシルエットを洗練します。
反復過程の任意の点において、そのようなスケッチから高忠実度画像を生成するための2パスアルゴリズムを開発した。
論文 参考訳(メタデータ) (2024-02-28T07:09:31Z) - Character Generation through Self-Supervised Vectorization [9.36599317326032]
画像のストロークレベル表現で動作する描画エージェントを提案する。
描画」判定を行うと、エージェントは、描画すべきストロークを示すプログラムを出力する。
本研究は,3世代全てのタスクと解析タスクについて,成功した結果を示す。
論文 参考訳(メタデータ) (2022-08-03T12:31:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。