論文の概要: SceneCraft: Interactive System for Image Editing via Scene Graph
- arxiv url: http://arxiv.org/abs/2606.16103v1
- Date: Mon, 15 Jun 2026 01:34:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.029882
- Title: SceneCraft: Interactive System for Image Editing via Scene Graph
- Title(参考訳): SceneCraft:Scene Graphによる画像編集のためのインタラクティブシステム
- Authors: Duc-Manh Phan, Ngoc-Dai Tran, Duy-Khang Do, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le,
- Abstract要約: SceneCraftは、イメージを編集可能なシーングラフとして表現することで、ユーザの意図とモデル実行をブリッジする、新しいフレームワークである。
テキストのプロンプトを試行錯誤で推測する代わりに、ユーザはビジュアルグラフと直接対話して複雑な空間的およびリレーショナルな操作を行う。
我々は、SceneCraftがより直感的な制御機構を提供し、手動プロンプトエンジニアリングの認知的負担を大幅に軽減することを示した。
- 参考スコア(独自算出の注目度): 17.007784605446716
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent advances in generative AI have enabled natural language-driven image editing, yet existing systems often fail in complex scenes with multiple interacting objects because they rely heavily on users crafting precise text prompts. To address the absence of structured control, we propose SceneCraft, a novel interactive framework that bridges user intent and model execution by representing images as editable scene graphs. Instead of guessing text prompts through trial and error, users interact directly with a visual graph to perform complex spatial and relational operations. These graph modifications are automatically translated into precise, context-aware editing prompts, effectively eliminating linguistic ambiguity. To ensure robust and diverse results, structured prompts are dispatched to multiple state-of-the-art generative models. Evaluations across diverse editing scenarios show that SceneCraft provides a more intuitive control mechanism, significantly reducing the cognitive burden of manual prompt engineering while generating outputs that users consistently rate as higher in quality and fidelity.
- Abstract(参考訳): 生成AIの最近の進歩により、自然言語による画像編集が可能になったが、既存のシステムは複数の対話オブジェクトを持つ複雑なシーンで失敗することが多い。
構造化制御の欠如に対処するため,画像を編集可能なシーングラフとして表現することで,ユーザの意図とモデル実行をブリッジするインタラクティブなフレームワークであるSceneCraftを提案する。
テキストのプロンプトを試行錯誤で推測する代わりに、ユーザはビジュアルグラフと直接対話して複雑な空間的およびリレーショナルな操作を行う。
これらのグラフ修正は、自動的に文脈対応の正確な編集プロンプトに変換され、言語的曖昧さを効果的に排除する。
堅牢で多様な結果を保証するため、構造化されたプロンプトは複数の最先端の生成モデルに送られる。
多様な編集シナリオに対する評価は、SceneCraftがより直感的な制御メカニズムを提供し、手動のプロンプトエンジニアリングの認知的負担を大幅に低減するとともに、ユーザーが品質と忠実さを常に高く評価するアウトプットを生成していることを示している。
関連論文リスト
- Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation [19.404516863003057]
INSETは、テキスト命令内にネイティブ語彙として画像をシームレスに埋め込む統合生成モデルである。
本稿では,標準画像およびビデオデータセットから1500万件の高品質なインターリーブ付きサンプルを合成するスケーラブルなデータエンジンを提案する。
InterleaveBenchの結果は、INSETがマルチイメージの一貫性とテキストアライメントにおいて最先端の手法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-12T15:54:49Z) - ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text [26.951462580463883]
ScribbleEditは、このギャップを埋めるために設計された大規模な合成データセットである。
拡散ベースおよび自己回帰型統合マルチモーダル画像編集モデルの評価と精細化を行う。
実験の結果,市販のモデルでは抽象的なスクリブル入力に苦しむ一方で,合成データセットの微調整により,空間的整合性や意味的整合性のある編集が大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-05-01T22:26:42Z) - Text-Driven Image Editing via Learnable Regions [74.45313434129005]
本研究では,ユーザが提供するマスクやスケッチを必要とせずに,テキストプロンプトによって駆動される領域ベースの画像編集手法を提案する。
この単純なアプローチにより、現在の画像生成モデルと互換性のあるフレキシブルな編集が可能になることを示す。
実験では,提案した言語記述に対応する忠実度とリアリズムの高い画像の操作において,提案手法の競合性能を示す。
論文 参考訳(メタデータ) (2023-11-28T02:27:31Z) - Dynamic Prompt Learning: Addressing Cross-Attention Leakage for
Text-Based Image Editing [23.00202969969574]
そこで本稿では,テキストプロンプト中の名詞の正しい単語に注意を向けるために,クロスアテンションマップを強制する動的プロンプト学習(DPL)を提案する。
本稿では,Word-Swap, Prompt Refinement, Attention Re-weightingの編集結果の改善について述べる。
論文 参考訳(メタデータ) (2023-09-27T13:55:57Z) - Prompt-to-Prompt Image Editing with Cross Attention Control [41.26939787978142]
本稿では,テキストのみによる編集を行う直感的なプロンプト・プロンプト編集フレームワークを提案する。
様々な画像やプロンプトに対して結果を示し、高品質な合成と忠実さを編集されたプロンプトに示す。
論文 参考訳(メタデータ) (2022-08-02T17:55:41Z) - Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors [58.71128866226768]
近年のテキスト・ツー・イメージ生成手法は、生成した画像の忠実度とテキスト関連性を漸進的に改善している。
i)シーンの形式でテキストを補完する単純な制御機構を実現することで,これらのギャップに対処する新しいテキスト・ツー・イメージ手法を提案する。
このモデルにより,512×512ピクセルの解像度で高忠実度画像を生成することができる。
論文 参考訳(メタデータ) (2022-03-24T15:44:50Z) - SGEITL: Scene Graph Enhanced Image-Text Learning for Visual Commonsense
Reasoning [61.57887011165744]
マルチモーダルトランスフォーマーはVisual Commonsense Reasoningのタスクにおいて大きな進歩を遂げた。
視覚的なシーングラフを常識的推論に組み込むためのScene Graph Enhanced Image-Text Learningフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-16T03:16:30Z) - HairCLIP: Design Your Hair by Text and Reference Image [100.85116679883724]
本稿では, 毛髪属性を個別に, 共同で操作できる新しい毛髪編集インタラクションモードを提案する。
画像とテキストの条件を共有埋め込み空間にエンコードし、統一的なヘア編集フレームワークを提案する。
念入りに設計されたネットワーク構造と損失関数により,我々のフレームワークは高品質な毛髪編集を行うことができる。
論文 参考訳(メタデータ) (2021-12-09T18:59:58Z) - Adjusting Image Attributes of Localized Regions with Low-level Dialogue [83.06971746641686]
NLIEの低レベル命令を探索するタスク指向対話システムを開発した。
我々のシステムは、編集操作のレベルに基づいて言語を基盤とし、ユーザーが選択するオプションを提案する。
分析の結果,提案した低レベル言語インタフェースの利用に一般的に適応していることがわかった。
論文 参考訳(メタデータ) (2020-02-11T20:59:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。