論文の概要: Dependency-Aware Discrete Diffusion for Scene Graph Generation
- arxiv url: http://arxiv.org/abs/2605.09065v1
- Date: Sat, 09 May 2026 17:16:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.052238
- Title: Dependency-Aware Discrete Diffusion for Scene Graph Generation
- Title(参考訳): シーングラフ生成のための依存性を考慮した離散拡散
- Authors: Rajalaxmi Rajagopalan, Romit Roy Choudhury,
- Abstract要約: 本稿では,シーングラフ生成のための依存性を考慮した階層的制約付き離散拡散モデルを提案する。
我々のアプローチは、フォワードプロセスとリバースプロセスの間で構造とセマンティクスを分離し、モデルが条件付き依存関係をキャプチャすることを可能にする。
下流画像生成に投入すると,本手法はテキスト・ツー・イメージモデルよりもコンポジションアライメントが向上する。
- 参考スコア(独自算出の注目度): 8.87774679281067
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scene graphs (SGs) represent objects and their relationships as structured graphs, enabling applications in image generation, robotics, and 3D understanding. Recent work suggests that conditioning image generation on scene graphs improves compositional fidelity compared to text-only prompting. However, since users typically provide text rather than structured graphs, a key challenge is to generate scene graphs from natural language. Prior work on discrete diffusion has demonstrated success in generating generic graphs such as molecules and circuits, but fails to account for the hierarchical structure and strong dependencies between objects, edges, and relations in scene graphs. We address this limitation by introducing a dependency-aware, hierarchically constrained discrete diffusion model for scene graph generation. Our approach decouples structure and semantics across the forward and reverse processes, enabling the model to capture conditional dependencies. At inference time, we perform training-free conditioning to sample text-aligned scene graphs. We evaluate our method on standard SG benchmarks and demonstrate improvements over both continuous and discrete graph generation baselines across graph and layout metrics. When fed to downstream image generation, our approach yields improved compositional alignment compared to text-to-image models, particularly in multi-object scenarios.
- Abstract(参考訳): シーングラフ(SG)は、オブジェクトとその関係を構造化グラフとして表現し、画像生成、ロボティクス、三次元理解の応用を可能にする。
近年の研究では、シーングラフのコンディショニング画像生成は、テキストのみのプロンプトに比べて構成の忠実度を向上させることが示唆されている。
しかし、一般的にユーザは構造化グラフではなくテキストを提供するため、自然言語からシーングラフを生成することが重要な課題である。
離散拡散に関する以前の研究は、分子や回路などの一般的なグラフの生成に成功したが、階層構造やオブジェクト、エッジ、シーングラフ間の強い依存を考慮できない。
本稿では,シーングラフ生成のための依存性を考慮した階層的制約付き離散拡散モデルを導入することで,この制限に対処する。
我々のアプローチは、フォワードプロセスとリバースプロセスの間で構造とセマンティクスを分離し、モデルが条件付き依存関係をキャプチャすることを可能にする。
推論時にテキスト整列シーングラフのサンプルに対して,トレーニング不要条件付けを行う。
提案手法を標準SGベンチマークで評価し,グラフおよびレイアウトメトリクス間の連続グラフ生成ベースラインおよび離散グラフ生成ベースラインの改善を示す。
下流画像生成に投入すると、特に多目的シナリオにおいて、テキスト・画像モデルと比較して、コンポジションアライメントが改善される。
関連論文リスト
- From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models [81.92098140232638]
シーングラフ生成(SGG)は、下流の推論タスクのための中間グラフ表現に視覚シーンを解析することを目的としている。
既存の手法は、新しい視覚的関係の概念を持つシーングラフを生成するのに苦労している。
シークエンス生成に基づく新しいオープン語彙SGGフレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-01T04:21:01Z) - Image Synthesis with Graph Conditioning: CLIP-Guided Diffusion Models for Scene Graphs [0.0]
シーングラフから画像を生成する新しい手法を提案する。
トレーニング済みのテキスト・ツー・イメージ拡散モデルとCLIPガイダンスを利用して、グラフ知識を画像に変換する。
実験により,本手法は標準ベンチマークにおける既存手法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2024-01-25T11:46:31Z) - Joint Generative Modeling of Grounded Scene Graphs and Images via Diffusion Models [35.22309759777998]
本稿では,共同シーングラフ(画像生成)のためのフレームワークを提案する。
DiffuseSGは、異種ノードとエッジ属性を共同でモデル化する新しい拡散モデルである。
本モデルは,VGおよびCOCO-Stuffデータセット上でのシーングラフ生成において,既存の手法よりも優れる。
論文 参考訳(メタデータ) (2024-01-02T10:10:29Z) - Diffusion-Based Scene Graph to Image Generation with Masked Contrastive
Pre-Training [112.94542676251133]
画像とのアライメントを直接最適化することで,シーングラフの埋め込みを学習する。
具体的には,シーングラフからグローバル情報とローカル情報の両方を抽出するエンコーダを事前訓練する。
SGDiffと呼ばれる結果の方法は、シーングラフノードと接続を変更することによって生成された画像のセマンティックな操作を可能にする。
論文 参考訳(メタデータ) (2022-11-21T01:11:19Z) - Scene Graph Modification as Incremental Structure Expanding [61.84291817776118]
本研究では,既存のシーングラフを自然言語クエリに基づいて更新する方法を学習するために,シーングラフ修正(SGM)に注目した。
インクリメンタル構造拡張(ISE)の導入によるグラフ拡張タスクとしてのSGM
既存のデータセットよりも複雑なクエリと大きなシーングラフを含む、挑戦的なデータセットを構築します。
論文 参考訳(メタデータ) (2022-09-15T16:26:14Z) - Unconditional Scene Graph Generation [72.53624470737712]
我々はラベル付きおよび有向グラフ上の確率分布を学習できるSceneGraphGenと呼ばれる深層自己回帰モデルを開発した。
SceneGraphGenによって生成されたシーングラフは多様であり、実世界のシーンのセマンティックなパターンに従う。
論文 参考訳(メタデータ) (2021-08-12T17:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。