論文の概要: Learning to Generate Multiple Objects from Dense and Occluded Layouts
- arxiv url: http://arxiv.org/abs/2607.03488v1
- Date: Fri, 03 Jul 2026 16:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.632133
- Title: Learning to Generate Multiple Objects from Dense and Occluded Layouts
- Title(参考訳): 難易度と難易度から複数の物体を生成する学習
- Authors: Bach-Hoang Ngo, Si-Tri Ngo, Hieu Le, Trung-Nghia Le,
- Abstract要約: 密集したシーンでは、重なり合うインスタンスは、視覚的に可視であるように見えるにもかかわらず、区別できない構造に崩壊する。
本研究は,領域依存型グループ化に向けたトークン相互作用をソフトにバイアスする,レイアウト対応型アテンションバイアスを通じてこの問題に対処する。
本手法は,画像品質を保ちながら,カウント精度を大幅に向上し,インスタンスのマージを防止する。
- 参考スコア(独自算出の注目度): 8.60490943852385
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Text-to-image diffusion models fail to generate correct object counts in dense scenes, where overlapping instances collapse into indistinguishable structures despite appearing visually plausible. We identify this as instance ownership collapse: tokens from overlapping objects interact freely through attention, while heavily occluded instances receive weak supervision due to their small visible areas. We address this through layout-aware attention biases that softly bias token interactions toward region-consistent grouping and suppress cross-instance leakage, paired with an amodal-balanced loss that amplifies gradients for occluded objects based on their occlusion level. To enable systematic evaluation, we introduce OverlapDepth-45K, a benchmark of densely overlapping scenes with amodal supervision. Our approach substantially improves count accuracy and prevents instance merging while preserving image quality. Project page: https://bachngoh.github.io/AIBL
- Abstract(参考訳): テキストと画像の拡散モデルは、密集したシーンで正しいオブジェクト数を生成できない。
重複するオブジェクトからのトークンは、注意を通して自由に相互作用する一方、非常に隠蔽されたインスタンスは、小さな可視領域のために弱い監督を受けます。
本研究は,領域一貫性を有するグループに対してトークンの相互作用をソフトにバイアスするレイアウト認識型アテンションバイアスと,その閉塞レベルに基づいて隠蔽対象の勾配を増幅するアモーダルバランス損失とを併用したクロスインスタンスリークを抑制することを通して,この問題に対処する。
オーバラップDepth-45K(オーバラップDepth-45K)は,アモーダル監督を伴う重重重重畳されたシーンのベンチマークである。
本手法は,画像品質を保ちながら,カウント精度を大幅に向上し,インスタンスのマージを防止する。
プロジェクトページ:https://bachngoh.github.io/AIBL
関連論文リスト
- OcclusionFormer: Arranging Z-Order for Layout-Grounded Image Generation [49.49933361280724]
OcclusionFormerは、インスタンスを分離することで、Zオーダーの優先順位を明示的にモデル化する新しいフレームワークです。
また、個別のインスタンスを明示的に監視し、セマンティックな一貫性を高めるクエリアライメント損失を導入します。
提案手法は,重なり合う領域の曖昧さを効果的に低減し,正しい閉塞依存性を強制し,構造的整合性を保ち,様々な場面で精度の高い向上をもたらす。
論文 参考訳(メタデータ) (2026-05-20T16:10:44Z) - Semantic Concentration for Self-Supervised Dense Representations Learning [103.10708947415092]
イメージレベルの自己教師型学習(SSL)は大きな進歩を遂げているが、パッチの密度の高い表現を学ぶことは依然として難しい。
この研究は、画像レベルのSSLが暗黙のセマンティックな集中を伴って過分散を避けることを明らかにしている。
論文 参考訳(メタデータ) (2025-09-11T13:12:10Z) - TRACE: Your Diffusion Model is Secretly an Instance Edge Detector [45.119480971518946]
本稿では,テキストと画像の拡散モデルが秘密裏にインスタンスエッジアノテータとして機能していることを示し,TRACEを提案する。
TRACEは、オブジェクト境界が最初に自己アテンションマップに現れるインスタンスエネルジェンスポイント(IEP)を特定し、アテンション境界分割(ABDiv)を通して境界を抽出し、それらを軽量のワンステップエッジデコーダに蒸留する。
COCOベンチマークでは、TRACEは教師なしのインスタンスセグメンテーションを+5.1 APで改善し、タグ付きパノスコープセグメンテーションでは、インスタンスレベルのラベルを使わずに、ポイント付きベースラインを+1.7 PQで上回る。
論文 参考訳(メタデータ) (2025-03-11T02:34:33Z) - HEAP: Unsupervised Object Discovery and Localization with Contrastive
Grouping [29.678756772610797]
教師なしオブジェクトの発見と位置決めは、監督なしで画像内のオブジェクトを検出し、セグメント化することを目的としている。
近年の取り組みは、自己監督型トランスフォーマー機能を利用して、有能な前景物体を識別する顕著な可能性を実証している。
これらの問題に対処するために、Herarchical mErging framework via contrAstive grouPing (HEAP) を紹介する。
論文 参考訳(メタデータ) (2023-12-29T06:46:37Z) - ZoomNeXt: A Unified Collaborative Pyramid Network for Camouflaged Object Detection [70.11264880907652]
最近のオブジェクト(COD)は、現実のシナリオでは極めて複雑で難しい、視覚的にブレンドされたオブジェクトを周囲に分割しようと試みている。
本研究では,不明瞭な画像を観察したり,ズームインしたりアウトしたりする際の人間の行動を模倣する,効果的な統合協調ピラミッドネットワークを提案する。
我々のフレームワークは、画像とビデオのCODベンチマークにおいて、既存の最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2023-10-31T06:11:23Z) - Discriminator-Free Generative Adversarial Attack [87.71852388383242]
生成的ベースの敵攻撃は、この制限を取り除くことができる。
ASymmetric Saliency-based Auto-Encoder (SSAE) は摂動を生成する。
SSAEが生成した敵の例は、広く使われているモデルを崩壊させるだけでなく、優れた視覚的品質を実現する。
論文 参考訳(メタデータ) (2021-07-20T01:55:21Z) - Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers [72.38919601150175]
高オーバーラップオブジェクトをセグメント化するBilayer Convolutional Network (BCNet)を提案する。
BCNetはオクルージョンオブジェクト(Occluder)を検出し、ボトムGCN層は部分的にOccludedインスタンス(Occludee)を推論する
論文 参考訳(メタデータ) (2021-03-23T06:25:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。