論文の概要: Does Attention-Guided Masking Really Help Object Discovery in Object-Centric Learning?
- arxiv url: http://arxiv.org/abs/2609.15187v2
- Date: Mon, 21 Sep 2026 10:46:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.349188
- Title: Does Attention-Guided Masking Really Help Object Discovery in Object-Centric Learning?
- Title(参考訳): 注意誘導型マスキングは、オブジェクト中心学習におけるオブジェクト発見に本当に役立つか?
- Abstract要約: オブジェクト中心学習(OCL)は、人間のアノテーションなしで画像をオブジェクトに分解することを目的としている。
我々は、より優れたイメージパッチマスキング戦略、すなわち注意誘導マスキング(AGM)を開発する。
- 参考スコア(独自算出の注目度): 33.761120582273556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Object-Centric Learning (OCL) aims to decompose images into objects without human annotations. A major family of mainstream methods uses Slot Attention to aggregate image features into object-level representations and then from them reconstructs masked image content, i.e., Random Masking (RM), to provide self-supervision. The recent method DIAS simply masks image patches at uniform randomness yet achieves competitive object discovery accuracy. Since attention during aggregation already possesses object discovery ability, we explore using it to develop a better image patch masking strategy, i.e., Attention Guided Masking (AGM), thereby providing better self-supervision. Results on six recognized datasets show that AGM does not always outperform RM. Under unconditional slot initialization, AGM substantially improves background segmentation on datasets with realistic textures (COCO and VOC); Regardless of conditional or unconditional slot initialization and across datasets, foreground object discovery remains comparable or decreases. We suggest peer researchers in the OCL community that attempts to exploit internal attention semantics to improve OCL with masked decoding are risky. Our source code, model checkpoints and evaluation logs is available on https://github.com/und-entropy/Does-Attention-Guided-Masking-Really-Help-Object-Discovery-in-Object- Centric-Learning-.
- Abstract(参考訳): オブジェクト中心学習(OCL)は、人間のアノテーションなしで画像をオブジェクトに分解することを目的としている。
主流手法の主要なファミリーでは、Slot Attention を用いて画像の特徴をオブジェクトレベルの表現に集約し、そこからマスクされた画像、すなわちランダム・マスキング(RM)を再構成して自己監督する。
最近のDIAS法は、画像パッチを均一なランダム性でマスクするが、競合する物体発見精度を実現する。
集約中の注意はすでに対象発見能力を持っているため、より優れたイメージパッチマスキング戦略、すなわち注意誘導マスキング(AGM)を開発するためにそれを用いて、より良い自己監督を提供する。
6つの認識されたデータセットの結果は、AGMがRMを常に上回るとは限らないことを示している。
非条件スロット初期化の下では、AGMは現実的なテクスチャを持つデータセット(COCOとVOC)の背景セグメンテーションを大幅に改善する。
OCLコミュニティの研究者は、内部の注意セマンティクスを活用して、マスク付き復号法でOCLを改善することは危険であると考えている。
ソースコード、モデルチェックポイント、評価ログはhttps://github.com/und-entropy/Does-Attention-Guided-Really-Help-Object-Discovery-in-Object-Centric- Learning-で公開されています。
関連論文リスト
- Beyond Single Images: Retrieval Self-Augmented Unsupervised Camouflaged Object Detection [18.382178646073474]
RISEは、トレーニングデータセット全体を利用して、単一画像のための擬似ラベルを生成するパラダイムである。
アノテーションを使わずにトレーニング画像のみを使用することは、高品質なプロトタイプライブラリ構築において顕著な課題である、と認識することが重要である。
KNN検索の段階では,特徴マップにおけるアーティファクトの影響を軽減するために,マルチビューKNN検索を提案する。
論文 参考訳(メタデータ) (2025-10-21T09:12:26Z) - Are We Done with Object-Centric Learning? [65.67948794110212]
オブジェクト中心学習(OCL)は、シーン内の他のオブジェクトやバックグラウンドキューから分離されたオブジェクトのみをエンコードする表現を学習しようとする。
最近のサンプル効率のセグメンテーションモデルでは、ピクセル空間内のオブジェクトを分離し、それらを独立に符号化することができる。
我々は,OCLのレンズを通した背景刺激によるOOD一般化の課題に対処する。
論文 参考訳(メタデータ) (2025-04-09T17:59:05Z) - Gaussian Masked Autoencoders [74.2341070024126]
本稿では,Masked Autoencoders (MAE) をガウススプラッティングで探索する。
GMAE(Gaussian Masked Autoencoder)と呼ばれる我々のアプローチは,意味論的抽象化と空間的理解を共同で学習することを目的としている。
論文 参考訳(メタデータ) (2025-01-06T18:59:57Z) - LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion [79.22197702626542]
本稿では, 乱れ場面におけるロボットグルーピングのためのアモーダルセグメンテーションを探求する枠組みを提案する。
線形融合注意誘導畳み込みネットワーク(LAC-Net)を提案する。
その結果,本手法が最先端の性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2024-08-06T14:50:48Z) - Masked Multi-Query Slot Attention for Unsupervised Object Discovery [7.613552182035413]
本研究では,DINO ViTの特徴をスロットと呼ばれる一連の表現によって再構成するオブジェクト中心のアプローチについて考察する。
本稿では,背景領域を無視した入力特徴のマスキング手法を提案する。
実験結果とPASCAL-VOC 2012データセットの短縮は、各コンポーネントの重要性を示し、それらの組み合わせがオブジェクトのローカライゼーションを継続的に改善することを示す。
論文 参考訳(メタデータ) (2024-04-30T15:51:05Z) - Monocular Per-Object Distance Estimation with Masked Object Modeling [33.59920084936913]
本稿では、Masked Image Modeling (MiM) からインスピレーションを得て、マルチオブジェクトタスクに拡張する。
Masked Object Modeling (MoM) と呼ばれる我々の戦略は、マスキング技術の新しい応用を可能にする。
我々は、標準KITTI、NuScenes、MOT Synthデータセット上の新しい参照アーキテクチャ(DistFormer)におけるMoMの有効性を評価する。
論文 参考訳(メタデータ) (2024-01-06T10:56:36Z) - Improving Masked Autoencoders by Learning Where to Mask [65.89510231743692]
マスケ画像モデリングは視覚データに対する有望な自己教師型学習手法である。
本稿では,Gumbel-Softmax を用いて,対向学習マスク生成装置とマスク誘導画像モデリングプロセスとを相互接続するフレームワーク AutoMAE を提案する。
実験の結果,AutoMAEは,標準の自己監督型ベンチマークや下流タスクに対して,効果的な事前学習モデルを提供することがわかった。
論文 参考訳(メタデータ) (2023-03-12T05:28:55Z) - Exploring the Coordination of Frequency and Attention in Masked Image Modeling [28.418445136155512]
Masked Image Modeling (MIM) はコンピュータビジョンにおける自己教師型学習を支配している。
本稿では,周波数・注意駆動型マスキング・スローング戦略 (FAMT) を提案する。
FAMTはプラグイン・アンド・プレイモジュールとしてシームレスに統合することができ、以前の作業を超えている。
論文 参考訳(メタデータ) (2022-11-28T14:38:19Z) - Discovering Object Masks with Transformers for Unsupervised Semantic
Segmentation [75.00151934315967]
MaskDistillは教師なしセマンティックセグメンテーションのための新しいフレームワークである。
我々のフレームワークは、低レベルの画像キューにラッチを付けず、オブジェクト中心のデータセットに限らない。
論文 参考訳(メタデータ) (2022-06-13T17:59:43Z) - Learning to Detect Every Thing in an Open World [139.78830329914135]
我々は、Learning to Detect Every Thing (LDET)と呼ぶ、シンプルながら驚くほど強力なデータ拡張とトレーニングスキームを提案する。
可視だがラベル付けされていない背景オブジェクトの隠蔽を避けるため、元の画像の小さな領域から採取した背景画像上に注釈付きオブジェクトを貼り付ける。
LDETは、オープンワールドのインスタンスセグメンテーションタスクにおいて、多くのデータセットに大きな改善をもたらす。
論文 参考訳(メタデータ) (2021-12-03T03:56:06Z) - Object-Aware Cropping for Self-Supervised Learning [21.79324121283122]
本研究では,通常のランダムな作付けに基づく自己教師型学習が,このようなデータセットでは不十分であることを示す。
対象提案アルゴリズムから得られた作物を、ランダムな作物の一方または両方に置き換えることを提案する。
オブジェクト認識トリミング(object-aware cropping)と呼ぶこのアプローチを用いることで、分類とオブジェクト検出ベンチマークにおいてシーントリミングよりも大幅に改善される。
論文 参考訳(メタデータ) (2021-12-01T07:23:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。