論文の概要: Self-supervised Automatic Matting
- arxiv url: http://arxiv.org/abs/2607.10395v1
- Date: Sat, 11 Jul 2026 16:51:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.421503
- Title: Self-supervised Automatic Matting
- Title(参考訳): 自己教師型自動マッチング
- Abstract要約: 高品質のアルファマットはアノテートするのに費用がかかることで知られており、ディープ・イメージ・マッティングの基本的なデータボトルネックを生み出している。
SSMatteは、完全に教師付き自動マッチングと同等のパフォーマンスを実現する自己教師型フレームワークである。
私たちの研究は、自動マッティングを、新しく完全にアノテーションのないパラダイムに推し進めています。
- 参考スコア(独自算出の注目度): 9.945819717717447
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality alpha mattes are notoriously expensive to annotate, creating a fundamental data bottleneck for deep image matting. While prior work attempts to reduce annotation cost using coarser labels like trimaps or masks, they remain reliant on costly per-pixel supervision, limiting scalability and generalization. In this work, we push the boundary further and ask: can we train an automatic matting model using only RGB images, with no manual annotation at all? We answer this by presenting SSMatte, a self-supervised framework that for the first time achieves performance on par with fully-supervised automatic matting. Our key insight is to decompose the problem into semantic anchoring and detail matting. SSMatte first generates a semantic matting prompt from frozen self-supervised ViT features by propagating class-token seeds via a novel, training-efficient semantic anchoring loss based on a generalized Rayleigh quotient. This prompt then anchors a detail matting network, which is optimized via a fixed-point-based loss that enforces alpha-RGB consistency. Extensive experiments show SSMatte outperforms prior weakly-supervised methods, matches the performance of fully-supervised models on portrait benchmarks, and demonstrates favorable scaling and generalization behaviors with additional data. Our work pushes automatic matting to an fresh, fully annotation-free paradigm. Code will be available.
- Abstract(参考訳): 高品質のアルファマットはアノテートするのに費用がかかることで知られており、ディープ・イメージ・マッティングの基本的なデータボトルネックを生み出している。
以前の作業では、トリマップやマスクのような粗いラベルを使ってアノテーションのコストを削減しようとしたが、コストのかかる1ピクセルあたりの監視、スケーラビリティの制限、一般化に依存していた。
この作業では,境界をさらに推し進めて,手動のアノテーションを使わずに,RGBイメージのみを使用して自動マッチングモデルをトレーニングすることができますか?
SSMatteは、完全に教師された自動マッチングと同等のパフォーマンスを初めて達成するセルフ教師付きフレームワークである。
私たちの重要な洞察は、問題をセマンティックアンカリングと詳細マッチングに分解することです。
SSMatteは、まず、一般化されたレイリー商法に基づく訓練効率の良いセマンティックアンカリング損失を通じて、クラストーケン種を伝播することにより、凍結した自己制御型ViT特徴からセマンティック・マッティング・プロンプトを生成する。
このプロンプトは、アルファ-RGBの一貫性を強制する固定ポイントベースの損失によって最適化される詳細マッチングネットワークをアンロックする。
大規模な実験では、SSMatteは弱教師付き手法よりも優れており、ポートレートベンチマークで完全に教師付きモデルのパフォーマンスと一致しており、さらなるデータによるスケーリングと一般化の挙動が好ましい。
私たちの研究は、自動マッティングを、新しく完全にアノテーションのないパラダイムに押し付けます。
コードは利用可能です。
関連論文リスト
- Learning Accurate Segmentation Purely from Self-Supervision [87.78965637247107]
Selfmentは完全に自己管理型のフレームワークで、人間のラベルなしでオブジェクトを生画像から直接分割する。
Selfmentは、複数のベンチマークで新しい最先端(SoTA)結果を設定する。
論文 参考訳(メタデータ) (2026-02-27T07:36:32Z) - Towards Label-Efficient Human Matting: A Simple Baseline for Weakly Semi-Supervised Trimap-Free Human Matting [50.99997483069828]
我々は、新しい学習パラダイム、弱半教師付きヒトマット(WSSHM)を導入する。
WSSHMは、少量の高価なマットラベルと大量の予算に優しいセグメンテーションラベルを使用して、アノテーションのコストを節約し、ドメインの一般化問題を解決する。
また, 実時間モデルにも容易に適用でき, ブレークネック推論速度で競合精度を達成できる。
論文 参考訳(メタデータ) (2024-04-01T04:53:06Z) - In-Context Matting [16.345261293801965]
In-context matting, a novel task set of image mattingを紹介する。
In-context mattingは、同じフォアグラウンドカテゴリのターゲット画像のバッチに対する自動アルファ推定を可能にする。
IconMattingは、事前訓練されたテキスト-画像拡散モデルに基づいて構築されたコンテキスト内マッチングモデルである。
論文 参考訳(メタデータ) (2024-03-23T10:32:29Z) - Disentangled Pre-training for Image Matting [74.10407744483526]
画像マッチングは、深層モデルのトレーニングをサポートするために高品質なピクセルレベルの人間のアノテーションを必要とする。
本研究では、無限個のデータを活用する自己教師付き事前学習手法を提案し、マッチング性能を向上する。
論文 参考訳(メタデータ) (2023-04-03T08:16:02Z) - GD-MAE: Generative Decoder for MAE Pre-training on LiDAR Point Clouds [72.60362979456035]
Masked Autoencoders (MAE)は、大規模な3Dポイントクラウドでの探索が難しい。
我々は,周囲のコンテキストを自動的にマージするためのtextbfGenerative textbfDecoder for MAE (GD-MAE)を提案する。
提案手法の有効性を, KITTI と ONCE の2つの大規模ベンチマークで実証した。
論文 参考訳(メタデータ) (2022-12-06T14:32:55Z) - MAPLE: Masked Pseudo-Labeling autoEncoder for Semi-supervised Point
Cloud Action Recognition [160.49403075559158]
本稿では,Pseudo-Labeling autoEncoder (textbfMAPLE) フレームワークを提案する。
特に、MAPLEのバックボーンとして、新規で効率的なtextbfDecoupled textbfspatial-textbftemporal TranstextbfFormer(textbfDestFormer)を設計する。
MAPLEは3つの公開ベンチマークにおいて優れた結果を得て、MSR-Action3の精度を8.08%向上させる。
論文 参考訳(メタデータ) (2022-09-01T12:32:40Z) - Simplicial Embeddings in Self-Supervised Learning and Downstream
Classification [17.38535641404417]
自己教師付きモデルの符号化表現を、それぞれ$V$の単純さに制限する方法として、Simplicial Embeddings (SEM)を導入します。
SEMは、CIFAR-100やImageNetのような自然画像データセットの一般化を大幅に改善した。
論文 参考訳(メタデータ) (2022-04-01T17:59:40Z) - Deep Automatic Natural Image Matting [82.56853587380168]
自動画像マッチング(AIM)とは、任意の自然画像からソフトフォアグラウンドをトリマップのような補助的な入力なしで推定することである。
本稿では,これらの画像の一般化されたトリマップを統一的な意味表現として予測できる,新しいエンドツーエンドマッチングネットワークを提案する。
我々のネットワークは、利用可能な合成マッチングデータセットをトレーニングし、既存の手法を客観的にも主観的にも優れています。
論文 参考訳(メタデータ) (2021-07-15T10:29:01Z) - Mask Guided Matting via Progressive Refinement Network [40.7044070641012]
mask guided (mg) mattingは一般的な粗いマスクを指導する堅牢なマットリングフレームワークである。
PRNはトリマップや低品質のアルファマットのような見えない種類の誘導マスクに一般化可能であることを示す。
我々はデータセット問題に対処するために驚くほど簡単な改善を提案する。
論文 参考訳(メタデータ) (2020-12-12T04:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。