論文の概要: A Backbone Benchmarking Study on Self-supervised Learning as a Auxiliary Task with Texture-based Local Descriptors for Face Analysis
- arxiv url: http://arxiv.org/abs/2603.22190v1
- Date: Mon, 23 Mar 2026 16:49:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.796147
- Title: A Backbone Benchmarking Study on Self-supervised Learning as a Auxiliary Task with Texture-based Local Descriptors for Face Analysis
- Title(参考訳): 顔分析のためのテクスチャベースのローカル記述子を用いた補助課題としての自己教師型学習のベンチマーク
- Authors: Shukesh Reddy, Abhijit Das,
- Abstract要約: 我々は、異なるバックボーンをベンチマークし、補助的なタスクとして自己教師付き学習(SSL)への影響について研究する。
我々は,Masked Auto-Encoder (MAE) のSSLタスクを補助目的として,浅部から深部まで異なるバックボーンを用いている。
様々な顔分析パラダイムにおける特徴表現品質と一般化能力の整合性のために、統一されたバックボーンは存在しない。
- 参考スコア(独自算出の注目度): 1.9269756235105742
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we benchmark with different backbones and study their impact for self-supervised learning (SSL) as an auxiliary task to blend texture-based local descriptors into feature modelling for efficient face analysis. It is established in previous work that combining a primary task and a self-supervised auxiliary task enables more robust and discriminative representation learning. We employed different shallow to deep backbones for the SSL task of Masked Auto-Encoder (MAE) as an auxiliary objective to reconstruct texture features such as local patterns alongside the primary task in local pattern SSAT (L-SSAT), ensuring robust and unbiased face analysis. To expand the benchmark, we conducted a comprehensive comparative analysis across multiple model configurations within the proposed framework. To this end, we address the three research questions: "What is the role of the backbone in performance L-SSAT?", "What type of backbone is effective for different face analysis tasks?", and "Is there any generalized backbone for effective face analysis with L-SSAT?". Towards answering these questions, we provide a detailed study and experiments. The performance evaluation demonstrates that the backbone for the proposed method is highly dependent on the downstream task, achieving average accuracies of 0.94 on FaceForensics++, 0.87 on CelebA, and 0.88 on AffectNet. For consistency of feature representation quality and generalisation capability across various face analysis paradigms, including face attribute prediction, emotion classification, and deepfake detection, there is no unified backbone.
- Abstract(参考訳): 本研究では,テクスチャベースの局所記述子を特徴モデリングにブレンドして,効率的な顔分析を行うための補助タスクとして,異なるバックボーンを用いてベンチマークを行い,自己教師付き学習(SSL)への影響について検討する。
主課題と自己監督的補助課題を組み合わせることで、より堅牢で差別的な表現学習が可能になることが過去の研究で確立された。
マスク付きオートエンコーダ (MAE) のSSLタスクには, 局所パターンSSAT (L-SSAT) に付随する局所パターンなどのテクスチャ特徴を再構築する補助的目的として, 浅部から深部へのバックボーンを用いた。
ベンチマークを拡大するために、提案フレームワーク内の複数のモデル構成について包括的な比較分析を行った。
この目的のために,「パフォーマンスL-SSATにおけるバックボーンの役割は何か」,「異なる顔分析タスクにどのようなバックボーンが有効か」,「L-SSATを用いた効果的な顔分析のための一般化されたバックボーンはあるのか」という3つの研究課題に対処する。
これらの疑問に答えるために、我々は詳細な研究と実験を行った。
性能評価の結果,提案手法のバックボーンは下流タスクに大きく依存しており,FaceForensics++では0.94,CelebAでは0.87,AffectNetでは0.88であった。
顔属性予測、感情分類、ディープフェイク検出など、さまざまな顔分析パラダイムにおける特徴表現品質と一般化能力の整合性については、統一されたバックボーンは存在しない。
関連論文リスト
- Self-supervised Auxiliary Learning for Texture and Model-based Hybrid Robust and Fair Featuring in Face Analysis [7.479920049311377]
我々は、テクスチャベースのローカル記述子を特徴モデリングにブレンドし、効率的な顔分析を行うための補助的なタスクとして、自己教師あり学習(SSL)を探求する。
マスクオートエンコーダ(MAE)のSSLタスクを,局所パターンなどのテクスチャの特徴を再構築する補助タスクとして使用した。
論文 参考訳(メタデータ) (2024-09-29T07:03:05Z) - Deep Content Understanding Toward Entity and Aspect Target Sentiment Analysis on Foundation Models [0.8602553195689513]
Entity-Aspect Sentiment Triplet extract (EASTE)は、Aspect-Based Sentiment Analysisタスクである。
本研究は,EASTEタスクにおける高性能化を目標とし,モデルサイズ,タイプ,適応技術がタスクパフォーマンスに与える影響について検討する。
最終的には、複雑な感情分析における詳細な洞察と最先端の成果を提供する。
論文 参考訳(メタデータ) (2024-07-04T16:48:14Z) - Task-adaptive Q-Face [75.15668556061772]
本稿では,タスク適応型マルチタスク顔分析手法Q-Faceを提案する。
Q-Faceは統合されたモデルで複数の顔分析タスクを同時に実行する。
本手法は,顔表情認識,行動単位検出,顔属性分析,年齢推定,顔ポーズ推定における最先端性能を実現する。
論文 参考訳(メタデータ) (2024-05-15T03:13:11Z) - FaceXFormer: A Unified Transformer for Facial Analysis [59.94066615853198]
FaceXFormerは10の顔分析タスクを実行することができるエンドツーエンドの統一トランスフォーマーモデルである。
タスクには、顔解析、ランドマーク検出、ヘッドポーズ推定、属性予測、年齢、性別、人種推定が含まれる。
私たちは、FaceXFormerを10種類の多様な顔認識データセットでトレーニングし、特殊モデルとマルチタスクモデルの両方に対して評価する。
論文 参考訳(メタデータ) (2024-03-19T17:58:04Z) - Faceptor: A Generalist Model for Face Perception [52.8066001012464]
Faceptorは、よく設計されたシングルエンコーダのデュアルデコーダアーキテクチャを採用するために提案されている。
Faceptorへのレイヤアテンションにより、モデルが最適なレイヤから機能を適応的に選択して、望ましいタスクを実行することができる。
我々のトレーニングフレームワークは補助的な教師付き学習にも適用でき、年齢推定や表現認識といったデータスパースタスクの性能を大幅に向上させることができる。
論文 参考訳(メタデータ) (2024-03-14T15:42:31Z) - Masked Momentum Contrastive Learning for Zero-shot Semantic
Understanding [39.424931953675994]
自己教師付き事前学習(SSP)は、ラベル付きデータなしで有意義な特徴表現を抽出できる機械学習の一般的な手法として登場した。
本研究は、コンピュータビジョンタスクにおける純粋な自己教師付き学習(SSL)技術の有効性を評価する。
論文 参考訳(メタデータ) (2023-08-22T13:55:57Z) - A Practical Contrastive Learning Framework for Single-Image
Super-Resolution [51.422185656787285]
コントラスト学習に基づく単一画像の超解像を2つの視点から検討する。
SISR のための実践的コントラスト学習フレームワーク PCL-SR を提案する。
既存のベンチマーク手法と比較して,提案手法をPCL-SRフレームワークで再学習し,優れた性能を実現する。
論文 参考訳(メタデータ) (2021-11-27T15:42:12Z) - Dynamic Feature Integration for Simultaneous Detection of Salient
Object, Edge and Skeleton [108.01007935498104]
本稿では,高次物体分割,エッジ検出,スケルトン抽出など,低レベルの3つの視覚問題を解く。
まず、これらのタスクで共有される類似点を示し、統一されたフレームワークの開発にどのように活用できるかを示す。
論文 参考訳(メタデータ) (2020-04-18T11:10:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。