論文の概要: PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition
- arxiv url: http://arxiv.org/abs/2607.03581v1
- Date: Fri, 03 Jul 2026 19:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.653636
- Title: PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition
- Title(参考訳): PLGSA-transformer:Occlusion-Adaptive Cosine Thresholding を用いた眼周囲ランドマーク誘導注意
- Abstract要約: 本稿では,3つのコントリビューションを持つクロスモーダル顔マッチングフレームワークであるPLGSA-Transformerを提案する。
PLGSA-Transformerは、ROC AUC 1.0000で97.22%のペア検証精度を達成し、VGG-16ベースのMUFMを上回った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The widespread adoption of facial masks, accelerated by COVID-19 and mandated in security-sensitive settings, has exposed limitations of conventional face recognition systems. Existing approaches relying on fixed cosine thresholds, non-adaptive CNNs, and purely data-driven features fail to generalize when facial regions are occluded, creating a gap between lab performance and real-world deployability. This paper proposes PLGSA-Transformer, a cross-modal face matching framework with three contributions. First, Periocular Landmark-Guided Spatial Attention (PLGSA) uses MediaPipe landmarks to compute Gaussian heatmaps over the eye, brow, and forehead regions, fusing them with EfficientNetB3 features via a learnable residual gate to direct attention toward discriminative visible regions. Second, a Hybrid CNN-Transformer Branch reshapes feature maps into tokens processed by a two-layer Multi-Head Self-Attention encoder, enabling cross-regional dependency modelling. Third, the Occlusion-Adaptive Cosine Threshold (OACT) is a jointly trained head that raises the matching threshold in proportion to predicted occlusion severity. The model is evaluated on 858 images from Zenodo MDMFR (60%), Kaggle CelebA-HQ masked collection (25%), and author-collected images (15%), spanning both genders, ages 21-75, with varied mask types, trained via a unified loss combining contrastive verification, identity classification, and occlusion cross-entropy. PLGSA-Transformer achieves 97.22% pair verification accuracy with ROC AUC 1.0000, surpassing VGG-16-based MUFM (Abdullah et al., 2025; 95.0%), HOG classifiers (Adnan et al., 2020; 85.0%), and Feature-based Structural Measure (Shnain et al., 2017; 86.61%). These results confirm that encoding periocular geometry into attention, with Transformer modelling and occlusion-adaptive thresholds, yields a robust, scalable solution for cross-modal masked face recognition.
- Abstract(参考訳): 新型コロナウイルス(COVID-19)によって加速され、セキュリティに敏感な設定が義務付けられている顔マスクの普及は、従来の顔認識システムの限界を露呈している。
既存のアプローチでは、固定されたコサインしきい値、非適応的なCNN、純粋にデータ駆動の機能は、顔領域が閉鎖された時に一般化できないため、ラボのパフォーマンスと実際のデプロイ性の間にギャップが生じる。
本稿では,3つのコントリビューションを持つクロスモーダル顔マッチングフレームワークであるPLGSA-Transformerを提案する。
第一に、周囲のランドマーク誘導空間注意(PLGSA)は、MediaPipeのランドマークを使用して、目、額、額の領域のガウス熱マップを計算し、学習可能な残差ゲートを介して効率的なNetB3特徴と融合し、識別可能な可視領域に向けて注意を向ける。
第二に、ハイブリッドCNN-Transformerブランチは、機能マップを2層多層セルフアテンションエンコーダで処理されたトークンに再結合し、クロスリージョンの依存性モデリングを可能にする。
第三に、Occlusion-Adaptive Cosine Threshold (OACT) は、Occlusion-Adaptive Cosine Threshold (OACT) が、予測されたオクルージョン重症度に比例して一致する閾値を上昇させる共同訓練された頭である。
このモデルは,MDMFR (60%), Kaggle CelebA-HQ masked collection (25%), and author-collected image (15%), acrossing both genders, 21-75, with various mask types, training by a unified loss with together with contrastive verification, identity classification, and occlusion cross-entropy。
PLGSA-Transformerは、ROC AUC 1.0000で97.22%のペア検証精度を達成し、VGG-16ベースのMUFM(Abdullah et al , 2025; 95.0%)、HOG分類器(Adnan et al , 2020; 85.0%)、特徴に基づく構造測定器(Shnain et al , 2017; 86.61%)を上回る。
これらの結果は、トランスフォーマーモデリングとオクルージョン適応しきい値を用いて、眼周囲形状を注意に符号化することで、クロスモーダルマスク認識のための堅牢でスケーラブルな解が得られることを確認した。
関連論文リスト
- Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks [2.1485350418225244]
本稿では,ジェネレーティブ・アタック・フレームワークであるAdv-TGDを提案する。
ターゲットのアイデンティティを偽装し、顔認識システムを欺くことができる光現実的な顔を合成する。
Adv-TGDは、IR152、IRSE50、MobileFace、FaceNetで平均攻撃成功率(ASR)が85.90%に達する。
論文 参考訳(メタデータ) (2026-06-10T03:28:00Z) - LAMM-ViT: AI Face Detection via Layer-Aware Modulation of Region-Guided Attention [4.0810988694972385]
本稿では,顔偽造検出のための視覚変換器であるLayer-Aware Mask Modulation Vision Transformer (LAMM-ViT)を紹介する。
LAMM-ViTはリージョンガイド型マルチヘッドアテンション(RG-MHA)とレイヤ対応マスク変調(LAMM)を各レイヤに統合する。
クロスモデル一般化テストでは、LAMM-ViT は優れた性能を示し、平均 ACC は94.09%、平均 AP は98.62% である。
論文 参考訳(メタデータ) (2025-05-12T16:42:19Z) - Person Recognition at Altitude and Range: Fusion of Face, Body Shape and Gait [70.00430652562012]
FarSightは、顔認識のためのエンドツーエンドシステムで、顔、歩行、体形を横断する生体計測の手がかりを統合する。
FarSightは、4つのコアモジュールにまたがる新しいアルゴリズムを組み込んでいる。
論文 参考訳(メタデータ) (2025-05-07T17:58:25Z) - Generative Adversarial Networks based Skin Lesion Segmentation [7.9234173309439715]
本稿では, 教師なし生成ネットワークを用いて正確な病変マスクを生成する, Efficient-GAN という新たな逆学習基盤を提案する。
Dice係数、Jaccard類似度、精度はそれぞれ90.1%、83.6%、94.5%である。
また,EGANと同等の性能を持つ軽量セグメンテーションフレームワーク(MGAN)を設計する。
論文 参考訳(メタデータ) (2023-05-29T15:51:31Z) - Adaptive Face Recognition Using Adversarial Information Network [57.29464116557734]
顔認識モデルは、トレーニングデータがテストデータと異なる場合、しばしば退化する。
本稿では,新たな敵情報ネットワーク(AIN)を提案する。
論文 参考訳(メタデータ) (2023-05-23T02:14:11Z) - Blind Face Restoration: Benchmark Datasets and a Baseline Model [63.053331687284064]
Blind Face Restoration (BFR) は、対応する低品質 (LQ) 入力から高品質 (HQ) の顔画像を構築することを目的としている。
EDFace-Celeb-1M (BFR128) と EDFace-Celeb-150K (BFR512) と呼ばれる2つのブラインドフェイス復元ベンチマークデータセットを最初に合成する。
最先端の手法は、ブラー、ノイズ、低解像度、JPEG圧縮アーティファクト、それらの組み合わせ(完全な劣化)の5つの設定でベンチマークされる。
論文 参考訳(メタデータ) (2022-06-08T06:34:24Z) - POSTER: A Pyramid Cross-Fusion Transformer Network for Facial Expression
Recognition [11.525573321175925]
顔の表情認識(FER)はコンピュータビジョンにおいて重要な課題であり、人間とコンピュータのインタラクション、教育、医療、オンラインモニタリングといった分野に実践的な応用がある。
特に大きな問題は、クラス間類似性、クラス内類似性、スケール感度の3つである。
本稿では,これら3つの問題を総括的に解決することを目的とした2ストリームのピラミッド crOss-fuSion TransformER ネットワーク (POSTER) を提案する。
論文 参考訳(メタデータ) (2022-04-08T14:01:41Z) - Heterogeneous Face Frontalization via Domain Agnostic Learning [74.86585699909459]
本研究では, 視覚領域における正面視を, ポーズのバリエーションで合成できるドメイン非依存学習型生成逆数ネットワーク(DAL-GAN)を提案する。
DAL-GANは、補助分類器を備えたジェネレータと、より優れた合成のために局所的およびグローバルなテクスチャ識別をキャプチャする2つの識別器から構成される。
論文 参考訳(メタデータ) (2021-07-17T20:41:41Z) - Multi-Margin based Decorrelation Learning for Heterogeneous Face
Recognition [90.26023388850771]
本稿では,超球面空間におけるデコリレーション表現を抽出するディープニューラルネットワーク手法を提案する。
提案するフレームワークは,不均一表現ネットワークとデコリレーション表現学習の2つのコンポーネントに分けることができる。
2つの難解な異種顔データベースに対する実験結果から,本手法は検証タスクと認識タスクの両方において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2020-05-25T07:01:12Z) - Multi-Scale Thermal to Visible Face Verification via Attribute Guided
Synthesis [55.29770222566124]
可視画像から抽出した属性を用いて、熱画像から属性保存された可視画像を合成し、クロスモーダルマッチングを行う。
抽出した属性によって導かれる熱画像から可視像を合成するために, 新規なマルチスケールジェネレータを提案する。
事前訓練されたVGG-Faceネットワークを利用して、合成画像と入力可視画像から特徴を抽出し、検証を行う。
論文 参考訳(メタデータ) (2020-04-20T01:45:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。