論文の概要: Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark
- arxiv url: http://arxiv.org/abs/2607.26993v2
- Date: Thu, 30 Jul 2026 07:27:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.274302
- Title: Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark
- Title(参考訳): 顔提示攻撃検出のための基礎モデル:統一線形探索ベンチマーク
- Abstract要約: クロスデータセット評価においては,顔提示攻撃検出は依然として困難である。
PAD関連情報を最小限のタスク特化訓練で利用できる汎用視覚基盤モデルか?
自己教師型ビジョントランス、視覚言語エンコーダ、教師型CNNを含む24個の凍結エンコーダを評価した。
- 参考スコア(独自算出の注目度): 32.89408229880636
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Face presentation attack detection (PAD) remains challenging under cross-dataset evaluation, where domain shift degrades models trained on a single dataset. The scarcity of large-scale labeled data motivates adapting pretrained vision models rather than training task-specific architectures from scratch, raising a fundamental question: do general-purpose vision foundation models encode PAD-relevant information accessible with minimal task-specific training? To investigate, we systematically evaluate 24 frozen encoders, including self-supervised vision transformers, vision-language encoders, and supervised CNNs, using a unified linear-probing protocol on the MCIO benchmark (MSU-MFSD, CASIA-FASD, Replay-Attack, OULU-NPU). The backbone remains fixed, and only a lightweight linear head is trained to isolate the PAD information already present in the pretrained representation. Results show that frozen foundation-model representations can support strong intra-dataset PAD performance with only a linear classifier, but this performance does not reliably transfer across datasets. Model scale is beneficial within several families, although the effect is not monotonic and is strongly mediated by architecture and pretraining. InternViT-6B achieves the lowest mean intra-dataset error, whereas CLIP ViT-B/32 offers the most favorable cross-dataset transfer-compute trade-off among the evaluated probes. These findings suggest that while pretrained representations contain PAD-relevant information, explicit adaptation remains necessary to address domain shift.
- Abstract(参考訳): ドメインシフトは単一のデータセットでトレーニングされたモデルを分解する。
大規模ラベル付きデータの不足は、タスク固有のアーキテクチャをスクラッチからトレーニングするのではなく、事前トレーニングされたビジョンモデルを適応させることを動機付けている。
そこで我々は,MCIOベンチマーク(MSU-MFSD,CASIA-FASD,Replay-Attack,OULU-NPU)上での統一線形探索プロトコルを用いて,自己教師型視覚変換器,視覚言語符号化器,CNNを含む24個の凍結符号化器を系統的に評価した。
バックボーンは固定されており、事前訓練された表現に存在するPAD情報を分離するために、軽量のリニアヘッドのみを訓練する。
その結果, 基本モデル表現は線形分類器のみを用いて, 強力なデータベース内PAD性能を実現することができるが, この性能はデータセット間で確実に伝達されないことがわかった。
モデルスケールはいくつかのファミリーで有用であるが、その効果は単調ではなく、アーキテクチャや事前訓練によって強く媒介される。
一方、CLIP ViT-B/32は、評価されたプローブの中で最も好ましいクロスデータセット転送/計算トレードオフを提供する。
これらの結果は、事前訓練された表現はPAD関連情報を含んでいるが、ドメインシフトに対処するためには明示的な適応が必要であることを示唆している。
関連論文リスト
- LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection [6.441953169734952]
顔提示攻撃検出(PAD)は、広範囲の提示攻撃を確実に検出することを目的としている。
PAD法は個々のデータセット内で高い性能を達成するが、その性能はクロスデータセット評価の下で低下する。
典型的なPADデータセットは、Webベースの事前トレーニングで使用されるスケールに比べて小さいため、ファンデーションモデル(FM)が有望な代替手段として登場した。
論文 参考訳(メタデータ) (2026-08-10T14:13:23Z) - Selectivity Drives Efficiency: Dataset Pruning for Visual Place Recognition [52.52131290631774]
視覚的位置認識(VPR)に適したプレースワイズ・データセット・プルーニング・フレームワークを提案する。
本手法は,各場所を基本刈取単位として扱い,IPD(Intra-place diversity)とIPS(Inter-place similarity)の2つの新しい指標を導入する。
実験により, 提案手法は, 最先端のDPベースラインを異なるプルーニング比で連続的に上回ることを示した。
論文 参考訳(メタデータ) (2026-07-16T12:16:00Z) - LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories [1.4610038284393168]
視覚変換器(ViT)の誤差予測に関する研究
大規模言語モデルにおける内信号幻覚検出の動機付けにより、類似の深度信号がViTに存在するかどうかを考察する。
中間層に軽量な線形ヘッドを付加することにより、予測クラスのロジットとトップK競合の両方をキャプチャする最後のL層から特徴を抽出する。
これらの特徴に基づいて訓練された線形プローブは、エラーインジケータを予測する。
論文 参考訳(メタデータ) (2026-04-12T13:43:40Z) - Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation [105.23631749213729]
低データ体制における教師なし事前学習のための新しい手法を提案する。
最近成功したプロンプト技術に触発されて,言語ビジョンプロンプトを用いた教師なし事前学習法を導入した。
提案手法は,低データ方式のCNNモデルよりも高速に収束し,性能がよいことを示す。
論文 参考訳(メタデータ) (2024-05-22T06:48:43Z) - Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer [54.32283739486781]
適応学習パラダイムの下で,textbfForgery-aware textbfAdaptive textbfVision textbfTransformer(FA-ViT)を提案する。
FA-ViTは、クロスデータセット評価において、Celeb-DFおよびDFDCデータセット上で93.83%と78.32%のAUCスコアを達成する。
論文 参考訳(メタデータ) (2023-09-20T06:51:11Z) - In-Domain Self-Supervised Learning Improves Remote Sensing Image Scene
Classification [5.323049242720532]
リモートセンシング画像分類のための有望なアプローチとして,自己教師付き学習が登場している。
そこで本研究では,14の下流データセットにまたがる自己教師型事前学習戦略について検討し,その効果を評価する。
論文 参考訳(メタデータ) (2023-07-04T10:57:52Z) - Cluster-level pseudo-labelling for source-free cross-domain facial
expression recognition [94.56304526014875]
表情認識のためのSFUDA法を提案する。
本手法は,自己教師付き事前学習を利用して,対象データから優れた特徴表現を学習する。
提案手法の有効性を4つの適応方式で検証し,FERに適用した場合,既存のSFUDA法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2022-10-11T08:24:50Z) - Self-Distillation for Further Pre-training of Transformers [83.84227016847096]
我々は、さらなる事前学習段階の正則化として自己蒸留を提案する。
画像およびテキスト分類タスクのための様々なベンチマークデータセットにおける自己蒸留の有効性を実証的に検証する。
論文 参考訳(メタデータ) (2022-09-30T02:25:12Z) - Consecutive Pretraining: A Knowledge Transfer Learning Strategy with
Relevant Unlabeled Data for Remote Sensing Domain [25.84756140221655]
自然言語処理(NLP)における事前学習を停止しないという考え方に基づいて,CSPT(ConSecutive PreTraining)を提案する。
提案したCSPTは、タスク対応モデルトレーニングのためのラベルなしデータの巨大な可能性を公開することもできる。
その結果,提案したCSPTをタスク認識モデルトレーニングに活用することにより,従来の教師付きプレトレーニング-then-fine-tuning法よりもRTDのダウンストリームタスクのほとんどを上回り得ることがわかった。
論文 参考訳(メタデータ) (2022-07-08T12:32:09Z) - Attentive Prototypes for Source-free Unsupervised Domain Adaptive 3D
Object Detection [85.11649974840758]
3Dオブジェクト検出ネットワークは、トレーニングされたデータに対してバイアスを受ける傾向がある。
そこで本研究では,ライダーを用いた3次元物体検出器のソースレス・教師なし領域適応のための単一フレーム手法を提案する。
論文 参考訳(メタデータ) (2021-11-30T18:42:42Z) - Self-Supervised Pre-Training for Transformer-Based Person
Re-Identification [54.55281692768765]
トランスフォーマーに基づく教師付き事前訓練は、人物再識別(ReID)において大きなパフォーマンスを達成する
ImageNetとReIDデータセットのドメインギャップのため、通常、パフォーマンスを高めるために、より大きなトレーニング済みデータセットが必要です。
この研究は、データとモデル構造の観点から、事前トレーニングデータセットとReIDデータセットのギャップを軽減することを目的としている。
論文 参考訳(メタデータ) (2021-11-23T18:59:08Z) - Omni-supervised Facial Expression Recognition via Distilled Data [120.11782405714234]
ネットワークトレーニングにおいて,信頼度の高いサンプルを多量のラベルのないデータで活用するためのオムニ教師付き学習を提案する。
我々は,新しいデータセットが学習したFERモデルの能力を大幅に向上させることができることを実験的に検証した。
そこで本研究では,生成したデータセットを複数のクラスワイド画像に圧縮するために,データセット蒸留戦略を適用することを提案する。
論文 参考訳(メタデータ) (2020-05-18T09:36:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。