論文の概要: LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection
- arxiv url: http://arxiv.org/abs/2608.09633v2
- Date: Thu, 13 Aug 2026 12:11:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.58397
- Title: LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection
- Title(参考訳): LoRAベースの適応アローンは十分ではない:顔提示攻撃検出のための基礎モデルの限界を理解する
- Abstract要約: 顔提示攻撃検出(PAD)は、広範囲の提示攻撃を確実に検出することを目的としている。
PAD法は個々のデータセット内で高い性能を達成するが、その性能はクロスデータセット評価の下で低下する。
典型的なPADデータセットは、Webベースの事前トレーニングで使用されるスケールに比べて小さいため、ファンデーションモデル(FM)が有望な代替手段として登場した。
- 参考スコア(独自算出の注目度): 6.441953169734952
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Face presentation attack detection (PAD) aims to reliably detect a wide range of presentation attacks. While PAD methods achieve strong performance within individual datasets, their performance degrades under cross-dataset evaluation. Variations in sensors or lighting conditions can reduce the effectiveness of detectors from near-perfect to nearly random. Foundation models (FMs) have emerged as a promising alternative because typical PAD datasets, such as the MCIO benchmarks (MSU-MFSD, CASIA-FASD, Replay-Attack, and OULU-NPU), are small relative to the scale used for web-based pretraining. However, existing PAD systems primarily focus on CLIP-based foundation models, while overlooking other FMs with different architectures and training procedures. This study addresses this question by systematically evaluating 32 FMs. Zero-shot prompting achieves performance near chance across model families and scales. The vision encoders, when low-rankadapted (LoRA) with fewer than 1% trainable weights, achieve below 2% intra-dataset ACER in most cases, while cross-dataset ACER is substantially higher. LoRA primarily refines the decision boundary within a dataset, suggesting that pretrained representations and the adaptation dataset play a larger role in cross-dataset generalization than the evaluated lightweight adaptation strategy.
- Abstract(参考訳): 顔提示攻撃検出(PAD)は、広範囲の提示攻撃を確実に検出することを目的としている。
PAD法は個々のデータセット内で高い性能を達成するが、その性能はクロスデータセット評価の下で低下する。
センサーや照明条件の変化は、検出器の有効性をほぼ完璧からほぼランダムに低下させる。
MCIOベンチマーク(MSU-MFSD、CASIA-FASD、Replay-Attack、OULU-NPU)のような典型的なPADデータセットは、Webベースの事前トレーニングで使用されるスケールと比較して小さいため、ファンデーションモデル(FM)が有望な選択肢として現れている。
しかし、既存のPADシステムは主にCLIPベースの基礎モデルに焦点を当て、異なるアーキテクチャとトレーニング手順を持つ他のFMを見下ろしている。
本研究は,32個のFMを系統的に評価することによってこの問題に対処する。
ゼロショットプロンプトは、モデルファミリとスケールにわたるパフォーマンスに近いパフォーマンスを達成する。
視覚エンコーダは、低ランク適応(LoRA)でトレーニング可能な重量が1%未満である場合、ほとんどの場合、2%以下のデータセット内ACERを達成する。
LoRAは主にデータセット内の決定境界を洗練し、事前訓練された表現と適応データセットが評価された軽量適応戦略よりもクロスデータセットの一般化において大きな役割を果たすことを示唆している。
関連論文リスト
- PCQA-R1: Advancing Generalized 3D Point Cloud Quality Assessment with Reinforcement Learning [51.75061005702151]
ノンリファレンスポイントクラウド品質アセスメント(PCQA)は近年活発なトピックであり、ポイントクラウドの視覚的エクスペリエンスの測定と最適化に使用されている。
本稿では,3次元点雲質評価のための最初の強化学習LMMであるPCQA-R1について述べる。
論文 参考訳(メタデータ) (2026-08-19T07:21:58Z) - Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark [32.89408229880636]
クロスデータセット評価においては,顔提示攻撃検出は依然として困難である。
PAD関連情報を最小限のタスク特化訓練で利用できる汎用視覚基盤モデルか?
自己教師型ビジョントランス、視覚言語エンコーダ、教師型CNNを含む24個の凍結エンコーダを評価した。
論文 参考訳(メタデータ) (2026-07-29T14:52:25Z) - RoHOI: Robustness Benchmark for Human-Object Interaction Detection [84.78366452133514]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、コンテキスト認識支援を可能にするロボット・ヒューマン・アシストに不可欠である。
HOI検出のための最初のベンチマークを導入し、様々な課題下でモデルのレジリエンスを評価する。
我々のベンチマークであるRoHOIは、HICO-DETとV-COCOデータセットに基づく20の汚職タイプと、新しいロバストネスにフォーカスしたメトリクスを含んでいる。
論文 参考訳(メタデータ) (2025-07-12T01:58:04Z) - FoundPAD: Foundation Models Reloaded for Face Presentation Attack Detection [8.605999078286567]
プレゼンテーションアタック検出(PAD)アルゴリズムは、目に見えない領域に一般化する必要がある。
ファンデーションモデル(FM)は、広範囲なデータセットで事前訓練され、目に見えない領域に一般化する際、顕著な結果が得られる。
FoundPADの実装はhttps://github.com/gurayozgur/FoundPADで公開しています。
論文 参考訳(メタデータ) (2025-01-06T10:14:52Z) - Model Inversion Attacks Through Target-Specific Conditional Diffusion Models [54.69008212790426]
モデル反転攻撃(MIA)は、ターゲット分類器のトレーニングセットからプライベートイメージを再構築することを目的としており、それによってAIアプリケーションにおけるプライバシー上の懸念が高まる。
従来のGANベースのMIAは、GANの固有の欠陥と潜伏空間における最適化の偏りにより、劣った遺伝子的忠実度に悩まされる傾向にある。
これらの問題を緩和するために拡散モデル反転(Diff-MI)攻撃を提案する。
論文 参考訳(メタデータ) (2024-07-16T06:38:49Z) - Class Imbalance in Object Detection: An Experimental Diagnosis and Study
of Mitigation Strategies [0.5439020425818999]
本研究は, YOLOv5単段検出器を用いて, 前地上クラス不均衡問題に対処するベンチマークフレームワークを提案する。
我々は,サンプリング,損失重み付け,データ強化という3つの確立した手法を精査した。
比較分析の結果,2段階検出法では有効であるが,YOLOv5の性能向上には有効ではないことが明らかとなった。
論文 参考訳(メタデータ) (2024-03-11T19:06:04Z) - Take the Bull by the Horns: Hard Sample-Reweighted Continual Training
Improves LLM Generalization [165.98557106089777]
大きな言語モデル(LLM)の能力を高めることが大きな課題だ。
本研究は,従来の事前学習データセットを用いたLCMの光連続訓練に関する実証的戦略から始まった。
次に、この戦略をインスタンス重み付け分散ロバスト最適化の原則化されたフレームワークに定式化します。
論文 参考訳(メタデータ) (2024-02-22T04:10:57Z) - A Meta-Learning Approach to Predicting Performance and Data Requirements [163.4412093478316]
本稿では,モデルが目標性能に達するために必要なサンプル数を推定する手法を提案する。
モデル性能を推定するデファクト原理であるパワー法則が,小さなデータセットを使用する場合の誤差が大きいことが判明した。
本稿では,2つのデータを異なる方法で処理するPPL法について紹介する。
論文 参考訳(メタデータ) (2023-03-02T21:48:22Z) - Cluster-level pseudo-labelling for source-free cross-domain facial
expression recognition [94.56304526014875]
表情認識のためのSFUDA法を提案する。
本手法は,自己教師付き事前学習を利用して,対象データから優れた特徴表現を学習する。
提案手法の有効性を4つの適応方式で検証し,FERに適用した場合,既存のSFUDA法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2022-10-11T08:24:50Z) - Towards Better Object Detection in Scale Variation with Adaptive Feature
Selection [3.5352273012717044]
チャネル次元の多レベル表現を融合する方法を自動学習する新しい適応的特徴選択モジュール(AFSM)を提案する。
これは、特徴ピラミッド構造を持つ検出器の性能を著しく向上させる。
クラス不均衡問題に対処するために,クラス対応サンプリング機構(CASM)を提案する。
論文 参考訳(メタデータ) (2020-12-06T13:41:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。