論文の概要: EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment
- arxiv url: http://arxiv.org/abs/2608.21486v1
- Date: Fri, 21 Aug 2026 12:16:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.211523
- Title: EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment
- Title(参考訳): EXPL-FR:視覚言語アライメントによる顔認識モデルの説明
- Abstract要約: 軽量のアダプタは、視覚言語モデル(VLM)イメージエンコーダと凍ったFR空間をアライメントし、顔画像だけで訓練され、テキスト上は決して訓練されない。
ラベルなし検出可能性尺度は、FR空間における各概念の分離可能性とVLM空間を比較し、最も検出可能な100個のモデルの意味シグネチャを比較する。
我々は、4つのFRバックボーンと2つのVLMエンコーダをカバーし、EXPL-FRはアーキテクチャアクセスを必要としない。
- 参考スコア(独自算出の注目度): 16.296464057419517
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deep face recognition (FR) models reach near-saturated accuracy but remain opaque: a practitioner cannot ask which semantic attributes a similarity score relied upon. EXPL-FR answers this inside the FR model's own embedding space. A lightweight adapter aligns a vision-language model's (VLM) image encoder with the frozen FR space, trained on face images alone and never on text. Because the VLM's encoders share one space, the same adapter applies to the text encoder, turning 978 attribute prompts in 22 categories, also extendable, into FR-space anchors at no extra cost. We do not assume this transfer works: a face-verification protocol measures it, and an ablation changing only the adapter isolates its contribution. Not every concept survives, because an FR model earns its invariances by discarding the factors it must verify identities across. A label-free detectability measure compares each concept's separability in FR space against the VLM space, and the 100 most detectable form the model's readable semantic signature, which separates identities better than the full vocabulary. We cover four FR backbones and two VLM encoders, EXPL-FR needs no architecture access, and supports identity-level, per-image, and differential explanations. We benchmark attribute-level auditing under three supervision settings, human labels (current practice), VLM pseudo-labels, and our fully prompt-driven audit, against real verification behavior. With no labels, the prompt-driven audit ranks four FR models by their measured per-ethnicity RFW errors and ranks controlled attribute changes by their true verification cost.
- Abstract(参考訳): 深層顔認識(FR)モデルは、ほぼ飽和した精度に達するが、不透明なままである。
EXPL-FRはFRモデルの埋め込み空間内でこれを答える。
軽量のアダプタは、視覚言語モデル(VLM)イメージエンコーダと凍ったFR空間をアライメントし、顔画像だけで訓練され、テキスト上は決して訓練されない。
VLMのエンコーダは1つのスペースを共有しているため、同じアダプタがテキストエンコーダに適用される。
フェース検証プロトコルがそれを測定し、アダプタのみを変更するアブレーションがそのコントリビューションを分離する。
全ての概念が生き残るわけではない、なぜならFRモデルはその不変性を得るのは、正当性を検証しなければならない因子を捨てることによってであるからである。
ラベルなし検出可能性尺度は、FR空間における各概念の分離可能性とVLM空間を比較し、モデルの可読性セマンティックシグネチャの最も検出可能な100個のフォームを比較し、完全な語彙よりもアイデンティティを分離する。
我々は、4つのFRバックボーンと2つのVLMエンコーダをカバーし、EXPL-FRはアーキテクチャアクセスを必要としない。
属性レベルの監査を3つの監督設定、人間ラベル(現在の実践)、VLM擬似ラベル、および実際の検証行動に対する完全な即時監査でベンチマークする。
ラベルがない場合、プロンプト駆動監査は、測定された民族ごとのRFW誤差によって4つのFRモデルをランク付けし、真の検証コストによって制御された属性変化をランク付けする。
関連論文リスト
- Parser-Free VLM Verification for Federated Weakly Supervised Video Anomaly Detection [0.27998963147546135]
本稿では,クライアント間で小型のMILスコアラーのみを訓練する軽量なMIL-VLMカスケードを導入し,凍結したVLMはハイスコアな疑似セグメントをポストホックで検証する。
解析されたテキスト生成決定と、次の確率から連続的な異常スコアを抽出するロジットベースインタフェースの2つのVLMフィードバックインタフェースについて検討する。
対照的に、ロジットインタフェースは、フレームレベルのAUCとフレームレベルのAPの両方を、両方のVLMでMILベースライン上で改善する固定自由信号を提供する。
論文 参考訳(メタデータ) (2026-09-07T13:04:00Z) - SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation [52.62632888060867]
可視赤外画像変換は、豊富な可視画像を用いて赤外線トレーニングデータを拡張するための実用的な方法を提供する。
既存の拡散に基づくメソッドは、通常、外部条件としてのみセマンティックプリエントを使用する。
SC-Diffは、条件付きガイダンスと内部自己注意校正の両方にセマンティックな事前情報を利用する意味論的潜伏拡散フレームワークである。
論文 参考訳(メタデータ) (2026-08-09T07:57:40Z) - Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition [38.294322671641545]
微粒な画像認識は、手動のアノテーションに必要な相当な専門知識と努力のために重要な課題である。
現在のメソッドでは、クラスラベルを独立した独立したエンティティとして扱い、それらの間のリッチなセマンティックな関係を見渡しています。
本稿では,素早い学習における意味的構造モデリングの強化を目的としたSCPT(Structured-Condensed Prompt Tuning)を提案する。
論文 参考訳(メタデータ) (2026-07-07T12:09:49Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models [54.097381112138]
現在の自己進化型LMMは、イメージキャプションや視覚的質問応答といった視覚言語理解タスクに苦慮している。
モデルの視覚条件を直接正規化する,純粋に教師なしの自己進化型フレームワークであるVISEを提案する。
VISEは、専門的な役割、外部報酬モデル、アノテーションなしで単一のモデル内で動作します。
論文 参考訳(メタデータ) (2026-06-25T17:59:55Z) - [CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation [20.637119409165418]
PIAAは、アダプティブアグリゲーション(Adaptive Aggregation)によって、パッチレベルの推論として予測を定式化する。
パッチレベルのスコアを最終的なマルチラベル予測に集約するアダプティブアグリゲーションモジュールを導入する。
実験の結果,提案手法は最小限の余剰計算で強い改善を達成できることがわかった。
論文 参考訳(メタデータ) (2026-05-25T13:19:12Z) - Identifiable Steering via Sparse Autoencoding of Multi-Concept Shifts [11.81523319216474]
ステアリング法は、大きな言語モデル(LLM)の表現を操作して、望ましい特性を持つ応答を誘導する。
伝統的に、ステアリングは、単一のターゲット概念で異なる対照的なプロンプトのペアなど、監督に依存してきた。
Sparse Shift Autoencoders (SSAE)を導入し、その代わりに埋め込みの違いをスパース表現にマッピングする。
論文 参考訳(メタデータ) (2025-02-14T08:49:41Z) - VladVA: Discriminative Fine-tuning of LVLMs [67.14293827774827]
CLIPのような対照的に訓練された視覚言語モデル(VLM)は、識別的視覚言語表現学習の事実上のアプローチとなっている。
我々は,LVLMの識別的微調整のための新たな訓練手法である「両世界のベスト」を組み合わせることを提案する。
論文 参考訳(メタデータ) (2024-12-05T17:54:27Z) - Multi-modal NeRF Self-Supervision for LiDAR Semantic Segmentation [24.5316699425354]
LiDARセマンティックは、各LiDARポイントをセマンティックラベルに関連付けることで、自律運転知覚の基本的なタスクである。
本稿では,カメラ画像からの知識の抽出とともに,ラベルのないLiDAR点雲を利用するセミ・スーパーバイザード・ラーニング・セットアップを提案する。
論文 参考訳(メタデータ) (2024-11-05T10:13:23Z) - Towards Realistic Zero-Shot Classification via Self Structural Semantic
Alignment [53.2701026843921]
大規模事前訓練型視覚言語モデル(VLM)はゼロショット分類に有効であることが証明されている。
本稿では,アノテーションではなく,より広い語彙を前提とした,より難易度の高いゼロショット分類(Realistic Zero-Shot Classification)を提案する。
本稿では,ラベルのないデータから構造意味情報を抽出し,同時に自己学習を行う自己構造意味アライメント(S3A)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-24T17:56:46Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。