論文の概要: Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models
- arxiv url: http://arxiv.org/abs/2607.14423v1
- Date: Wed, 15 Jul 2026 23:23:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.934602
- Title: Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models
- Title(参考訳): 凍結視覚基礎モデルにおける創発的領域レベル顔対応
- Authors: Izaldein Al-Zyoud, Abdulmotaleb El Saddik,
- Abstract要約: 自己監督型視覚モデルでは、ジェネリックオブジェクトの一部をアライメントすることができるが、この対応が人間の顔にも及ぶかどうかは不明だ。
凍結したDINOv3特徴が領域レベルの顔座標系を定義するかどうかを検証する。
- 参考スコア(独自算出の注目度): 14.839283562982544
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frozen self-supervised vision models can align parts of generic objects, but it remains unclear whether this correspondence extends to human faces, where global layout is shared while identity-specific appearance varies sharply. We test whether frozen DINOv3 features define a region-level facial coordinate system: a feature space in which eyes, brows, nose, mouth, skin, and hair remain distinguishable across people and across time without face-specific training. Using DINOv3 ViT-L/16 patch embeddings and FaRL only as a face-part labeling interface, we evaluate cross-identity nearest-neighbor matching and temporal label propagation on 200 CelebDF-v2 real videos. DINOv3 achieves 83.0% region-level semantic accuracy under unconstrained cross-identity matching, compared with a 23.0% area-weighted random baseline, and 95.5% temporal tracking accuracy without a learned temporal module. A no-FaRL control collapses to 0.9%, showing that FaRL supplies semantic initialization while DINOv3 supplies dense spatial correspondence. The strongest correspondence appears at an intermediate layer: block 18 gives a 4.93x same-region versus cross-region discrimination ratio, compared with 1.48x at the final block. Against CLIP ViT-L/14, DINOv3 shows only a small aggregate advantage but a +16.8 pp gain on anatomical regions, indicating that image-level contrastive supervision captures coarse facial layout but not fine-grained anatomical identity. These results establish frozen DINOv3 as a strong zero-shot representation for region-level facial correspondence and identify intermediate self-supervised features as the most useful layer for dense face analysis.
- Abstract(参考訳): 凍結した自己監督型視覚モデルでは、一般的な物体の一部を整列させることができるが、この対応が人間の顔にも及ぶかどうかは不明であり、グローバルなレイアウトは共有され、アイデンティティ固有の外観は顕著に変化する。
DINOv3は、目、額、鼻、口、皮膚、毛髪が顔特有の訓練を受けずに、時間をかけて区別できる特徴空間である。
DINOv3 ViT-L/16 パッチ埋め込みと FaRL をフェースパートラベリングインターフェースとして使用し,200 CelebDF-v2 実ビデオ上での相互同一性近傍マッチングと時間的ラベル伝搬を評価した。
DINOv3は23.0%の領域重み付きランダムベースラインと、学習時間モジュールなしでの時間追跡精度95.5%と比較して、制約のないクロスアイデンティティマッチングの下で83.0%の領域レベルのセマンティック精度を達成する。
非FaRL制御は0.9%に崩壊し、FaRLが意味的初期化を、DINOv3が密接な空間対応を供給していることを示す。
最強の対応は中間層に現れ、ブロック18は最終ブロックの1.48倍に対して4.93倍の同領域とクロスリージョンの識別比を与える。
CLIP ViT-L/14に対して、DINOv3は解剖学的領域において小さな凝集能しか示さず、+16.8ppの上昇を示した。
これらの結果から,DINOv3は領域レベルの顔対応の強いゼロショット表現として成立し,中間的な自己監督的特徴を高密度顔分析の最も有用な層として同定した。
関連論文リスト
- PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition [0.0]
本稿では,3つのコントリビューションを持つクロスモーダル顔マッチングフレームワークであるPLGSA-Transformerを提案する。
PLGSA-Transformerは、ROC AUC 1.0000で97.22%のペア検証精度を達成し、VGG-16ベースのMUFMを上回った。
論文 参考訳(メタデータ) (2026-07-03T19:48:17Z) - DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation [58.47973015036709]
DisPOSEは、本質的に離散的な多視点人物割り当て問題を近似する自己教師型フレームワークである。
特定可能なシンクホーン射影を用いることにより、本モデルは有効かつ実現可能な課題への解の導出を学ぶ。
提案手法は、標準データセット上での最先端の自己教師手法よりも優れている。
論文 参考訳(メタデータ) (2026-06-05T16:14:39Z) - When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection [12.446807294893638]
本稿では,視線方向の相互コヒーレンス,頭部アライメント,対人関係の瞳孔配置として定義された高レベルの意味的キューであるソーシャル・ゲイズ・コンシステンシーを紹介する。
既存の低レベルパラダイムに対して,これまで未利用であった検出軸を構成することを示す。
4ステップのアカウントでは、単一インパインター(FLUX.1-Fill)のトレーニングがマルチジェネレータスイートに移行した理由が説明されている。
論文 参考訳(メタデータ) (2026-05-26T17:50:17Z) - Segmentation-Guided Spatial Indexing for Generalizable and Explainable Deepfake Detection [14.839283562982544]
ディープフェイク検出のためのセグメンテーション誘導空間インデクシングを提案する。
まずセマンティックに意味のあるパッチトークンを選択し、それからそれらだけをプールします。
Celeb-DF v2では、マウスインデクシングプローブがAUC 0.905を達成し、LipForensicsとXceptionを上回っている。
論文 参考訳(メタデータ) (2026-05-25T17:07:00Z) - Slum Detection and Density Mapping with AlphaEarth Foundations: A Representation Learning Evaluation Across 12 Global Cities [9.982796078979648]
画素レベルのスラムマッピングは、長い間、限られた都市間一般化によって制約されてきた。
AlphaEarth Foundationsは、軽量スラムモニタリングのための新しい分析可能なベースを提供する。
我々は,12都市と69都市年対のスラム分類とサブピクセル密度推定についてAFFを評価した。
論文 参考訳(メタデータ) (2026-05-11T05:54:15Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - ID$^3$: Identity-Preserving-yet-Diversified Diffusion Models for Synthetic Face Recognition [60.15830516741776]
合成顔認識(SFR)は、実際の顔データの分布を模倣するデータセットを生成することを目的としている。
拡散燃料SFRモデルであるtextID3$を紹介します。
textID3$はID保存損失を利用して、多様だがアイデンティティに一貫性のある顔の外観を生成する。
論文 参考訳(メタデータ) (2024-09-26T06:46:40Z) - Progressive Feature Self-reinforcement for Weakly Supervised Semantic
Segmentation [55.69128107473125]
Weakly Supervised Semantic (WSSS) のイメージレベルラベルを用いたシングルステージアプローチを提案する。
我々は、画像内容が決定論的領域(例えば、自信ある前景と背景)と不確実領域(例えば、オブジェクト境界と誤分類されたカテゴリ)に適応的に分割して、別々の処理を行う。
そこで我々は,これらの自信のある領域と同一のクラスラベルを持つ拡張画像とのセマンティック一貫性を制約する補完的な自己強調手法を提案する。
論文 参考訳(メタデータ) (2023-12-14T13:21:52Z) - Towards Label-free Scene Understanding by Vision Foundation Models [87.13117617056004]
ネットワークがラベル付きデータなしで2Dおよび3D世界を理解できるようにするためのビジョン基盤モデルの可能性について検討する。
本稿では,CLIPとSAMの強度を利用して2次元ネットワークと3次元ネットワークを同時に監視するクロスモダリティ・ノイズ・スーパービジョン(CNS)手法を提案する。
我々の2Dネットワークと3Dネットワークは、ScanNet上で28.4%と33.5%のmIoUでラベルなしセマンティックセグメンテーションを実現し、それぞれ4.7%と7.9%を改善した。
論文 参考訳(メタデータ) (2023-06-06T17:57:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。