論文の概要: CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition
- arxiv url: http://arxiv.org/abs/2603.27999v2
- Date: Tue, 31 Mar 2026 15:59:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.436817
- Title: CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition
- Title(参考訳): CLIP-AUTT:細粒度映像感情認識のためのアクションユニットプロンプトによるテスト時間パーソナライズ
- Abstract要約: アクションユニット(AU)は、きめ細かい表情をモデル化するためのCLIP内のテキストプロンプトである。
私たちはCLIPに解釈可能なAUセマンティクスを統合する軽量なAU誘導時間学習手法であるCLIP-AUを紹介する。
ビデオベーステストタイムパーソナライズ手法であるCLIP-AUTTを提案する。
- 参考スコア(独自算出の注目度): 57.8548595493709
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personalization in emotion recognition (ER) is essential for an accurate interpretation of subtle and subject-specific expressive patterns. Recent advances in vision-language models (VLMs) such as CLIP demonstrate strong potential for leveraging joint image-text representations in ER. However, CLIP-based methods either depend on CLIP's contrastive pretraining or on LLMs to generate descriptive text prompts, which are noisy, computationally expensive, and fail to capture fine-grained expressions, leading to degraded performance. In this work, we leverage Action Units (AUs) as structured textual prompts within CLIP to model fine-grained facial expressions. AUs encode the subtle muscle activations underlying expressions, providing localized and interpretable semantic cues for more robust ER. We introduce CLIP-AU, a lightweight AU-guided temporal learning method that integrates interpretable AU semantics into CLIP. It learns generic, subject-agnostic representations by aligning AU prompts with facial dynamics, enabling fine-grained ER without CLIP fine-tuning or LLM-generated text supervision. Although CLIP-AU models fine-grained AU semantics, it does not adapt to subject-specific variability in subtle expressions. To address this limitation, we propose CLIP-AUTT, a video-based test-time personalization method that dynamically adapts AU prompts to videos from unseen subjects. By combining entropy-guided temporal window selection with prompt tuning, CLIP-AUTT enables subject-specific adaptation while preserving temporal consistency. Our extensive experiments on three challenging video-based subtle ER datasets, BioVid, StressID, and BAH, indicate that CLIP-AU and CLIP-AUTT outperform state-of-the-art CLIP-based FER and TTA methods, achieving robust and personalized subtle ER. Our code is publicly available at: https://github.com/osamazeeshan/CLIP-AUTT.
- Abstract(参考訳): 感情認識(ER)のパーソナライゼーションは、微妙で主観的な表現パターンの正確な解釈に不可欠である。
CLIPのような視覚言語モデル(VLM)の最近の進歩は、ERにおける共同画像テキスト表現を活用する強力な可能性を示している。
しかし、CLIPベースの手法は、CLIPの対照的な事前学習に依存するか、あるいは記述的なテキストプロンプトを生成するためにLLMに依存する。
本研究では、CLIP内の構造化テキストプロンプトとしてアクションユニット(AU)を活用し、きめ細かい表情をモデル化する。
AUは、表現の基礎となる微妙な筋肉の活性化を符号化し、より堅牢なERに対して局所的で解釈可能な意味的手がかりを提供する。
私たちはCLIPに解釈可能なAUセマンティクスを統合する軽量なAU誘導時間学習手法であるCLIP-AUを紹介する。
AUプロンプトを顔のダイナミックスと整列させることで、汎用的で主題に依存しない表現を学習し、CLIPの微調整やLLM生成したテキストの監督なしに細粒のERを可能にする。
CLIP-AUは微粒なAUセマンティクスをモデル化するが、微妙な表現では主観的な変動に適応しない。
この制限に対処するために,ビデオベースのテスト時間パーソナライズ手法であるCLIP-AUTTを提案する。
エントロピー誘導による時間的ウィンドウ選択と即時チューニングを組み合わせることで、CLIP-AUTTは時間的一貫性を維持しながら主題固有の適応を可能にする。
ビデオベースの微妙なERデータセットであるBioVid、ScressID、BAHに関する大規模な実験は、CLIP-AUとCLIP-AUTTが最先端のCLIPベースのFERとTTAメソッドより優れており、堅牢でパーソナライズされた微妙なERを達成することを示唆している。
私たちのコードは、https://github.com/osamazeeshan/CLIP-AUTT.comで公開されています。
関連論文リスト
- Fine-grained CLIP fine-tuning with self-annotated region alignment [57.28808560528696]
対照的な言語-画像事前学習は、そのきめ細かい特徴表現に制限があることが示されている。
そこで我々は,CLIPファインチューニングにおける細粒度表現能力を高めるために,SFF-CLIP(Self-annotated Fine-fine-tuning for CLIP)を提案する。
論文 参考訳(メタデータ) (2026-07-15T10:06:39Z) - ALADIN:Attribute-Language Distillation Network for Person Re-Identification [3.350310340720105]
ALADINは、冷凍のCLIP教師から軽量のReID学生に知識を蒸留する属性言語蒸留ネットワークである。
Scene-Aware Prompt Generatorは、適応アライメントを容易にするために、画像固有のソフトプロンプトを生成する。
論文 参考訳(メタデータ) (2026-03-23T02:05:22Z) - ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder [50.25233123718465]
CLIPテキストエンコーダは77トークンの最大入力長で制限される。
ProCLIPはカリキュラムベースのプログレッシブ・ビジョン言語アライメントフレームワークである。
論文 参考訳(メタデータ) (2025-10-21T16:48:49Z) - Multimodal Prompt Alignment for Facial Expression Recognition [24.470095812039286]
MPA-FERは、引き起こされた視覚的特徴の学習プロセスに対して、きめ細かいセマンティックガイダンスを提供する。
我々のフレームワークは、FERベンチマークの3つのベンチマークデータセット上で最先端の手法より優れています。
論文 参考訳(メタデータ) (2025-06-26T05:28:57Z) - Open-Set Video-based Facial Expression Recognition with Human Expression-sensitive Prompting [28.673734895558322]
本稿では,未知の表情と未知の表情の両方を識別することを目的とした,オープンセット映像に基づく表情認識タスクを提案する。
既存のアプローチでは、CLIPのような大規模な視覚言語モデルを使用して、目に見えないクラスを特定する。
本稿では,CLIPの映像ベース表情詳細を効果的にモデル化する能力を大幅に向上させる新しいHuman Expression-Sensitive Prompting(HESP)機構を提案する。
論文 参考訳(メタデータ) (2024-04-26T01:21:08Z) - FiGCLIP: Fine-Grained CLIP Adaptation via Densely Annotated Videos [19.08882495584709]
セマンティックな特性を損なうことなく,CLIPの細粒度・統語能力を高めることが可能であることを示す。
私たちは、高品質で包括的で比較的小さなデータセットにCLIPを効率的に適用します。
我々は、細部指向のセマンティック理解を保った強力な視覚表現であるファイングラインドCLIP(FiGCLIP)を学習する。
論文 参考訳(メタデータ) (2024-01-15T13:27:34Z) - CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation [31.264574799748903]
アノテーションを必要としないオープン語彙セマンティックセマンティックセマンティクス法を提案する。
使用済みの自己教師機能プロパティは,CLIP機能から直接学習可能であることを示す。
我々のCLIP-DINOiser法は,CLIPの1つの前方通過と2つの軽い畳み込み層のみを必要とする。
論文 参考訳(メタデータ) (2023-12-19T17:40:27Z) - Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot
Anomaly Localization [63.61093388441298]
対照的な言語-画像事前学習モデルは、ゼロショット視覚認識タスクで有望なパフォーマンスを示した。
本研究では,ゼロショット異常局所化のためのAnoCLIPを提案する。
論文 参考訳(メタデータ) (2023-08-30T10:35:36Z) - Prompting Visual-Language Models for Dynamic Facial Expression Recognition [12.51368195072919]
本稿ではDFER-CLIPと呼ばれる新しい視覚言語モデルを提案する。
これはCLIPモデルに基づいており、幅内動的顔表情認識のために設計されている。
DFEW、FERV39k、MAFWベンチマークの現在の教師付きDFER法と比較すると、最先端の結果が得られる。
論文 参考訳(メタデータ) (2023-08-25T13:52:05Z) - CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model [55.321010757641524]
CLIP4STRは,CLIPのイメージエンコーダとテキストエンコーダ上に構築された,シンプルで効果的なSTRメソッドである。
モデルサイズ、事前トレーニングデータ、トレーニングデータの観点からCLIP4STRをスケールし、13のSTRベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-05-23T12:51:20Z) - CLIP-Adapter: Better Vision-Language Models with Feature Adapters [84.88106370842883]
即時チューニング以外に、より良い視覚言語モデルを実現するための代替経路があることが示される。
CLIP-Adapterは新たなボトルネックレイヤを採用して、新機能を学び、残留スタイルの機能ブレンディングを実行する。
様々な視覚的分類タスクの実験および広範囲なアブレーション研究は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2021-10-09T11:39:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。