論文の概要: Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
- arxiv url: http://arxiv.org/abs/2602.08057v1
- Date: Sun, 08 Feb 2026 17:02:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-10 20:26:24.956685
- Title: Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
- Title(参考訳): 弱みと強み:マルチモーダルビデオベース隠れ感情理解タスクにおける弱々しい指導戦略としてのVLMに基づく擬似ラベル
- Abstract要約: 本稿では,映像中の「概念的感情」の自動認識に取り組むための弱視的枠組みを提案する。
実験により、厳密なクラス不均衡にもかかわらず、提案手法は以前の作業で0.6以下から0.69以上に上昇することが示された。
- 参考スコア(独自算出の注目度): 4.888851550406879
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: To tackle the automatic recognition of "concealed emotions" in videos, this paper proposes a multimodal weak-supervision framework and achieves state-of-the-art results on the iMiGUE tennis-interview dataset. First, YOLO 11x detects and crops human portraits frame-by-frame, and DINOv2-Base extracts visual features from the cropped regions. Next, by integrating Chain-of-Thought and Reflection prompting (CoT + Reflection), Gemini 2.5 Pro automatically generates pseudo-labels and reasoning texts that serve as weak supervision for downstream models. Subsequently, OpenPose produces 137-dimensional key-point sequences, augmented with inter-frame offset features; the usual graph neural network backbone is simplified to an MLP to efficiently model the spatiotemporal relationships of the three key-point streams. An ultra-long-sequence Transformer independently encodes both the image and key-point sequences, and their representations are concatenated with BERT-encoded interview transcripts. Each modality is first pre-trained in isolation, then fine-tuned jointly, with pseudo-labeled samples merged into the training set for further gains. Experiments demonstrate that, despite severe class imbalance, the proposed approach lifts accuracy from under 0.6 in prior work to over 0.69, establishing a new public benchmark. The study also validates that an "MLP-ified" key-point backbone can match - or even surpass - GCN-based counterparts in this task.
- Abstract(参考訳): そこで本研究では,ビデオにおける「合意された感情」の自動認識に対処するため,iMiGUEテニス・インタービューデータセット上で,マルチモーダル・弱スーパービジョン・フレームワークを提案し,最先端の結果を達成した。
まず、YOLO 11xは人間の肖像画をフレーム単位で検出して収穫し、DINOv2-Baseは収穫された領域から視覚的特徴を抽出する。
次に、Chain-of-ThoughtとReflectionのプロンプト(CoT + Reflection)を統合することで、Gemini 2.5 Proは自動的に擬似ラベルを生成し、下流モデルの弱い監視に役立つ推論テキストを生成する。
その後、OpenPoseは137次元のキーポイントシーケンスを生成し、フレーム間オフセットの特徴を付加し、通常のグラフニューラルネットワークのバックボーンをMPPに単純化し、3つのキーポイントストリームの時空間関係を効率的にモデル化する。
超長周期変換器は、画像とキーポイントシーケンスの両方を独立に符号化し、その表現はBERT符号化インタビュートランスクリプトと連結される。
それぞれのモダリティは最初は単独で事前訓練され、その後は微調整され、擬似ラベルのサンプルはさらなる利得を得るためにトレーニングセットにマージされる。
実験により、厳密なクラス不均衡にもかかわらず、提案手法は前の作業で0.6未満の精度を0.69以上に引き上げ、新しい公開ベンチマークが確立された。
のキーポイントバックボーンが、このタスクにおいてGCNベースのバックボーンと一致するか、あるいは超える可能性があることを検証している。
関連論文リスト
- Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation [50.92925099642139]
拡散変換器(DiT)は高忠実度ビデオ生成において支配的なパラダイムとなっているが、ハイレベルなセマンティックプランニングを行う能力は依然として限られている。
MLLMが最初にセマンティック・ビジュアル・トークンを生成し、DiTが多層クロスアテンションを介してテキストとそれらのトークンに条件付きビデオを表示するハイブリッド・フレームワークであるBiVidGenを提案する。
論文 参考訳(メタデータ) (2026-08-14T07:40:41Z) - Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards [52.42920996842378]
視覚的理解と画像生成の両方をサポートするほとんどの統合された大型マルチモーダルモデル(LMM)は、訓練後の監督に頼っている。
本稿では,3つの内部的役割を持つ自己進化型トレーニングフレームワークを提案する。 視覚的質問を生成するプロポーラ, 回答と評価を行うソルバ, 画像を生成するジェネレータである。
画像生成のために,質問文の忠実度とサイクル一貫性キャプションを組み合わせたマルチスケール内部評価手法を設計する。
論文 参考訳(メタデータ) (2026-06-25T17:59:57Z) - SS3D: End2End Self-Supervised 3D from Web Videos [15.931354477455445]
単眼ビデオからのフィードフォワード3D推定のためのWebスケールSfMベースのセルフスーパービジョン事前学習パイプラインであるSS3Dを提案する。
本モデルでは,1回の前方通過で深度,エゴモーション,内在を同時予測し,コヒーレントなエンドツーエンド3次元推定器として訓練・評価する。
論文 参考訳(メタデータ) (2026-04-24T16:12:44Z) - UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval [87.12447641908143]
組込みゼロショット合成ビジュアル検索フレームワークUniCVRを提案する。
UniCVRは、タスク固有の人間アノテーションのない3つのタスクすべてに共同で対処する。
ステージIでは,約3.5Mサンプルのキュレートされたデータセットに対して,コントラスト学習によりMLLMを合成クエリ埋め込み器として訓練する。
ステージIIでは,少数の上位候補に対して適応的予算付サブセットスコアを付与するMLLM誘導二重レベル再ランク機構を導入する。
論文 参考訳(メタデータ) (2026-04-22T08:16:50Z) - GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining [16.806385071639866]
我々は、GoldiCLIPという、Goldilocksの原理に基づいて構築された、監督信号の適切なバランスを見つけるフレームワークを提示する。
筆者らの多面的学習フレームワークは,(1) テキストに依存しない特徴とテキスト条件の両方を整合させるテキスト条件の自己蒸留法,(2) エンコーダ統合デコーダと視覚質問応答(VQA)の目的とを組み合わせ,キャプションのようなクエリを超えてエンコーダを一般化する。
論文 参考訳(メタデータ) (2026-03-25T20:33:25Z) - Detect Anything via Next Point Prediction [51.55967987350882]
Rex-Omniは最先端の物体認識性能を実現する3BスケールのMLLMである。
COCOやLVISのようなベンチマークでは、Rex-Omniは回帰ベースのモデルに匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2025-10-14T17:59:54Z) - UniVid: The Open-Source Unified Video Model [41.15980565061684]
MLLMと拡散デコーダを軽量アダプタで結合する統一アーキテクチャUniVidを提案する。
標準ベンチマークの実験では、最先端のパフォーマンスが示されている。
論文 参考訳(メタデータ) (2025-09-29T02:31:36Z) - A Transformer Based Handwriting Recognition System Jointly Using Online and Offline Features [8.419663258260671]
オフライン画像とオンラインストロークデータの早期融合を行うエンド・ツー・エンド・ネットワークを提案する。
我々の手法は最先端の精度を達成し、過去のベストを最大1%上回っている。
論文 参考訳(メタデータ) (2025-06-25T08:58:47Z) - GAME: Learning Multimodal Interactions via Graph Structures for Personality Trait Estimation [13.071227081328288]
ショートビデオからの明瞭なパーソナリティ分析は、視覚的、聴覚的、およびテキスト的手がかりの複雑な相互作用のため、重要なチャルレンジを呈する。
本稿では,グラフ拡張型マルチモーダル進化法であるGAMEを提案する。
ビジュアルストリームのために、顔グラフを構築し、グラフ畳み込みネットワーク(GCN)と畳み込みニューラルネットワーク(CNN)を組み合わせたデュアルブランチGeo Two-Stream Networkを導入する。
時間的ダイナミクスを捉えるために、フレームレベルの特徴はBiGによって処理される
論文 参考訳(メタデータ) (2025-05-05T13:48:09Z) - Compile Scene Graphs with Reinforcement Learning [69.36723767339001]
次世代予測は大規模言語モデル(LLM)の訓練の基本原理である
本稿では,マルチモーダルLLM(M-LLM)であるR1-SGGを紹介する。
私たちは、Hard Recall、Hard Recall+Relax、Soft Recallの3つのリコールベースのバリエーションを含む、グラフ中心の報酬セットを設計します。
論文 参考訳(メタデータ) (2025-04-18T10:46:22Z) - Retinal IPA: Iterative KeyPoints Alignment for Multimodal Retinal Imaging [11.70130626541926]
マルチモダリティ網膜画像間のマッチングと登録を強化するために,クロスモダリティ特徴を学習するための新しいフレームワークを提案する。
本モデルでは,従来の学習に基づく特徴検出と記述手法の成功を例に挙げる。
同じ画像の異なるオーグメンテーション間のセグメンテーション一貫性を強制することにより、自己指導的な方法で訓練される。
論文 参考訳(メタデータ) (2024-07-25T19:51:27Z) - Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning [116.75939193785143]
画像領域における視覚変換器(ViT)のコントラスト学習(CL)は、従来の畳み込みバックボーンのCLに匹敵する性能を達成した。
ViTで事前訓練した3Dポイントクラウドでは、マスク付きオートエンコーダ(MAE)モデリングが主流である。
論文 参考訳(メタデータ) (2024-07-08T12:28:56Z) - Match me if you can: Semi-Supervised Semantic Correspondence Learning with Unpaired Images [76.47980643420375]
本稿では,意味的対応の学習に固有のデータ・ハングリー・マターが存在するという仮説に基づく。
我々は,機械の監督を通じて,ペア化されたキーポイントを確実に強化する単純な機械注釈器を実証する。
我々のモデルは,SPair-71k,PF-PASCAL,PF-WILLOWといった意味対応学習ベンチマークの最先端モデルを上回る。
論文 参考訳(メタデータ) (2023-11-30T13:22:15Z) - BEST: BERT Pre-Training for Sign Language Recognition with Coupling
Tokenization [135.73436686653315]
我々は、BERTの事前学習の成功を活用し、手話認識(SLR)モデルを肥大化させるために、ドメイン固有の統計モデルを構築している。
手と体が手話表現の優位性を考えると、それらを三重奏単位として整理し、トランスフォーマーのバックボーンに供給する。
劣化した入力シーケンスからマスク三重項ユニットを再構成して事前学習を行う。
意味的ジェスチャー/身体状態を表すポーズ三重奏ユニットから離散擬似ラベルを適応的に抽出する。
論文 参考訳(メタデータ) (2023-02-10T06:23:44Z) - Holistically-Attracted Wireframe Parsing: From Supervised to
Self-Supervised Learning [112.54086514317021]
本稿では,線分とジャンクションを用いた幾何解析のためのホロスティック適応型ワイヤフレーム解析法を提案する。
提案したHAWPは、エンド・ツー・フォームの4Dラベルによって強化された3つのコンポーネントで構成されている。
論文 参考訳(メタデータ) (2022-10-24T06:39:32Z) - MIST: Multiple Instance Self-Training Framework for Video Anomaly
Detection [76.80153360498797]
タスク固有の識別表現を効率的に洗練するためのマルチインスタンス自己学習フレームワーク(MIST)を開発した。
mistは1)スパース連続サンプリング戦略を適用し,より信頼性の高いクリップレベル擬似ラベルを生成するマルチインスタンス擬似ラベル生成器,2)自己誘導型注意強調特徴エンコーダで構成される。
本手法は,上海技術におけるフレームレベルのAUC 94.83%の取得において,既存の教師付きおよび弱教師付き手法と同等あるいはそれ以上に機能する。
論文 参考訳(メタデータ) (2021-04-04T15:47:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。