論文の概要: CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition
- arxiv url: http://arxiv.org/abs/2607.13976v1
- Date: Wed, 15 Jul 2026 16:02:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.826674
- Title: CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition
- Title(参考訳): CF-Net: 話者正規化と確実度重み付けを併用した衝突核融合
- Authors: Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh,
- Abstract要約: CF-Netは、凍結したSigLIP2、HuBERT、DistilBERTのバックボーンで、ビジュアル、オーディオ、および転写ストリームをエンコードする。
ConflictFusionモジュールは、ペアワイズ・クロスモーダルの不整合を明示的に計算する。
CF-NetはBAH検証セットで0.7155のマクロF1、プライベートチャレンジテストセットで0.7364(AP = 0.7492)を達成する。
- 参考スコア(独自算出の注目度): 4.4644619064521995
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detecting ambivalence and hesitancy (AH) in unconstrained video is challenging because the target signal is inherently ambiguous and expressed through subtle cross-modal incongruence rather than prototypical affect. We present CF-Net, a deep multimodal network submitted to the 3rd Edition of the AH Video Recognition Challenge (ABAW 11th, ECCV 2026), targeting the BAH dataset. CF-Net encodes visual, audio, and transcript streams with frozen SigLIP2, HuBERT, and DistilBERT backbones, normalises backbone features per speaker to reduce identity leakage, and fuses them via a ConflictFusion module that explicitly computes pairwise cross-modal incongruence. Training combines certainty-weighted focal loss, manifold mixup, and modality dropout; an auxiliary certainty-regression head leverages ambiguity annotations to stabilise learning on genuinely borderline samples. CF-Net achieves a Macro F1 of 0.7155 on the BAH validation set and 0.7364 (AP = 0.7492) on the private challenge test set.
- Abstract(参考訳): 非拘束ビデオにおけるアンビバレンスとヘシシタンス(AH)の検出は、ターゲット信号が本質的に不明瞭であり、原型的影響よりも微妙なクロスモーダル不一致によって表現されるため困難である。
AHビデオ認識チャレンジの第3版(ABAW 11th, ECCV 2026)に提出された深いマルチモーダルネットワークであるCF-Netについて述べる。
CF-Netは、凍結したSigLIP2、HuBERT、DistilBERTのバックボーンで、ビジュアル、オーディオ、トランスクリプトストリームをエンコードし、話者ごとのバックボーン機能を正規化し、IDリークを減らす。
トレーニングは、特定の重み付けされた焦点損失、多様体の混合、モダリティのドロップアウトを組み合わせる。
CF-NetはBAH検証セットで0.7155のマクロF1、プライベートチャレンジテストセットで0.7364(AP = 0.7492)を達成する。
関連論文リスト
- Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment [53.50824432699408]
Traits Run Deeperは、新しいパーソナリティアセスメントフレームワークである。
MFR(Multimodal Foundation Representation)、TSMF(Trit-Specific Modality Fusion)、DCPR(Distributed-Calibrated Personality Regression)の3つのコンポーネントで構成されている。
論文 参考訳(メタデータ) (2026-06-09T06:38:36Z) - FIDES: Faithful Inference via Deep Evidence Signals for Retrieval-Memory Conflict in RAG [28.69005193011498]
コントラストデコーディングは、パラメトリックバイアスを抑制するために文脈条件付き出力を増幅する。
単一のグローバルな対照的な重みは、真に矛盾したトークンを不十分に修正しながら、安全なトークンを過払いする。
本研究では,学習不要なデコーダであるFIDESを提案する。
論文 参考訳(メタデータ) (2026-06-04T03:16:17Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion [0.0]
第10回ABAWコンペティション(CVPR 2026)におけるA/Hビデオ認識チャレンジへの取り組み
本稿では,視覚的,音声的,テキスト的チャネル間の相互競合を明示的に測定する分散型マルチモーダル融合を提案する。
提案手法は, 検証テストセットにおいて0.6808のマクロF1を達成し, 課題ベースラインの0.2827を上回った。
論文 参考訳(メタデータ) (2026-03-15T15:37:25Z) - Team RAS in 10th ABAW Competition: Multimodal Valence and Arousal Estimation Approach [53.64487844936037]
本手法は,顔,行動,音声の3つの相補的なモードを組み合わせる。
実験により,提案したマルチモーダル核融合戦略は, Aff-Wild2 開発セット上で0.658 の一致相関係数(CCC)を達成することを示した。
論文 参考訳(メタデータ) (2026-03-13T15:06:14Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Bulk-Calibrated Credal Ambiguity Sets: Fast, Tractable Decision Making under Out-of-Sample Contamination [8.826173150779145]
分散ロバストな最適化(DRO)は、あいまいさセットよりも最悪のケースで予想される損失を最小化する。
我々は,IPクレダルセットが,解釈可能な許容レベルを持つDRO目標にどのように変換されるかを示す。
論文 参考訳(メタデータ) (2026-01-29T06:37:36Z) - When in Doubt, Deliberate: Confidence-Based Routing to Expert Debate for Sexism Detection [7.299050989302629]
我々は,(i)低表現,(ii)雑音,(iii)データおよびモデル予測における概念的あいまいさの複合効果に対処する枠組みを提案する。
提案手法では,タスク EXIST 2025 タスク 1.1 では F1 が +2.72% 改善され,EDOS A と B では +4.48% と +1.30% が得られた。
論文 参考訳(メタデータ) (2025-12-21T05:48:57Z) - Expressive Losses for Verified Robustness via Convex Combinations [67.54357965665676]
本研究では, 過近似係数と異なる表現的損失に対する性能分布の関係について検討した。
表現性が不可欠である一方で、最悪の場合の損失のより良い近似は、必ずしも優れた堅牢性-正確性トレードオフに結びついていないことを示す。
論文 参考訳(メタデータ) (2023-05-23T12:20:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。