論文の概要: Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach
- arxiv url: http://arxiv.org/abs/2607.14702v2
- Date: Tue, 21 Jul 2026 07:24:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.222241
- Title: Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach
- Title(参考訳): 第11回ABAWコンペティションにおけるチームRAS:マルチモーダルアンビバレンス認識アプローチ
- Abstract要約: ビデオレベルのアンビバレンスとヘシタシー認識のための単一のテキスト中心マルチモーダルアプローチを提案する。
提案手法は,テキスト中心のマルチモーダル融合モデルを用いて,言語的,音響的,顔的,シーン的特徴を組み合わせたものである。
行動共生/衛生(BAH)コーパスの実験は、テキストが最強の単調なモダリティであることを確認した。
- 参考スコア(独自算出の注目度): 52.92973028971813
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic recognition of ambivalence and hesitancy is challenging because these states may be expressed through inconsistent linguistic, acoustic, facial, and contextual patterns, while top-performing systems often rely on computationally expensive ensembles. We present a single text-centered multimodal approach for video-level ambivalence and hesitancy recognition for the 11th Affective & Behavior Analysis in-the-Wild (ABAW) Challenge. The proposed approach combines linguistic, acoustic, facial, and scene features using text-centered multimodal fusion model. Text Residual Fusion treats text as the anchor modality and applies gated residual adjustments based on the other modalities. Experiments on the Behavioural Ambivalence/Hesitancy (BAH) corpus confirm that text is the strongest unimodal modality. The Text Residual Fusion model achieves an average Macro F1-score (MF1) of 75.14% across the Development and Public Test subsets. On the Private Test subset, it reaches an MF1 of 78.24%, outperforming the text model by 4.03%. These results demonstrate that complementary multimodal information can improve recognition performance without requiring a large model ensemble.
- Abstract(参考訳): これらの状態が一貫性のない言語的、音響的、顔的、文脈的なパターンを通して表現されるのに対して、最高性能のシステムは計算に高価なアンサンブルに依存することが多いため、アンビヴァレンスとヘシタンシーの自動認識は困難である。
第11回ABAW(Affective & Behavior Analysis in-the-Wild)チャレンジにおいて,ビデオレベルのアンビバレンスとヘシタシー認識のための単一のテキスト中心型マルチモーダルアプローチを提案する。
提案手法は,テキスト中心のマルチモーダル融合モデルを用いて,言語的,音響的,顔的,シーン的特徴を組み合わせたものである。
Text Residual Fusionはテキストをアンカーモダリティとして扱い、他のモダリティに基づいてゲート付残差調整を適用する。
行動共生/衛生(BAH)コーパスの実験は、テキストが最強の単調なモダリティであることを確認した。
Text Residual Fusionモデルは、開発および公開テストサブセットで平均75.14%のマクロF1スコア(MF1)を達成する。
Private Testサブセットでは、MF1の78.24%に達し、テキストモデルを4.03%上回っている。
これらの結果は,大規模なモデルアンサンブルを必要とせずに,相補的なマルチモーダル情報が認識性能を向上させることを示す。
関連論文リスト
- Achieving Text-based Person Retrieval with Any Granularity [80.69427598925718]
本稿では、任意の粒度を持つテキストベースの人物検索という新しいパラダイムを紹介する。
5段階の粒度スペクトルを定式化し,高品質な多粒度アノテートデータセットであるUFine6926-MGを構築した。
次に、クロスモーダルな多重粒度アライニングおよびマッチングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-23T08:42:25Z) - Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment [41.72676356491381]
行動品質アセスメント(AQA)は、人がどれだけ運動を行うかを評価することを目的としている。
ユニモーダルアプローチは、現実の環境での運動品質の微妙な手がかりを捉えるのにしばしば苦労する。
適応アライメントを備えた2段階多モード融合フレームワークであるDualAlignを提案する。
論文 参考訳(メタデータ) (2026-07-08T14:09:13Z) - MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - Team RAS in 10th ABAW Competition: Multimodal Valence and Arousal Estimation Approach [53.64487844936037]
本手法は,顔,行動,音声の3つの相補的なモードを組み合わせる。
実験により,提案したマルチモーダル核融合戦略は, Aff-Wild2 開発セット上で0.658 の一致相関係数(CCC)を達成することを示した。
論文 参考訳(メタデータ) (2026-03-13T15:06:14Z) - Team LEYA in 10th ABAW Competition: Multimodal Ambivalence/Hesitancy Recognition Approach [43.09390014734485]
本稿では,制約のないビデオにおけるアンビバレンス/ヘシタシー認識のためのマルチモーダルアプローチを提案する。
提案手法は,シーン,顔,音声,テキストの4つの相補的モダリティを統合する。
BAHコーパスの実験では、全ての単調基底線上でのマルチモーダル核融合の明らかな利得が示されている。
論文 参考訳(メタデータ) (2026-03-13T09:50:03Z) - FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning [52.88164697048371]
FysicsWorldは、画像、ビデオ、オーディオ、テキスト間の双方向入力出力をサポートする最初の統一されたフルモダリティベンチマークである。
FysicsWorldには16の主要なタスクと3,268のキュレートされたサンプルが含まれており、40以上の高品質なソースから集約されている。
論文 参考訳(メタデータ) (2025-12-14T16:41:29Z) - Enhancing Multimodal Sentiment Analysis for Missing Modality through Self-Distillation and Unified Modality Cross-Attention [45.31956918333587]
マルチモーダルな感情分析では、テキストデータの収集はビデオやオーディオよりも難しいことが多い。
我々は,テキストのモダリティがなくても,マルチモーダルな感情情報を統合する頑健なモデルを開発した。
論文 参考訳(メタデータ) (2024-10-19T07:59:41Z) - TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis [26.867610944625337]
言語・視覚・音響モダリティを活用したマルチモーダル感性分析(MSA)の試み
過去の研究は、主に表現学習技術と特徴融合戦略の改善に焦点を当てた。
テキスト指向のクロスアテンションネットワーク(TCAN)を導入し,MSAにおけるテキストモダリティの主要な役割を強調した。
論文 参考訳(メタデータ) (2024-04-06T07:56:09Z) - Joint Multimodal Transformer for Emotion Recognition in the Wild [49.735299182004404]
マルチモーダル感情認識(MMER)システムは、通常、単調なシステムよりも優れている。
本稿では,キーベースのクロスアテンションと融合するために,ジョイントマルチモーダルトランス (JMT) を利用するMMER法を提案する。
論文 参考訳(メタデータ) (2024-03-15T17:23:38Z) - SCMM: Calibrating Cross-modal Representations for Text-Based Person Search [45.24784242117999]
テキストベースPerson Search (TBPS) は、クロスモーダル情報融合において重要な課題に直面している。
SCMM(Sew and Masked Modeling)は,2つの相補的なメカニズムによってこれらの融合課題に対処する新しいフレームワークである。
論文 参考訳(メタデータ) (2023-04-05T07:50:16Z) - Bi-Bimodal Modality Fusion for Correlation-Controlled Multimodal
Sentiment Analysis [96.46952672172021]
Bi-Bimodal Fusion Network (BBFN) は、2対のモダリティ表現で融合を行う新しいエンドツーエンドネットワークである。
モデルは、モダリティ間の既知の情報不均衡により、2つのバイモーダルペアを入力として取る。
論文 参考訳(メタデータ) (2021-07-28T23:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。