論文の概要: Fine-Grained Visual Preprocessing and Dual-Stream Temporal Modeling for Multimodal Sentiment Analysis on Social Media
- arxiv url: http://arxiv.org/abs/2609.07010v1
- Date: Mon, 07 Sep 2026 04:01:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:55:19.656061
- Title: Fine-Grained Visual Preprocessing and Dual-Stream Temporal Modeling for Multimodal Sentiment Analysis on Social Media
- Title(参考訳): ソーシャルメディア上でのマルチモーダル感性分析のためのファイングラインドビジュアル前処理とデュアルストリームテンポラルモデリング
- Abstract要約: マルチモーダル感情分析は、生のビデオノイズと時間的モデリングが不十分なため、テキストに支配されることが多い。
本研究では,NAPS,DS-TAFNet,DS-TAFNetの3つの改良点を提案する。
これらの結果は,限られたデータ条件下での融合複雑性の増加よりも,視覚的入力品質と時間的表現の改善が効果的であることを示す。
- 参考スコア(独自算出の注目度): 2.858227487978669
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal sentiment analysis often remains text-dominant due to raw-video noise and insufficient temporal modeling. Using CH-SIMS v2.0S, this study proposes three improvements: the NAPS pipeline---a seven-stage system integrating face tracking,identity embedding, and normalized lip-motion analysis to reduce visual noise;DS-TANet, combining an EfficientNetB2 static stream, RAFT optical-flow motion stream, motion-guided attention, and Bi-GRU temporal modeling; and DS-TAFNet, fusing visual and MacBERT-Base textual representations via concatenation fusion. With NAPS, the static visual baseline achieves 80.98\% Macro F1, comparable to the text baseline of 80.55\%; DS-TANet improves visual Macro F1 to 82.58\%;and DS-TAFNet achieves 87.49\% accuracy and 87.48\% Macro F1. These results demonstrate that improving visual input quality and temporal representation is more effective than increasing fusion complexity under limited-data conditions.
- Abstract(参考訳): マルチモーダル感情分析は、生のビデオノイズと時間的モデリングが不十分なため、テキストに支配されることが多い。
CH-SIMS v2.0Sを用いて, 顔追跡, 同一性埋め込み, 正常化リップモーション分析を統合した7段階のシステムであるNAPSパイプライン, 効率的なNetB2静的ストリーム, RAFT光フローモーションストリーム, 動き誘導された注意, およびBi-GRU時間モデルを組み合わせたDS-TAFNet, 結合融合による視覚的およびMacBERT-Baseテキスト表現を融合したDS-TAFNetの3つの改良を提案する。
NAPSでは、静的ビジュアルベースラインは80.98\%のマクロF1、テキストベースラインは80.55\%、DS-TANetはビジュアルマクロF1を82.58\%に改善し、DS-TAFNetは87.49\%の精度と87.48\%のマクロF1を達成する。
これらの結果は,限られたデータ条件下での融合複雑性の増加よりも,視覚的入力品質と時間的表現の改善が効果的であることを示す。
関連論文リスト
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding [0.0]
MTSS(Multi-Stream Scene Script)はモノリシックなテキストを因数化して具体化されたシーン記述に置き換える新しいパラダイムである。
広範囲な実験によりMTSSは様々なモデルにおけるビデオ理解を一貫して強化することを示した。
アーキテクチャの適応がなくても、マルチショットビデオ生成におけるモノリシックプロンプトをMTSSに置き換えると、大幅に改善される。
論文 参考訳(メタデータ) (2026-04-13T09:50:36Z) - AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment [18.39945426205332]
本稿では,動的セマンティックアライメントを用いた適応グラフ信号処理(AGSP DSA)フレームワークを提案する。
CMU-MOSEI、AVE、MM-IMDBを含む3つのベンチマークデータセットの実験結果は、AGSP-DSAが最先端として機能していることを示している。
論文 参考訳(メタデータ) (2026-01-26T15:35:03Z) - Adaptive Fusion Network with Temporal-Ranked and Motion-Intensity Dynamic Images for Micro-expression Recognition [0.0]
マイクロ・エクスプレッション(ME)は微妙で過渡的な顔の変化であり、非常に低強度であり、肉眼ではほとんど知覚できない。
本稿では2つの主な貢献点を持つ新しいMER法を提案する。
まず,時間的進行を重視したテンポラルランク動的画像と,動きの強度を取り入れたフレームリオーダー機構による微妙な動きを強調するモーションインテンシティ動的画像の2つの相補的表現を提案する。
第2に,これら2つの表現を最適に統合することを自動的に学習し,雑音を抑えながら識別的ME特性を向上する適応融合ネットワークを提案する。
論文 参考訳(メタデータ) (2025-10-10T11:03:20Z) - UniVid: The Open-Source Unified Video Model [41.15980565061684]
MLLMと拡散デコーダを軽量アダプタで結合する統一アーキテクチャUniVidを提案する。
標準ベンチマークの実験では、最先端のパフォーマンスが示されている。
論文 参考訳(メタデータ) (2025-09-29T02:31:36Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment [5.922172844641853]
本稿では,マルチモーダルコンテンツ理解に基づく新しい映像要約モデルであるMF2Summを紹介する。
MF2Summは、特徴抽出、モーダル間アテンション相互作用、特徴融合、セグメント予測、キーショット選択という5段階のプロセスを採用している。
SumMeおよびTVSumデータセットの実験結果から,MF2Summが競合性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-06-12T07:32:51Z) - GAME: Learning Multimodal Interactions via Graph Structures for Personality Trait Estimation [13.071227081328288]
ショートビデオからの明瞭なパーソナリティ分析は、視覚的、聴覚的、およびテキスト的手がかりの複雑な相互作用のため、重要なチャルレンジを呈する。
本稿では,グラフ拡張型マルチモーダル進化法であるGAMEを提案する。
ビジュアルストリームのために、顔グラフを構築し、グラフ畳み込みネットワーク(GCN)と畳み込みニューラルネットワーク(CNN)を組み合わせたデュアルブランチGeo Two-Stream Networkを導入する。
時間的ダイナミクスを捉えるために、フレームレベルの特徴はBiGによって処理される
論文 参考訳(メタデータ) (2025-05-05T13:48:09Z) - DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs [124.52164183968145]
視覚言語モデル(VLM)の計算負担を軽減する,効率的なトレーニング不要なフレームワークであるDyMUを提案する。
まず、動的トークンマージ(DToMe)は、画像の複雑さに基づいて類似のトークンをマージすることで、視覚トークンの埋め込み数を削減します。
第二に、仮想トークンアンマージ(VTU)は、大きな言語モデル(LLM)の期待トークンシーケンスを、フルシーケンスの注意ダイナミクスを効率的に再構築することでシミュレートする。
論文 参考訳(メタデータ) (2025-04-23T18:38:18Z) - Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models [111.97026994761254]
Mixture-of-Transformer (MoT) はスパースマルチモーダルトランスアーキテクチャである。
MoTはモデルの非埋め込みパラメータをモダリティで分離する。
複数の設定とモデルスケールでMoTを評価する。
論文 参考訳(メタデータ) (2024-11-07T18:59:06Z) - Slow-Fast Visual Tempo Learning for Video-based Action Recognition [78.3820439082979]
アクション・ビジュアル・テンポ(Action visual tempo)は、アクションのダイナミクスと時間スケールを特徴付ける。
以前の方法は、複数のレートで生のビデオをサンプリングするか、階層的にバックボーンの特徴をサンプリングすることによって、視覚的テンポをキャプチャする。
単一層における低レベルバックボーン特徴からアクション・テンポを抽出するための時間相関モジュール(TCM)を提案する。
論文 参考訳(メタデータ) (2022-02-24T14:20:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。