論文の概要: Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis
- arxiv url: http://arxiv.org/abs/2608.16201v1
- Date: Mon, 17 Aug 2026 07:34:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.57774
- Title: Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis
- Title(参考訳): LLMに基づくマルチモーダル感性分析のためのマルチグラニュラリティ感性統合
- Authors: Shanshan Lin, Yuesheng Wu, Chao Chen, Yizhe Yang, Zhihao Chen, Zexian Yang, Xiangwen Liao,
- Abstract要約: マルチモーダル感情分析(MSA)は、テキスト、音声、視覚などの異種入力から感情の極性と強度を予測することを目的としている。
LLMベースのMSAのための多粒度感情統合フレームワークMGSIを提案する。
- 参考スコア(独自算出の注目度): 11.01072663453698
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal sentiment analysis (MSA) aims to predict sentiment polarity and intensity from heterogeneous inputs such as text, audio, and vision. While large language models (LLMs) offer strong semantic priors for MSA, effectively incorporating audio and visual signals effectively remains challenging. A key challenge is that audio and visual sentiment cues evolve over different temporal scales, yet many LLM-based methods compress these signals through shallow projection or coarse pooling before fusing them with text, which can weaken cross-modal alignment and erase fine-grained affective information. We propose MGSI, a multi-granularity sentiment integration framework for LLM-based MSA. MGSI first encodes audio and visual streams at short-, medium-, and long-range temporal scales, preserving both local variations and global affective trends. It then refines non-text features through text-guided alignment, and applies polarity- and intensity-aware enhancement to better handle ambiguous and near-neutral samples. The resulting multimodal representation is finally compressed into a small set of pseudo-tokens for efficient conditioning of a frozen LLM. Experiments on four public benchmarks show that MGSI substantially outperforms frozen-LLM baselines and remains competitive with strong multimodal methods. Further ablation and sensitivity analyses support the effectiveness of multi-granularity temporal modeling, text-guided refinement, and adaptive sentiment calibration.
- Abstract(参考訳): マルチモーダル感情分析(MSA)は、テキスト、音声、視覚などの異種入力から感情の極性と強度を予測することを目的としている。
大規模言語モデル(LLM)は、MSAに強力なセマンティック先行を提供するが、音声や視覚信号を効果的に組み込むことは、依然として困難である。
重要な課題は、異なる時間スケールで音声と視覚の感情の手がかりが進化することであるが、多くのLCMベースの手法は、これらの信号を浅い投射や粗いプーリングを通じて圧縮し、テキストと融合することで、モーダルなアライメントを弱め、きめ細かい感情情報を消去することができる。
LLMベースのMSAのための多粒度感情統合フレームワークMGSIを提案する。
MGSIはまず、短・中・長距離の時間スケールで音声と視覚のストリームを符号化し、局所的な変動とグローバルな感情傾向の両方を保存する。
その後、テキスト誘導アライメントによって非テキスト機能を洗練し、偏極性および強度認識の強化を適用し、あいまいなサンプルやほぼ中立なサンプルの処理を改善する。
結果のマルチモーダル表現は、凍結LDMの効率的な条件付けのために、最後に擬似トークンの小さなセットに圧縮される。
4つの公開ベンチマークの実験では、MGSIは凍ったLLMベースラインを大幅に上回っており、強力なマルチモーダル手法と競合している。
さらにアブレーションと感度分析は、多粒度時間モデル、テキスト誘導リファインメント、適応的な感情校正の有効性を支持する。
関連論文リスト
- MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs [0.0]
感情分析のためのマルチモーダル適応Few-Shot Prompting (MAF) フレームワークを提案する。
MAFはクエリ関連デモを検索して統合し、MLLMの感情推論能力を文脈に敏感な方法で引き出す。
公開ベンチマークデータセットの実験では、MAFが大幅に、一貫したパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2026-06-14T09:16:36Z) - Explicit Representation Alignment for Multimodal Sentiment Analysis [17.25685888421759]
マルチモーダル感情分析は、テキストや画像などの異質なモダリティを共同でモデル化することで、人間の感情と感情を理解することを目的としている。
実効マルチモーダル学習の鍵となるボトルネックとして,独立に事前訓練されたモダリティエンコーダ間の表現の不整合を同定する。
視覚的コンテンツを構造化されたテキスト記述に変換するために視覚言語モデル(VLM)を利用する統合マルチモーダル感情分析フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-08T07:43:52Z) - Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models [67.45032003041399]
本稿では,MLLMに対する敵例の転送可能性を高めるために,MPCAttack(Multi-Paradigm Collaborative Attack)フレームワークを提案する。
MPCOは異なるパラダイム表現の重要性を適応的にバランスさせ、グローバルな最適化を導く。
我々のソリューションは、オープンソースおよびクローズドソースMLLMに対する標的および未ターゲットの攻撃において、常に最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2026-03-05T06:01:26Z) - From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning [12.903267405917388]
マルチモーダル大規模言語モデル(MLLM)であるMADIを提案する。
合成および実世界のベンチマーク実験により、MADIは汎用LLMと時系列特化MLLMを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-29T09:13:46Z) - A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models [85.30893355216486]
我々は,異なるdMLLMアーキテクチャとタスクを用いて,視覚的トークン冗長性がどのように進化するかを検討する。
本研究により, 視覚的冗長性は, 長時間のタスクを処理しながら, オフスクラッチdMLLMでのみ現れることが明らかとなった。
層スキッピングはAR-to-diffusion dMLLMの加速に有効であるのに対し、プログレッシブプルーニングやレイトステッププルーニングはストクラッチdMLLMよりも効果的である。
論文 参考訳(メタデータ) (2025-11-19T04:13:36Z) - Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations [94.62792643569567]
この研究は、話者の感情の役割を体系的に調査する。
複数の感情や強度にまたがって表現される悪意のある音声命令のデータセットを構築し、いくつかの最先端のLALMを評価する。
異なる感情は、様々なレベルの安全でない反応を誘発し、強度の影響は非単調であり、中性表現は最大のリスクを伴うことが多い。
論文 参考訳(メタデータ) (2025-10-19T15:41:25Z) - Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis [27.11612547025828]
textbfAdaptive textbfGated textbfFusion textbfNetwork。
CMU-MOSIとCMU-MOSEIの実験により、AGFNは精度において強いベースラインを著しく上回り、頑健なパフォーマンスを持つ微妙な感情を効果的に識別することを示した。
論文 参考訳(メタデータ) (2025-10-02T05:05:41Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Large AI Model Empowered Multimodal Semantic Communications [48.73159237649128]
本稿では,Large AI Model-based Multimodal SC (LAMMSC) フレームワークを提案する。
まず、条件付きマルチモーダルアライメント(MMA)を提案し、マルチモーダルデータと非モーダルデータ間の変換を可能にする。
次に、パーソナライズされたLLMベースの知識ベース(LKB)を提案し、ユーザがパーソナライズされたセマンティック抽出やリカバリを行うことができる。
最後に,CGE(Generative Adversarial Network-based Channel Estimation)を用いて,無線チャネルの状態情報を推定する。
論文 参考訳(メタデータ) (2023-09-03T19:24:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。