論文の概要: Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis
- arxiv url: http://arxiv.org/abs/2607.27790v1
- Date: Thu, 30 Jul 2026 07:23:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.442875
- Title: Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis
- Title(参考訳): 多モード感性解析のための意味的アライメント構造抽象化
- Authors: Wei Chen, Junkai Li, Tongguan Wang, Hui Liu, Feiyue Xue, Chuanxiang Ma, Ying Sha,
- Abstract要約: マルチモーダル感覚分析(MSA)は、自然言語と非言語的モダリティを統合することで、複雑な人間の感情を解釈することを目的としている。
SentiLLMは、連続した生信号をコンパクトで意味のあるトークンに蒸留するフレームワークである。
提案手法は,MSAにおける構造抽象パラダイムの有効性を実証し,4つのデータセット上での優れた性能を実現する。
- 参考スコア(独自算出の注目度): 13.853304646673637
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Sentiment Analysis (MSA) aims to interpret complex human emotions by integrating natural language with non-verbal modalities. Non-verbal modalities share a structural isomorphism with natural language, as both can be viewed as feature sequences evolving over time. This isomorphism enables the transformation of non-verbal modalities into text-like tokens for unified semantic reasoning. Large Language Models (LLMs), designed to understand and generate sequential data, can thus be utilized to interpret complex affective sequences. However, existing LLM-based methods primarily capture low-level superficial features, failing to model affective semantics arising from structural variations and contextual interactions. To address this limitation, we propose \textbf{SentiLLM}, a unified framework that leverages \textit{Semantic-Aligned Structural Abstraction} to distill continuous raw signals into compact, semantically meaningful tokens. Specifically, we introduce a \textit{Dual-Stream Salience-Context Calibration Mechanism}, which disentangles non-verbal feature sequences into a focus stream and an ambient stream. The focus stream captures salient sentiment shifts (e.g., facial expressions) guided by textual priors, while the ambient stream characterizes stable background states. Through calibrating these dynamic sentiment shifts against background states, SentiLLM effectively projects non-verbal modalities into a unified semantic space, making them naturally understandable for LLMs. Serving as a plug-and-play module, SentiLLM significantly improves discriminative performance with only a small number of trainable parameters. Our method achieves superior performance on four datasets, MOSI, MOSEI, CH-SIMS, and CH-SIMS v2, demonstrating the effectiveness of the structural abstraction paradigm in MSA. Our code is available at: \href{https://github.com/especiallyW/SentiLLM}.
- Abstract(参考訳): マルチモーダル感覚分析(MSA)は、自然言語と非言語的モダリティを統合することで、複雑な人間の感情を解釈することを目的としている。
非言語的モダリティは自然言語と構造的同型を共有しており、どちらも時間とともに進化する特徴列と見なすことができる。
この同型は、非言語的モダリティを統一意味推論のためのテキストのようなトークンに変換することを可能にする。
大規模言語モデル(LLM)は、シーケンシャルなデータを理解し、生成するために設計されており、複雑な感情的なシーケンスを解釈するために利用することができる。
しかし、既存のLCMベースの手法は主に低レベルの表面的特徴を捉えており、構造的変動や文脈的相互作用から生じる情緒的意味論をモデル化しなかった。
この制限に対処するため,<textit{Semantic-Aligned Structure Abstraction} を利用して連続生信号をコンパクトで意味のあるトークンに蒸留する統合フレームワークである \textbf{SentiLLM} を提案する。
具体的には、非言語的特徴列をフォーカスストリームと周囲ストリームに切り離す「textit{Dual-Stream Salience-Context Calibration Mechanism」を導入する。
フォーカスストリームは、テキストの先行によって導かれる健全な感情変化(例えば、表情)をキャプチャし、周囲ストリームは安定した背景状態を特徴付ける。
これらの動的感情シフトを背景状態に対して校正することで、SentiLLMは非言語的モダリティを統一意味空間に効果的に投影し、LLMに対して自然に理解できるようにする。
SentiLLMはプラグアンドプレイモジュールとして機能し、少数のトレーニング可能なパラメータだけで識別性能を大幅に向上させる。
提案手法は,MOSI,MOSEI,CH-SIMS,CH-SIMS v2の4つのデータセットにおいて,MSAにおける構造抽象パラダイムの有効性を示す。
私たちのコードは以下の通りです。
関連論文リスト
- FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation [76.08991871243333]
FlowSegは、中間復号状態と条件埋め込みの間の双方向のセマンティックフローを通じてセマンティックガイダンスを導入する。
この設計は意味的に接地されたマスク表現と視覚的に整合した言語条件をもたらし、より信頼性の高いマッチングを可能にする。
論文 参考訳(メタデータ) (2026-05-28T06:55:35Z) - Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation [52.8308168727975]
Seg-Agentは完全にトレーニング不要のフレームワークで、Explicit Multimodal Chain-of-Reasoningの先駆者です。
提案手法は, 生成, 選択, 洗練の3段階からなる対話型視覚推論ループを構築する。
various-LangSegは、明示的なセマンティック、ジェネリックオブジェクト、推論誘導セグメンテーションタスクをカバーする新しいベンチマークである。
論文 参考訳(メタデータ) (2026-05-13T03:36:44Z) - Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression [55.51959317490934]
大規模言語モデル(LLM)は、テキスト分散グラフ(TAG)理解において有望な能力を示している。
グラフは本来、構造情報や意味情報を豊富に含むものであり、それらの有効利用はLLMの推論性能の潜在的な利益を解放する可能性があると論じる。
グラフホモフィリーの活用を目的としたフレームワーク LLMs (HS2C) のホモフィリー対応構造とセマンティック圧縮を提案する。
論文 参考訳(メタデータ) (2026-01-13T03:35:18Z) - DEFT-LLM: Disentangled Expert Feature Tuning for Micro-Expression Recognition [16.903294278064667]
マルチエキスパート・ディアングルメントによるセマンティックアライメントを実現するDEFT-LLMを提案する。
まず,テキストと局所的な顔の動きを一致させる動作駆動型命令であるUni-MERを紹介する。
次に、3人の専門家によるアーキテクチャを設計し、顔のダイナミクスを独立した表現に分離します。
論文 参考訳(メタデータ) (2025-11-14T04:21:24Z) - Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability [31.30541946703775]
モデルの内部表現と計算を人間が理解できる概念に変換することが、解釈可能性の重要な目標である。
スパースオートエンコーダのような最近の辞書学習手法は、人間の解釈可能な特徴を発見するための有望な経路を提供する。
しかし、彼らは「文の始めの「The」というフレーズ」のような浅い、トークン特有の、または騒々しい特徴に偏りを呈している。
論文 参考訳(メタデータ) (2025-10-30T17:59:30Z) - LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization [8.365515332927444]
近年の音声トークン化手法は,低レベル音響から意味情報を分離し,言語モデルとの整合性を向上することを目的としている。
新規なセマンティック蒸留を導入する音声トークン化手法であるLM-SPTを提案する。
LM-SPTは,ベースラインに比べて高い再現性が得られることを示す。
論文 参考訳(メタデータ) (2025-06-20T04:15:14Z) - VLLMs Provide Better Context for Emotion Understanding Through Common Sense Reasoning [66.23296689828152]
我々は、視覚・言語モデルの機能を活用し、文脈内感情分類を強化する。
まず、VLLMに対して、視覚的文脈に関連して、被験者の明らかな感情を自然言語で記述するように促す。
第二に、記述は視覚入力とともに、トランスフォーマーベースのアーキテクチャのトレーニングに使用される。
論文 参考訳(メタデータ) (2024-04-10T15:09:15Z) - Guiding the PLMs with Semantic Anchors as Intermediate Supervision:
Towards Interpretable Semantic Parsing [57.11806632758607]
本稿では,既存の事前学習言語モデルを階層型デコーダネットワークに組み込むことを提案する。
第一原理構造をセマンティックアンカーとすることで、2つの新しい中間管理タスクを提案する。
いくつかのセマンティック解析ベンチマークで集中的な実験を行い、我々のアプローチがベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2022-10-04T07:27:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。