論文の概要: Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding
- arxiv url: http://arxiv.org/abs/2608.04054v1
- Date: Tue, 04 Aug 2026 10:55:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.482512
- Title: Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding
- Title(参考訳): マルチモーダル・インテント理解のためのモダリティ・コンセンサスとコンフリクト・アウェア・プロトタイプハイパーグラフ学習
- Abstract要約: 本稿では,マルチモーダルな合意と対立を表現する階層型プロトタイプ・ハイパーグラフフレームワークを提案する。
MACH (Modality Agreement- and Conflict-aware prototype Hypergraph) は、マルチモーダルなコンセンサスとコンフリクトを別個のリレーショナル構造として表現する。
- 参考スコア(独自算出の注目度): 2.2012643583422347
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal intent recognition requires understanding not only what textual, acoustic, and visual signals share, but also how they disagree. Such disagreement is frequently class-informative; for example, lexical positivity accompanied by incongruent vocal or facial behavior may indicate sarcasm or taunting, yet most fusion methods either encourage modality alignment or treat inconsistency as uncertainty to be suppressed. We propose MACH (Modality Agreement- and Conflict-aware prototype Hypergraph), a hierarchical prototype-hypergraph framework that represents multimodal agreement and conflict as distinct, recurring relational structures. MACH progressively composes unimodal representations into bimodal and trimodal abstractions. At each applicable level, modality-composition anchors activate sparse agreement prototype hypergraphs that capture reusable consensus patterns, while a separate conflict pathway maps cross-modal discrepancies to dedicated conflict prototype hypergraphs. The two pathways are combined through a feature-wise, sample-adaptive arbitration mechanism, enabling the model to preserve informative disagreement while suppressing incidental modality noise. A progressive optimization strategy stabilizes the interdependent hierarchy before joint agreement-conflict learning. Experiments on benchmark datasets demonstrate the effectiveness of the proposed formulation, while component and robustness analyses validate the distinct roles of hierarchical composition, prototype-mediated semantic refinement, and agreement-conflict arbitration.
- Abstract(参考訳): マルチモーダルな意図認識は、テキスト、音響、視覚信号の共有だけでなく、それらがどのように一致しているかを理解する必要がある。
このような不一致はしばしば類型的であり、例えば、不連続な声や顔の振舞いを伴う語彙的肯定は、サルカズムまたはタウンティングを示すことがあるが、ほとんどの融合法は、不整合を抑制すべき不整合性として促進するか、不整合を治療する。
マルチモーダルなアグリーメントとコンフリクトを表す階層型プロトタイプ・ハイパグラフフレームワークであるMACH(Modality Agreement- and Conflict-aware prototype Hypergraph)を提案する。
MACHは、一様表現を二モーダル抽象と三モーダル抽象に徐々に構成する。
各レベルにおいて、モダリティ・コンポジション・アンカーは、再利用可能なコンセンサスパターンをキャプチャするスパース・コンセンサス・プロトタイプ・ハイパーグラフを起動する一方、コンセンサス・パスは、クロスモーダルな差異を専用のコンセンサス・プロトタイプ・ハイパーグラフにマップする。
2つの経路は特徴的、サンプル適応的調停機構によって結合され、入射モードノイズを抑えながら情報的不一致を抑えることができる。
プログレッシブ最適化戦略は、共同合意紛争学習の前に相互依存階層を安定化する。
ベンチマークデータセットの実験では、提案した定式化の有効性が示され、一方、コンポーネントおよびロバスト性分析は、階層構成、プロトタイプによるセマンティックリファインメント、および合意-紛争仲裁の異なる役割を検証している。
関連論文リスト
- Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization for Multimodal Sarcasm Detection [8.747820204756566]
マルチモーダルサルカズム検出は、マルチモーダルコンテンツからサーカティックインテントを特定することを目的としている。
新しいフレームワークは動的Gated Cross-Modal FusionとSarcastic-aware Contrastive Regularizationを統合している。
論文 参考訳(メタデータ) (2026-08-20T12:02:06Z) - CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection [56.64398465636452]
ジェネレーティブAIは、マルチモーダルなフェイクニュースをますます現実的で広範にし、公共の信頼と社会的安定に深刻な脅威を与えている。
textbfConflict-textbfOriented textbfREasoning (textbfCORE) フレームワークを提案する。
COREは堅牢で一般化可能なコンフリクト検出を実現し、いくつかのサンプルやゼロショット設定で、目に見えない操作タイプに効果的かつ迅速に適応する。
論文 参考訳(メタデータ) (2026-06-02T02:53:48Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention [32.62063298936575]
この研究は、人間のコミュニケーションにおける微妙な実用的不整合をモデル化するための、堅牢で分離されたパラダイムを提供する。
textttMUStARDベンチマークと、その素早い相関緩和型バランスデータセットの実験は、我々のアプローチが新しい最先端のパフォーマンスを達成することを実証している。
論文 参考訳(メタデータ) (2026-05-04T10:47:17Z) - Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning [78.86309644343295]
長い連鎖推論におけるマルチモーダルな大言語モデル(MLLM)は、異なる知識源が矛盾する信号を提供するときにしばしば失敗する。
我々は、これらの失敗を知識の衝突という統一概念の下で形式化し、入力レベルの客観的衝突とプロセスレベルの効果的な衝突を区別する。
本研究は,知識衝突下でのマルチモーダル推論のメカニズムを考察し,長CoT障害の診断と制御を可能にする。
論文 参考訳(メタデータ) (2026-02-16T07:10:44Z) - When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models [75.16145284285456]
我々は,White-box設定とBlack-box設定の両方の下で,組込みVLAモデルのマルチモーダル対向ロバスト性に関する総合的研究であるVLA-Foolを紹介する。
自動生成および意味的に誘導されるプロンプトフレームワークを最初に開発する。
LIBEROベンチマークの実験では、小さなマルチモーダル摂動でさえ大きな行動偏差を引き起こすことが示されている。
論文 参考訳(メタデータ) (2025-11-20T10:14:32Z) - Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning [49.17801010041155]
MLLM(Multimodal large language model)は、テキスト、ビジョン、オーディオなどの多様な入力を統合することで推論を強化することを約束する。
しかし、追加のモダリティがパフォーマンスを損なうかどうかについての報告は相反する。
我々は、多モーダル推論を6つの相互作用パターンに分類し、事実がどのようにモダリティに分散され、論理的に組み合わせられるかを決定する。
論文 参考訳(メタデータ) (2025-09-28T08:46:11Z) - CLAMP: Contrastive Learning with Adaptive Multi-loss and Progressive Fusion for Multimodal Aspect-Based Sentiment Analysis [0.6961946145048322]
本稿では,Adaptive Multi-lossとProgressive Attention Fusionを用いた,エンドツーエンドのコントラスト学習フレームワークを提案する。
このフレームワークは、Progressive Attention Fusion Network、Multi-task Contrastive Learning、Adaptive Multi-loss Aggregationの3つの新しいモジュールで構成されている。
標準の公開ベンチマークによる評価は、CLAMPが既存の最先端技術よりも一貫して優れていることを示している。
論文 参考訳(メタデータ) (2025-07-21T11:49:57Z) - CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation [24.952907733127223]
クロスモーダルアライメント・蒸留(CAD)を用いたビデオディープフェイク検出のための一般的なフレームワークを提案する。
1)高レベルのセマンティックシンセシスにおける矛盾を識別するクロスモーダルアライメント(例:リップ音声ミスマッチ)、2)モダリティ特異的な法医学的痕跡(例:合成音声のスペクトル歪み)を保存しながらミスマッチを緩和するクロスモーダル蒸留(例:合成音声のスペクトル歪み)である。
論文 参考訳(メタデータ) (2025-05-21T08:11:07Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。