論文の概要: UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction
- arxiv url: http://arxiv.org/abs/2608.04949v1
- Date: Wed, 05 Aug 2026 15:18:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.975736
- Title: UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction
- Title(参考訳): UG-UMRE:統一マルチモーダル関係抽出のための不確実性誘導モード拡張と分布校正
- Authors: Bo Kong, Liruiz Jia, Yi Liang, Chao Liu, Dongfang Han, Tianwei Yan, Yuan Liu, Shengquan Liu,
- Abstract要約: 不確実性駆動一様拡張(UDUA)とJAUA(Joint Aleatoric Uncertainty Alignment)を提案する。
UDUAは、セマンティック一貫性を維持しながら、効果的にノイズを除去する。
JAUAleverages probabilistic distribution consistency to construct a shared latent space。
3つのベンチマークデータセットの実験は、UG-UMREが最先端のパフォーマンスを達成することを示した。
- 参考スコア(独自算出の注目度): 15.235667200083226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified Multimodal Relation Extraction (UMRE) aims to identify intra-modal and cross-modal relations between textual entities and visual objects. However, existing UMRE studies still encounter two critical issues: ignoring inherent aleatoric uncertainty causes noise propagation, and deep-seated heterogeneity between distinct modal distributions hinders alignment. To address these issues, we propose the Uncertainty-Guided UMRE Network (UG-UMRE). Specifically, we design an Uncertainty-Driven Unimodal Augmentation (UDUA) module, which models features as Gaussian distributions based on the Variational Information Bottleneck. By incorporating an uncertainty-aware self-supervised contrastive learning mechanism, UDUA effectively filters out noise while maintaining semantic consistency. Furthermore, we introduce the Joint Aleatoric Uncertainty Alignment (JAUA) module as a global semantic pre-calibration mechanism. JAUA leverages probabilistic distribution consistency to construct a shared latent space, eliminating the distributional gap by synchronizing cross-modal statistical properties, thereby laying a robust foundation for fine-grained interaction. Experiments on three benchmark datasets (UMRE, MORE, and MNRE) demonstrate that UG-UMRE achieves state-of-the-art performance. Further analysis validates the pluggable and effective performance of the proposed UDUA and JAUA modules.
- Abstract(参考訳): 統一マルチモーダル関係抽出(UMRE)は、テキストエンティティと視覚オブジェクト間のモーダル内およびモーダル間関係を同定することを目的としている。
しかし、既存のUMRE研究は、2つの重要な問題に直面している。
これらの課題に対処するため,Uncertainty-Guided UMRE Network (UG-UMRE)を提案する。
具体的には,変分情報ボトルネックに基づくガウス分布をモデルとした不確実性駆動ユニモーダル拡張(UDUA)モジュールを設計する。
不確実性を考慮した自己教師付きコントラスト学習機構を導入することで、UDUAはセマンティック一貫性を維持しつつ、効果的にノイズを除去する。
さらに,大域的セマンティック事前校正機構として,JAUAモジュールを導入する。
JAUAは確率分布の整合性を活用して共有潜在空間を構築することにより、クロスモーダルな統計特性を同期させることにより分布ギャップを排除し、きめ細かな相互作用のための堅牢な基盤を構築する。
3つのベンチマークデータセット(UMRE、MORE、MNRE)の実験は、UG-UMREが最先端のパフォーマンスを達成することを示した。
さらなる解析により,提案したUDUAモジュールとJAUAモジュールのプラガブルかつ有効性能が検証される。
関連論文リスト
- UMSS: Towards Unsupervised Multi-modal Semantic Segmentation [6.785303759588842]
我々は、unsupervised Multimodal Semantic (UMSS) の問題を解決するための最初の試みを行っている。
従来の融合手法を一貫した性能向上に変換するDINOv3上に構築された新しいフレームワークUniM2を提案する。
私たちのキーとなるアイデアは、Cross Modal Cor correspondingence Synergy(CMCS)によって駆動される統一潜在空間を学習し、固有の共有セマンティックキューを抽出することです。
論文 参考訳(メタデータ) (2026-07-14T05:44:29Z) - Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment [53.50824432699408]
Traits Run Deeperは、新しいパーソナリティアセスメントフレームワークである。
MFR(Multimodal Foundation Representation)、TSMF(Trit-Specific Modality Fusion)、DCPR(Distributed-Calibrated Personality Regression)の3つのコンポーネントで構成されている。
論文 参考訳(メタデータ) (2026-06-09T06:38:36Z) - A Mutual Information Lower Bound for Multimodal Regression Active Learning [9.04041860173466]
Mutual Information Lower Bound (MI-LB) は、Mixture Network アンサンブルのクローズドフォーム近似である。
我々は,MI-LBがマルチモーダルシステムを備えたベンチマークで評価されたベースラインのすべてに一致または打ち勝つことを示す。
論文 参考訳(メタデータ) (2026-05-14T14:50:47Z) - Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective [6.3310165899037045]
頑健なマルチモーダル学習のための因果的モダリティ不変表現(CmIR)学習フレームワークを提案する。
CmIRは学習した不変表現が、異なる環境におけるラベルとの安定した予測関係を維持することを保証している。
CmIRはアウト・オブ・ディストリビューションデータとノイズデータに優れ、その堅牢性と一般化性を確認する。
論文 参考訳(メタデータ) (2026-04-20T16:16:36Z) - Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs [84.3271821505699]
カオス・オブ・モダリティ(Chain of Modality, CoM)は、マルチモーダル融合を受動的結合から動的オーケストレーションに移行するエージェントフレームワークである。
CoMはトレーニングフリーまたはデータ効率のSFT設定で動作し、様々なベンチマークで堅牢で一貫した一般化を実現する。
論文 参考訳(メタデータ) (2026-04-16T01:21:14Z) - Latent Diffusion Model Based Denoising Receiver for 6G Semantic Communication: From Stochastic Differential Theory to Application [11.385703484113552]
生成人工知能(GAI)を利用した新しい意味コミュニケーションフレームワークを提案する。
意味的特徴抽出のための変分オートエンコーダを組み合わせた潜在拡散モデル(LDM)に基づくセマンティックコミュニケーションフレームワークを提案する。
提案システムはゼロショットの一般化をサポートし,低SNRおよびアウト・オブ・ディストリビューション条件下での優れた性能を実現する訓練自由フレームワークである。
論文 参考訳(メタデータ) (2025-06-06T03:20:32Z) - Latent Distribution Decoupling: A Probabilistic Framework for Uncertainty-Aware Multimodal Emotion Recognition [7.25361375272096]
マルチモーダル・マルチラベル感情認識は,マルチモーダルデータにおける複数の感情の存在を同時に認識することを目的としている。
既存の研究では、マルチモーダルデータに固有のノイズであるテクスブファレラティック不確実性の影響を見落としている。
本稿では,不確かさ認識フレームワークを用いた潜在感情分布分解法を提案する。
論文 参考訳(メタデータ) (2025-02-19T18:53:23Z) - Modality Prompts for Arbitrary Modality Salient Object Detection [57.610000247519196]
本論文は、任意のモーダリティ・サリエント物体検出(AM SOD)の課題について述べる。
任意のモダリティ、例えばRGBイメージ、RGB-Dイメージ、RGB-D-Tイメージから有能なオブジェクトを検出することを目的としている。
AM SODの2つの基本的な課題を解明するために,新しいモード適応トランス (MAT) を提案する。
論文 参考訳(メタデータ) (2024-05-06T11:02:02Z) - Exploiting modality-invariant feature for robust multimodal emotion
recognition with missing modalities [76.08541852988536]
我々は、欠落したモダリティ・イマジネーション・ネットワーク(IF-MMIN)に不変な特徴を用いることを提案する。
提案モデルは,不確実なモダリティ条件下で,すべてのベースラインを上回り,全体の感情認識性能を不変に向上することを示す。
論文 参考訳(メタデータ) (2022-10-27T12:16:25Z) - Inference-InfoGAN: Inference Independence via Embedding Orthogonal Basis
Expansion [2.198430261120653]
解離学習は、生成モデルが一般的な戦略である独立かつ解釈可能な潜在変数を構築することを目的としている。
本稿では,直交基底拡張(OBE)をInfoGANネットワークに組み込むことで,新しいGANベースの非絡み合いフレームワークを提案する。
我々の推論情報GANは、モデル微調整なしで、FactVAE、分離されたferenceAttribute Predictability(SAP)、Mutual Information Gap(MIG)、およびVP(VP)の指標で高い歪みスコアを得る。
論文 参考訳(メタデータ) (2021-10-02T11:54:23Z) - Bi-Bimodal Modality Fusion for Correlation-Controlled Multimodal
Sentiment Analysis [96.46952672172021]
Bi-Bimodal Fusion Network (BBFN) は、2対のモダリティ表現で融合を行う新しいエンドツーエンドネットワークである。
モデルは、モダリティ間の既知の情報不均衡により、2つのバイモーダルペアを入力として取る。
論文 参考訳(メタデータ) (2021-07-28T23:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。