論文の概要: Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution
- arxiv url: http://arxiv.org/abs/2607.17712v1
- Date: Mon, 20 Jul 2026 09:08:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.558367
- Title: Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution
- Title(参考訳): クロスモーダルネゴシエーションの学習:潜在表現と注意に基づく解法の分析
- Abstract要約: 否定は、標準視覚言語モデルの潜在空間において線形あるいは非線形に分離可能なクラスを形成しないことを示す。
モーダル間の依存関係を明示的にモデル化する新しいモーダル間アテンションアーキテクチャを提案する。
- 参考スコア(独自算出の注目度): 44.39196719594625
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detecting high-level semantic concepts like negation across modalities remains a challenge for current multimodal systems. We analyze this as a fundamental representation learning problem, providing the first evidence that negation does not form a linearly or non-linearly separable class in the latent spaces of standard vision-language models (VLMs). We demonstrate that pretrained embeddings primarily encode modality-specific features, lacking a generalizable negation signal. To overcome this, we propose a novel cross-modal attention architecture that explicitly models inter-modal dependencies, achieving performance gains of up to +7.03% F1 over unimodal baselines. Our analysis reveals a key asymmetry: while textual negation often appears independently, visual negation is semantically dependent on linguistic context, a finding validated through our statistical analysis of 3,222 political video-text pairs automatically annotated via \textsc{Qwen2.5-VL}. By combining this analysis with self-supervised video representations (JEPA2), we advance the modeling of temporal negation. This work provides new methods and insights for learning robust, semantically-aligned representations in multimodal systems.
- Abstract(参考訳): モダリティ間の否定のような高レベルのセマンティックな概念を検出することは、現在のマルチモーダルシステムの課題である。
我々はこれを基本的な表現学習問題として分析し、標準的な視覚言語モデル(VLM)の潜在空間において、否定が線形あるいは非線形に分離可能なクラスを形成しないという最初の証拠を提供する。
プレトレーニングされた埋め込みは、主にモダリティ固有の特徴を符号化し、一般化可能な否定信号が欠如していることが実証された。
そこで本研究では,モーダル間の依存関係を明示的にモデル化し,非モーダルベースライン上での最大7.03%のF1の性能向上を実現する,新しいモーダル間アテンションアーキテクチャを提案する。
テキスト否定は独立して現れることが多いが、視覚否定は言語文脈に依存している。
この分析を自己教師付きビデオ表現(JEPA2)と組み合わせることで、時間的否定のモデル化を推し進める。
この研究は、マルチモーダルシステムにおいて、堅牢で意味的に整合した表現を学ぶための新しい方法と洞察を提供する。
関連論文リスト
- Revisiting the Systematicity in Negation in the Era of In-Context Learning [16.384578665588936]
我々は,否定の理解に関する体系性について,行動的体系性と表現的体系性という2つの視点から分析する。
行動体系性については、実演や文脈内学習を通じて、LLMは文内の否定表現やスコープをある程度認識できるが、完全な性能は得られないことを確認した。
表現体系性において,否定を理解する上で不可欠なタスクの文脈内例から,関数ベクトルが頑健に構築できる範囲を解析する。
論文 参考訳(メタデータ) (2026-06-15T15:44:15Z) - Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning [65.15766304205657]
In-context Learning (ICL) は、大規模なモデルをいくつかの例を使ってタスクに適応させるが、視覚言語モデル(VLM)への拡張は脆弱である。
我々の分析によると、基本的な限界は帰納的ギャップにあり、モデルはしばしば欠陥のある推論から正しい答えを導き出す。
帰納的帰納的プロセスとしてマルチモーダル ICL を再構成する枠組みを導入する。
論文 参考訳(メタデータ) (2026-05-04T09:18:19Z) - Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation [16.63373250752545]
大規模言語モデル(LLM)は、テキスト生成の限界化により評価が難しい表現バイアスと構文バイアスを示す。
本稿では,集約比較によるバイアス評価を目的とした視覚解析ツールであるTreeTracerを紹介する。
論文 参考訳(メタデータ) (2026-04-24T13:37:51Z) - When Negation Is a Geometry Problem in Vision-Language Models [32.51815690470519]
CLIPのような統合ビジョン-言語埋め込みモデルは、通常、テキストクエリで否定を理解するのに失敗する。
画像コンテンツに関する単純なイエス/ノー質問の理解に優れるマルチモーダルLLMs-as-a-judgeに基づく代替評価フレームワークについて検討する。
論文 参考訳(メタデータ) (2026-03-20T23:06:23Z) - Mastering Negation: Boosting Grounding Models via Grouped Opposition-Based Learning [87.15765427638195]
D-Negationは、ポジティブな意味記述とネガティブな意味記述の両方で注釈付けされたオブジェクトを提供する新しいデータセットである。
本稿では,限られたサンプルから否定認識表現を学習する,反抗型学習フレームワークを提案する。
モデルパラメータの10%未満を微調整することにより、正および負のセマンティック評価において最大4.4mAPおよび5.7mAPの改善が達成される。
論文 参考訳(メタデータ) (2026-03-13T03:21:48Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - Geometry of Semantics in Next-Token Prediction: How Optimization Implicitly Organizes Linguistic Representations [34.88156871518115]
Next-token Prediction (NTP) 最適化により、言語モデルがテキストから意味構造を抽出し、整理する。
我々は、より大きな特異値に対応する概念が訓練中に学習され、自然な意味階層が生成されることを示した。
この洞察は、解釈可能なセマンティックカテゴリを識別するための概念記号を組み合わせる方法である、オーサントベースのクラスタリングを動機付けている。
論文 参考訳(メタデータ) (2025-05-13T08:46:04Z) - A Novel Energy based Model Mechanism for Multi-modal Aspect-Based
Sentiment Analysis [85.77557381023617]
マルチモーダル感情分析のための新しいフレームワークDQPSAを提案する。
PDQモジュールは、プロンプトをビジュアルクエリと言語クエリの両方として使用し、プロンプト対応の視覚情報を抽出する。
EPEモジュールはエネルギーベースモデルの観点から解析対象の境界ペアリングをモデル化する。
論文 参考訳(メタデータ) (2023-12-13T12:00:46Z) - Improving negation detection with negation-focused pre-training [58.32362243122714]
否定は共通の言語的特徴であり、多くの言語理解タスクにおいて不可欠である。
最近の研究で、最先端のNLPモデルは否定を含むサンプルで性能が低いことが示されている。
本稿では,データ拡張と否定マスキングを対象とする,否定に焦点をあてた新たな事前学習戦略を提案する。
論文 参考訳(メタデータ) (2022-05-09T02:41:11Z) - Language Models for Lexical Inference in Context [4.581468205348204]
文脈における語彙推論(英: Lexical inference in context, LIiC)とは、2つの非常に類似した文間のテキストの含意を認識するタスクである。
本稿では,この課題に対する事前学習言語モデル(LM)に基づいて,最初のアプローチを定式化し,評価する。
LIiC に対する事前訓練による LM の可能性が示された。
論文 参考訳(メタデータ) (2021-02-10T09:08:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。