論文の概要: PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.09772v1
- Date: Mon, 10 Aug 2026 16:00:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.367798
- Title: PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models
- Title(参考訳): PragMatch: 大規模視覚言語モデルにおけるクロスモーダル・ミスマッチからのプラグマチック・イングルリティの分離
- Authors: Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh,
- Abstract要約: PragMatchは、MMSD2.0から派生した3000の画像テキストペアのベンチマークである。
我々は,システマティックマスクを用いて影響力のあるショートカットを同定し,ターゲット注入実験によりその影響を評価する。
以上の結果から,LVLM予測は語彙的・OCR的・スタイリスティックな手法に敏感であることがわかった。
- 参考スコア(独自算出の注目度): 15.638379666159127
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) have demonstrated strong performance on multimodal benchmarks, yet it remains unclear whether they genuinely reason about relationships between images and text or rely on superficial correlations, known as shortcut learning. This question is particularly important for multimodal sarcasm detection, where successful prediction depends on recognizing pragmatic incongruity rather than treating sarcasm as simple image-text mismatch. We introduce PragMatch, a controlled benchmark of 3,000 image-text pairs derived from MMSD2.0, including original sarcastic examples and constructed literal and hard-negative pairs. We identify influential shortcut cues through systematic masking and evaluate their impact through targeted injection experiments. Our results show that LVLM predictions are sensitive to lexical, OCR-derived and stylistic cues, with injected surface signals causing substantial changes in model predictions despite unchanged underlying image-text relationships. Our findings reveal limitations in current LVLMs while PragMatch provides a systematic testbed for evaluating multimodal pragmatic reasoning beyond surface-level image-text alignment.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、マルチモーダルベンチマークにおいて強力な性能を示しているが、画像とテキストの関係について真に理由づけているのか、あるいはショートカット学習として知られる表面的相関に依存しているのかは不明だ。
この問題は、サルカズムを単純な画像テキストのミスマッチとして扱うよりも、実用的不整合を認識することによって予測を成功させるマルチモーダルサルカズム検出において特に重要である。
PragMatchは、MMSD2.0から派生した3000の画像テキストペアの制御ベンチマークである。
我々は,システマティックマスクを用いて影響力のあるショートカットを同定し,ターゲット注入実験によりその影響を評価する。
以上の結果から,LVLM予測は語彙的・OCR的・スタイリスティックな手法に敏感であることがわかった。
PragMatchは表面レベルの画像テキストアライメントを超えて多モードの実用的な推論を評価するための体系的なテストベッドを提供するのに対し、現在のLVLMの制限は明らかである。
関連論文リスト
- Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery [21.95600321802019]
視覚言語モデルが語彙的判断における偶発的画像文脈と有用な視覚的証拠を区別できるかどうかを考察する。
実画像のコンテキストは、一貫した利得を得られず、しばしば人間のレーティングとの整合性を損なう。
以上の結果から,現在のVLMでは,視覚的コンテキストが語彙的判断に影響を及ぼす場合のキャリブレーションの精度が向上することが示唆された。
論文 参考訳(メタデータ) (2026-05-26T17:24:59Z) - Is my model perplexed for the right reason? Contrasting LLMs' Benchmark Behavior with Token-Level Perplexity [6.285055089721361]
モデルが言語学的に関係のある手がかりに依存しているかどうかをテストするために,トークンレベルの難易度に基づく基本的解釈可能性フレームワークを導入する。
本手法は,不安定な特徴帰属技術に頼ることなく,正確な仮説駆動解析を可能にする。
論文 参考訳(メタデータ) (2026-03-31T08:00:55Z) - Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs [80.03370593724422]
Out-of-Distribution (OOD) は未知のクラスからサンプルを識別する。
現在の手法では、否定的なテキストとIDラベルを比較するなど、OOD検出中にモード内距離を組み込むことが多い。
テキストおよび視覚的視点から一貫したモーダル距離拡張を体系的に利用するフレームワークであるInterNegを提案する。
論文 参考訳(メタデータ) (2026-03-03T05:44:47Z) - Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation [0.0]
Visual Word Sense Disambiguationは、視覚言語タスクにおける語彙的曖昧性に取り組むのに役立つ。
VWSDは、最小のテキスト入力で曖昧な単語の正しい意味を見つけるために視覚的手がかりを使用する。
2016年から2025年にかけての研究では、特徴ベース、グラフベース、コントラスト埋め込み技術によるVWSDの成長について検討した。
論文 参考訳(メタデータ) (2026-02-01T12:36:01Z) - GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection [7.415126751461174]
マルチモーダルsarcasm Detection (MSD) は、モダリティ間の意味的不一致をモデル化することによって、画像とテキストのペア内のsarcasmを識別することを目的としている。
本稿では,GDCNet(Generative Discrepancy Comparison Network)を提案する。
GDCNetは、生成した目的記述と原文間の意味的・感情的不一致を、視覚的・テキスト的忠実度の測定とともに計算する。
論文 参考訳(メタデータ) (2026-01-28T13:51:34Z) - When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought [118.71264263478083]
MIRAは,中間画像の生成が推論の成功に不可欠であるシナリオにおいて,モデルを評価するために設計された新しいベンチマークである。
546のマルチモーダル問題を含み、中間画像と最終回答が注釈付きである。
論文 参考訳(メタデータ) (2025-11-04T18:00:51Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - Planting a SEED of Vision in Large Language Model [73.17530130368053]
このSEEDは,大規模言語モデル(LLM)とSEEとDrawを同時に実現する,精巧な画像トークンである。
このバージョンのSEEDは、64のV100 GPUと5Mのパブリックな画像テキストペアを使用して、5.7日間でトレーニングされた。
論文 参考訳(メタデータ) (2023-07-16T13:41:39Z) - Probing Contextual Language Models for Common Ground with Visual
Representations [76.05769268286038]
我々は、マッチングと非マッチングの視覚表現を区別する上で、テキストのみの表現がいかに効果的かを評価するための探索モデルを設計する。
以上の結果から,言語表現だけでは,適切な対象カテゴリから画像パッチを検索する強力な信号が得られることがわかった。
視覚的に接地された言語モデルは、例えば検索においてテキストのみの言語モデルよりわずかに優れているが、人間よりもはるかに低い。
論文 参考訳(メタデータ) (2020-05-01T21:28:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。