論文の概要: MoGround: Measuring and Mitigating Modality Distraction in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.33431v1
- Date: Sun, 27 Sep 2026 10:29:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 16:56:02.225013
- Title: MoGround: Measuring and Mitigating Modality Distraction in Vision-Language Models
- Title(参考訳): MoGround:視覚言語モデルにおけるモダリティ・ディトラクションの測定と緩和
- Abstract要約: MoGroundは、4つの視覚領域にまたがるビジョン言語データセットで、すべての質問に対する回答が、正確に1つのモダリティから利用できることが保証されています。
この保証により、あるモデルが1つのモダリティのみから正しい解答をした後、他のモダリティから無関係な内容が加わったとき、間違った解答に切り替えるという、モダリティの逸脱を測定することができる。
- 参考スコア(独自算出の注目度): 37.94536058655549
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We release MoGround, a vision-language dataset spanning four visual domains in which the answer to every question is guaranteed to be available from exactly one modality. This guarantee enables us to measure modality distraction, the failure in which a model answers a question correctly from one modality alone and then flips to a wrong answer once irrelevant content from the other modality is added. Existing probes rarely establish single-modality answerability this way, making it hard to isolate distraction in the first place. Across seven open-source VLMs, we find that modality distraction is not universal but model-dependent. The weaker-grounded modality is the more distracted one (r = +0.86), and distraction scales inversely with grounding strength (r = -0.90). The single-modality guarantee also enables a mitigation method that needs to distinguish between relevant and irrelevant context. Trained on one split of MoGround alone, a weight-space robustness vector reduces distraction on all seven models by 9% to 51%, at a cost of only 0.1 average points of accuracy on standard multimodal tasks.
- Abstract(参考訳): MoGroundは、4つの視覚領域にまたがるビジョン言語データセットで、すべての質問に対する回答が、正確に1つのモダリティから利用できることが保証されています。
この保証により、あるモデルが1つのモダリティのみから正しい解答をした後、他のモダリティから無関係な内容が加わったとき、間違った解答に切り替えるという、モダリティの逸脱を測定することができる。
既存のプローブは、このような単一モードの応答性を確立することは滅多になく、そもそも注意をそらすことは困難である。
7つのオープンソース VLM において、モダリティの逸脱は普遍的ではなくモデルに依存している。
より弱い基底のモダリティは、より散逸した(r = +0.86)ものであり、散逸は、接地強度(r = -0.90)とともに逆スケールする。
単一モダリティ保証はまた、関連するコンテキストと無関係なコンテキストを区別する必要がある緩和方法を可能にする。
重量空間のロバスト性ベクトルは、MoGround単独で訓練され、標準マルチモーダルタスクにおいて平均0.1ポイントの精度で7つのモデルの邪魔を9%から51%削減する。
関連論文リスト
- Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection [12.754751703604734]
本研究では,多目的意図検出タスクにおいて,テキストのみを含むLarge Language Models (LLMs) と非LLMs (マルチモーダルモデル) の有効性について検討する。
この結果,テキストのみのLLMであるMistral-7Bは,MIntRec-1で約9%,MIntRec2.0データセットで約4%,最も競争力のあるマルチモーダルモデルよりも優れていた。
論文 参考訳(メタデータ) (2025-08-22T06:29:29Z) - A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1 [43.32593407341789]
オープンソースの大規模ビジョン言語モデルで有望なパフォーマンスにもかかわらず、トランスファーベースのターゲットアタックは、クローズドソースの商用LVLMに対して失敗することが多い。
本稿では,局所領域内の意味的詳細を明示的に符号化することで,意味的明瞭度を高めることを提案する。
提案手法は, GPT-4.5, 4o, o1において90%以上の成功率を達成し, 従来の攻撃方法よりも優れていた。
論文 参考訳(メタデータ) (2025-03-13T17:59:55Z) - XTrack: Multimodal Training Boosts RGB-X Video Object Trackers [88.72203975896558]
マルチモーダルセンシングから得られる知識を効果的に共有することが重要である。
異なるモダリティにまたがる類似のサンプルは、他のものよりも多くの知識を共有できる。
提案手法は,現在のSOTAよりも平均+3%精度が向上したRGB-Xトラッカーである。
論文 参考訳(メタデータ) (2024-05-28T03:00:58Z) - Composed Image Retrieval with Text Feedback via Multi-grained
Uncertainty Regularization [73.04187954213471]
粗い検索ときめ細かい検索を同時にモデル化する統合学習手法を提案する。
提案手法は、強いベースラインに対して+4.03%、+3.38%、+2.40%のRecall@50精度を達成した。
論文 参考訳(メタデータ) (2022-11-14T14:25:40Z) - Defending Multimodal Fusion Models against Single-Source Adversaries [6.019777076722421]
標準マルチモーダル融合モデルは単一ソースの敵に対して脆弱であることを示す。
単一のモダリティに対する攻撃は、複数の乱れのないモダリティからの正しい情報を克服し、モデルを失敗させる。
この発見に触発され、逆向きに堅牢な核融合戦略を提案する。
論文 参考訳(メタデータ) (2022-06-25T18:57:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。