論文の概要: Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2608.00076v2
- Date: Tue, 04 Aug 2026 08:25:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.41094
- Title: Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs
- Title(参考訳): どのモダリティが低下するか : マルチモーダルLCMの非現実的モダリティ属性
- Abstract要約: マルチモーダル大規模言語モデル (MLLM) は画像とテキストの相補的な情報を組み合わせることで高い意思決定を支援する。
既存の説明可能性法では、どのモダリティが予測を駆動するかという根本的な疑問に答えることができない。
MLLMにおけるモダリティレベルのコントリビューションを定量化するための最初のフレームワークとして,CMA(Counterfactual Modality Attribution)を提案する。
- 参考スコア(独自算出の注目度): 4.192318018134786
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) increasingly support high-stakes decision making by combining complementary information from images and text. While existing explainability methods identify influential image regions or text tokens, they cannot answer a fundamental question: which modality drives a prediction? Consequently, a model may produce the correct output while relying on the wrong source of evidence, masking shortcut learning and unsafe reasoning. We formulate modality attribution as a complementary explainability objective for multimodal foundation models and propose Counterfactual Modality Attribution (CMA), the first framework for quantifying modality-level contributions in MLLMs. CMA generates image-only, text-only, and joint multimodal counterfactuals using coupled diffusion priors and converts them into principled modality attribution scores through a cooperative game-theoretic formulation based on Shapley values. We evaluate CMA on controlled synthetic benchmarks with known ground-truth modality reliance and on a real-world multimodal clinical dataset. CMA correctly identifies the decision-driving modality in 98% of controlled cases and consistently outperforms baselines, revealing failures of cross-modal reasoning that remain invisible to predictive accuracy alone. Our results establish modality attribution as a complementary dimension of explainability beyond feature attribution, providing a principled framework for auditing multimodal foundation models in safety-critical applications.
- Abstract(参考訳): マルチモーダル大規模言語モデル (MLLM) は画像とテキストの相補的な情報を組み合わせることで高い意思決定を支援する。
既存の説明可能性手法は、影響のある画像領域やテキストトークンを識別するが、基本的な質問に答えることはできない。
その結果、モデルは間違った証拠源に依存しながら正しい出力を生成し、ショートカット学習を隠蔽し、安全でない推論を行う。
マルチモーダル基礎モデルの相補的説明可能性の目的としてモダリティ属性を定式化し,MLLMにおけるモダリティレベルの貢献を定量化するための最初のフレームワークであるCMA(Cerfactal Modality Attribution)を提案する。
CMAは、結合拡散先行値を用いて、画像のみ、テキストのみ、および共同マルチモーダルカウンターファクトを生成し、シェープリー値に基づく協調ゲーム理論の定式化により、原理化されたモダリティ属性スコアに変換する。
実世界におけるマルチモーダル臨床データセットを用いて,CMAの評価を行った。
CMAは、コントロールされたケースの98%で意思決定のモダリティを正しく識別し、ベースラインを一貫して上回る。
本研究は,マルチモーダル基礎モデルを安全クリティカルなアプリケーションで監査するための枠組みとして,特徴属性以外の説明可能性の相補的な次元として,モダリティ属性を確立した。
関連論文リスト
- Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment [53.50824432699408]
Traits Run Deeperは、新しいパーソナリティアセスメントフレームワークである。
MFR(Multimodal Foundation Representation)、TSMF(Trit-Specific Modality Fusion)、DCPR(Distributed-Calibrated Personality Regression)の3つのコンポーネントで構成されている。
論文 参考訳(メタデータ) (2026-06-09T06:38:36Z) - MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models [48.33850939857255]
我々は、サンプリングカバレッジ、インスタンスの難易度、残留リスクをリンクする理論的枠組みを開発する。
解析の結果,マルチモーダル推論は重み付き難易度分布を示すことがわかった。
推定不確実性に応じて動的に割り当てる適応型推論機構であるCoverage-Aware Multimodal Decoding (CAMD)を提案する。
論文 参考訳(メタデータ) (2026-03-16T02:31:03Z) - Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities [26.613566093134065]
マルチモーダル・センティメント・アナリティクスは、テキスト、音響、視覚的手がかりを統合することで人間の感情を推測する。
既存のアプローチでは、すべてのモダリティが完全であるのに対して、現実のアプリケーションは、ノイズやハードウェアの障害、あるいはモダリティの欠如につながるプライバシー制限にしばしば遭遇する。
我々は、不確実なモダリティ条件下でMSA用に設計されたプログレッシブ表現学習フレームワークPRLFを提案する。
論文 参考訳(メタデータ) (2026-03-10T02:45:02Z) - Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition [51.68340973140949]
GMNER(Multimodal Named Entity Recognition)は、テキストベースのエンティティを抽出し、セマンティックカテゴリを割り当て、それらを対応する視覚領域に接地することを目的としている。
MLLMは、視覚バイアスやテキストバイアスを含む$textbfmodality bias$を示す。
本稿では,モダリティを考慮した一貫性推論(bfMCR$)を提案する。
論文 参考訳(メタデータ) (2026-02-04T12:12:49Z) - When One Modality Sabotages the Others: A Diagnostic Lens on Multimodal Reasoning [22.39245479538899]
本報告では,高信頼な一元誤差が他の証拠をオーバーライドし,融合結果を誤認する診断障害モードであるモダリティ・サボタージュを導入する。
モデル非依存評価層は、各モダリティをエージェントとして扱い、候補ラベルと監査に用いる簡単な自己評価を生成する。
単純な融合機構はこれらの出力を集約し、コントリビュータ(正しい結果を支持するモダリティ)とサボツール(誤解を招くモダリティ)を露呈する。
論文 参考訳(メタデータ) (2025-11-04T18:20:13Z) - When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs [15.617378124319472]
マルチモーダル大言語モデル(MLLM)は、異なるモーダルが矛盾する情報を提供する場合、競合を解決する必要がある。
本稿では,モダリティを,相対的推論の不確かさと本質的なモダリティ選好の2つの基本的要因に分解する新しい枠組みを導入する。
論文 参考訳(メタデータ) (2025-11-04T04:11:31Z) - Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models [12.841405829775852]
我々は、VidQAベンチマークとデータセットのバイアスを特定するために、MIS(Modality importance score)を導入する。
また,最新のMLLMを用いてモダリティの重要度を推定する手法を提案する。
以上の結果から,既存のデータセットでは,モダリティの不均衡による情報統合が効果的に行われていないことが示唆された。
論文 参考訳(メタデータ) (2024-08-22T23:32:42Z) - Confidence-aware multi-modality learning for eye disease screening [58.861421804458395]
眼疾患スクリーニングのための新しい多モード顕在核融合パイプラインを提案する。
モダリティごとに信頼度を測り、マルチモダリティ情報をエレガントに統合する。
パブリックデータセットと内部データセットの両方の実験結果は、我々のモデルが堅牢性に優れていることを示している。
論文 参考訳(メタデータ) (2024-05-28T13:27:30Z) - A Novel Unified Conditional Score-based Generative Framework for
Multi-modal Medical Image Completion [54.512440195060584]
我々は、スコアベース生成モデル(SGM)を活用するために、統一多モードスコアベース生成モデル(UMM-CSGM)を提案する。
UMM-CSGMは、新しいマルチインマルチアウトコンディションスコアネットワーク(mm-CSN)を用いて、クロスモーダル条件分布の包括的集合を学習する。
BraTS19データセットの実験により、UMM-CSGMは腫瘍誘発病変における不均一な増強と不規則な領域をより確実に合成できることが示された。
論文 参考訳(メタデータ) (2022-07-07T16:57:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。