論文の概要: I Don't Miss You, but I Do: Self-Explanation Faithfulness of Modality Missingness in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.07596v1
- Date: Mon, 07 Sep 2026 15:07:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.451082
- Title: I Don't Miss You, but I Do: Self-Explanation Faithfulness of Modality Missingness in Vision-Language Models
- Title(参考訳): I don't Miss you, but I do: Self-Explanation Faithfulness of Modality Missingness in Vision-Language Models
- Abstract要約: モーダリティ力学の自己説明を評価するための介入プロトコルを提案する。
4つのタスクにまたがる8つのオープンウェイト視覚言語モデルを評価する。
我々は、利用可能なモダリティ証拠の十分性を誇張する体系的な傾向を見出した。
- 参考スコア(独自算出の注目度): 1.0705399532413615
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models are increasingly used in settings where some input modalities may be unavailable, yet we know little about whether they can faithfully explain how such missing information affects their own predictions. We introduce an interventional protocol for evaluating self-explanations of modality dynamics: models state what each modality alone would support, whether restoring a missing modality would change their answer, and whether the available evidence is sufficient; we then execute the corresponding modality intervention and compare these claims with the model's realized behavior. We evaluate eight open-weight VLMs from two model families across four tasks spanning complementary and isomorphic text-image settings and a multi-view driving setting. We find a systematic tendency to overstate the sufficiency of available modality evidence. Models substantially underestimate the effect of restoring missing modalities: task-level median predicted change rates are at most 8.8%, while the corresponding executed change rates reach 72.1%, with underprediction in 62 of 64 model-task-condition settings. Insufficiency claims are rare, but precise when produced: restoring the modality changes the answer in a median of 78-100% of flagged cases. Retrospective self-explanations show the same tendency: on complementary data, models over-credit single-modality sufficiency; on isomorphic data, they over-credit single representation sufficiency relative to their executed behavior. Together, these results show that VLMs systematically mischaracterize how their predictions depend on available and missing modality evidence, motivating executable interventions as a behavioral ground truth for evaluating multimodal self-explanations.
- Abstract(参考訳): 視覚言語モデルは、いくつかの入力モダリティが利用できないような設定で使われることが多いが、そのような不足した情報が自身の予測にどのように影響するかを忠実に説明できるかどうかはほとんど分かっていない。
モデルでは、各モダリティのみがサポートするもの、欠落したモダリティの復元が彼らの答えを変えるかどうか、利用可能な証拠が十分であるかどうかを記述し、対応するモダリティの介入を実行し、これらの主張をモデルが実現した振る舞いと比較する。
相補的および同型テキストイメージ設定とマルチビュー駆動設定にまたがる4つのタスクにわたる2つのモデルファミリーから8つのオープンウェイトVLMを評価する。
我々は、利用可能なモダリティ証拠の十分性を誇張する体系的な傾向を見出した。
タスクレベルの中央値の変更率は少なくとも8.8%であり、それに対応する変更率は72.1%に達し、64のモデルタスク条件設定のうち62に下限がある。
モダリティの回復は、フラグ付きケースの78-100%の中央値で答えを変える。
相補的なデータでは、モデルが1つのモダリティを過剰に満たし、同型データでは、実行された振る舞いに対して1つの表現を過剰に過剰に表現する。
これらの結果から,VLMは可利用性やモダリティの欠如による予測を体系的に誤認識し,多モーダルな自己説明を評価するための行動的根拠の真理として実行可能な介入を動機付けることが示唆された。
関連論文リスト
- Order-Agnostic Autoregressive Modelling with Missing Data [12.971361761803891]
本研究では,無秩序な自己回帰モデルが,無作為なランダムな機構の下で暗黙的に不規則化を行うことを示す。
一般的な欠落メカニズムの下で、不完全なデータセットを直接トレーニングするための、最初の原則付きフレームワークを紹介します。
私たちのMissingness-Aware Order-Agnostic Autoregressive Modelは、実世界のベンチマークの中で、確立された計算基準よりも一貫して優れています。
論文 参考訳(メタデータ) (2026-05-07T14:34:08Z) - MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling [43.81891375838308]
PRIMOは、欠落したモダリティの予測的影響を定量化する教師付き潜在変数計算モデルである。
PRIMOは、モダリティが完全か部分的であるかにかかわらず、すべての利用可能なトレーニング例の使用を可能にする。
我々は,合成XORデータセット,Audio-Vision MNIST,MIMIC-IIIを用いてPRIMOを評価し,死亡率とICD-9の予測を行った。
論文 参考訳(メタデータ) (2026-02-19T00:37:28Z) - Who's Asking? Investigating Bias Through the Lens of Disability Framed Queries in LLMs [2.722784054643991]
大規模言語モデル(LLM)は、ユーザの人口統計特性を、単独で推測する。
これらの推論を形作る際の障害の手がかりは、ほとんど未発見のままである。
そこで本研究では,障害条件による人口統計バイアスを,最先端の8つのLLMに対して,初めて体系的に評価した。
論文 参考訳(メタデータ) (2025-08-18T21:03:09Z) - Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos [92.38662956154256]
現実のアプリケーションは、プライバシの懸念、効率性の必要性、ハードウェアの問題により、不完全なモダリティを伴う問題に直面することが多い。
再トレーニングを必要とせずに,テスト時にこの問題に対処する新しい手法を提案する。
MiDlは、欠落したモダリティをテスト時にのみ扱う、自己管理型のオンラインソリューションとしては初めてのものだ。
論文 参考訳(メタデータ) (2024-04-23T16:01:33Z) - VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models [57.43276586087863]
LVLM(Large Vision-Language Models)は幻覚に悩まされ、このモデルでは可聴音を発生させるが、実際には誤出力を発生させる。
既存のベンチマークはスコープに限られており、主にオブジェクト幻覚に焦点を当てている。
対象,属性,関係を多次元のベンチマークで表現し,連想バイアスに基づいて画像を選択する。
論文 参考訳(メタデータ) (2024-04-22T04:49:22Z) - Debiasing Multimodal Models via Causal Information Minimization [65.23982806840182]
我々は、マルチモーダルデータのための因果グラフにおいて、共同創設者から生じるバイアスを研究する。
ロバストな予測機能は、モデルがアウト・オブ・ディストリビューションデータに一般化するのに役立つ多様な情報を含んでいる。
これらの特徴を共同設立者表現として使用し、因果理論によって動機づけられた手法を用いてモデルからバイアスを取り除く。
論文 参考訳(メタデータ) (2023-11-28T16:46:14Z) - Sharing pattern submodels for prediction with missing values [12.981974894538668]
機械学習の多くのアプリケーションでは欠落値は避けられず、トレーニング中もテスト時にも課題が提示される。
パターンサブモデル(パターンサブモデル)と呼ばれる別の手法を提案する。これは、テスト時に欠落した値に対して、予測を堅牢にし、パターンサブモデルの予測力を維持または改善させる。
論文 参考訳(メタデータ) (2022-06-22T15:09:40Z) - On Modality Bias Recognition and Reduction [70.69194431713825]
マルチモーダル分類の文脈におけるモダリティバイアス問題について検討する。
本稿では,各ラベルの特徴空間を適応的に学習するプラグアンドプレイ損失関数法を提案する。
本手法は, ベースラインに比べ, 顕著な性能向上を実現している。
論文 参考訳(メタデータ) (2022-02-25T13:47:09Z) - Explain, Edit, and Understand: Rethinking User Study Design for
Evaluating Model Explanations [97.91630330328815]
我々はクラウドソーシング研究を行い、真偽のホテルレビューと偽のホテルレビューを区別するために訓練された詐欺検出モデルと対話する。
単語の線形バッグモデルでは、トレーニング中に特徴係数にアクセスした参加者は、非説明制御と比較して、テストフェーズにおいてモデルの信頼性が大幅に低下する可能性があることを観察する。
論文 参考訳(メタデータ) (2021-12-17T18:29:56Z) - Discriminative Multimodal Learning via Conditional Priors in Generative
Models [21.166519800652047]
本研究は,モデルトレーニングにおいて,すべてのモダリティとクラスラベルが利用できる現実的なシナリオについて研究する。
このシナリオでは、変動的な下界境界は、結合表現と欠測モダリティの間の相互情報を制限する。
論文 参考訳(メタデータ) (2021-10-09T17:22:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。