論文の概要: Seeing What Should Be Heard: Diagnosing and Repairing Cross-Modal Shortcuts in Omni-Modal LLMs
- arxiv url: http://arxiv.org/abs/2609.36798v1
- Date: Tue, 29 Sep 2026 06:12:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.227813
- Title: Seeing What Should Be Heard: Diagnosing and Repairing Cross-Modal Shortcuts in Omni-Modal LLMs
- Title(参考訳): Omni-Modal LLMのクロスモーダルショートカットの診断と修復
- Abstract要約: オムニモーダル大言語モデル(LLM)における広汎なクロスモーダルショートカットを見つける。
そこで我々は,DMC-Repairを提案する。DMC-Repairは,同じ種類のクロスモーダルなスワップサンプルのモデルを訓練し,質問によって指定されたモダリティに応じて監督を割り当てる。
実験により、DMC-Repairは、画像による応答効果のシェアを59.9%削減し、音声要求応答性能を損なうことなく、モーダル間ショートカットを効果的に抑制することを示した。
- 参考スコア(独自算出の注目度): 11.70808362123821
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Omni-modal large language models (LLMs) are expected to answer a question using the modality it explicitly refers to. However, existing training paradigms rarely verify whether models actually follow this modality, because multimodal inputs from the same sample often provide redundant evidence for the same answer. In this work, we uncover a pervasive cross-modal shortcut in omni-modal LLMs: when asked an audio-related question, models rely on the image as much as on the audio, and sometimes even more. To systematically diagnose this behavior, we introduce the Factorized Modality Diagnostic, which independently swaps audio and images between samples to isolate each modality's causal contribution. Across two model families in different settings, we find that this shortcut persists throughout supervised fine-tuning and reinforcement learning post-training, while judge-based RL may further amplify such reliance on irrelevant visual information. Based on this finding, we propose DMC-Repair, which trains models on the same kind of cross-modal swapped samples while assigning supervision according to the modality specified by the question. This prevents models from exploiting the spurious correspondence between modalities within the same clip. Experiments demonstrate that DMC-Repair reduces the image-induced share of the answer effect by 59.9%, effectively suppressing the cross-modal shortcut without compromising audio-question answering performance. The reduction in shortcut reliance generalizes across two model families and zero-shot to an unseen dataset and an unseen benchmark, and persists through subsequent post-training. Code is available at https://anonymous.4open.science/r/DMC-Repair.
- Abstract(参考訳): Omni-Modal Large Language Model (LLM) は、それが明示的に参照するモダリティを使って、質問に答えることが期待されている。
しかし、既存の訓練パラダイムでは、同じサンプルからのマルチモーダル入力がしばしば同じ答えの冗長な証拠を与えるため、モデルが実際にこのモダリティに従うかどうかを検証することは滅多にない。
そこで本研究では,Omni-modal LLMにおける広範に横断的なショートカットを明らかにする。
この振る舞いを体系的に診断するために,各モダリティの因果的寄与を分離するために,サンプル間で個別に音声と画像を取り替えるFacterized Modality Diagnosticを導入する。
異なる設定の2つのモデルファミリーで、このショートカットは教師付き微調整および強化学習後トレーニングを通して継続するが、ジャッジベースのRLは、さらに無関係な視覚情報への依存を増幅する可能性がある。
そこで本研究では,同種のクロスモーダルスワップサンプルをモデルとしたDMC-Repairを提案する。
これにより、モデルが同じクリップ内のモダリティ間の急激な対応を利用するのを防ぐことができる。
実験により、DMC-Repairは、画像による応答効果のシェアを59.9%削減し、音声要求応答性能を損なうことなく、モーダル間ショートカットを効果的に抑制することを示した。
ショートカット依存の低減は、2つのモデルファミリにまたがって一般化され、ゼロショットは見えないデータセットと見えないベンチマークに一般化され、その後のトレーニングを通じて持続する。
コードはhttps://anonymous.4open.science/r/DMC-Repairで入手できる。
関連論文リスト
- Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI [3.7524666944787644]
2つの疑問は、どのモダリティに責任があるか、そしてモデルがモダリティを落として大音量または無音で失敗するかである。
モデルに依存しないモダリティ・欠陥の枠組みとして、Nのモダリティの埋め込み、マスクを意識したプローブ、ラベルを与えられた場合、例ごとの故障分類を返します。
モダリティ当たりのVSサイレントレートを報告し、3つのモダリティ相補性行列にスケールする。
論文 参考訳(メタデータ) (2026-08-02T19:38:56Z) - Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought [49.53567098922619]
モーダル間干渉を低減するための音声・視覚的推論フレームワークとして, 分離ファースト, ファウズ・レイト (SFFL) を提案する。
SFFLは、モーダリティ固有の連鎖推論を強制し、別々の音声および視覚的推論トレースを生成し、答えのエビデンスを統合する。
実験では精度と頑健さの両面で一貫した改善が示され、一般的なAVQAベンチマークでは5.16%、クロスモーダル幻覚ベンチマークでは11.17%の平均的な相対的な増加が得られた。
論文 参考訳(メタデータ) (2026-05-11T02:50:27Z) - Architecture Decoupling Is Not All You Need For Unified Multimodal Model [64.19284951218098]
本稿では,トレーニング中のタスク-特定マルチモーダルインタラクションパターンを明示的に学習する,意図的インタラクションアライメント(AIA)の損失を提案する。
AIAは、横断的な注意パターンを洗練するだけでなく、生成と理解の両方のパフォーマンスも向上させる。
論文 参考訳(メタデータ) (2025-11-27T17:55:25Z) - Calibrated Multimodal Representation Learning with Missing Modalities [100.55774771852468]
マルチモーダル表現学習は、それらを統一潜在空間に整列させることにより、異なるモダリティを調和させる。
最近の研究は、従来のクロスモーダルアライメントを一般化して、強化されたマルチモーダル・シナジーを生成するが、すべてのモダリティを共通の例に含める必要がある。
我々は、アンカーシフトの観点から、この問題に関する理論的洞察を提供する。
モーダルの欠如に起因する不完全なアライメントを校正するために,マルチモーダル表現学習のためのCalMRLを提案する。
論文 参考訳(メタデータ) (2025-11-15T05:01:43Z) - Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models [63.032359320629105]
In this present: Unpaired Multimodal, a modality-agnostic training paradigm, a single model then alternately processs from different modalities while sharing parameters across。
補助モダリティからの未ペアリングデータを使用することで、画像や音声などの様々な単一目標に対して、ダウンストリーム性能が一貫して向上することを示す。
論文 参考訳(メタデータ) (2025-10-09T17:32:23Z) - A Study of Dropout-Induced Modality Bias on Robustness to Missing Video
Frames for Audio-Visual Speech Recognition [53.800937914403654]
AVSR(Advanced Audio-Visual Speech Recognition)システムは、欠落したビデオフレームに敏感であることが観察されている。
ビデオモダリティにドロップアウト技術を適用することで、フレーム不足に対するロバスト性が向上する一方、完全なデータ入力を扱う場合、同時に性能損失が発生する。
本稿では,MDA-KD(Multimodal Distribution Approximation with Knowledge Distillation)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-07T06:06:55Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - VERITE: A Robust Benchmark for Multimodal Misinformation Detection
Accounting for Unimodal Bias [17.107961913114778]
マルチモーダルの誤報は ソーシャルメディアのプラットフォームで 増え続けている問題です
本研究では,広範に使用されているMDDベンチマークにおいて,一様偏差の存在を調査・同定する。
リアルな合成学習データを生成するための新しい手法であるCrossmodal HArd Synthetic MisAlignment (CHASMA)を導入する。
論文 参考訳(メタデータ) (2023-04-27T12:28:29Z) - Does my multimodal model learn cross-modal interactions? It's harder to
tell than you might think! [26.215781778606168]
クロスモーダルモデリングは、視覚的質問応答のようなマルチモーダルタスクにおいて不可欠である。
本稿では,与えられたタスク上でのモデル間の相互作用によって性能が向上するか否かを分離する,新たな診断ツールである経験的多モード付加関数投影(EMAP)を提案する。
7つの画像+テキスト分類タスク(それぞれに新しい最先端のベンチマークを設定した)に対して、多くの場合、モーダル間相互作用を削除することは、パフォーマンスの劣化をほとんど、あるいは全く起こさない。
論文 参考訳(メタデータ) (2020-10-13T17:45:28Z) - Audio-Visual Decision Fusion for WFST-based and seq2seq Models [3.2771898634434997]
雑音下では、音声認識システムは高い単語誤り率(WER)に悩まされる
提案手法は,推測時における音声と視覚のモダリティから情報を融合する新しい手法である。
提案手法は音響のみのWERよりも大幅に改善されていることを示す。
論文 参考訳(メタデータ) (2020-01-29T13:45:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。