論文の概要: Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation
- arxiv url: http://arxiv.org/abs/2608.14655v1
- Date: Fri, 31 Jul 2026 05:46:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.945907
- Title: Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation
- Title(参考訳): モダリティサブスペース活性化によるOmni-LLMの知覚-決定ミスの診断と緩和
- Authors: Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai,
- Abstract要約: 両レンズフレームワークを介して動作した因果感(Causal Modality Sensitivity, CMS)を定式化する。
また、言語事前の診断データセットであるCausalMSBenchをキュレートする。
トレーニング不要な推論時間フレームワークであるModality Subspace Activation (MSA)を提案する。
- 参考スコア(独自算出の注目度): 32.16800432913683
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Omni-Large Language Models (Omni-LLMs) power complex multi-modal reasoning in applications like World Action Models and autonomous agents. However, their strong performance often masks a profound Perceptual-Decision Misalignment (PDM), where decisions remain unfaithful to multi-modal perceptions. To diagnose this, we formalize Causal Modality Sensitivity (CMS), operationalized via a dual-lens framework: Answer Retention Rate (ARR) at the macro behavioral level, and Logit Angular Discrepancy (LAD) to track microscopic distribution shifts. We also curate CausalMSBench, a diagnostic dataset isolating language priors. Benchmarking reveals that popular Omni-LLMs exhibit critically low CMS, showing negligible distribution shifts even when key modalities are removed. To rectify this, we propose Modality Subspace Activation (MSA), a training-free inference-time framework that uses Singular Value Decomposition (SVD) to estimate modal activation strengths. MSA dynamically balances modal projections in the last hidden state, effectively restoring CMS across benchmarks.
- Abstract(参考訳): Omni-Large Language Models (Omni-LLMs)は、World Action Modelsや自律エージェントのようなアプリケーションにおいて、複雑なマルチモーダル推論をパワーアップする。
しかしながら、彼らの強いパフォーマンスは、多要素的知覚に不信感を抱く決定が続く、深い知覚的決定的ミスサライメント(PDM)を隠蔽することが多い。
これを診断するために、マクロな行動レベルでのAnswer Retention Rate(ARR)とLogit Angular Discrepancy(LAD)という、デュアルレンズフレームワークを介して運用されるCausal Modality Sensitivity(CMS)を定式化した。
また、言語事前の診断データセットであるCausalMSBenchをキュレートする。
ベンチマークにより、人気のあるOmni-LLMsはCMSが極めて低く、キーモダリティが削除されたとしても無視できる分布シフトを示すことが明らかになった。
これを修正するために,Singular Value Decomposition (SVD) を用いてモーダルアクティベーション強度を推定するトレーニングフリーな推論時間フレームワークである Modality Subspace Activation (MSA) を提案する。
MSAは最後の隠れ状態のモードプロジェクションを動的にバランスさせ、ベンチマーク間で事実上CMSを復元する。
関連論文リスト
- Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs [4.192318018134786]
マルチモーダル大規模言語モデル (MLLM) は画像とテキストの相補的な情報を組み合わせることで高い意思決定を支援する。
既存の説明可能性法では、どのモダリティが予測を駆動するかという根本的な疑問に答えることができない。
MLLMにおけるモダリティレベルのコントリビューションを定量化するための最初のフレームワークとして,CMA(Counterfactual Modality Attribution)を提案する。
論文 参考訳(メタデータ) (2026-07-29T13:33:11Z) - Unified Hallucination Fuzzing for Multimodal Large Language Models [44.4785399881315]
マルチモーダル大言語モデル(MLLM)に対する幻覚は依然として永続的な課題である
既存の評価は、主に静的なベンチマークに基づいており、狭い分類範囲と急速な性能飽和に悩まされている。
本稿では,総合的なベンチマークと自己進化型ストレステストを統合するシステム評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T17:57:37Z) - MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models [70.34265674686516]
マルチモーダル埋め込みモデルは、テキスト、画像、ビデオ、オーディオなどの異種入力を共有意味空間にマッピングすることを目的としている。
本稿では,テキスト,画像,ビデオ,オーディオ,エージェント中心のシナリオにまたがる埋め込みを評価するベンチマークであるMMEB-V3を紹介する。
本研究は, 完全モダリティ埋め込みの系統的解析を行い, 3つの重要な知見を同定する。
論文 参考訳(メタデータ) (2026-04-25T14:15:05Z) - On the Cone Effect and Modality Gap in Medical Vision-Language Embeddings [6.66266390476704]
VLM(Vision-Language Models)は、非線形エンコーダが表現空間の高度に集中した領域に埋め込む特徴的な「コーン効果」を示す。
本稿では, クロスモーダル分離を継続的に制御しながら, 事前学習したVLMエンコーダを凍結し続ける軽量なポストホック機構を提案する。
これにより、モダリティギャップが高価なリトレーニングなしで下流のマルチモーダルパフォーマンスにどのように影響するかを体系的に分析することができる。
論文 参考訳(メタデータ) (2026-03-18T01:04:21Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition [51.68340973140949]
GMNER(Multimodal Named Entity Recognition)は、テキストベースのエンティティを抽出し、セマンティックカテゴリを割り当て、それらを対応する視覚領域に接地することを目的としている。
MLLMは、視覚バイアスやテキストバイアスを含む$textbfmodality bias$を示す。
本稿では,モダリティを考慮した一貫性推論(bfMCR$)を提案する。
論文 参考訳(メタデータ) (2026-02-04T12:12:49Z) - Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness [61.87055159919641]
マルチモーダルセマンティックセグメンテーション(MMSS)は、モーダル間で補完情報を統合することで、単一モーダルデータの制限に対処する。
顕著な進歩にもかかわらず、マルチモーダルデータ品質の変動と不確実性により、研究と実世界の展開の間に大きなギャップが持続する。
Intire-Missing Modality (EMM)、Random-Missing Modality (RMM)、Noisy Modality (NM)の3つのシナリオでMMSSモデルを評価する頑健性ベンチマークを導入する。
論文 参考訳(メタデータ) (2025-03-24T08:46:52Z) - MMD-ReID: A Simple but Effective Solution for Visible-Thermal Person
ReID [20.08880264104061]
本稿では,モダリティギャップを明示的な差分低減制約によって低減する,シンプルで効果的なMDD-ReIDを提案する。
我々はMDD-ReIDの有効性を定性的かつ定量的に実証するための広範囲な実験を行った。
提案手法は,SYSU-MM01およびRegDBデータセットにおける最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2021-11-09T11:33:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。