論文の概要: The Alignment Illusion in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.30210v1
- Date: Thu, 24 Sep 2026 17:42:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.175596
- Title: The Alignment Illusion in Multimodal Large Language Models
- Title(参考訳): マルチモーダル大言語モデルにおけるアライメントイリュージョン
- Abstract要約: MLLMの内部的な視覚テキストアライメントは、言語モデル内の視覚ストリームの診断として最もよく読まれる。
この読みは、スカラーアライメントスコアがコンテンツレベルの相互モーダル相互作用を反映しているという仮定に基づいている。
- 参考スコア(独自算出の注目度): 20.422121064806188
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Layer-wise visual-text similarity in Multimodal Large Language Models (MLLMs) is widely interpreted as evidence that the language model progressively integrates visual content into a shared representation space. This reading rests on the assumption that scalar alignment scores reflect content-level cross-modal interaction. To test this assumption, we apply controlled interventions to the visual stream. Across 13 MLLMs from five families spanning 0.5B to 72B parameters, replacing projector-output visual tokens with Gaussian noise sharply reduces task accuracy, yet four standard scalar measures (CKA, SVCCA, MIR, and the leading principal-angle cosine) fail to consistently separate the corrupted stream from the original. We call this failure the alignment illusion and trace it to the shared language-model pathway: anisotropic MLP down-projections pull visual and text tokens toward common output directions, producing weight-induced alignment. Because this component is essentially one-dimensional, we introduce the principal-angle gap (PA gap), defined as the difference between the top two principal-angle cosines, which separates weight-induced similarity from multi-directional visual structure. Under graded visual corruption, the PA gap tracks task accuracy more consistently than the scalar scores we consider; under a structured but irrelevant image, it further exposes regimes in which internal geometry and task accuracy come apart. Internal visual-text alignment in MLLMs is therefore best read as a geometric diagnostic of the visual stream inside the language model rather than a direct proxy for content-level cross-modal interaction, and is most informative when calibrated by controlled task evidence.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)における階層的視覚テキスト類似性は、言語モデルが視覚コンテンツを共有表現空間に徐々に統合する証拠として広く解釈されている。
この読みは、スカラーアライメントスコアがコンテンツレベルの相互モーダル相互作用を反映しているという仮定に基づいている。
この仮定をテストするために、制御された介入を視覚ストリームに適用する。
0.5Bから72Bのパラメータにまたがる5つのファミリーからなる13のMLLMで、プロジェクター出力の視覚トークンをガウスノイズに置き換えることで、タスクの精度が大幅に低下するが、4つの標準スカラー測度(CKA、SVCCA、MIR、および主要な主角コサイン)は、元のストリームを一貫して分離することができない。
我々はこの失敗をアライメントイリュージョンと呼び、それを共有言語モデルパス(英語版)にトレースする:異方性MLPダウンプロジェクションは、共通の出力方向に向かって視覚的およびテキストトークンをプルし、重み付きアライメントを生成する。
この成分は基本的に1次元であるため、重みによる類似性を多方向視覚構造から分離する2つの主角コサイン間の差として定義される主角ギャップ(PAギャップ)を導入する。
段階的な視覚的腐敗の下では、PAギャップは我々が考慮するスカラースコアよりもタスクの精度をより一貫して追跡する。
したがって、MLLMの内部的な視覚テキストアライメントは、コンテンツレベルのクロスモーダル相互作用の直接的なプロキシではなく、言語モデル内の視覚ストリームの幾何学的診断として最もよく読まれており、制御されたタスクエビデンスによって校正されるときに最も有益である。
関連論文リスト
- One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting [51.09550363815034]
シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
SPaTS はフロンティアのクローズドソースMLLM と OCR MLLM の両方で一貫した性能を示し,その性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-07-30T09:17:48Z) - When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models [4.309108879640932]
VLM(Vision-Language Models)は、より強力な高感度アプリケーションである。
定期的に幻覚を呈し、入力に存在しない内容について自信を持って記述する。
これらの障害モードを幾何学的オーバーアライメントにトレースする。
本稿では,トレーニングフリー推論戦略とバイアス対応微調整パラダイムの2つの補完策を提案する。
論文 参考訳(メタデータ) (2026-05-07T10:09:18Z) - Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs [9.043999205886658]
大きな視覚言語モデルにおける幻覚は、言語が視覚的証拠を支配するときにしばしば起こる。
本稿では,視覚言語と言語のみの注意経路を構築するために,自己注意層内で動作するシングルパス機構であるContrastive Guidance(ACG)を提案する。
ACGは、計算コストを大幅に削減しつつ、最先端の忠実さとキャプション品質を達成する。
論文 参考訳(メタデータ) (2026-01-20T08:04:18Z) - Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs [88.68484904214142]
Patch-as-Decodable Token (PaDT)を導入し、テキストと多様な視覚出力を生成する。
PaDTの中心は、クエリイメージのビジュアルパッチ埋め込みから派生したVisual Reference Tokens (VRT)である。
MLLMモデルと比較しても,PaDTは最先端の性能を一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T12:23:57Z) - Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model [51.02616473941499]
大規模言語モデル(LLM)による3Dオブジェクトのセグメンテーションは、その広範囲なセマンティクス、タスクの柔軟性、強力な一般化により、広く普及しているパラダイムとなっている。
LLMは高レベルなセマンティックトークンを処理し、3次元の点雲は密度の高い幾何学的構造のみを伝達する。
本稿では,LLMと高密度3次元点雲の間の表現ギャップを橋渡しする一般フレームワークであるポイント言語モデル(PLM)を提案する。
論文 参考訳(メタデータ) (2025-09-09T15:01:28Z) - Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration [22.39558434131574]
LVLM(Large Vision-Language Models)は、視覚的コンテンツと実際に一致しない応答を生成する。
我々は、単一の意味のない入力画像からバイアスを推定する、トレーニング不要なソリューションUniform Attention (UAC)を導入する。
また、画像中のオブジェクトがどこにあっても一貫した出力を強制する、微調整ソリューションであるDynamic Attention (DAC)を導入します。
論文 参考訳(メタデータ) (2025-02-04T03:27:38Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。