論文の概要: CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
- arxiv url: http://arxiv.org/abs/2604.03231v1
- Date: Fri, 03 Apr 2026 17:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.565809
- Title: CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
- Title(参考訳): CoME-VL: 補完的なマルチエンコーダビジョンランゲージ学習
- Authors: Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan,
- Abstract要約: CoME-VLは、対照的に訓練された視覚エンコーダと自己教師型DINOエンコーダを統合するモジュラーフュージョンフレームワークである。
提案手法は,RefCOCOのベースライン上での精度を高いマージンで向上させながら,検出のための最先端性能を実現する。
- 参考スコア(独自算出の注目度): 79.07656918674684
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent vision-language models (VLMs) typically rely on a single vision encoder trained with contrastive image-text objectives, such as CLIP-style pretraining. While contrastive encoders are effective for cross-modal alignment and retrieval, self-supervised visual encoders often capture richer dense semantics and exhibit stronger robustness on recognition and understanding tasks. In this work, we investigate how to scale the fusion of these complementary visual representations for vision-language modeling. We propose CoME-VL: Complementary Multi-Encoder Vision-Language, a modular fusion framework that integrates a contrastively trained vision encoder with a self-supervised DINO encoder. Our approach performs representation-level fusion by (i) entropy-guided multi-layer aggregation with orthogonality-constrained projections to reduce redundancy, and (ii) RoPE-enhanced cross-attention to align heterogeneous token grids and produce compact fused visual tokens. The fused tokens can be injected into a decoder-only LLM with minimal changes to standard VLM pipelines. Extensive experiments across diverse vision-language benchmarks demonstrate that CoME-VL consistently outperforms single-encoder baselines. In particular, we observe an average improvement of 4.9% on visual understanding tasks and 5.4% on grounding tasks. Our method achieves state-of-the-art performance on RefCOCO for detection while improving over the baseline by a large margin. Finally, we conduct ablation studies on layer merging, non-redundant feature mixing, and fusion capacity to evaluate how complementary contrastive and self-supervised signals affect VLM performance.
- Abstract(参考訳): 最近の視覚言語モデル(VLM)は、通常、CLIPスタイルの事前訓練のような対照的な画像テキストの目的で訓練された単一の視覚エンコーダに依存している。
コントラストエンコーダはクロスモーダルアライメントと検索に有効であるが、自己監督型ビジュアルエンコーダは、よりリッチな密接なセマンティクスをキャプチャし、認識および理解タスクに強い堅牢性を示す。
本研究では,視覚言語モデリングにおける視覚表現の融合のスケールについて検討する。
コントラスト訓練された視覚エンコーダと自己教師型DINOエンコーダを統合するモジュール型融合フレームワークであるComplementary Multi-Encoder Vision-Languageを提案する。
提案手法は表現レベル融合を行う。
(i)直交制約プロジェクションによるエントロピー誘導多層アグリゲーションによる冗長性低減
(II)不均一なトークングリッドを整列させ、コンパクトな融合されたビジュアルトークンを生成するRoPE強化型クロスアテンション。
融合トークンは、標準のVLMパイプラインに最小限の変更を加えてデコーダのみのLLMに注入することができる。
様々な視覚言語ベンチマークによる大規模な実験は、CoME-VLがシングルエンコーダベースラインを一貫して上回っていることを示している。
特に,視覚理解タスクは平均4.9%,接地タスクは5.4%改善した。
提案手法は,RefCOCOのベースライン上での精度を高いマージンで向上させながら,検出のための最先端性能を実現する。
最後に、相補的なコントラスト信号と自己教師信号がVLM性能に与える影響を評価するために、層融合、非冗長な特徴混合、および融合能力に関するアブレーション研究を行う。
関連論文リスト
- Hierarchical Pre-Training of Vision Encoders with Large Language Models [4.52797541666943]
HIVE(Hierarchical Pre-Training of Visions)は、視覚言語アライメントを強化する新しいフレームワークである。
画像埋め込みをフラットにする従来の方法とは異なり、HIVEは複数の層にまたがる構造的特徴融合を可能にする。
我々の結果は階層的な機能統合の利点を強調し、より効率的な視覚言語モデルへの道を開いた。
論文 参考訳(メタデータ) (2026-03-31T18:00:39Z) - METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models [92.37117312251755]
プログレッシブプルーニングフレームワークであるMulti-Encoder collaboraTivE tOken pRuning (METEOR)を提案する。
マルチビジョン符号化では,各エンコーダ内の冗長トークンをランク誘導型協調トークン代入戦略により破棄する。
マルチビジョン融合では、異なるエンコーダの視覚的特徴を組み合わせながら、コラボレーティブプルーニングによるクロスエンコーダ冗長性を低減させる。
論文 参考訳(メタデータ) (2025-07-28T13:50:53Z) - EVEv2: Improved Baselines for Encoder-Free Vision-Language Models [72.07868838411474]
既存のエンコーダフリービジョン言語モデル(VLM)は、エンコーダベースモデルと性能ギャップを狭めている。
我々は,主流のエンコーダをベースとしたVLMと競合するエンコーダフリーVLMの効率的な戦略を開発する。
統一モデルにおいて、視覚と言語を適切に階層的に関連付けることで、モダリティ間の干渉を減少させることを示す。
論文 参考訳(メタデータ) (2025-02-10T18:59:58Z) - Optimizing Vision-Language Interactions Through Decoder-Only Models [4.219163079329444]
MUDAIFは視覚とテキストの入力をシームレスに統合する視覚言語モデルである。
効率性、柔軟性、クロスモーダルな理解が向上します。
45Mイメージテキストペアの大規模なデータセットでトレーニングされている。
論文 参考訳(メタデータ) (2024-12-14T09:04:32Z) - Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation [109.5893580175657]
近年,MLLMの開発における標準的な実践は,視覚エンコーダの機能をLLMに供給し,自然言語による指導を施すことである。
このアプローチは、しばしばモデルが言語理解に傾き、データに存在するリッチな視覚知覚信号を損なう。
本稿では,視覚知識をエキスパートビジョンエンコーダからLLMの隠れ表現に注入する最初のアプローチであるVisPer-LMを提案する。
論文 参考訳(メタデータ) (2024-12-12T18:55:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。