論文の概要: A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2610.05413v1
- Date: Sun, 04 Oct 2026 17:54:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:54:42.292227
- Title: A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models
- Title(参考訳): マルチモーダル大言語モデルにおけるビジョンエンコーダ評価のための強力なベースライン
- Abstract要約: 我々は大規模な実験を通して視覚エンコーダのクロスモーダル評価を再考する。
RAVEL, クロスモーダル近傍探索に基づく学習自由度手法を提案する。
RAVELは実験全体を通して最先端のパフォーマンスを達成し、先行手法よりもかなりのマージンで性能を向上する。
- 参考スコア(独自算出の注目度): 6.928806411111984
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating vision encoders requires metrics that reliably predict their downstream performance in multimodal large language models (MLLMs). Although recent studies have shown that cross-modal metrics can better capture such performance, unimodal metrics remain the dominant choice in practice. In this work, we revisit cross-modal evaluation of vision encoders through large-scale experiments. We identify important limitations in both the experimental design and methodological formulation of prior approaches. After addressing these limitations and introducing simple improvements, we propose RAVEL, a training-free method based on cross-modal nearest-neighbor retrieval. Despite its simplicity, RAVEL achieves state-of-the-art performance across our experiments, outperforming prior methods by a substantial margin. Our results demonstrate that simple cross-modal metrics, when evaluated under a careful and comprehensive setup, can provide a strong basis for evaluating vision encoders for MLLMs.
- Abstract(参考訳): 視覚エンコーダの評価には、マルチモーダル大言語モデル(MLLM)の下流性能を確実に予測するメトリクスが必要である。
近年の研究では、クロスモーダルなメトリクスはそのようなパフォーマンスをよりよく捉えることができることが示されているが、実際はユニモーダルなメトリクスが主要な選択肢である。
本研究では,大規模な実験を通じて,視覚エンコーダのクロスモーダル評価を再考する。
先行手法の実験的設計と方法論的定式化の両方において重要な限界を同定する。
これらの制限に対処し、簡単な改善を導入した後、クロスモーダルな近接検索に基づくトレーニングフリー手法であるRAVELを提案する。
その単純さにもかかわらず、RAVELは我々の実験全体にわたって最先端のパフォーマンスを達成し、先行手法よりも大幅に性能が向上した。
本研究は, MLLMの視覚エンコーダ評価において, 簡易なクロスモーダル指標を, 注意的かつ包括的に評価することで, 強力な基礎となることを示すものである。
関連論文リスト
- Hierarchical Pre-Training of Vision Encoders with Large Language Models [4.52797541666943]
HIVE(Hierarchical Pre-Training of Visions)は、視覚言語アライメントを強化する新しいフレームワークである。
画像埋め込みをフラットにする従来の方法とは異なり、HIVEは複数の層にまたがる構造的特徴融合を可能にする。
我々の結果は階層的な機能統合の利点を強調し、より効率的な視覚言語モデルへの道を開いた。
論文 参考訳(メタデータ) (2026-03-31T18:00:39Z) - Conformal Cross-Modal Active Learning [16.42479423972555]
Active Learningは、ラベル付けのための最も有益なサンプルを戦略的に選択することで、アノテーションコストを最小限にすることを目的としている。
本稿では,教師-学生アーキテクチャを通じて視覚と言語モダリティを橋渡しする新しいALフレームワークであるConformal Cross-Modal Acquisition (CCMA)を紹介する。
論文 参考訳(メタデータ) (2026-03-24T12:59:47Z) - Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models [28.416254061159176]
マルチモーダルキーフレーズ予測(MMKP)は、テキストのみの手法を超えて進歩することを目的としている。
従来のマルチモーダルアプローチは、困難な不在と目に見えないシナリオを扱う上で、重大な制限があることが証明されている。
MMKPタスクに視覚言語モデル(VLM)を活用することを提案する。
論文 参考訳(メタデータ) (2025-10-10T13:13:07Z) - NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints [100.02131897927484]
本稿では,Multimodal Large Language Models(MLLM)のエンドツーエンドなネイティブトレーニングに焦点を当てる。
そこで我々は,NaViLと呼ばれるネイティブMLLMと,シンプルで費用対効果の高いレシピを組み合わせて提案する。
14のマルチモーダルベンチマークによる実験結果から,既存のMLLMに対するNaViLの競合性能が確認された。
論文 参考訳(メタデータ) (2025-10-09T17:59:37Z) - Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs [78.09559830840595]
本稿では拡散に基づく言語モデルの定量化に関する最初の体系的研究について述べる。
異常に大きなアクティベーション値によって特徴付けられるアクティベーションアウトリーチの存在を同定する。
我々は最先端のPTQ手法を実装し、包括的な評価を行う。
論文 参考訳(メタデータ) (2025-08-20T17:59:51Z) - Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward [77.34936657745578]
本稿では,MLLMに視覚内容の正確な知覚を促す新しい視覚認識報酬を導入するPerception-R1を提案する。
本稿では,Perception-R1が1,442のトレーニングデータのみを用いて,ほとんどのベンチマークで最先端のパフォーマンスを実現することを示す。
論文 参考訳(メタデータ) (2025-06-08T16:48:42Z) - MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models [71.36392373876505]
我々は、LVLM(Large Vision-Language Models)において、インターリーブされたマルチモーダル理解と生成を評価するための大規模ベンチマークであるMMIEを紹介する。
MMIEは、数学、コーディング、物理学、文学、健康、芸術を含む3つのカテゴリ、12のフィールド、102のサブフィールドにまたがる20Kの厳密にキュレートされたマルチモーダルクエリで構成されている。
インターリーブされたインプットとアウトプットの両方をサポートし、多様な能力を評価するために、複数選択とオープンな質問フォーマットの混合を提供する。
論文 参考訳(メタデータ) (2024-10-14T04:15:00Z) - Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training [48.455597568212944]
マルチモーダル・ミックス・オブ・エキスパート構造を用いて視覚専門家の集合をシームレスに統合するモノリシックMLLMであるMono-InternVLを提案する。
特に、EViPは、ノイズの多いデータから高品質なデータへの視覚的知識を完全に活用することを目的とした、視覚専門家のための進歩的な学習プロセスとして設計されている。
論文 参考訳(メタデータ) (2024-10-10T17:59:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。