論文の概要: Hierarchical Pre-Training of Vision Encoders with Large Language Models
- arxiv url: http://arxiv.org/abs/2604.00086v1
- Date: Tue, 31 Mar 2026 18:00:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.672054
- Title: Hierarchical Pre-Training of Vision Encoders with Large Language Models
- Title(参考訳): 大規模言語モデルを用いた視覚エンコーダの階層的事前訓練
- Authors: Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee,
- Abstract要約: HIVE(Hierarchical Pre-Training of Visions)は、視覚言語アライメントを強化する新しいフレームワークである。
画像埋め込みをフラットにする従来の方法とは異なり、HIVEは複数の層にまたがる構造的特徴融合を可能にする。
我々の結果は階層的な機能統合の利点を強調し、より効率的な視覚言語モデルへの道を開いた。
- 参考スコア(独自算出の注目度): 4.52797541666943
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The field of computer vision has experienced significant advancements through scalable vision encoders and multimodal pre-training frameworks. However, existing approaches often treat vision encoders and large language models (LLMs) as independent modules, limiting the integration of hierarchical visual features. In this work, we propose HIVE (Hierarchical Pre-Training of Vision Encoders), a novel framework that enhances vision-language alignment by introducing hierarchical cross-attention between the vision encoder and LLM. Unlike conventional methods that flatten image embeddings, HIVE enables structured feature fusion across multiple layers, improving gradient flow and representation learning. To optimize this interaction, we introduce a three-stage training strategy that progressively aligns the vision encoder with the LLM, ensuring stable optimization and effective multimodal fusion. Empirical evaluations demonstrate that HIVE achieves superior performance not only in image classification but also on various vision-language tasks, outperforming self-attention-based methods in benchmarks such as MME, GQA, OK-VQA, and ScienceQA. Our results highlight the benefits of hierarchical feature integration, paving the way for more efficient and expressive vision-language models.
- Abstract(参考訳): コンピュータビジョンの分野は、スケーラブルなビジョンエンコーダとマルチモーダル事前学習フレームワークを通じて、大きな進歩を遂げてきた。
しかし、既存のアプローチでは視覚エンコーダや大規模言語モデル(LLM)を独立したモジュールとして扱うことが多く、階層的な視覚的特徴の統合を制限している。
本研究では、視覚エンコーダとLLMの階層的相互アテンションを導入することで、視覚言語アライメントを強化する新しいフレームワークであるHIVE(Hierarchical Pre-Training of Vision Encoders)を提案する。
画像埋め込みをフラットにする従来の方法とは異なり、HIVEは複数の層にまたがる構造的特徴融合を可能にし、勾配流と表現学習を改善している。
この相互作用を最適化するために、視覚エンコーダとLCMを段階的に整列させ、安定した最適化と効果的なマルチモーダル融合を実現する3段階のトレーニング戦略を導入する。
MME,GQA,OK-VQA,ScienceQAなどのベンチマークにおいて,HIVEは画像分類だけでなく様々な視覚言語タスクでも優れた性能を発揮することを示す。
我々の結果は階層的な機能統合の利点を強調し、より効率的で表現力豊かな視覚言語モデルへの道を開いた。
関連論文リスト
- VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization [87.26383908243878]
マルチモーダル大言語モデルにおける視覚エンコーダは,その高密度な特徴表現に欠けていることを示す。
本稿では,協調学習のための新しいマルチタスクフレームワークであるVersaViTを提案する。
論文 参考訳(メタデータ) (2026-02-10T16:08:19Z) - CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models [7.442802086966249]
CARPE(Context-Aware Image Representation Prioritization via Ensemble)は、視覚統合レイヤとコンテキスト認識アンサンブル戦略を導入した、モデルに依存しないフレームワークである。
CARPEは、視覚エンコーダと言語モデルで構成されるほとんどのオープンソースのLVLMと効果的に統合されるように設計されている。
論文 参考訳(メタデータ) (2026-01-20T05:44:33Z) - From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion [91.35078719566472]
VLM(Vision-Language Models)は、粗い非対称接続を使用することで、深刻な視覚的特徴のボトルネックを生み出す。
CLI(Cross-Layer Injection)は,2つのモダリティの間に動的に多対多の橋を架ける,斬新で軽量なフレームワークである。
論文 参考訳(メタデータ) (2026-01-15T18:59:10Z) - Attention Guided Alignment in Efficient Vision-Language Models [56.20286899428444]
VLM(Large Vision-Language Models)は、事前訓練された視覚エンコーダとLLM(Large Language Models)の効果的なマルチモーダルアライメントに依存している。
本稿では,効率的なVLMにおける注意パターンの包括的解析について述べる。
本稿では,Attention-Guided Efficient Vision-Language Models (AGE-VLM)を紹介する。
論文 参考訳(メタデータ) (2025-11-21T21:36:48Z) - Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models [50.98559225639266]
6つのタスクカテゴリにまたがる18のベンチマークを用いて,異なるエンコーダ層からの視覚的特徴の寄与について検討した。
この結果から,多層構造はタスク依存性の相補的な長所を提供し,均一な融合が最適以下の性能をもたらすことが明らかとなった。
テキスト命令に基づいて動的に多層視覚特徴を統合する命令誘導型視覚アグリゲータを提案する。
論文 参考訳(メタデータ) (2024-12-26T05:41:31Z) - X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs [49.30255148577368]
X-FormerはCLとMIMの相補的な強度を利用するために設計された軽量トランスフォーマーモジュールである。
X-Formerは、2つの凍結した視覚エンコーダから視覚言語表現学習とマルチモーダル・マルチモーダル生成学習をブートストラップする。
さらに、凍結したLLMから視覚から言語への生成学習をブートストラップし、X-Formerの視覚的特徴をLLMで解釈できるようにする。
論文 参考訳(メタデータ) (2024-07-18T18:39:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。