論文の概要: MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations
- arxiv url: http://arxiv.org/abs/2608.25575v1
- Date: Wed, 26 Aug 2026 09:37:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.72019
- Title: MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations
- Title(参考訳): MLLMCLIP:ロバスト視覚言語表現のためのMLLMの特徴レベル蒸留
- Authors: Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji,
- Abstract要約: CLIPのような事前訓練された視覚言語モデルはゼロショット認識では優れるが、しばしば合成では失敗する。
MLLMCLIPは,生成型多モーダル大言語モデルから識別型CLIP学習者へ直接,多モーダルな知識を伝達するフレームワークである。
MLLMCLIPは、標準のゼロショット分類と画像テキスト検索で一貫したゲインを達成しつつ、最先端の合成精度を達成する。
- 参考スコア(独自算出の注目度): 35.542111485761744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretrained vision-language models such as CLIP excel at zero-shot recognition but often fail at compositionality, particularly attribute-object and relational structures. Recent studies mitigate this issue by augmenting training with synthetic hard negatives generated by a cascade of large language models and text-to-image models, which incurs substantial pipeline overhead. We instead propose MLLMCLIP, a heterogeneous distillation framework that transfers multimodal knowledge directly from a generative Multimodal Large Language Model (MLLM) teacher into a discriminative CLIP student, bypassing synthetic data entirely. To bridge the architectural mismatch between the two paradigms, we introduce an attention-based per-layer token selection and a CKA-based distillation loss. Compared to prior CLIP-enhancement methods, MLLMCLIP achieves state-of-the-art compositional accuracy while delivering consistent gains on standard zero-shot classification and image-text retrieval, showing that feature-level distillation strengthens both compositional and general vision-language representation capability.
- Abstract(参考訳): CLIPのような事前訓練された視覚言語モデルは、ゼロショット認識では優れるが、特に属性オブジェクトやリレーショナル構造において合成に失敗することが多い。
近年の研究では、大規模な言語モデルとテキスト・ツー・イメージモデルのカスケードによって生成される合成ハード・ネガによるトレーニングの強化により、この問題を緩和している。
そこで我々は,MLLMCLIPを提案する。MLLMCLIPは多モーダルな知識を生成型多モーダル大言語モデル(MLLM)の教師から差別的CLIPの学生へ直接伝達し,合成データを完全にバイパスする多モーダルな蒸留フレームワークである。
2つのパラダイム間のアーキテクチャミスマッチを橋渡しするために,注目層単位のトークン選択とCKAに基づく蒸留損失を導入する。
従来のCLIP-Enhancement法と比較して,MLLMCLIPは,標準ゼロショット分類と画像テキスト検索の一貫性を保ちながら,最先端の合成精度を実現する。
関連論文リスト
- VladVA: Discriminative Fine-tuning of LVLMs [67.14293827774827]
CLIPのような対照的に訓練された視覚言語モデル(VLM)は、識別的視覚言語表現学習の事実上のアプローチとなっている。
我々は,LVLMの識別的微調整のための新たな訓練手法である「両世界のベスト」を組み合わせることを提案する。
論文 参考訳(メタデータ) (2024-12-05T17:54:27Z) - LLM2CLIP: Powerful Language Model Unlocks Richer Visual Representation [72.02635550088546]
この研究は、大規模言語モデル(LLM)がCLIPの機能をどのように強化するか、特により長く複雑なイメージキャプションを処理するために検討する。
キャプション・トゥ・キャプション・トゥ・キャプション・トゥ・コントラスト・ファインチューニング・フレームワークを導入し,LLM出力の識別品質を大幅に向上させた。
提案手法はLoRA法よりも優れ,より優れた性能で4倍近い高速トレーニングを実現している。
論文 参考訳(メタデータ) (2024-11-07T18:59:16Z) - Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models [0.0]
本稿では,従来のCLIP手法の制約を克服する革新的なフレームワークであるCascadeVLMを紹介する。
様々なきめ細かい画像データセットに対する実験により、CascadeVLMは既存のモデルよりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2024-05-18T14:12:04Z) - Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP [57.53087077735303]
本稿では,CLIPの構成的視覚言語推論を強化する軽量で効率的な蒸留法であるSDS-CLIPを紹介する。
提案手法は,Stable-Diffusionのような大規模テキスト・画像生成モデルから抽出した蒸留目標を用いた微細構造CLIPである。
挑戦的なWinogroundベンチマークでは、SDS-CLIPは様々なCLIPモデルの視覚言語性能を7%向上させ、AROデータセットでは、パフォーマンスを最大3%向上させた。
論文 参考訳(メタデータ) (2023-07-18T13:10:11Z) - Prompting Language-Informed Distribution for Compositional Zero-Shot Learning [73.49852821602057]
合成ゼロショット学習(CZSL)タスクは、目に見えない合成視覚概念を認識することを目的としている。
本稿では,タスクに対して言語インフォームド分布(PLID)を指示するモデルを提案する。
MIT-States、UT-Zappos、C-GQAデータセットの実験結果は、PLIDの先行技術よりも優れた性能を示している。
論文 参考訳(メタデータ) (2023-05-23T18:00:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。