論文の概要: ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
- arxiv url: http://arxiv.org/abs/2604.18452v1
- Date: Mon, 20 Apr 2026 16:10:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.984751
- Title: ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
- Title(参考訳): ESsEN:低リソース環境下での小型識別型ビジョンランゲージ変換器の訓練
- Authors: Clayton Fields, Casey Kennington,
- Abstract要約: 本稿では,2-towerエンコーダモデルが低リソース環境下での1-towerエンコーダよりも優れていることを示す。
また、比較的少ないリソースでエンドツーエンドにトレーニング可能な、コンパクトな視覚言語モデルであるESsENを提示する。
- 参考スコア(独自算出の注目度): 0.8307668828380427
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language modeling is rapidly increasing in popularity with an ever expanding list of available models. In most cases, these vision-language models have parameters in the tens of billions, which is necessary for some needs, but in many cases smaller models are necessary (e.g., on edge devices or independent robotic platforms). Unfortunately, there is little research in producing light-weight models or in training them with small datasets. Inspired by the language learning progression and data sparsity in child development, in this paper, we address both of these goals in a systematic fashion. We show that two-tower encoder models are superior to one-tower encoders in low-resource settings for discriminative English tasks. We show also that incorporating traditional convolutional networks into the two-tower transformer architecture can help produce parameter efficient vision-language models. Finally, we show that the cross-modal fusion module of two-tower encoders can vary significantly in shape and size while producing the same results. In addition, we present ESsEN, a compact vision-language model that can be trained end-to-end with relatively few resources that performs as well on several tasks with only a fraction of the parameters compared to other models. The experimental results and the tools we present here make vision-language modeling more accessible to a wider variety of researchers.
- Abstract(参考訳): 視覚言語モデリングは、利用可能なモデルのリストが拡大し、急速に人気が高まっている。
多くの場合、これらの視覚言語モデルは数百億のパラメータを持ち、それはいくつかのニーズに必要だが、小さなモデルが必要な場合が多い(例えば、エッジデバイスや独立したロボットプラットフォーム)。
残念なことに、軽量モデルの作成や、小さなデータセットでそれらをトレーニングする研究はほとんどない。
本稿では,子どもの発達における言語学習の進展とデータ空間性に着想を得て,これらの目標を体系的な方法で解決する。
本稿では,2-towerエンコーダモデルが低リソース環境下での1-towerエンコーダよりも優れていることを示す。
また、従来の畳み込みネットワークを2tower変換器アーキテクチャに組み込むことで、パラメータ効率の良い視覚言語モデルを作成することができることを示す。
最後に, 2-towerエンコーダのクロスモーダル融合モジュールは, 同じ結果が得られるとともに, 形状やサイズが大きく異なることを示す。
さらに,他のモデルに比べて少数のパラメータしか持たないタスクでも,比較的少ないリソースでエンド・ツー・エンドで学習可能な,コンパクトな視覚言語モデルであるESsENを提案する。
実験結果とツールにより、より広い範囲の研究者が視覚言語モデリングを利用できるようになる。
関連論文リスト
- Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and Modality [74.59049806800176]
このデモペーパーでは、Tevatronツールキットの重要な特徴、学界と産業の橋渡しについて取り上げている。
強い多言語・多モーダルな有効性を実現するための密集型検索器について紹介する。
私たちはOmniEmbedもリリースしています。私たちの知る限り、テキスト、画像ドキュメント、ビデオ、オーディオ検索を統一する最初の埋め込みモデルです。
論文 参考訳(メタデータ) (2025-05-05T08:52:49Z) - LLAVADI: What Matters For Multimodal Large Language Models Distillation [77.73964744238519]
本研究では,新しい効率的なモデル構造を提案するのではなく,スクラッチから小規模MLLMを訓練する。
本研究は, 知識蒸留プロセスにおける学習戦略, モデル選択, 蒸留アルゴリズムに関するものである。
異なるベンチマークと適切な戦略を評価することで、2.7Bの小型モデルでも7Bまたは13Bのパラメータを持つ大型モデルと同等に動作することができる。
論文 参考訳(メタデータ) (2024-07-28T06:10:47Z) - TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones [18.954681684239358]
本稿では,様々な視覚言語タスクを対象とした効率的なトレーニングと推論を目的とした,オープンソースのMLLMであるTinyGPT-Vを紹介する。
言語モデル280億のパラメータで、TinyGPT-VはVQAと画像推論タスクにおいて、より大きなパラメータに匹敵する結果を達成している。
論文 参考訳(メタデータ) (2023-12-28T07:11:41Z) - Contrastive Alignment of Vision to Language Through Parameter-Efficient
Transfer Learning [60.26952378997713]
コントラスト的視覚言語モデル(例えばCLIP)は、コントラスト的トレーニングを通じて視覚モデルと言語モデルの全てのパラメータを更新することによって作成される。
パラメータ更新の最小セット($7%)が、フルモデルトレーニングと同じパフォーマンスを実現可能であることを示す。
既存の知識がパラメータ効率のトレーニングにおいてより強く保存されていることを示す。
論文 参考訳(メタデータ) (2023-03-21T14:12:08Z) - eP-ALM: Efficient Perceptual Augmentation of Language Models [70.47962271121389]
本稿では,既存モデルの適応性を向上するための直接的な取り組みを提案し,認識を伴う言語モデルの拡張を提案する。
視覚言語タスクに事前訓練されたモデルを適用するための既存のアプローチは、その効率を妨げているいくつかの重要なコンポーネントに依存している。
総パラメータの99%以上を凍結し,1つの直線射影層のみをトレーニングし,1つのトレーニング可能なトークンのみを予測することにより,我々のアプローチ(eP-ALM)は,VQAとCaptioningの他のベースラインよりも有意に優れていることを示す。
論文 参考訳(メタデータ) (2023-03-20T19:20:34Z) - Scaling Vision-Language Models with Sparse Mixture of Experts [128.0882767889029]
提案手法は, 等価計算コストの高密度モデルに対して, 様々なベンチマークにおいて, 最先端性能を実現することができることを示す。
我々の研究は、MoEモデルのトレーニングの安定化、モデル解釈可能性に対するMoEの影響の理解、ビジョン言語モデルをスケールする際の計算性能間のトレードオフのバランスに関する貴重な洞察を提供する。
論文 参考訳(メタデータ) (2023-03-13T16:00:31Z) - Language Models are General-Purpose Interfaces [109.45478241369655]
本稿では,様々な基礎モデルに対する汎用インタフェースとして言語モデルを提案する。
事前訓練されたエンコーダのコレクションは、様々なモダリティ(ビジョンや言語など)を知覚する
インタフェースとモジュールエンコーダを協調的に事前学習するための半因果言語モデリング手法を提案する。
論文 参考訳(メタデータ) (2022-06-13T17:34:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。