論文の概要: Tuning LayerNorm in Attention: Towards Efficient Multi-Modal LLM
Finetuning
- arxiv url: http://arxiv.org/abs/2312.11420v1
- Date: Mon, 18 Dec 2023 18:21:43 GMT
- ステータス: 処理完了
- システム内更新日: 2023-12-20 18:53:31.070946
- Title: Tuning LayerNorm in Attention: Towards Efficient Multi-Modal LLM
Finetuning
- Title(参考訳): 注意のチューニング層ノルム:効率的なマルチモーダルllm微調整に向けて
- Authors: Bingchen Zhao, Haoqin Tu, Chen Wei, Jieru Mei, Cihang Xie
- Abstract要約: 本稿では,Large Language Model(LLM)をMLLM(Multi-Modal Large Language Model)に変換するための効率的な戦略を提案する。
強いパフォーマンスを得るためにLayerNormをチューニングする。
フルパラメータファインタニングやLoRAといった他のチューニングアプローチと比較した場合、その効率性に対するメリットはかなり大きい。
- 参考スコア(独自算出の注目度): 34.49906405191175
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper introduces an efficient strategy to transform Large Language
Models (LLMs) into Multi-Modal Large Language Models (MLLMs). By
conceptualizing this transformation as a domain adaptation process, i.e.,
transitioning from text understanding to embracing multiple modalities, we
intriguingly note that, within each attention block, tuning LayerNorm suffices
to yield strong performance. Moreover, when benchmarked against other tuning
approaches like full parameter finetuning or LoRA, its benefits on efficiency
are substantial. For example, when compared to LoRA on a 13B model scale,
performance can be enhanced by an average of over 20% across five multi-modal
tasks, and meanwhile, results in a significant reduction of trainable
parameters by 41.9% and a decrease in GPU memory usage by 17.6%. On top of this
LayerNorm strategy, we showcase that selectively tuning only with
conversational data can improve efficiency further. Beyond these empirical
outcomes, we provide a comprehensive analysis to explore the role of LayerNorm
in adapting LLMs to the multi-modal domain and improving the expressive power
of the model.
- Abstract(参考訳): 本稿では,Large Language Models(LLM)をMLLM(Multi-Modal Large Language Models)に変換するための効率的な戦略を提案する。
この変換を、テキスト理解から複数のモダリティの受け入れへと移行するドメイン適応プロセスとして概念化することで、各アテンションブロック内で、レイヤノルムのチューニングが強力なパフォーマンスをもたらすことに興味深いことに気付きます。
さらに、フルパラメータファインタニングやLoRAといった他のチューニングアプローチと比較した場合、その効率性に対するメリットはかなり大きい。
例えば、13BモデルスケールのLoRAと比較して、パフォーマンスは5つのマルチモーダルタスクで平均20%以上向上し、トレーニング可能なパラメータを41.9%削減し、GPUメモリ使用率を17.6%削減することができる。
このLayerNorm戦略に加えて、対話データのみを選択的にチューニングすることで、効率をさらに向上できることを示す。
これらの経験的結果の他に、マルチモーダル領域へのLLMの適用とモデルの表現力向上におけるLayerNormの役割を総合的に分析する。
関連論文リスト
- LayerNorm: A key component in parameter-efficient fine-tuning [2.7229002282002397]
BERT(Bidirectional Representations from Transformers)のような事前学習モデルの微調整は、多くの自然言語処理(NLP)タスクを解決する効果的な方法であることが証明されている。
BERTを含む多くの最先端NLPモデルではパラメータが多数存在するため、微調整のプロセスは計算コストがかかる。
この問題に対する魅力的な解決策の1つはパラメータ効率の細かいチューニングであり、残余を変更せずに最小限のセグメントだけを変更することである。
論文 参考訳(メタデータ) (2024-03-29T16:53:11Z) - AffineQuant: Affine Transformation Quantization for Large Language Models [58.45460102764]
ポストトレーニング量子化(PTQ)は、その圧縮効率とトレーニングの文脈における費用対効果により、かなりの関心を集めている。
既存の大規模言語モデル(LLM)のPTQ手法は、事前量子化重みと後量子化重みの間の変換のスケーリングに最適化範囲を制限している。
本稿では,PTQ(AffineQuant)における等価アフィン変換を用いた直接最適化を提唱する。
論文 参考訳(メタデータ) (2024-03-19T08:40:21Z) - Matrix-Transformation Based Low-Rank Adaptation (MTLoRA): A Brain-Inspired Method for Parameter-Efficient Fine-Tuning [11.037221461758806]
マトリックス変換に基づく低ランク適応(MTLoRA)は、脳の機能はその幾何学的構造によって形成されるという考えから着想を得ている。
MTLoRAは8つのタスクでパフォーマンスが約1.0%向上する。
論文 参考訳(メタデータ) (2024-03-12T09:32:25Z) - CREMA: Multimodal Compositional Video Reasoning via Efficient Modular
Adaptation and Fusion [65.3593129253195]
CREMAはビデオ推論に新しいモダリティを注入するための効率的なフレームワークである。
本稿では,ビデオ3D,ビデオオーディオ,ビデオ言語推論タスクについて検証する。
論文 参考訳(メタデータ) (2024-02-08T18:27:22Z) - Context-PEFT: Efficient Multi-Modal, Multi-Task Fine-Tuning [12.648711621637663]
この論文は小説を紹介します。
COCO-Efficient Fine-Tuning (PEFT) framework for multi-modal, multi-task transfer learning with pre-trained language model。
トークンのドメインに基づいて異なる適応パラメータ群を学習するContext-PEFTを提案する。
提案手法はキャプションタスクで評価され、類似したデータ制約下での完全な微調整よりも優れる。
論文 参考訳(メタデータ) (2023-12-14T13:00:24Z) - Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large
Language Models [56.256069117502385]
Chain of Thought (CoT)アプローチは、複雑な推論タスクにおいて、LLM(Large Language Models)の能力を高めるために使用できる。
しかし、マルチモーダル推論における最適なCoT実例の選択は、まだ検討されていない。
本稿では,この課題に対処する新しい手法として,検索機構を用いて実演例を自動的に選択する手法を提案する。
論文 参考訳(メタデータ) (2023-12-04T08:07:21Z) - CRaSh: Clustering, Removing, and Sharing Enhance Fine-tuning without
Full Large Language Model [22.870512676002463]
本稿では,集中型LCMと下流エミュレータ間でトランスフォーマブロックを転送する代表的手法であるOffsite-Tuning(OFT)に焦点を当てる。
これらの観測にインスパイアされたCRaShは、LCMから改善エミュレータを導出するトレーニングフリー戦略であるClustering、Removing、Sharingを含む。
以上の結果から,CRaShとOFTの有効性が明らかとなった。
論文 参考訳(メタデータ) (2023-10-24T03:08:58Z) - Federated Learning of Large Language Models with Parameter-Efficient
Prompt Tuning and Adaptive Optimization [71.87335804334616]
フェデレートラーニング(FL)は、分散データとの協調モデルトレーニングを可能にする、有望なパラダイムである。
LLM(Large Language Models)のトレーニングプロセスは一般的に重要なパラメータの更新を引き起こす。
本稿では,性能と効率を同時に向上する効率的な部分的プロンプトチューニング手法を提案する。
論文 参考訳(メタデータ) (2023-10-23T16:37:59Z) - QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources [37.265708531464746]
大規模言語モデル(LLM)は、さまざまな自然言語処理タスクに顕著な影響を与えている。
これらのトレーニング済みモデルを下流データセットに微調整することで、さらなる大幅なパフォーマンス向上が達成されるが、このプロセスは異常なリソース要求のために困難だった。
性能を損なうことなくメモリ効率のよい微調整を可能にするLLMのための新しい量子フルパラメータチューニングフレームワークQFTを提案する。
論文 参考訳(メタデータ) (2023-10-11T02:47:40Z) - ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language
Models [70.45441031021291]
LVLM(Large Vision-Language Models)は、様々なモダリティから豊富な情報を統合することで、世界を包括的に理解することができる。
LVLMは計算/エネルギーの膨大なコストと炭素消費のためにしばしば問題となる。
本稿では,LVLMの2段間粗大な重み付け法であるECoFLaP(Efficient Coarse-to-Fine LayerWise Pruning)を提案する。
論文 参考訳(メタデータ) (2023-10-04T17:34:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。