論文の概要: SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective
Depth Up-Scaling
- arxiv url: http://arxiv.org/abs/2312.15166v2
- Date: Fri, 29 Dec 2023 01:51:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-01-02 20:25:47.153990
- Title: SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective
Depth Up-Scaling
- Title(参考訳): SOLAR 10.7B: 単純だが効果的なアップスケーリングによる大規模言語モデルのスケーリング
- Abstract要約: 我々は107億のパラメータを持つ大規模言語モデル(LLM)であるSOLAR 10.7Bを紹介し、様々な自然言語処理(NLP)タスクにおいて優れた性能を示す。
本稿では,深層スケーリングと継続事前学習を含むDUS(Deep Up-scaling)と呼ばれるLSMのスケーリング手法を提案する。
DUSモデル上に構築されたSOLAR 10.7B-インストラクトは、Mixtral-8x7B-インストラクトを超越した、命令追従機能用に微調整された変種である。
- 参考スコア(独自算出の注目度): 11.435566730435461
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce SOLAR 10.7B, a large language model (LLM) with 10.7 billion
parameters, demonstrating superior performance in various natural language
processing (NLP) tasks. Inspired by recent efforts to efficiently up-scale
LLMs, we present a method for scaling LLMs called depth up-scaling (DUS), which
encompasses depthwise scaling and continued pretraining. In contrast to other
LLM up-scaling methods that use mixture-of-experts, DUS does not require
complex changes to train and inference efficiently. We show experimentally that
DUS is simple yet effective in scaling up high-performance LLMs from small
ones. Building on the DUS model, we additionally present SOLAR 10.7B-Instruct,
a variant fine-tuned for instruction-following capabilities, surpassing
Mixtral-8x7B-Instruct. SOLAR 10.7B is publicly available under the Apache 2.0
license, promoting broad access and application in the LLM field.
- Abstract(参考訳): 我々は107億のパラメータを持つ大規模言語モデル(LLM)であるSOLAR 10.7Bを紹介し、様々な自然言語処理(NLP)タスクにおいて優れた性能を示す。
近年の大規模llmの効率化に触発されて,深度拡大スケーリング(dus, depth up-scaling)と呼ばれるllmのスケーリング手法を提案する。
他のLLMアップスケーリング手法とは異なり、DUSはトレーニングや推論を効率的に行うのに複雑な変更を必要としない。
実験により, DUS は単純だが, 高速 LLM のスケールアップには有効であることがわかった。
dusモデルに基づいて、さらに、命令追従機能のために微調整された変種であるsolar 10.7b-instructを、mixtral-8x7b-instructを上回っている。
solar 10.7bはapache 2.0ライセンスの下で公開されており、llm分野の幅広いアクセスとアプリケーションを促進する。
関連論文リスト
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models [27.78079458473877]
MLLM(Multimodal large language model)は通常、クロスモーダルアライメント、教師付き微調整、優先最適化からなる多段階パイプラインを通じて構築される。
音声エンコーダとLLMの両方を凍結したままに保ち、軽量プロジェクタのみを学習するインストラクションフリーアライメントオンリー大型オーディオ言語モデル(LALM)を導入する。
この結果から,競合MLLMはアライメントのみから出現し,軽量プロジェクタトレーニング問題へのマルチモーダル拡張を低減できる可能性が示唆された。
論文 参考訳(メタデータ) (2026-07-28T03:30:41Z) - LLaVA-KD: A Framework of Distilling Multimodal Large Language Models [70.19607283302712]
本稿では,l-MLLMからs-MLLMへ知識を伝達する新しいフレームワークを提案する。
具体的には,l-MLLMとs-MLLMの視覚的テキスト出力分布のばらつきを最小限に抑えるために,MDist(Multimodal Distillation)を導入する。
また,S-MLLMの可能性を完全に活用するための3段階学習手法を提案する。
論文 参考訳(メタデータ) (2024-10-21T17:41:28Z) - WALL-E: World Alignment by Rule Learning Improves World Model-based LLM Agents [55.64361927346957]
大規模言語モデル(LLM)による規則の勾配なし学習のためのニューロシンボリックアプローチを提案する。
我々のLLMエージェントWALL-Eはモデル予測制御(MPC)上に構築されている
MinecraftとALFWorldにおけるオープンワールドの課題について、WALL-Eは既存の方法よりも高い成功率を達成する。
論文 参考訳(メタデータ) (2024-10-09T23:37:36Z) - Delta-CoMe: Training-Free Delta-Compression with Mixed-Precision for Large Language Models [79.46938238953916]
多様なアプリケーションへの微調整された大規模言語モデル(LLM)は、複雑な要求を満たすために不可欠である。
近年の研究では、微調整LDMをベースモデルと対応するデルタウェイトに分解し、低ランクまたは低ビットのアプローチで圧縮してコストを削減することが示唆されている。
本研究では,従来の低ランク圧縮法と低ビット圧縮法がタスク固有の微調整LDMのモデル性能を著しく損なうことを観察する。
論文 参考訳(メタデータ) (2024-06-13T07:57:27Z) - ST-LLM: Large Language Models Are Effective Temporal Learners [58.79456373423189]
大規模言語モデル(LLM)は、テキストの理解と生成において印象的な能力を示した。
ビデオベースの対話システムでビデオを効果的にエンコードし、理解する方法は、まだ解決されていない。
LLM内部の時空間シーケンスをモデル化したビデオLLMベースラインST-LLMを提案する。
論文 参考訳(メタデータ) (2024-03-30T10:11:26Z) - Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models [90.14693869269519]
MoE LLMはより少ないパラメータで高いパフォーマンスを実現することができるが、パラメータサイズが大きいためデプロイは困難である。
本稿では主に,プラグ・アンド・プレイ・エキスパートレベルのスペーシフィケーション技術を導入することで,MoE LLMの展開効率を向上させることを目的としている。
論文 参考訳(メタデータ) (2024-02-22T18:56:07Z) - InfMLLM: A Unified Framework for Visual-Language Tasks [44.29407348046122]
マルチモーダルな大言語モデル (MLLM) が注目されている。
この作業は、LLMがより視覚的な言語に関連したタスクに取り組むことを可能にすることを目的としている。
InfMLLMは、最先端(SOTA)パフォーマンスまたは最近のMLLMに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-11-12T09:58:16Z) - Scaling Sentence Embeddings with Large Language Models [43.19994568210206]
本研究では,文埋め込み性能の向上を目的としたテキスト内学習手法を提案する。
提案手法では,従来のプロンプトに基づく表現手法を自己回帰モデルに適用する。
モデルサイズをスケールすることで、数千億以上のパラメータへのスケーリングが意味的なテキスト類似性タスクのパフォーマンスを損なうことが分かる。
論文 参考訳(メタデータ) (2023-07-31T13:26:03Z) - Okapi: Instruction-tuned Large Language Models in Multiple Languages
with Reinforcement Learning from Human Feedback [61.83548032416181]
複数の言語を対象としたRLHFに基づく命令調整型LLMシステムであるOkapiを提案する。
オカピは26の多言語言語でインストラクションと応答ランクデータを導入し、将来の多言語LLM研究の促進と開発に役立てている。
論文 参考訳(メタデータ) (2023-07-29T18:01:46Z) - Response Length Perception and Sequence Scheduling: An LLM-Empowered LLM
Inference Pipeline [22.08897444328099]
大規模言語モデル(LLM)はAIの分野に革命をもたらし、様々なタスクで前例のない能力を示している。
本稿では,LLMのパワーを利用する効率的なLLM推論パイプラインを提案する。
論文 参考訳(メタデータ) (2023-05-22T15:36:06Z) - LLM-Pruner: On the Structural Pruning of Large Language Models [65.02607075556742]
大規模言語モデル(LLM)は、言語理解と生成において顕著な能力を示している。
タスク非依存であり、元のトレーニングデータセットへの依存を最小限に抑えるという2つの制約の範囲内でLLMの圧縮に取り組む。
LLM-Prunerという名前のこの手法は、非臨界結合構造を選択的に除去する構造プルーニングを採用する。
論文 参考訳(メタデータ) (2023-05-19T12:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。