Fugu-MT 論文翻訳(概要): MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning

論文の概要: MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning

arxiv url: http://arxiv.org/abs/2311.02303v1
Date: Sat, 4 Nov 2023 02:22:40 GMT
ステータス: 翻訳完了
システム内更新日: 2023-11-07 18:20:27.908585
Title: MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning
Title（参考訳）: MFTCoder: マルチタスクファインチューニングによるコードLLMの強化
Authors: Bingchang Liu, Chaoyu Chen, Cong Liao, Zi Gong, Huan Wang, Zhichao Lei, Ming Liang, Dajun Chen, Min Shen, Hailian Zhou, Hang Yu, Jianguo Li
Abstract要約: 複数のタスクを同時に並列に微調整できるマルチタスクファインチューニングフレームワーク MFTcoder を提案する。実験により、我々のマルチタスクファインチューニングアプローチは、単一タスクにおける個々のファインチューニングと、混合タスクにおけるファインチューニングの両方より優れていることが示された。
参考スコア（独自算出の注目度）: 28.12788291168137
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Code LLMs have emerged as a specialized research field, with remarkable studies dedicated to enhancing model's coding capabilities through fine-tuning on pre-trained models. Previous fine-tuning approaches were typically tailored to specific downstream tasks or scenarios, which meant separate fine-tuning for each task, requiring extensive training resources and posing challenges in terms of deployment and maintenance. Furthermore, these approaches failed to leverage the inherent interconnectedness among different code-related tasks. To overcome these limitations, we present a multi-task fine-tuning framework, MFTcoder, that enables simultaneous and parallel fine-tuning on multiple tasks. By incorporating various loss functions, we effectively address common challenges in multi-task learning, such as data imbalance, varying difficulty levels, and inconsistent convergence speeds. Extensive experiments have conclusively demonstrated that our multi-task fine-tuning approach outperforms both individual fine-tuning on single tasks and fine-tuning on a mixed ensemble of tasks. Moreover, MFTcoder offers efficient training capabilities, including efficient data tokenization modes and PEFT fine-tuning, resulting in significantly improved speed compared to traditional fine-tuning methods. MFTcoder seamlessly integrates with several mainstream open-source LLMs, such as CodeLLama and Qwen. Leveraging the CodeLLama foundation, our MFTcoder fine-tuned model, \textsc{CodeFuse-CodeLLama-34B}, achieves an impressive pass@1 score of 74.4\% on the HumaneEval benchmark, surpassing GPT-4 performance (67\%, zero-shot). MFTCoder is open-sourced at \url{https://github.com/codefuse-ai/MFTCOder}
Abstract（参考訳）: コードllmは特別な研究分野として登場し、事前訓練されたモデルの微調整によるモデルのコーディング能力の向上に特化している。従来の微調整アプローチは、通常、特定の下流タスクやシナリオに合わせたもので、各タスクごとに微調整を分離し、広範なトレーニングリソースを必要とし、デプロイメントとメンテナンスの観点から課題を提起することを意味していた。さらに、これらのアプローチは、異なるコード関連タスク間の固有の相互接続性を活用できなかった。これらの制約を克服するために,複数タスクの同時かつ並列な微調整を可能にするマルチタスクファインチューニングフレームワーク MFTcoder を提案する。各種損失関数を組み込むことにより,データ不均衡,難易度の変化,収束速度の不整合といったマルチタスク学習における共通課題を効果的に解決する。大規模な実験により、我々のマルチタスクファインチューニングアプローチは、単一タスクにおける個々のファインチューニングと混合タスクにおけるファインチューニングの両方に優れることが示された。さらに、MPTコーダは、効率的なデータトークン化モードやPEFTファインチューニングを含む効率的なトレーニング機能を提供しており、従来のファインチューニング手法に比べて、大幅に速度が向上している。 MFTcoder は CodeLLama や Qwen など,主要なオープンソース LLM とシームレスに統合されている。 MFTcoderの微調整モデルであるCodeLLama Foundationを活用して、HumaneEvalベンチマークで74.4\%の素晴らしいパス@1スコアを達成し、GPT-4パフォーマンス(67.%、ゼロショット)を上回りました。 MFTCoder は \url{https://github.com/codefuse-ai/MFTCOder} でオープンソース化されている

関連論文リスト

MTL-KD: Multi-Task Learning Via Knowledge Distillation for Generalizable Neural Vehicle Routing Solver [9.61561012521585]
本研究は知識蒸留(MTL-KD)による新しいマルチタスク学習手法を提案する。提案手法は,複数の異なるRLベースの単一タスクモデルから単一重デコーダモデルへのポリシー知識の転送,ラベルなしトレーニング,多種多様なタスクにおけるモデルの一般化能力の向上を効果的に行う。最大1000ノードのVRP変異体6種と10種のVRP変異体に対する実験結果から,提案手法が一様および実世界のベンチマークにおいて常に優れた性能を発揮することが示された。
論文参考訳（メタデータ） (2025-06-03T14:35:36Z)
Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning [59.001091197106085]
Vision TransformerのためのMulti-Task Learning (MTL)は、複数のタスクを同時に処理することでモデル能力を向上させることを目的としている。最近の研究は、Mixture-of-Experts(MoE)構造の設計とローランド適応(LoRA)によるマルチタスク学習の効率化に重点を置いている。本稿では,事前学習した視覚変換器を効率的なマルチタスク学習器に変換することで,EMTAL(Efficient Multi-Task Learning)と呼ばれる新しい手法を提案する。
論文参考訳（メタデータ） (2025-01-12T17:41:23Z)
R-MTLLMF: Resilient Multi-Task Large Language Model Fusion at the Wireless Edge [78.26352952957909]
マルチタスク大言語モデル(MTLLM)は、ユーザが複数のタスクを効率的に処理するための特殊なモデルを要求する無線エッジにおける多くのアプリケーションにとって重要である。タスクベクトルによるモデル融合の概念は、MDLLMを生成するための微調整パラメータを組み合わせるための効率的なアプローチとして登場した。本稿では,最悪の逆攻撃を前提として,エッジユーザがタスクベクトルを介して協調的にMTLMを作成できる問題について検討する。
論文参考訳（メタデータ） (2024-11-27T10:57:06Z)
Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。 In-Context Learning (ICL) など。効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。下流タスクへのLLM。我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文参考訳（メタデータ） (2024-09-30T10:48:20Z)
AdapMTL: Adaptive Pruning Framework for Multitask Learning Model [5.643658120200373]
AdapMTLはマルチタスクモデルのための適応型プルーニングフレームワークである。複数のタスクにまたがって、空間割り当てと精度のパフォーマンスのバランスをとる。最先端の刈り取り法に比べて優れた性能を示す。
論文参考訳（メタデータ） (2024-08-07T17:19:15Z)
Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment [0.0]
ハーモナイズドトランスファーラーニングとモダリティアライメント(HarMA)は,タスク制約,モダリティアライメント,単一モダリティアライメントを同時に満足する手法である。 HarMAはリモートセンシング分野における2つの一般的なマルチモーダル検索タスクにおいて最先端の性能を達成する。
論文参考訳（メタデータ） (2024-04-28T17:20:08Z)
Intuition-aware Mixture-of-Rank-1-Experts for Parameter Efficient Finetuning [50.73666458313015]
大規模言語モデル(LLM)はマルチメディアアプリケーションで複数のタスクを実行する上で大きな可能性を証明している。 MoEは、効率的なタスクデカップリングのためのスパースアーキテクチャによる有望なソリューションとして登場した。 Intuition-MoR1Eは14のパブリックデータセットで優れた効率と2.15%の全体的な精度向上を実現している。
論文参考訳（メタデータ） (2024-04-13T12:14:58Z)
MTLoRA: A Low-Rank Adaptation Approach for Efficient Multi-Task Learning [1.4396109429521227]
大規模データセットに事前トレーニングされたモデルを、さまざまな下流タスクに適応させることは、ディープラーニングにおける一般的な戦略である。パラメータ効率のよい微調整手法は、最小限のパラメータだけを訓練しながら、事前訓練されたモデルを異なるタスクに適応させる有望な方法として登場した。本稿では,マルチタスク学習モデルのパラメータ効率向上のための新しいフレームワークMTLoRAを紹介する。
論文参考訳（メタデータ） (2024-03-29T17:43:58Z)
Fair Resource Allocation in Multi-Task Learning [12.776767874217663]
マルチタスク学習(MTL)はタスク間の共有知識を活用でき、データ効率と一般化性能が向上する。 MTLにおける大きな課題は、いくつかのタスクの公平な最適化を妨げる、矛盾する勾配の存在にある。通信ネットワークにおける公平なリソース割り当てに着想を得て,新しいMTL最適化法であるFairGradを提案する。
論文参考訳（メタデータ） (2024-02-23T22:46:14Z)
AdaMerging: Adaptive Model Merging for Multi-Task Learning [68.75885518081357]
本稿では,Adaptive Model Merging (AdaMerging)と呼ばれる革新的な手法を紹介する。本来のトレーニングデータに頼ることなく、タスクレベルでも階層的にも、モデルマージの係数を自律的に学習することを目指している。 AdaMergingは、現在の最先端のタスク演算のマージ方式と比較すると、パフォーマンスが11%向上している。
論文参考訳（メタデータ） (2023-10-04T04:26:33Z)
M$^3$ViT: Mixture-of-Experts Vision Transformer for Efficient Multi-task Learning with Model-Accelerator Co-design [95.41238363769892]
マルチタスク学習(MTL)は、複数の学習タスクを単一のモデルにカプセル化し、それらのタスクを共同でよりよく学習できるようにする。現在のMTLレギュレータは、1つのタスクだけを実行するためにさえ、ほぼすべてのモデルを起動する必要がある。効率的なオンデバイスMTLを実現するためのモデル-アクセラレータ共設計フレームワークを提案する。
論文参考訳（メタデータ） (2022-10-26T15:40:24Z)
Multi-Task Learning as a Bargaining Game [63.49888996291245]
マルチタスク学習(MTL)では、複数のタスクを同時に予測するためにジョイントモデルを訓練する。これらの異なるタスクの勾配が矛盾する可能性があるため、MTLのジョイントモデルを訓練すると、対応するシングルタスクモデルよりも低いパフォーマンスが得られる。本稿では,パラメータ更新のジョイント方向で合意に達するためのタスクを交渉する交渉ゲームとして,勾配の組み合わせステップを考察する。
論文参考訳（メタデータ） (2022-02-02T13:21:53Z)
Transfer Learning for Sequence Generation: from Single-source to Multi-source [50.34044254589968]
そこで本研究では,2段階のファイントゥニング手法を提案する。また,MSGタスクにおいて,より優れた表現を学習するための微細エンコーダを備えた新しいMSGモデルを提案する。提案手法は,WMT17 APE タスクと WMT14 テストセットを用いたマルチソース翻訳タスクにおいて,新たな最先端結果を実現する。
論文参考訳（メタデータ） (2021-05-31T09:12:38Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。