Fugu-MT 論文翻訳(概要): Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?

論文の概要: Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?

arxiv url: http://arxiv.org/abs/2406.11402v2
Date: Thu, 29 Aug 2024 19:24:29 GMT
ステータス: 翻訳完了
システム内更新日: 2024-09-02 19:41:40.104363
Title: Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
Title（参考訳）: 小規模言語モデルは、実践的な応用のために大規模言語モデルと競合する準備が整っているか?
Authors: Neelabh Sinha, Vinija Jain, Aman Chadha,
Abstract要約: 本研究は,小規模かつオープンなLMを実用的に評価する枠組みを提案する。また、特定のアプリケーション要件に応じて、最高のLMとプロンプトスタイルを特定するために、10個のオープンなLMの詳細な比較を行う。また、適切に選択すれば、DeepSeek-v2, GPT-4o-mini, Gemini-1.5-ProなどのSOTA LLMを上回り、GPT-4oと競合することを示す。
参考スコア（独自算出の注目度）: 0.9217021281095907
License: http://creativecommons.org/licenses/by/4.0/
Abstract: The rapid rise of Language Models (LMs) has expanded their use in several applications. Yet, due to constraints of model size, associated cost, or proprietary restrictions, utilizing state-of-the-art (SOTA) LLMs is not always feasible. With open, smaller LMs emerging, more applications can leverage their capabilities, but selecting the right LM can be challenging as smaller LMs don't perform well universally. This work tries to bridge this gap by proposing a framework to experimentally evaluate small, open LMs in practical settings through measuring semantic correctness of outputs across three practical aspects: task types, application domains and reasoning types, using diverse prompt styles. It also conducts an in-depth comparison of 10 small, open LMs to identify best LM and prompt style depending on specific application requirement using the proposed framework. We also show that if selected appropriately, they can outperform SOTA LLMs like DeepSeek-v2, GPT-4o-mini, Gemini-1.5-Pro, and even compete with GPT-4o.
Abstract（参考訳）: 言語モデル(LM)の急速な普及により、いくつかのアプリケーションでの利用が拡大した。しかし、モデルサイズ、関連するコスト、あるいはプロプライエタリな制約のために、最先端(SOTA)のLSMを利用することは、必ずしも実現不可能であるとは限らない。オープンで小さなLMが出現すると、より多くのアプリケーションがそれらの能力を活用することができるが、より小さなLMが普遍的にうまく機能しないため、適切なLMを選択することは困難である。この研究は、タスクタイプ、アプリケーションドメイン、推論タイプという3つの実践的な側面でアウトプットの意味的正当性を計測し、様々なプロンプトスタイルを用いて、実践的な環境で小規模でオープンなLMを実験的に評価するフレームワークを提案することによって、このギャップを埋めようとしている。また、提案したフレームワークを用いて、特定のアプリケーション要件に応じて、ベストなLMとプロンプトスタイルを特定するために、10個のオープンなLMの詳細な比較を行う。また、適切に選択すれば、DeepSeek-v2、GPT-4o-mini、Gemini-1.5-ProといったSOTA LLMよりも優れ、GPT-4oと競合することを示す。

関連論文リスト

Revisiting Prompt Engineering: A Comprehensive Evaluation for LLM-based Personalized Recommendation [2.3650193864974978]
大規模言語モデル(LLM)は、自然言語で書かれたプロンプトを入力として取り込むことで推奨タスクを実行することができる。本稿では,他のユーザからの情報を一切使用しない単一ユーザ設定に焦点をあてる。
論文参考訳（メタデータ） (2025-07-17T20:26:00Z)
Fine-Tune an SLM or Prompt an LLM? The Case of Generating Low-Code Workflows [1.6163129903911508]
現実世界のアプリケーションのための微調整の小さな言語モデル(SLM)は、もはや明確ではないかもしれない。我々は、低符号を生成するタスクにおいて、SLMの微調整とLCMのプロンプトを比較した。適切なプロンプトが妥当な結果をもたらす一方で、微調整は品質を平均で10%向上させる。
論文参考訳（メタデータ） (2025-05-30T03:59:35Z)
Self-Steering Language Models [113.96916935955842]
DisCIPLは、"セルフステアリング(self-steering)"言語モデルのメソッドである。 DisCIPLはPlannerモデルを使用してタスク固有の推論プログラムを生成する。我々の研究は、高度に並列化されたモンテカルロ推論戦略の設計空間を開く。
論文参考訳（メタデータ） (2025-04-09T17:54:22Z)
Verifiable Format Control for Large Language Model Generations [24.789801375314664]
LLM(Large Language Models)は、一般的な命令に従う能力を満たすことを実証している。約7B のパラメータを持つ小さな LLM は、よりきめ細かいフォーマット(例えば、検証可能なフォーマット)に苦慮する。
論文参考訳（メタデータ） (2025-02-06T20:57:36Z)
L3Ms -- Lagrange Large Language Models [47.228171239031326]
Supervised Fine-tuning (SFT) と Large Language Model (LLM) のアライメントは、優れたユーザエクスペリエンスを提供するための重要なステップである。制約を強制するために対数障壁を用いるラグランジュ大言語モデル(L3Ms)を提案する。各種用途に適したアライメントを実現するためのL3Msの有用性と有効性を実験的に実証した。
論文参考訳（メタデータ） (2024-10-28T21:02:13Z)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models [70.19607283302712]
本稿では,l-MLLMからs-MLLMへ知識を伝達する新しいフレームワークを提案する。具体的には,l-MLLMとs-MLLMの視覚的テキスト出力分布のばらつきを最小限に抑えるために,MDist(Multimodal Distillation)を導入する。また,S-MLLMの可能性を完全に活用するための3段階学習手法を提案する。
論文参考訳（メタデータ） (2024-10-21T17:41:28Z)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation [108.2008975785364]
Graph Inspired Veracity Extrapolation (GIVE)は、パラメトリックメモリと非パラメトリックメモリを融合して、最小の外部入力で正確な推論を改善する新しい推論手法である。 GIVE は LLM エージェントをガイドして,最も関連する専門家データ (observe) を選択し,クエリ固有の発散思考 (reflect) に従事し,その情報を合成して最終的な出力 (speak) を生成する。
論文参考訳（メタデータ） (2024-10-11T03:05:06Z)
Delta-CoMe: Training-Free Delta-Compression with Mixed-Precision for Large Language Models [79.46938238953916]
多様なアプリケーションへの微調整された大規模言語モデル(LLM)は、複雑な要求を満たすために不可欠である。近年の研究では、微調整LDMをベースモデルと対応するデルタウェイトに分解し、低ランクまたは低ビットのアプローチで圧縮してコストを削減することが示唆されている。本研究では,従来の低ランク圧縮法と低ビット圧縮法がタスク固有の微調整LDMのモデル性能を著しく損なうことを観察する。
論文参考訳（メタデータ） (2024-06-13T07:57:27Z)
Large Language Models Can Automatically Engineer Features for Few-Shot Tabular Learning [35.03338699349037]
本稿では,機能エンジニアとして大規模言語モデルを用いる新しい文脈内学習フレームワークFeatLLMを提案する。 FeatLLMは高品質なルールを生成し、TabLLMやSTUNTなどよりも大幅に(平均で10%)優れている。
論文参考訳（メタデータ） (2024-04-15T06:26:08Z)
BLADE: Enhancing Black-box Large Language Models with Small Domain-Specific Models [56.89958793648104]
大規模言語モデル(LLM)は多用途であり、多様なタスクに対処することができる。従来のアプローチでは、ドメイン固有のデータによる継続的な事前トレーニングを行うか、一般的なLLMをサポートするために検索拡張を採用する。 BLADEと呼ばれる新しいフレームワークを提案する。このフレームワークは、小さなDomain-spEcificモデルでブラックボックスのLArge言語モデルを拡張する。
論文参考訳（メタデータ） (2024-03-27T08:57:21Z)
Empirical Studies of Parameter Efficient Methods for Large Language Models of Code and Knowledge Transfer to R [1.9799527196428242]
大きなLangauge Models(LLM)は、ソフトウェア工学(SE)コミュニティで注目を集めています。本研究は,CodeT5 と CodeLlama 上で,PEFT法,LoRA と Compacter を実証研究する。自然言語モデルからコードへの知識伝達や、学習した知識を目に見えない言語に適応させる能力について、完全に微調整されたモデルと比較して、それらの性能を評価する。
論文参考訳（メタデータ） (2024-03-16T03:12:45Z)
LM-Polygraph: Uncertainty Estimation for Language Models [71.21409522341482]
不確実性推定(UE)手法は、大規模言語モデル(LLM)の安全性、責任性、効果的な利用のための1つの経路である。テキスト生成タスクにおけるLLMの最先端UEメソッドのバッテリを実装したフレームワークであるLM-PolygraphをPythonで統一したプログラムインタフェースで導入する。研究者によるUEテクニックの一貫した評価のための拡張可能なベンチマークと、信頼スコア付き標準チャットダイアログを強化するデモWebアプリケーションを導入している。
論文参考訳（メタデータ） (2023-11-13T15:08:59Z)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models [73.86954509967416]
マルチモーダル言語モデル(MLLM)は、マルチモーダルタスクを実行するために強力なLLMに依存している。本稿では,MLLM 評価ベンチマーク MME について述べる。知覚能力と認知能力の両方を合計14のサブタスクで測定する。
論文参考訳（メタデータ） (2023-06-23T09:22:36Z)
Small Language Models Improve Giants by Rewriting Their Outputs [18.025736098795296]
本研究では,大規模言語モデル(LLM)の性能向上にトレーニングデータを活用するという課題に,微調整なしで対処する。我々は、数発のプロンプトによってLSMから候補のプールを作成し、コンパクトモデルLM-corrector(LMCor)を用いて、これらの候補をマージして拡張出力を生成するように特別に訓練した。 4つの自然言語生成タスクの実験により、小さな LMCor モデル (250M) でさえ、LLM (62B) の少数ショット性能を大幅に改善し、マッチングや標準微調整よりも優れることを示した。
論文参考訳（メタデータ） (2023-05-22T22:07:50Z)
Low-code LLM: Graphical User Interface over Large Language Models [115.08718239772107]
本稿では,人間-LLMインタラクションフレームワークであるLow-code LLMを紹介する。より制御可能で安定した応答を実現するために、6種類のシンプルなローコードビジュアルプログラミングインタラクションを組み込んでいる。ユーザフレンドリなインタラクション,制御可能な生成,広い適用性という,低コード LLM の3つの利点を強調した。
論文参考訳（メタデータ） (2023-04-17T09:27:40Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。