Fugu-MT 論文翻訳(概要): Evaluating Open Language Models Across Task Types, Application Domains, and Reasoning Types: An In-Depth Experimental Analysis

論文の概要: Evaluating Open Language Models Across Task Types, Application Domains, and Reasoning Types: An In-Depth Experimental Analysis

arxiv url: http://arxiv.org/abs/2406.11402v1
Date: Mon, 17 Jun 2024 10:45:36 GMT
ステータス: 翻訳完了
システム内更新日: 2024-06-18 15:21:39.025240
Title: Evaluating Open Language Models Across Task Types, Application Domains, and Reasoning Types: An In-Depth Experimental Analysis
Title（参考訳）: タスクタイプ、アプリケーションドメイン、推論タイプにわたるオープン言語モデルの評価:詳細な実験分析
Authors: Neelabh Sinha, Vinija Jain, Aman Chadha,
Abstract要約: この研究は、10個の小さいオープンなLMの出力の意味的正当性を詳細に実験的に分析する。適切に利用すれば、これらのLMはDeepSeek-v2, GPT-3.5-Turbo, GPT-4oといったSOTA LLMと競合し、時として優れることを示す。
参考スコア（独自算出の注目度）: 0.9217021281095907
License: http://creativecommons.org/licenses/by/4.0/
Abstract: The rapid rise of Language Models (LMs) has expanded their use in several applications. Yet, due to constraints of model size, associated cost, or proprietary restrictions, utilizing state-of-the-art (SOTA) LLMs is not always feasible. With open, smaller LMs emerging, more applications can leverage their capabilities, but selecting the right LM can be challenging. This work conducts an in-depth experimental analysis of the semantic correctness of outputs of 10 smaller, open LMs across three aspects: task types, application domains and reasoning types, using diverse prompt styles. We demonstrate that most effective models and prompt styles vary depending on the specific requirements. Our analysis provides a comparative assessment of LMs and prompt styles using a proposed three-tier schema of aspects for their strategic selection based on use-case and other constraints. We also show that if utilized appropriately, these LMs can compete with, and sometimes outperform, SOTA LLMs like DeepSeek-v2, GPT-3.5-Turbo, and GPT-4o.
Abstract（参考訳）: 言語モデル(LM)の急速な普及により、いくつかのアプリケーションでの利用が拡大した。しかし、モデルサイズ、関連するコスト、あるいはプロプライエタリな制約のために、最先端(SOTA)のLSMを利用することは、必ずしも実現不可能であるとは限らない。オープンで小さなLMが出現すると、より多くのアプリケーションがその能力を活用することができるが、適切なLMを選択することは難しい。本研究は,タスクタイプ,アプリケーションドメイン,推論型という3つの側面にまたがる10個のオープンなLMの出力の意味的正当性を,多様なプロンプトスタイルを用いて詳細に実験的に分析する。最も効果的なモデルとプロンプトスタイルは、特定の要件によって異なることを実証する。本分析では,提案した3階層のアスペクトスキーマを用いたLMとプロンプトスタイルの比較評価を行い,ユースケースや他の制約に基づいた戦略選択を行う。また,これらのLMを適切に利用すれば,DeepSeek-v2, GPT-3.5-Turbo, GPT-4oといったSOTA LLMと競合し,時として優れることを示す。

関連論文リスト

Revisiting Prompt Engineering: A Comprehensive Evaluation for LLM-based Personalized Recommendation [2.3650193864974978]
大規模言語モデル(LLM)は、自然言語で書かれたプロンプトを入力として取り込むことで推奨タスクを実行することができる。本稿では,他のユーザからの情報を一切使用しない単一ユーザ設定に焦点をあてる。
論文参考訳（メタデータ） (2025-07-17T20:26:00Z)
Fine-Tune an SLM or Prompt an LLM? The Case of Generating Low-Code Workflows [1.6163129903911508]
現実世界のアプリケーションのための微調整の小さな言語モデル(SLM)は、もはや明確ではないかもしれない。我々は、低符号を生成するタスクにおいて、SLMの微調整とLCMのプロンプトを比較した。適切なプロンプトが妥当な結果をもたらす一方で、微調整は品質を平均で10%向上させる。
論文参考訳（メタデータ） (2025-05-30T03:59:35Z)
Self-Steering Language Models [113.96916935955842]
DisCIPLは、"セルフステアリング(self-steering)"言語モデルのメソッドである。 DisCIPLはPlannerモデルを使用してタスク固有の推論プログラムを生成する。我々の研究は、高度に並列化されたモンテカルロ推論戦略の設計空間を開く。
論文参考訳（メタデータ） (2025-04-09T17:54:22Z)
Verifiable Format Control for Large Language Model Generations [24.789801375314664]
LLM(Large Language Models)は、一般的な命令に従う能力を満たすことを実証している。約7B のパラメータを持つ小さな LLM は、よりきめ細かいフォーマット(例えば、検証可能なフォーマット)に苦慮する。
論文参考訳（メタデータ） (2025-02-06T20:57:36Z)
L3Ms -- Lagrange Large Language Models [47.228171239031326]
Supervised Fine-tuning (SFT) と Large Language Model (LLM) のアライメントは、優れたユーザエクスペリエンスを提供するための重要なステップである。制約を強制するために対数障壁を用いるラグランジュ大言語モデル(L3Ms)を提案する。各種用途に適したアライメントを実現するためのL3Msの有用性と有効性を実験的に実証した。
論文参考訳（メタデータ） (2024-10-28T21:02:13Z)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models [70.19607283302712]
本稿では,l-MLLMからs-MLLMへ知識を伝達する新しいフレームワークを提案する。具体的には,l-MLLMとs-MLLMの視覚的テキスト出力分布のばらつきを最小限に抑えるために,MDist(Multimodal Distillation)を導入する。また,S-MLLMの可能性を完全に活用するための3段階学習手法を提案する。
論文参考訳（メタデータ） (2024-10-21T17:41:28Z)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation [108.2008975785364]
Graph Inspired Veracity Extrapolation (GIVE)は、パラメトリックメモリと非パラメトリックメモリを融合して、最小の外部入力で正確な推論を改善する新しい推論手法である。 GIVE は LLM エージェントをガイドして,最も関連する専門家データ (observe) を選択し,クエリ固有の発散思考 (reflect) に従事し,その情報を合成して最終的な出力 (speak) を生成する。
論文参考訳（メタデータ） (2024-10-11T03:05:06Z)
Delta-CoMe: Training-Free Delta-Compression with Mixed-Precision for Large Language Models [79.46938238953916]
多様なアプリケーションへの微調整された大規模言語モデル(LLM)は、複雑な要求を満たすために不可欠である。近年の研究では、微調整LDMをベースモデルと対応するデルタウェイトに分解し、低ランクまたは低ビットのアプローチで圧縮してコストを削減することが示唆されている。本研究では,従来の低ランク圧縮法と低ビット圧縮法がタスク固有の微調整LDMのモデル性能を著しく損なうことを観察する。
論文参考訳（メタデータ） (2024-06-13T07:57:27Z)
Large Language Models Can Automatically Engineer Features for Few-Shot Tabular Learning [35.03338699349037]
本稿では,機能エンジニアとして大規模言語モデルを用いる新しい文脈内学習フレームワークFeatLLMを提案する。 FeatLLMは高品質なルールを生成し、TabLLMやSTUNTなどよりも大幅に(平均で10%)優れている。
論文参考訳（メタデータ） (2024-04-15T06:26:08Z)
BLADE: Enhancing Black-box Large Language Models with Small Domain-Specific Models [56.89958793648104]
大規模言語モデル(LLM)は多用途であり、多様なタスクに対処することができる。従来のアプローチでは、ドメイン固有のデータによる継続的な事前トレーニングを行うか、一般的なLLMをサポートするために検索拡張を採用する。 BLADEと呼ばれる新しいフレームワークを提案する。このフレームワークは、小さなDomain-spEcificモデルでブラックボックスのLArge言語モデルを拡張する。
論文参考訳（メタデータ） (2024-03-27T08:57:21Z)
Empirical Studies of Parameter Efficient Methods for Large Language Models of Code and Knowledge Transfer to R [1.9799527196428242]
大きなLangauge Models(LLM)は、ソフトウェア工学(SE)コミュニティで注目を集めています。本研究は,CodeT5 と CodeLlama 上で,PEFT法,LoRA と Compacter を実証研究する。自然言語モデルからコードへの知識伝達や、学習した知識を目に見えない言語に適応させる能力について、完全に微調整されたモデルと比較して、それらの性能を評価する。
論文参考訳（メタデータ） (2024-03-16T03:12:45Z)
LM-Polygraph: Uncertainty Estimation for Language Models [71.21409522341482]
不確実性推定(UE)手法は、大規模言語モデル(LLM)の安全性、責任性、効果的な利用のための1つの経路である。テキスト生成タスクにおけるLLMの最先端UEメソッドのバッテリを実装したフレームワークであるLM-PolygraphをPythonで統一したプログラムインタフェースで導入する。研究者によるUEテクニックの一貫した評価のための拡張可能なベンチマークと、信頼スコア付き標準チャットダイアログを強化するデモWebアプリケーションを導入している。
論文参考訳（メタデータ） (2023-11-13T15:08:59Z)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models [73.86954509967416]
マルチモーダル言語モデル(MLLM)は、マルチモーダルタスクを実行するために強力なLLMに依存している。本稿では,MLLM 評価ベンチマーク MME について述べる。知覚能力と認知能力の両方を合計14のサブタスクで測定する。
論文参考訳（メタデータ） (2023-06-23T09:22:36Z)
Small Language Models Improve Giants by Rewriting Their Outputs [18.025736098795296]
本研究では,大規模言語モデル(LLM)の性能向上にトレーニングデータを活用するという課題に,微調整なしで対処する。我々は、数発のプロンプトによってLSMから候補のプールを作成し、コンパクトモデルLM-corrector(LMCor)を用いて、これらの候補をマージして拡張出力を生成するように特別に訓練した。 4つの自然言語生成タスクの実験により、小さな LMCor モデル (250M) でさえ、LLM (62B) の少数ショット性能を大幅に改善し、マッチングや標準微調整よりも優れることを示した。
論文参考訳（メタデータ） (2023-05-22T22:07:50Z)
Low-code LLM: Graphical User Interface over Large Language Models [115.08718239772107]
本稿では,人間-LLMインタラクションフレームワークであるLow-code LLMを紹介する。より制御可能で安定した応答を実現するために、6種類のシンプルなローコードビジュアルプログラミングインタラクションを組み込んでいる。ユーザフレンドリなインタラクション,制御可能な生成,広い適用性という,低コード LLM の3つの利点を強調した。
論文参考訳（メタデータ） (2023-04-17T09:27:40Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。