論文の概要: Task-Specific Efficiency Analysis: When Small Language Models Outperform Large Language Models
- arxiv url: http://arxiv.org/abs/2603.21389v1
- Date: Sun, 22 Mar 2026 20:19:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.394564
- Title: Task-Specific Efficiency Analysis: When Small Language Models Outperform Large Language Models
- Title(参考訳): タスク特化効率分析:小言語モデルが大言語モデルを上回る場合
- Abstract要約: 大規模言語モデルは目覚ましい性能を達成するが、資源に制約のあるデプロイメントには適さない相当な計算コストを発生させる。
本稿では,5つの異なるNLPタスクを対象とした16の言語モデルの比較を行った。
- 参考スコア(独自算出の注目度): 2.067969102829454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models achieve remarkable performance but incur substantial computational costs unsuitable for resource-constrained deployments. This paper presents the first comprehensive task-specific efficiency analysis comparing 16 language models across five diverse NLP tasks. We introduce the Performance-Efficiency Ratio (PER), a novel metric integrating accuracy, throughput, memory, and latency through geometric mean normalization. Our systematic evaluation reveals that small models (0.5--3B parameters) achieve superior PER scores across all given tasks. These findings establish quantitative foundations for deploying small models in production environments prioritizing inference efficiency over marginal accuracy gains.
- Abstract(参考訳): 大規模言語モデルは目覚ましい性能を達成するが、資源に制約のあるデプロイメントには適さない相当な計算コストを発生させる。
本稿では,5つの異なるNLPタスクを対象とした16の言語モデルの比較を行った。
本稿では,幾何平均正規化による精度,スループット,メモリ,待ち時間を統合した新しいメトリクスであるPerformance-Efficiency Ratio(PER)を紹介する。
システム評価の結果,小モデル (0.5--3B パラメータ) が与えられたタスクに対して優れたPERスコアを達成できることが判明した。
これらの結果から, 限界精度よりも推論効率を優先して, 生産環境に小型モデルを展開するための定量的基盤を確立した。
関連論文リスト
- Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression [53.39128997308138]
テキスト圧縮性能に基づくモデル効率の指標である情報容量を導入する。
主流のオープンソースモデルに対する実証的な評価は、シリーズ内のさまざまなサイズのモデルが一貫した情報容量を示すことを示している。
情報容量の特徴的な特徴は、入力と出力の両方のトークン数に影響を与えるトークン化効率が組み込まれていることである。
論文 参考訳(メタデータ) (2025-11-11T10:07:32Z) - MELABenchv1: Benchmarking Large Language Models against Smaller Fine-Tuned Models for Low-Resource Maltese NLP [0.0]
低リソース言語であるMalteseにおける55の公開言語モデル(LLM)の性能を評価する。
我々の実験は、多くのモデルが、特に生成タスクにおいて、性能が良くないことを強調している。
本研究は, 事前訓練および指導訓練におけるマルタへの事前曝露が最も重要な要因であると結論付けている。
論文 参考訳(メタデータ) (2025-06-04T18:59:52Z) - Ensemble Bayesian Inference: Leveraging Small Language Models to Achieve LLM-level Accuracy in Profile Matching Tasks [0.0]
本研究では,プロプライエタリな大規模言語モデル (LLM) に匹敵する精度を実現するため,小型言語モデル (SLM) アンサンブルの可能性を検討する。
本稿では,複数のSLMから判断を合成するためにベイズ推定を適用した新しい手法として,EBI(Ensemble Bayesian Inference)を提案する。
論文 参考訳(メタデータ) (2025-04-24T15:55:10Z) - EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models [64.18350535770357]
マルチモーダル推論の効率を高めるために,大規模視覚言語モデルの自動プルーニング手法を提案する。
提案手法では,所望のプルーニングポリシーを探索するために,少数のサンプルのみを活用する。
視覚的質問応答のためのScienceQA, Vizwiz, MM-vet, LLaVA-Benchデータセットについて広範な実験を行った。
論文 参考訳(メタデータ) (2025-03-19T16:07:04Z) - Scaling BERT Models for Turkish Automatic Punctuation and Capitalization Correction [0.0]
本研究は,各モデルの性能指標の精度,リコール,F1スコアを系統的に比較した。
その結果,モデルのサイズが大きくなるにつれて,テキストの読みやすさと精度が大幅に向上した。
論文 参考訳(メタデータ) (2024-12-03T18:59:51Z) - InkubaLM: A small language model for low-resource African languages [9.426968756845389]
InkubaLMは0.4億のパラメータを持つ小さな言語モデルである。
パラメータ数が大幅に大きいモデルに匹敵するパフォーマンスを実現する。
複数の言語にまたがる顕著な一貫性を示す。
論文 参考訳(メタデータ) (2024-08-30T05:42:31Z) - TriSum: Learning Summarization Ability from Large Language Models with Structured Rationale [66.01943465390548]
本稿では,大規模言語モデルのテキスト要約能力を,コンパクトで局所的なモデルに抽出するフレームワークであるTriSumを紹介する。
本手法は,様々なベンチマーク上での局所モデル性能を向上させる。
また、要約の合理性に関する洞察を提供することで、解釈可能性も向上する。
論文 参考訳(メタデータ) (2024-03-15T14:36:38Z) - L3 Ensembles: Lifelong Learning Approach for Ensemble of Foundational
Language Models [15.726224465017596]
本稿では、未知のデータから意味のある表現を抽出し、構造化知識ベースを構築することに焦点を当てたアプローチを提案する。
我々は,GLUE や SuperGLUE などのベンチマークを含む様々な NLP タスクの有効性を検証する実験を行った。
提案したL3アンサンブル法は、細調整されたFLMと比較してモデル精度を4%36%向上させる。
論文 参考訳(メタデータ) (2023-11-11T06:59:50Z) - GPT-Neo for commonsense reasoning -- a theoretical and practical lens [0.46040036610482665]
我々は6ドルのコモンセンス推論ベンチマークタスクを用いてGPT-neoモデルの性能を評価する。
我々は,GPT-neoモデルを用いて,より大規模なモデルベースラインに対して,より小さなモデルの性能を検討することを目的とする。
論文 参考訳(メタデータ) (2022-11-28T17:49:38Z) - Discover, Explanation, Improvement: An Automatic Slice Detection
Framework for Natural Language Processing [72.14557106085284]
スライス検出モデル(SDM)は、データポイントの低パフォーマンスなグループを自動的に識別する。
本稿では,NLPタスクの分類のための "Discover, Explain, improve (DEIM)" というベンチマークを提案する。
評価の結果,Edisaは情報的セマンティックな特徴を持つ誤り発生データポイントを正確に選択できることがわかった。
論文 参考訳(メタデータ) (2022-11-08T19:00:00Z) - SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark
for Semantic and Generative Capabilities [76.97949110580703]
各種音声タスクの事前学習モデルを評価するための新しいベンチマークであるSUPERB-SGを紹介する。
データドメインのシフトの下で、事前訓練されたモデルによって学習された表現の堅牢性をテストするために、軽量な方法論を使用します。
また,SUPERB-SGのタスク多様性とタスク監督の限定が,モデル表現の一般化性を評価する効果的な方法であることを示す。
論文 参考訳(メタデータ) (2022-03-14T04:26:40Z) - Evaluating natural language processing models with generalization
metrics that do not need access to any training or testing data [66.11139091362078]
本稿では,Hugingface から事前学習した大規模トランスフォーマーに対して,一般化指標を用いた最初のモデル選択結果を提案する。
ニッチな状況にもかかわらず、ヘビーテール(HT)の観点から派生したメトリクスは、特にNLPタスクにおいて有用である。
論文 参考訳(メタデータ) (2022-02-06T20:07:35Z) - Mixed-Lingual Pre-training for Cross-lingual Summarization [54.4823498438831]
言語間の要約は、ソース言語の記事に対する対象言語の要約を作成することを目的としている。
本稿では,翻訳のような言語間タスクと,マスク付き言語モデルのようなモノリンガルタスクの両方を活用する混合言語事前学習に基づくソリューションを提案する。
本モデルでは,2.82(中国語)と1.15(中国語,英語)のROUGE-1スコアを最先端の結果に対して改善する。
論文 参考訳(メタデータ) (2020-10-18T00:21:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。