論文の概要: Scaling Down the Scaling Laws: Parameter Efficiency and Compute-Optimal Training in Resource-Constrained Large Language Models
- arxiv url: http://arxiv.org/abs/2610.06387v1
- Date: Mon, 05 Oct 2026 14:12:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.468454
- Title: Scaling Down the Scaling Laws: Parameter Efficiency and Compute-Optimal Training in Resource-Constrained Large Language Models
- Title(参考訳): スケーリング法則のスケールダウン:資源制約付き大言語モデルにおけるパラメータ効率と計算最適トレーニング
- Abstract要約: 大規模言語モデル(LLM)は、モデルサイズ、トレーニングデータ、計算資源の増加を通じて、大幅なパフォーマンス向上を実現している。
従来のスケーリングアプローチは、リターンの減少、財政と環境のコストの上昇、研究者への参加障壁を生み出している。
本稿では, LLMスケーリング理論の実証的スケーリング法則から計算最適トレーニングへの進化について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have achieved substantial performance gains through increases in model size, training data, and computational resources. However, traditional scaling approaches produce diminishing returns, rising financial and environmental costs, and barriers to participation for researchers operating outside large industrial laboratories. This review examines the evolution of LLM scaling theory from empirical scaling laws to compute-optimal training, with particular emphasis on parameter efficiency, token utilization, data efficiency, and resource-constrained environments. Foundational work on scaling laws is synthesized alongside later research on compute-optimal training, data pruning, efficient architectures, quantization, low-rank adaptation, and edge-oriented optimization. The literature indicates a shift from scale maximization toward more deliberate allocation of parameters, tokens, compute, and hardware resources. At the same time, important empirical, theoretical, and methodological gaps remain regarding whether scaling principles established on enterprise-grade infrastructure generalize to smaller models and constrained computing environments. This review organizes these developments into a unified framework for resource-efficient LLM training and argues that future progress should evaluate efficiency not solely through model performance, but through the relationship among performance, parameter count, computational cost, token allocation, and hardware constraints.
- Abstract(参考訳): 大規模言語モデル(LLM)は、モデルサイズ、トレーニングデータ、計算資源の増加を通じて、大幅なパフォーマンス向上を実現している。
しかし、従来のスケーリングアプローチは、リターンの低下、財政と環境コストの上昇、そして大規模な工業研究所の外で活動する研究者の参加への障壁を生んでいる。
本稿では, LLMスケーリング理論の実証的スケーリング法則から, パラメータ効率, トークン利用, データ効率, 資源制約のある環境への進化を考察する。
スケーリング法則に関する基礎研究は、後の計算最適トレーニング、データプルーニング、効率的なアーキテクチャ、量子化、低ランク適応、エッジ指向最適化の研究と共に合成される。
この文献は、スケールの最大化から、パラメータ、トークン、計算、ハードウェアリソースのより意図的に割り当てへの移行を示している。
同時に、エンタープライズグレードのインフラ上で確立されたスケーリング原則が、より小さなモデルや制約されたコンピューティング環境に一般化されるかどうかに関して、重要な経験的、理論的、方法論的なギャップが残っている。
このレビューでは、これらの開発を資源効率のLLMトレーニングのための統一されたフレームワークにまとめ、将来の進歩はモデル性能だけでなく、性能、パラメータ数、計算コスト、トークン割り当て、ハードウェア制約との関係を通して効率を評価するべきであると論じている。
関連論文リスト
- Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search [51.33002870475756]
マルチフィデリティベイズ最適化に基づくコスト認識獲得関数である Power-Law Entropy Search (PLES) を導入する。
PLESは、単一の目的関数を最適化するのではなく、スケーリング法見積の全体的な不確実性を低減する候補を検索する。
論文 参考訳(メタデータ) (2026-09-01T15:41:59Z) - Computational Economics in Large Language Models: Exploring Model Behavior and Incentive Design under Resource Constraints [1.00707850217229]
大規模言語モデル(LLM)は計算コストによって制限される。
我々は, LLMを資源制約されたエージェントの内部経済として扱う「計算経済学」の枠組みを導入する。
計算が不十分な場合、標準LLMは精度を保ちながら高価値トークンに注意を向ける。
論文 参考訳(メタデータ) (2025-08-14T07:55:45Z) - Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies [66.83950068218033]
スケーリング法則は、モデルのパラメータとトレーニングデータによって学習のパフォーマンスが向上することを示している。
性能向上の可能性にもかかわらず、スケーリング法則を深層強化学習に統合することは、完全には実現されていない。
本稿では,データ,ネットワーク,トレーニング予算という3次元のスケーリング戦略を体系的に分析することによって,このギャップに対処する。
論文 参考訳(メタデータ) (2025-08-05T08:03:12Z) - Deploying Large AI Models on Resource-Limited Devices with Split Federated Learning [39.73152182572741]
本稿では、SFLAM(Quantized Split Federated Fine-Tuning Large AI Model)と呼ばれる新しいフレームワークを提案する。
エッジデバイスとサーバ間のトレーニング負荷を分割することで、SFLAMはデバイス上の大規模なモデルの操作を容易にすることができる。
SFLAMは、トレーニング効率を高めるために、量子化管理、電力制御、帯域幅割り当て戦略を取り入れている。
論文 参考訳(メタデータ) (2025-04-12T07:55:11Z) - Cost-Optimal Grouped-Query Attention for Long-Context Modeling [45.981681856747365]
Grouped-Query Attention(GQA)は、大規模言語モデルにおける注目層の計算コストを削減するための広く採用されている戦略である。
我々は,文脈長,モデルサイズ,GQA構成,モデル損失の関係を分析する。
コスト最適GQA構成の導出法を提案する。
論文 参考訳(メタデータ) (2025-03-12T17:50:42Z) - DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs [86.76714527437383]
本稿では,事前学習したFFN層を計算ブロックに分割することで,分散化を実現するDSMoEを提案する。
我々は,Sigmoid アクティベーションとストレートスルー推定器を用いた適応型エキスパートルーティングを実装し,トークンがモデル知識の様々な側面に柔軟にアクセスできるようにする。
LLaMAモデルを用いた実験により、DSMoEは既存のプルーニング法やMoE法に比べて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-02-18T02:37:26Z) - eFedLLM: Efficient LLM Inference Based on Federated Learning [1.6179784294541053]
大言語モデル(LLMs)は人工知能(AI)の転換期を告げる
本稿では, LLM推論の運用効率と費用対効果を高める効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-11-24T22:50:02Z) - Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks [6.596361762662328]
大規模言語モデルの内部構造と操作機構を理論的に解析する。
我々は、適応最適化アルゴリズム(AdamWなど)、大規模並列計算技術、混合精度訓練戦略の寄与を評価した。
論文 参考訳(メタデータ) (2024-05-20T00:10:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。