論文の概要: Scaling of Capability and Efficiency at Inference Time in Large Reasoning Models
- arxiv url: http://arxiv.org/abs/2609.27166v2
- Date: Thu, 24 Sep 2026 12:42:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.34056
- Title: Scaling of Capability and Efficiency at Inference Time in Large Reasoning Models
- Title(参考訳): 大規模推論モデルにおける推論時間におけるキャパビリティと効率のスケーリング
- Abstract要約: 算術的およびアルゴリズム的推論問題の4つのクラスにまたがる大規模言語モデル(LLM)の性能と効率を評価する。
固定モデルサイズでは、インスタンスを正しく解く確率はインスタンスサイズとほぼ指数関数的に減少する。
崩壊スケールはモデルサイズとともにサブ線形に成長し、より大きなモデルの方が能力が高いが、その能力はスケールによって減少することを示している。
- 参考スコア(独自算出の注目度): 34.36607680550394
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Capability and efficiency are two key dimensions of reasoning in large language models (LLMs). Capability refers to the ability to solve a given problem correctly, whereas efficiency refers to the ability to do so with limited resources. When LLMs use Chain-of-Thought (CoT) reasoning to solve problems of controlled hardness, both the number of problems solved correctly and the number of tokens required to reach a correct answer depend on problem hardness and model size. However, how these factors jointly shape capability and efficiency remains poorly understood. Here, we use hierarchical Bayesian models to evaluate the capability and efficiency of LLMs from the DeepSeek-R1-Distill model family across four classes of arithmetic and algorithmic reasoning problems. At a fixed model size, the probability of correctly solving an instance decays approximately exponentially with instance size, our proxy for problem hardness. The decay scale grows sublinearly with model size, indicating that larger models are more capable, but that capability gains diminish with scale. Output length grows as a power law with instance size, which serves as a proxy for difficulty. However, the parameters of this power law do not vary systematically with model size, suggesting that larger models do not become more efficient. Together, these findings reveal potential limitations of naive scaling as a strategy for developing more capable AI systems: capability improves with diminishing returns, while efficiency shows little to no improvement.
- Abstract(参考訳): 能力と効率性は、大言語モデル(LLM)における推論の2つの重要な次元である。
能力とは与えられた問題を正しく解く能力であり、効率性は限られた資源でそれを行う能力である。
LLMが制御硬度の問題を解くためにChain-of-Thought(CoT)推論を使用する場合、問題の個数と正解に必要なトークンの数の両方が問題硬度とモデルサイズに依存している。
しかし、これらの要因がいかにして結合的に機能と効率を形作るかは、いまだに理解されていない。
本稿では,階層型ベイズモデルを用いて,DeepSeek-R1-Distillモデル群から,算術的およびアルゴリズム的推論問題の4つのクラスにまたがるLLMの能力と効率を評価する。
固定モデルサイズでは、インスタンスを正しく解く確率はインスタンスサイズとほぼ指数関数的に減少する。
崩壊スケールはモデルサイズとともにサブ線形に成長し、より大きなモデルの方が能力が高いが、その能力はスケールによって減少することを示している。
アウトプット長は、インスタンスサイズによる電力法則として成長し、難易度のためのプロキシとして機能する。
しかし、この乗法則のパラメータはモデルのサイズとともに体系的に変化せず、より大きなモデルはより効率的にならないことを示唆している。
これらの発見は、より有能なAIシステムを開発する戦略として、ナイーブスケーリングの潜在的な制限を明らかにしている。
関連論文リスト
- Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression [53.39128997308138]
テキスト圧縮性能に基づくモデル効率の指標である情報容量を導入する。
主流のオープンソースモデルに対する実証的な評価は、シリーズ内のさまざまなサイズのモデルが一貫した情報容量を示すことを示している。
情報容量の特徴的な特徴は、入力と出力の両方のトークン数に影響を与えるトークン化効率が組み込まれていることである。
論文 参考訳(メタデータ) (2025-11-11T10:07:32Z) - Compute-Optimal Scaling for Value-Based Deep RL [99.680827753493]
オンライン価値ベースディープRLの計算スケーリングについて検討する。
解析の結果,モデルサイズ,バッチサイズ,UTD間の微妙な相互作用が明らかになった。
この現象を理解するためのメンタルモデルを提供し、バッチサイズとUTDを選択するためのガイドラインを構築します。
論文 参考訳(メタデータ) (2025-08-20T17:54:21Z) - Superposition Yields Robust Neural Scaling [22.05527470952902]
表現重畳は、LLMが次元よりも多くの特徴を表現していることを意味するが、損失や神経スケーリングの原因となる重要な要因であることを示す。
結果は,表現重畳をニューラルスケーリング法則の中心的要因として認識し,ニューラルスケーリング法則がいつ改善され,いつ崩壊するかといった問題に対する洞察を提供する。
論文 参考訳(メタデータ) (2025-05-15T16:18:13Z) - Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging [17.038807261969033]
Long-to-Short (L2S) 推論は推論深度と実用効率のバランスをとることを目的としている。
モデルマージは、System 1モデルの迅速な思考能力とSystem 2モデルの方法論的推論を統合することで、コスト効率が高く堅牢な代替手段を提供する。
実験の結果,モデルマージにより平均応答長を最大55%削減できることがわかった。
論文 参考訳(メタデータ) (2025-03-26T15:34:37Z) - Is the Number of Trainable Parameters All That Actually Matters? [2.624902795082451]
スケーリング法を仮に騙し、より大規模なモデルを安価にトレーニングする方法を調査する。
テスト損失と計算の間のスケーリングの関係は、トレーニング可能なパラメータの実際の数にのみ依存することがわかった。
論文 参考訳(メタデータ) (2021-09-24T12:43:58Z) - Sufficiently Accurate Model Learning for Planning [119.80502738709937]
本稿では,制約付きSufficiently Accurateモデル学習手法を提案する。
これはそのような問題の例を示し、いくつかの近似解がいかに近いかという定理を提示する。
近似解の質は、関数のパラメータ化、損失と制約関数の滑らかさ、モデル学習におけるサンプルの数に依存する。
論文 参考訳(メタデータ) (2021-02-11T16:27:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。