Fugu-MT 論文翻訳(概要): Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs

論文の概要: Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs

arxiv url: http://arxiv.org/abs/2603.28823v1
Date: Sun, 29 Mar 2026 07:30:50 GMT
ステータス: 翻訳完了
システム内更新日: 2026-04-01 15:25:02.559102
Title: Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs
Title（参考訳）: Time is not Compute: Wall-Clock Constrained Trainings for Consumer GPUs
Authors: Yi Liu,
Abstract要約: スケーリング法則はモデル品質を計算予算(FLOP)に関連付けるが、実践者は計算予算ではなく、ウォールタイムの制約に直面している。コンシューマGPU(RTX 4090)において、固定時間予算下での最適モデルサイズを5分から24時間まで検討する。発見は、FLOPではなくウォールタイムがバインディング制約である、コンシューマハードウェアのトレーニングにすぐに影響する。
参考スコア（独自算出の注目度）: 4.28787537081191
License: http://creativecommons.org/licenses/by-nc-nd/4.0/
Abstract: Scaling laws relate model quality to compute budget (FLOPs), but practitioners face wall-clock time constraints, not compute budgets. We study optimal model sizing under fixed time budgets from 5 minutes to 24 hours on consumer GPUs (RTX 4090). Across 70+ runs spanning 50M--1031M parameters, we find: (1)~at each time budget a U-shaped curve emerges where too-small models overfit and too-large models undertrain; (2)~optimal model size follows $N^* \propto t^{0.60}$, growing \emph{faster} than Chinchilla's $N^* \propto C^{0.50}$, with $α= 0.60 \pm 0.07$ robustly exceeding compute-optimal across all sensitivity analyses; (3)~a \emph{dual U-shape mechanism}: short-budget U-curves arise from compute bottlenecks, while long-budget U-curves emerge from data bottlenecks (overfitting), with an intermediate regime where the U-curve temporarily disappears. These findings have immediate implications for researchers training on consumer hardware, where wall-clock time -- not FLOPs -- is the binding constraint. We release all code, logs, and 70+ experimental configurations.
Abstract（参考訳）: スケーリング法則はモデル品質を計算予算(FLOP)に関連付けるが、実践者は計算予算ではなく、ウォールタイムの制約に直面している。コンシューマGPU(RTX 4090)において,固定時間予算下での最適モデルサイズを5分から24時間まで検討した。 Across 70+ runing 50M--1031M parameters, we found: (1)~a \emph{dual U-shape mechanism}: short-budget U-curves occur from compute bottlenecks (overfit) while long-budget U-curves from a clusters (overfit) while long-budget U-curves from a clusters (overfit)。これらの発見は、FLOPではなくウォールタイムがバインディング制約である、コンシューマハードウェアのトレーニングにすぐに影響する。すべてのコード、ログ、70以上の実験的な設定をリリースしています。

関連論文リスト

Avoiding Premature Collapse: Adaptive Annealing for Entropy-Regularized Structural Inference [1.7523718031184992]
この障害の基本的なメカニズムは、 textbf Premature Mode Collapseである。提案手法は,適応型スケジューリングアルゴリズムであるtextbfEfficient Piecewise Hybrid Adaptive Stability Control (EPH-ASC) で,推論過程の安定性をモニタする。
論文参考訳（メタデータ） (2026-01-30T14:47:18Z)
INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。 $mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文参考訳（メタデータ） (2025-11-16T20:14:28Z)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文参考訳（メタデータ） (2025-06-15T05:50:05Z)
Faster Algorithms for User-Level Private Stochastic Convex Optimization [16.59551503680919]
ユーザレベルの差分プライバシー制約の下で,プライベート凸最適化(SCO)について検討する。ユーザレベルのDP SCOの既存のアルゴリズムは多くの大規模機械学習シナリオでは実用的ではない。我々は、最先端の過剰リスクと実行時保証を備えた新しいユーザレベルのDPアルゴリズムを提供する。
論文参考訳（メタデータ） (2024-10-24T03:02:33Z)
Coarse Graining with Neural Operators for Simulating Chaotic Systems [78.64101336150419]
カオスシステムの長期的挙動を予測することは、気候モデリングなどの様々な応用に不可欠である。このような完全解法シミュレーションに対する別のアプローチは、粗いグリッドを使用して、時間テキストモデルによってエラーを修正することである。この制限を克服する物理インフォームド・ニューラル演算子(PINO)を用いたエンド・ツー・エンドの学習手法を提案する。
論文参考訳（メタデータ） (2024-08-09T17:05:45Z)
Minimax Optimal Quantization of Linear Models: Information-Theoretic Limits and Efficient Algorithms [59.724977092582535]
測定から学習した線形モデルの定量化の問題を考える。この設定の下では、ミニマックスリスクに対する情報理論の下限を導出する。本稿では,2層ReLUニューラルネットワークに対して,提案手法と上界を拡張可能であることを示す。
論文参考訳（メタデータ） (2022-02-23T02:39:04Z)
Adaptive Distributed Stochastic Gradient Descent for Minimizing Delay in the Presence of Stragglers [31.309253646602933]
我々は、マスターが分散勾配降下(SGD)アルゴリズムを、データのサブセットを持つそれぞれ$n$ワーカー上で実行したいという設定について検討する。分散SGDは、遅延を引き起こす遅い作業者や非応答的な作業者など、ストラグラーの影響に悩まされることがある。本稿では,統計的概念に基づく適応分散SGDのアルゴリズムを提案する。
論文参考訳（メタデータ） (2020-02-25T16:25:22Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。