論文の概要: How Good Can Linear Models Be for Time-Series Forecasting?
- arxiv url: http://arxiv.org/abs/2606.27282v2
- Date: Mon, 29 Jun 2026 17:59:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.057517
- Title: How Good Can Linear Models Be for Time-Series Forecasting?
- Title(参考訳): 時系列予測にはリニアモデルにどんな効果があるのか?
- Abstract要約: 閉形式解と解釈可能な重みを持つので、テストベッドとしてリッジ回帰を用いる。
コンテクスト長,局所正規化,正規化,および8つの標準ベンチマーク上の拡張を探索する。
その結果得られたモデルは、ほとんどのデータセット水平エントリで以前の線形予測器を破り、8つのベンチマークのうち6つのベースラインであるTransformerを上回った。
- 参考スコア(独自算出の注目度): 1.558068541168739
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Time-series forecasting research has been moving steadily toward larger architectures, from specialized transformers to general-purpose foundation models, on the assumption that capacity is what unlocks accuracy. We take the opposite position: most of the gap can be closed at far lower cost by tuning preprocessing rather than scaling models. We use Ridge regression as the testbed, since it has a closed-form solution and interpretable weights, which let the optimal hyperparameters be read off the search directly. We search over context length, local normalization, regularization, and augmentation on eight standard benchmarks and find three patterns. (1) Optimal lookback is strongly series-specific and often non-monotonic in forecast horizon, with fitted power-law exponents ranging from $+0.46$ on ETTm2 to $-0.19$ on Exchange and Traffic, challenging the convention that longer horizons need longer history. (2) Normalizing over a learned trailing fraction of the context, rather than its entirety, is almost universally preferred. (3) Series within the same dataset often disagree on hyperparameters; the optimal degree of cross-series sharing varies from fully shared to fully per-series. The resulting models beat prior linear forecasters on most dataset-horizon entries and exceed Transformer, MLP, and CNN baselines on six of eight benchmarks. The optimized hyperparameters also serve as a diagnostic on the data itself, revealing structures that larger models absorb silently into their learned parameters. We provide an accompanying interactive online demonstration and the code at https://sakanaai.github.io/SearchCast/.
- Abstract(参考訳): 時系列予測の研究は、キャパシティが正確性を解き放つことを前提に、特殊なトランスフォーマーから汎用基盤モデルまで、より大規模なアーキテクチャに向かって着実に進んでいる。
ギャップのほとんどは、モデルをスケールするのではなく、前処理をチューニングすることで、はるかに低コストで閉じることができる。
閉形式解と解釈可能な重みを持ち、最適なハイパーパラメータを直接読み取ることができるため、テストベッドとしてリッジ回帰を用いる。
コンテクスト長、局所正規化、正規化、および8つの標準ベンチマークで拡張を探索し、3つのパターンを見つける。
1) 最適見返りは、予測地平線において強く直列的であり、しばしば単調ではない。ETTm2の$+0.46$から交換・交通の$-0.19$まで、より長い地平線が長い歴史を必要とする慣習に異議を唱える。
2) 学習した文脈の後続部分の正規化は, 全体ではなく, ほぼ普遍的に好まれる。
(3)同じデータセット内のシリーズは、しばしばハイパーパラメーターに異同し、最適なクロスシリーズ共有度は、完全に共有されるものから、全シリーズごとに異なる。
その結果得られたモデルは、ほとんどのデータセット水平エントリで以前の線形予測器を破り、8つのベンチマークのうち6つでTransformer、MLP、CNNのベースラインを超えた。
最適化されたハイパーパラメータは、データ自体の診断としても機能し、より大きなモデルが学習パラメータに静かに吸収する構造を明らかにする。
インタラクティブなオンラインデモとコードをhttps://sakanaai.github.io/SearchCast/.comで公開しています。
関連論文リスト
- Revisiting Chebyshev Polynomial and Anisotropic RBF Models for Tabular Regression [0.7734726150561086]
チェビシェフ回帰器や放射基底関数(RBF)ネットワークのような滑らかな基底モデルが数値解析においてよく確立されている。
アプリケーションドメインによって編成された55の回帰データセットにまたがって、モデルをベンチマークできるかどうかを問う。
論文 参考訳(メタデータ) (2026-02-25T21:34:52Z) - OverFill: Two-Stage Models for Efficient Language Model Decoding [68.68408155020568]
大規模言語モデル(LLM)は多様なタスクにまたがって優れていますが、高い推論コストのため、デプロイメント上の大きな課題に直面しています。
プリフィルとデコードステージを分離し,精度と効率のトレードオフを最適化するOverFillを提案する。
我々の3B-to-1B OverFill構成は1Bプルーニングモデルを83.2%上回り、8B-to-3B構成は3Bプルーニングモデルを79.2%上回った。
論文 参考訳(メタデータ) (2025-08-11T20:07:34Z) - T3Time: Tri-Modal Time Series Forecasting via Adaptive Multi-Head Alignment and Residual Fusion [0.4915744683251151]
T3Timeは、時間、スペクトル、プロンプトブランチで構成される新しい3モーダルフレームワークである。
予測地平線に基づいて時間的特徴とスペクトル的特徴の優先順位付けを学習する。
我々のモデルは一貫して最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-08-06T09:31:44Z) - Intention-Conditioned Flow Occupancy Models [80.42634994902858]
大規模な事前学習は、今日の機械学習研究のやり方を根本的に変えた。
同じフレームワークを強化学習に適用することは、RLの中核的な課題に対処するための魅力的な方法を提供するので、魅力的です。
生成AIの最近の進歩は、高度に複雑な分布をモデリングするための新しいツールを提供している。
論文 参考訳(メタデータ) (2025-06-10T15:27:46Z) - OLinear: A Linear Model for Time Series Forecasting in Orthogonally Transformed Domain [24.24834151329251]
OLinearは$mathbfo$rthogonally変換されたドメインで、$mathbfo$rthogonally変換されたドメインで動作する。
多変量依存を捉えるために正規化重み行列を利用する、カスタマイズされた線形層である $mathbfNormLin$ を導入する。
24のベンチマークと140の予測タスクの実験は、OLinearが常に最先端のパフォーマンスを高い効率で達成していることを示している。
論文 参考訳(メタデータ) (2025-05-12T10:39:37Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining [59.369484219304866]
我々は100兆のトークンをスクラッチから3,700以上の大規模言語モデル(LLM)に対する前例のない経験的調査訓練を実施している。
ステップ法則(ステップ法)と呼ばれる,LLM事前学習におけるハイパーパラメータ最適化のための普遍的スケーリング法則を確立する。
我々の推定オプティマは, 排他的探索によって得られた世界最高の性能から, テストセットの0.094%しか逸脱しない。
論文 参考訳(メタデータ) (2025-03-06T18:58:29Z) - SWIFT: Mapping Sub-series with Wavelet Decomposition Improves Time Series Forecasting [2.6764607949560593]
$textitSWIFT$は軽量モデルで、強力だが、長期の時系列予測のデプロイメントと推論にも効率的である。
我々は包括的実験を行い、この結果から、textitSWIFT$が複数のデータセット上での最先端(SOTA)性能を達成することを示す。
論文 参考訳(メタデータ) (2025-01-27T16:26:07Z) - tsGT: Stochastic Time Series Modeling With Transformer [0.12905935507312413]
本稿では,汎用トランスアーキテクチャ上に構築された時系列モデルであるtsGTを紹介する。
tsGT は MAD と RMSE の最先端モデルより優れており、QL と CRPS のピアよりも 4 つの一般的なデータセットで優れていることを示す。
論文 参考訳(メタデータ) (2024-03-08T22:59:41Z) - Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model [89.8764435351222]
分散を低減した行列生成のために, WTA-CRS と呼ばれる新しい非バイアス推定系を提案する。
我々の研究は、チューニング変換器の文脈において、提案した推定器が既存のものよりも低い分散を示すという理論的および実験的証拠を提供する。
論文 参考訳(メタデータ) (2023-05-24T15:52:08Z) - Transformers meet Stochastic Block Models: Attention with Data-Adaptive
Sparsity and Cost [53.746169882193456]
最近の研究は、自己注意の二次的コストを克服するために、様々なスパークアテンションモジュールを提案している。
本稿では,それぞれの注意を混合メンバーシップブロックモデルで表現することで,両方の問題を解決するモデルを提案する。
我々のモデルは、以前の効率的な変種とオリジナルのトランスフォーマーより優れており、十分に注目されています。
論文 参考訳(メタデータ) (2022-10-27T15:30:52Z) - High-dimensional regression with potential prior information on variable
importance [0.0]
順序付けによって示されるモデルの列に適合する簡単なスキームを提案する。
リッジ回帰を用いた場合の全てのモデルの適合に対する計算コストは、リッジ回帰の1つの適合に留まらないことを示す。
モデル全体の整合性を大幅に高速化するために,従来の整合性を利用したラッソ回帰の戦略を述べる。
論文 参考訳(メタデータ) (2021-09-23T10:34:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。