論文の概要: Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction
- arxiv url: http://arxiv.org/abs/2607.02829v1
- Date: Thu, 02 Jul 2026 23:43:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.430626
- Title: Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction
- Title(参考訳): 天気予報の正確さと予測精度の低下
- Abstract要約: Viベースの天気予報モデルは、近くの大気グリッドポイントが時間とともに同様の値や領域を含む場合であっても、すべての空間トークンにわたって計算を適用する。
パラメータフリーなプラグインルーティングモジュールであるSparse-Reslimを導入する。
ERA5の解像度は0.25textdegree標準と2つのモデルファミリ、決定論的トランスフォーマーと拡散モデルまでで、Sparse-Reslimは評価変数の予測精度を著しく向上し、コストを大幅に削減する。
- 参考スコア(独自算出の注目度): 24.266851703305004
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing ViT-based weather forecasting models apply uniform computation across all spatial tokens, even though nearby atmospheric grid points often contain similar values and large regions evolve smoothly over time. This makes much of the intermediate per-token computation redundant. Standard token-efficiency methods, such as pruning or merging, reduce cost by removing or fusing tokens. However, weather forecasting is a spatiotemporal dense prediction problem in which a history of atmospheric states must be mapped to future values on the original latitude-longitude grid. Thus, every grid cell must retain a physically meaningful representation, especially under autoregressive rollout. We introduce Sparse-Reslim, a parameter-free plug-in routing module that makes sparse token processing compatible with this fixed-grid requirement. Sparse-Reslim routes only 25% of spatial tokens through the expensive middle transformer blocks and treats those blocks as residual updates: it computes the change produced for the routed tokens and scatters only this delta back to the full sequence. Unselected tokens keep their pre-routing representations exactly, so no grid cell is dropped or replaced by a mask token, and no fusion layer or additional parameters are introduced. Across ERA5 resolutions up to the operational 0.25\textdegree{} standard and two model families, a deterministic Transformer and a diffusion model, Sparse-Reslim improves forecast accuracy on every evaluated variable while substantially reducing cost: training is about 2.5x faster in the main settings and reaches 3.18x speedup at 0.25\textdegree{}, with over 2.2x lower peak memory. A controlled decomposition shows that the accuracy gain comes primarily from sparse routing itself, while random token selection provides an additional regularization benefit without selector overhead.
- Abstract(参考訳): 既存のViTベースの天気予報モデルは、近傍の大気格子点はしばしば同様の値を含み、時間とともに大きな領域が滑らかに進化するにもかかわらず、すべての空間トークンに均一な計算を適用している。
これにより、中間のトーケン毎の計算の多くが冗長になる。
プルーニングやマージといった標準的なトークン効率の手法は、トークンの削除や融合によってコストを削減します。
しかし、気象予報は時空間密集予測問題であり、大気状態の歴史を元の緯度-経度格子上の将来の値にマッピングしなければならない。
したがって、全てのグリッドセルは、特に自己回帰的なロールアウトの下で、物理的に意味のある表現を保持する必要がある。
パラメータフリーなプラグインルーティングモジュールであるSparse-Reslimを導入する。
Sparse-Reslimは、高価な中間変圧器ブロックを通して空間トークンの25%をルートし、これらのブロックを残留更新として扱う。
選択されていないトークンは、プリルーチン表現を正確に保持するため、グリッドセルをドロップしたりマスクトークンに置き換えたりせず、融合層や追加パラメータは導入されない。
ERA5では、オペレーション 0.25\textdegree{} 標準と2つのモデルファミリ、決定論的トランスフォーマーと拡散モデルまで、Sparse-Reslimはコストを大幅に削減しながら、評価変数の予測精度を改善している。
制御された分解により、精度のゲインは主にスパースルーティング自身によるものであることが示され、一方ランダムトークンの選択はセレクタオーバーヘッドを伴わずにさらなる正規化の利点を提供する。
関連論文リスト
- S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models [5.680072178589744]
ビジュアルトークンプルーニングは、視覚トークンのサブセットだけを保持することで、マルチモーダルな大規模言語モデル(MLLM)の推論オーバーヘッドを低減する。
S$2$Pruneは,局所像構造にトークン密度を適応させながら空間被覆を保存する訓練不要プルーニング手法である。
論文 参考訳(メタデータ) (2026-09-01T13:26:57Z) - Reg4Pru: Regularisation Through Random Token Routing for Token Pruning [15.18142893449811]
本稿では,セグメンテーションのためのトークンプレーニング性能損失を軽減するトレーニング正規化手法であるReg4Pruを紹介する。
Reg4Pruは、ルーティングなしでトレーニングされた同じモデルと比較して、平均精度を絶対46%改善する。
論文 参考訳(メタデータ) (2026-02-02T14:38:19Z) - OmniCast: A Masked Latent Diffusion Model for Weather Forecasting Across Time Scales [31.2102435696238]
OmniCastはスケーラブルで熟練した確率モデルで、時間スケールで天気予報を統一する。
中距離の時間スケールで10倍から20倍高速に動作します。
これは、精度、物理ベース、確率的メトリクスにわたって、サブシーズンとシーズンのスケールで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-20T17:48:27Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization [130.46612643194973]
reARはトークン単位の正規化目標を導入する単純なトレーニング戦略です。
ImageNetでは、gFIDを3.02から1.86に削減し、標準化ベースのトークンーザを使用してISを316.9に改善している。
高度なトークン化器に適用すると、177Mパラメータしか持たない1.42のgFIDが達成され、その性能はより大きな最先端拡散モデル(675M)と一致する。
論文 参考訳(メタデータ) (2025-10-06T02:48:13Z) - Block-based Symmetric Pruning and Fusion for Efficient Vision Transformers [11.916258576313776]
Vision Transformer (ViT) は様々な視覚タスクで印象的な結果を得た。
近年の方法は、重要でないトークンをプルーニングすることで、ViTの$O(n2)$複雑さを減らすことを目的としている。
効率的なViTのための新しいbfブロックベースのシンメトリプルーニングとフュージョンを提案する。
論文 参考訳(メタデータ) (2025-07-16T10:48:56Z) - Neighboring Autoregressive Modeling for Efficient Visual Generation [19.486745219466666]
NAR(Neighboring Autoregressive Modeling)は、自動回帰視覚生成をプログレッシブ・アウトペイントの手順として定式化する新しいパラダイムである。
空間時間空間における複数の隣接トークンの並列予測を可能にするために,次元指向デコードヘッドのセットを導入する。
ImageNet$256times 256$とUCF101の実験では、それぞれ2.4$times$と8.6$times$高いスループットを達成した。
論文 参考訳(メタデータ) (2025-03-12T05:52:27Z) - AiluRus: A Scalable ViT Framework for Dense Prediction [95.1313839257891]
視覚変換器 (ViT) は、その優れた性能のため、視覚タスクの一般的なアーキテクチャとして登場した。
本稿では,画像の異なる領域に対して,その重要度に応じて適応分解能を適用することを提案する。
提案手法を3つの異なるデータセット上で評価し,有望な性能を観察する。
論文 参考訳(メタデータ) (2023-11-02T12:48:43Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z) - Paraformer: Fast and Accurate Parallel Transformer for
Non-autoregressive End-to-End Speech Recognition [62.83832841523525]
そこで我々はParaformerと呼ばれる高速かつ高精度な並列トランスを提案する。
出力トークンの数を正確に予測し、隠れた変数を抽出する。
10倍以上のスピードアップで、最先端のARトランスフォーマーに匹敵するパフォーマンスを実現することができる。
論文 参考訳(メタデータ) (2022-06-16T17:24:14Z) - DynamicViT: Efficient Vision Transformers with Dynamic Token
Sparsification [134.9393799043401]
入力に基づいて冗長なトークンを抽出する動的トークンスペーシフィケーションフレームワークを提案する。
入力トークンの66%を階層的にプルーニングすることで,FLOPの31%37%を大幅に削減し,スループットを40%以上向上する。
DynamicViTモデルは、ImageNetの最先端CNNやビジョントランスフォーマーと比較して、非常に競争力のある複雑性/精度のトレードオフを実現することができる。
論文 参考訳(メタデータ) (2021-06-03T17:57:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。