論文の概要: Evaluating the Generalizability of Foundation Models for Extreme Environmental Events: Case Study of California Wildfire PM2.5
- arxiv url: http://arxiv.org/abs/2607.07951v1
- Date: Wed, 08 Jul 2026 22:03:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.351651
- Title: Evaluating the Generalizability of Foundation Models for Extreme Environmental Events: Case Study of California Wildfire PM2.5
- Title(参考訳): 極端環境事象に対する基礎モデルの一般化可能性の評価:カリフォルニア・ワイルドファイアPM2.5を事例として
- Abstract要約: ワイルドファイアの煙は極端なPM$_2.5$の濃度を発生させ、公衆衛生上の深刻なリスクを引き起こす。
時系列基礎モデル(TSFM)はゼロショット推論と効率的な適応を提供する。
6つのTSFM構成と完全に訓練されたベースラインを比較した最初の体系的ベンチマークを示す。
- 参考スコア(独自算出の注目度): 7.6749440382595395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Wildfire smoke events produce extreme PM$_{2.5}$ concentrations that pose severe public health risks, yet forecasting rare, hazardous-level spikes remains a fundamental challenge. Time series foundation models (TSFMs), pretrained models offering zero-shot inference and efficient adaptation, perform strongly on general benchmarks, but their behavior under extreme out-of-distribution conditions is poorly understood. We present the first systematic benchmark comparing six TSFM configurations (zero-shot TimesFM, Chronos-2, Moirai-2, and Time-MoE, plus LoRA fine-tuned Chronos-2 and Time-MoE) against fully-trained baselines (LSTM, BiLSTM, Transformer) and naive persistence on a 12-year (2013--2025) hourly PM$_{2.5}$ dataset covering 1,375 wildfire incidents across 79 California monitoring sites. A leave-one-incident-out (LOIO) protocol evaluates generalization to unseen fires, using MAE, RMSE, and exceedance F1 at EPA AQI thresholds across 6-, 12-, and 24-hour horizons. Results reveal a consistent hierarchy. The BiLSTM achieves the lowest MAE ($5.16\,μg/m^3$) and the highest exceedance F1 at every threshold, including the Hazardous band ($>225.5\,μg/m^3$), reaching 0.63 versus at most 0.54 for any foundation model. Zero-shot TSFMs improve on persistence only modestly, and zero-shot Chronos-2 exhibits severe RMSE tail instability ($23.4\,μg/m^3$, negative $R^2$) from sporadic large errors. LoRA fine-tuning substantially improves both adapted families and largely repairs this instability, yet no foundation model surpasses the trained recurrent baselines on any metric. These findings challenge the assumption that larger pretrained models universally dominate environmental forecasting and provide actionable deployment guidance for wildfire air quality prediction.
- Abstract(参考訳): 野生火災の煙は、深刻な公衆衛生上のリスクをもたらす極端なPM$_{2.5}$濃度を発生させるが、希少で有害なレベルのスパイクを予測することは、依然として根本的な課題である。
時系列基礎モデル(TSFM)は、ゼロショット推論と効率的な適応を提供する事前訓練されたモデルであり、一般的なベンチマークで強く機能するが、極端なアウト・オブ・ディストリビューション条件下での動作は理解されていない。
我々は, フルトレーニングベースライン (LSTM, BiLSTM, Transformer) に対して, 6つのTSFM構成 (ゼロショットTimeFM, Chronos-2, Moirai-2, Time-MoE), LoRAファインチューニングChronos-2, Time-MoE) と12年間 (2013-2025) のPM$_{2.5}$データセットを比較した最初の系統的ベンチマークを行った。
LOIO(Leave-one-incident-out)プロトコルは、6時間、12時間、24時間にわたるEPA AQIしきい値におけるMAE, RMSE, および超過F1を用いて、目に見えない火災への一般化を評価する。
結果は一貫した階層性を示す。
BiLSTMは最低値のMAE(5.16\,μg/m^3$)と最高値のF1(Hazardous Band(225.5\,μg/m^3$)を達成する。
ゼロショットTSFMは持続性のみをわずかに改善し、ゼロショットChronos-2は散発的な大誤差から激しいRMSEテール不安定(23.4\,μg/m^3$,負の$R^2$)を示す。
LoRAファインチューニングは、両方の適応されたファミリーを著しく改善し、この不安定性を大幅に修復するが、任意のメトリクスのトレーニングされたリカレントベースラインを超える基礎モデルは存在しない。
これらの結果は,より大規模な事前訓練モデルが環境予測を普遍的に支配し,山火事の空気質予測のための実用的な展開ガイダンスを提供するという仮定に挑戦するものである。
関連論文リスト
- Multi-Step Forecasting of Grape Berry Temperature based on LSTM Model with Feed-Forward Attention [0.39146761527401436]
FAM-LSTMはLong Short-Term Memory Network (FAM-LSTM)と統合されたフィードフォワードアテンション機構である
モデルは2023年と2024年の環境データを用いて、アメリカ合衆国のプロッサーで訓練され、2025年の夏のデータに基づいて検証された。
FAM-LSTMは全ての地平線と入力シナリオでベンチマークモデルを一貫して上回った。
論文 参考訳(メタデータ) (2026-08-29T02:40:15Z) - Do Time-Series Foundation Models Pay Off for Industrial Monitoring? A Cost-Aware Empirical Study [1.8419890068150178]
時系列基礎モデル(TSFM)は再利用可能な表現とゼロショット予測を約束する。
本研究は,3つの設定にまたがってプロトコルを考慮した経験的評価を示す。
論文 参考訳(メタデータ) (2026-08-24T08:30:06Z) - Time series Foundation Models based on Physics-Informed Synthetic Histories for Cold-Start Photovoltaic Forecasting [45.753923525593045]
評価は4つのデータセットと多様な気候体制にまたがる440ドルのPVサイトに及んでいる。
性能は、合成履歴源にはほとんど敏感であり、精度は特定の発生器よりも、可視的時間的文脈の可用性によってより引き起こされることを示している。
論文 参考訳(メタデータ) (2026-06-05T17:05:19Z) - Empirical evaluation of Time Series Foundation Models for Day-ahead and Imbalance Electricity Price Forecasting in Belgium [0.0]
Time Series Foundation Models (TSFM) はタスク固有の最小限のトレーニングでゼロショット予測機能を約束する。
本研究は,ベルギーのデイアヘッドの予測と電力価格の不均衡に対するTSFMの系統的評価を提供する。
TSFMは真のゼロショット予測スキルを示すが、極端な市場条件下では苦戦している。
論文 参考訳(メタデータ) (2026-05-16T15:30:23Z) - Meteorology-Driven GPT4AP: A Multi-Task Forecasting LLM for Atmospheric Air Pollution in Data-Scarce Settings [4.364999214109123]
事前訓練GPT-2バックボーンとガウスランク安定化低ランク適応(rsLoRA)に基づく大気汚染のための気象駆動型GPT(GPT4AP)
モデルは、数ショット、ゼロショット、長期予測設定の下で6つの実世界の空気質監視データセットで評価される。
論文 参考訳(メタデータ) (2026-03-31T16:37:06Z) - One-for-All: A Lightweight Stabilized and Parameter-Efficient Pre-trained LLM for Time Series Forecasting [4.364999214109123]
One-for-Allは、時系列分析のためにトレーニング済みの大規模言語モデルを適用するためのフレームワークである。
rsLoRAは、低いランクでの証明可能な勾配安定性を可能にする数学的に基底的なランク安定化機構を導入している。
One-for-Allは最先端の効率と精度のトレードオフを達成する。
論文 参考訳(メタデータ) (2026-03-31T13:54:43Z) - $V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts [81.48669089692189]
一般値モデル(例えば$V_0.5$)は、コンテキスト内のモデル機能を明示的にエンコードすることで、事前訓練された値推定を実現する。
本稿では,このような値モデルにより予測されるベースラインと,スパースロールアウトから導出される経験的平均とを適応的に融合する$V_0.5$を提案する。
V_0.5$はGRPOとDAPOを大きく上回り、より高速な収束と約10%のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:41Z) - The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification [74.64864354503204]
本稿では,Large Language Models (LLM) を利用した予測自動監視システムであるThe Forecast Criticを提案する。
LLMの時系列予測品質を評価する能力を評価する。
合成および実世界の予測データを含む3つの実験を行った。
論文 参考訳(メタデータ) (2025-12-12T21:59:53Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Synergistic Neural Forecasting of Air Pollution with Stochastic Sampling [50.3911487821783]
大気汚染は世界的な健康と環境のリスクの先駆けであり、特に山火事、都市干ばつ、塵嵐による大気汚染の急激な増加に弱い地域ではなおもである。
本稿では,気象および大気組成データを統合し,平均および極端汚染レベルの予測を改善する高分解能神経予測モデルであるSynCastを提案する。
論文 参考訳(メタデータ) (2025-10-28T01:18:00Z) - Benchmarking Machine Learning Models for Fault Classification and Localization in Power System Protection [10.403249318465468]
本研究は、EMTデータに基づく電力系統保護における故障分類(FC)と故障局所化(FL)に関する古典的機械学習モデルの比較ベンチマーク研究である。
最高性能のFCモデルは0.992$pm$0.001のF1スコアを獲得し、上位のFLモデルは0.806$pm$0.008のR2スコアに達し、平均処理時間は0.563msとなった。
論文 参考訳(メタデータ) (2025-10-01T12:44:14Z) - Residual Corrective Diffusion Modeling for Km-scale Atmospheric Downscaling [58.456404022536425]
気象・気候からの物理的危険予知技術の現状には、粗い解像度のグローバルな入力によって駆動される高価なkmスケールの数値シミュレーションが必要である。
ここでは、コスト効率のよい機械学習代替手段として、このようなグローバルな入力をkmスケールにダウンスケールするために、生成拡散アーキテクチャを探索する。
このモデルは、台湾上空の地域気象モデルから2kmのデータを予測するために訓練され、世界25kmの再解析に基づいている。
論文 参考訳(メタデータ) (2023-09-24T19:57:22Z) - A comparative study of statistical and machine learning models on
near-real-time daily emissions prediction [0.0]
二酸化炭素排出量の急激な上昇は、地球温暖化と気候変動の大きな原因である。
本稿は、2020年1月1日から2022年9月30日までの日中排出量予測に適したモデルを選択することを目的とする。
論文 参考訳(メタデータ) (2023-02-02T15:14:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。