論文の概要: HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL
- arxiv url: http://arxiv.org/abs/2605.17792v1
- Date: Mon, 18 May 2026 03:17:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:48.69903
- Title: HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL
- Title(参考訳): HydroAgent:Simulator-Grounded RLによるHydrologic Model CalibrationにおけるFrontier LLMsとHuman Expertsのギャップを埋める
- Authors: Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong,
- Abstract要約: 分散水理モデルの校正は、運用水資源管理における重要なボトルネックである。
我々は、フロンティア大言語モデル(LLM)エージェントが人間の水理モデルに取って代わることができ、そうでなければ何が必要かと尋ねる。
我々は,アメリカ国立気象局がフラッシュフロード予測のために使用しているCREST分散水理モデル上で,9つのフロンティアLSMエージェントをベンチマークした。
- 参考スコア(独自算出の注目度): 6.680830184790049
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Calibrating distributed hydrologic models is a critical bottleneck across operational water resources management - streamflow prediction, reservoir operation, drought monitoring, infrastructure design, and flood forecasting all depend on it. Each basin demands an expert to translate hydrograph signatures into adjustments of a high-dimensional parameter vector, and the resulting workflow does not transfer between watersheds. We ask: can frontier large language model (LLM) agents replace the human hydrologic modeler, and if not, what would it take? We benchmark nine frontier LLM agents - Claude Opus 4.6/4.7, Sonnet 4.6, GPT-5/5.4/5.4-pro, and Gemini 2.5-pro/3.1-pro/3-flash - on the operational CREST distributed hydrologic model used by the U.S. National Weather Service for flash-flood forecasting. Best-of-twenty-rounds Nash-Sutcliffe Efficiency (NSE) across four held-out gauges spanning 329-40,792 km2 ranges from -0.16 (GPT-5.4) to 0.75 (Sonnet 4.6); the ceiling reproduces across all three vendors and capability tiers, with the strongest models concentrating in the 0.65-0.75 band, and no model reaches the human-expert reference except Opus-4.7 on one gauge. We argue this gap is not a parameter-count problem but a domain-grounding problem. We then propose HYDROAGENT, fine-tuning open-weight Qwen3-4B with supervised fine-tuning on 2,576 expert calibration trajectories and Group-Relative Policy Optimization using NSE as a verifiable reward from online CREST simulations - reinforcement learning with simulation feedback (RLSF). For Earth system science, a small domain-tuned policy with simulator-in-the-loop RL is a more compute-efficient and physically faithful path than scaling generic frontier models, and the multi-modal richness of Earth data - remote sensing, in-situ time series, and forecaster narrative - makes domain agents a leveraged direction for AI in physical science.
- Abstract(参考訳): 分散水理モデルの校正は、河川流量予測、貯水池の操業、干ばつモニタリング、インフラ設計、洪水予測など、運用水資源管理における重要なボトルネックである。
各流域は専門家にハイドログラフのシグネチャを高次元パラメータベクトルの調整に翻訳するよう要求し、その結果のワークフローは流域間で転送されない。
我々は、フロンティア大言語モデル(LLM)エージェントが人間の水理モデルに取って代わることができ、そうでなければ何が必要かと尋ねる。
我々は、アメリカ国立気象局がフラッシュフッド予測に使用しているCREST分散水理モデル上で、9つのフロンティアLCMエージェント(Claude Opus 4.6/4.7、Sonnet 4.6、GPT-5/5.4/5.4-pro、Gemini 2.5-pro/3.1-pro/3-flash)をベンチマークした。
最高20ラウンドのナッシュ・サトクリフ効率(NSE)は、329-40,792 km2の範囲で、-0.16 (GPT-5.4) から 0.75 (Sonnet 4.6) の範囲で、天井は3つのベンダーと能力層で再現される。
このギャップはパラメータカウントの問題ではなく、ドメイングラウンドの問題であると主張する。
次に,2,576のエキスパートキャリブレーショントラジェクトリを教師付き微調整するHYDROAGENTと,オンラインCRESTシミュレーション(RLSF)を用いたグループ相対ポリシー最適化を提案する。
地球システム科学にとって、シミュレーター・イン・ザ・ループRLを用いた小さなドメインチューニングポリシーは、一般的なフロンティアモデルをスケーリングするよりも計算効率が高く、物理的に忠実なパスであり、地球データのマルチモーダルな豊かさ – リモートセンシング、in-situ時系列、予測ナラティブ – によって、ドメインエージェントは、物理科学におけるAIの活用された方向性となっている。
関連論文リスト
- Tyche: One Step Flow for Efficient Probabilistic Weather Forecasting [48.263481135566316]
我々は,効率的な確率的天気予報のための一段階条件付き流れモデルであるTycheを提案する。
ERA5の1.5ドル(約1万2000円)と6時間の解像度での実験では、たった1つのNFEを使って、最先端の多段階生成ベースラインの予測スキルとキャリブレーションを一致または超過していることが示されています。
論文 参考訳(メタデータ) (2026-05-07T20:25:28Z) - Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints [48.80158223838359]
我々は、動的で反復的な物理地上モデル適合タスクに基づいてAIエージェントを評価するスケーラブルな環境であるStargazerを紹介した。
Stargazerは3つの難題にまたがる120のタスクで構成されており、20の実際のアーカイブケースを含んでいる。
8つのフロンティアエージェントを評価した結果,数値最適化と物理的制約への固執のギャップが明らかとなった。
論文 参考訳(メタデータ) (2026-04-17T03:38:50Z) - AIFL: A Global Daily Streamflow Forecasting Model Using Deterministic LSTM Pre-trained on ERA5-Land and Fine-tuned on IFS [0.39918810815847444]
本稿では,グローバルな日次ストリームフロー予測のための決定論的LSTMモデルであるAIFL(Artificial Intelligence for Floods)を紹介する。
CARAVANデータセットから算出された18,588の盆地で訓練されている。
ベンチマークの結果は、AIFLが現在の最先端のグローバルシステムと非常に競合していることを示している。
論文 参考訳(メタデータ) (2026-02-18T16:26:36Z) - AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents [75.67445299298949]
AgentCPM-Exploreは、知識密度と強力な探索能力を備えたコンパクトな4Bエージェントモデルである。
本稿では,パラメータ空間モデルの融合,報酬信号の復調,文脈情報の改良を特徴とする総合的なトレーニングフレームワークを提案する。
AgentCPM-Exploreは4つのベンチマークで8BクラスのSOTAモデルにマッチまたは超え、また5つのベンチマークでClaude-4.5-SonnetやDeepSeek-v3.2のような大規模モデルよりも優れている。
論文 参考訳(メタデータ) (2026-02-06T08:24:59Z) - HydroGEM: A Self Supervised Zero Shot Hybrid TCN Transformer Foundation Model for Continental Scale Streamflow Quality Control [2.153503585184628]
本稿では,大陸規模のストリームフロー品質管理の基礎モデルであるHydroGEMを紹介する。
HydroGEMは2段階の訓練をしており、3,724の駅から6.03万回の事前訓練を行っている。
保持された合成試験では、検出のためのHydroGEM F1 = 0.792、既存の方法よりも36.3%改善された。
論文 参考訳(メタデータ) (2025-12-16T05:39:26Z) - Accelerating HEC-RAS: A Recurrent Neural Operator for Rapid River Forecasting [0.0]
本稿では,HEC-RASを解法としてではなく,データ生成エンジンとして扱う深層学習サロゲートを提案する。
ミシシッピ川流域の67か所で訓練され、サロゲートは1年間、目に見えないホールドアウトシミュレーションで評価された。
結果は、モデルが高い予測精度を達成し、中央値の絶対ステージ誤差は0.31フィートであることを示している。
論文 参考訳(メタデータ) (2025-07-21T13:38:54Z) - Pix2Geomodel: A Next-Generation Reservoir Geomodeling with Property-to-Property Translation [2.004012818482403]
本研究では、Pix2Pixをベースとした新しい条件付き生成対向ネットワーク(cGAN)フレームワークであるPix2Geomodelを紹介する。
グローニンゲンガス田のロトリーゲンド貯水池から貯水池特性(空洞、ポーシティ、透水性、飽和度)を予測するように設計されている。
その結果, 病状 (PA 0.88, FWIoU 0.85) と水飽和 (PA 0.96, FWIoU 0.95) の精度が高く, 気孔率 (PA 0.70, FWIoU 0.55) と透過性 (PA 0.74, FWIoU 0.60) が適度に向上し, 翻訳性能も良好であった。
論文 参考訳(メタデータ) (2025-06-21T15:58:27Z) - FlowTS: Time Series Generation via Rectified Flow [67.41208519939626]
FlowTSは、確率空間における直線輸送を伴う整流フローを利用するODEベースのモデルである。
非条件設定では、FlowTSは最先端のパフォーマンスを達成し、コンテキストFIDスコアはStockとETThデータセットで0.019と0.011である。
条件設定では、太陽予測において優れた性能を達成している。
論文 参考訳(メタデータ) (2024-11-12T03:03:23Z) - GeoFUSE: A High-Efficiency Surrogate Model for Seawater Intrusion Prediction and Uncertainty Reduction [0.10923877073891446]
海岸帯水層への海水侵入は地下水資源に重大な脅威をもたらす。
ディープラーニングに基づく新しいサロゲートフレームワークGeoFUSEを開発した。
ワシントン州のビーバークリーク潮流-河床平原系の2次元断面にGeoFUSEを適用した。
論文 参考訳(メタデータ) (2024-10-26T08:10:32Z) - Rapid Flood Inundation Forecast Using Fourier Neural Operator [77.30160833875513]
洪水浸水予測は洪水前後の緊急計画に重要な情報を提供する。
近年,高分解能な流体力学モデリングが普及しつつあるが,道路の洪水範囲やリアルタイムのビルディングレベルは依然として計算的に要求されている。
洪水範囲と浸水深度予測のためのハイブリッドプロセスベースおよびデータ駆動機械学習(ML)アプローチを提案する。
論文 参考訳(メタデータ) (2023-07-29T22:49:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。