論文の概要: Forecast Workflow Bench: Evaluating Language-Model Decisions with Budgeted Forecast Tools
- arxiv url: http://arxiv.org/abs/2609.27385v1
- Date: Wed, 23 Sep 2026 05:35:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.900436
- Title: Forecast Workflow Bench: Evaluating Language-Model Decisions with Budgeted Forecast Tools
- Title(参考訳): Forecast Workflow Bench: 予算化された予測ツールによる言語モデル決定の評価
- Abstract要約: 時系列基礎モデル(TSFM)は、運用上の決定の予測を提供するが、精度だけではその価値を決定できない。
FWBenchは、固定予測ツールとシミュレートされた容量契約を用いて、この能力を1,251個の電気およびサイクルハイアケースで評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Time-series foundation models (TSFMs) provide forecasts for operational decisions, but accuracy alone does not determine their value. Evaluating agents that use these models requires measuring decision quality and forecast cost. FWBench evaluates this capability on 1,251 electricity and cycle-hire cases using fixed forecast tools and simulated capacity contracts. Agents select models, histories and horizons, then submit capacities to minimize a stated loss-cost objective. We evaluated two hosted and eight local configurations, including small language models, and tested local models with and without TSFMs. GPT-6 Astra bought inexpensive short-horizon forecasts selectively, using 2.5% of the budget, and outperformed fixed policies when the saved decisions were scored with three loss-cost weightings. FWBench enables reproducible evaluation of how language models select and use time-series forecasts to make decisions under cost constraints.
- Abstract(参考訳): 時系列基礎モデル(TSFM)は、運用上の決定の予測を提供するが、精度だけではその価値を決定できない。
これらのモデルを使用するエージェントを評価するには、意思決定の品質と予測コストを測定する必要がある。
FWBenchは、固定予測ツールとシミュレートされた容量契約を用いて、この能力を1,251個の電気およびサイクルハイアケースで評価する。
エージェントはモデル、履歴、地平線を選択し、次に与えられた損失コストの目標を最小化するために容量を提出する。
小言語モデルを含む2つのローカル構成と8つのローカル構成を評価し、TSFMを使用せずにローカルモデルをテストした。
GPT-6 アストラは予算の2.5%を使って安価な短地予測を選択的に購入し、節約された決定が3つの損失コスト重み付けで下されたときの固定政策よりも優れていた。
FWBenchは、コスト制約の下で意思決定を行うために、言語モデルをどのように選択し、時系列予測を使用するかを再現可能な評価を可能にする。
関連論文リスト
- Foundation models for electricity price forecasting and battery arbitrage: Can they replace market-specific forecasting models? [1.9336815376402718]
ファンデーションモデルは、タスク固有のトレーニングがほとんどあるいは全くない正確な予測を約束するが、電気価格予測に特化したモデルを置き換えることができるかどうかは不明だ。
ゼロショットモードで評価された5つのファウンデーションモデルファミリーの9つの変種と、2021年から2025年にかけてドイツ、ポーランド、スペインの2つの最先端の電力価格予測ベンチマークを比較した。
TabPFNモデルのみが3つの市場すべてでベンチマークを上回っている。
論文 参考訳(メタデータ) (2026-08-31T12:43:04Z) - Decision-Aware Training for Sample-Based Generative Models [0.08594140167290099]
本稿では, サンプルベース生成モデルに対する意思決定学習を提案し, モデル予測に作用して得られるコストを直接考慮し, エネルギースコアの目標を微分可能な決定損失で増大させる。
提案手法を1つの実世界のタスクと2つの実世界のタスクで検証し,完全な確率予測を維持しつつ,コスト感受性のある領域の改善を目標とした。
論文 参考訳(メタデータ) (2026-07-01T17:02:23Z) - Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice [12.709654635425442]
タブラル基礎モデルは選択予測タスクにおいて高い精度を達成する。
しかし、彼らの予測は、それらのタスクが必要とする経済論理に反することが多い。
実用最大化フレームワークに基礎モデル予測を組み込む2段階のアダプタを提案する。
論文 参考訳(メタデータ) (2026-05-26T05:13:20Z) - Assessing the Performance-Efficiency Trade-off of Foundation Models in Probabilistic Electricity Price Forecasting [0.0]
大規模な再生可能エネルギーの展開は、電力系統に顕著なボラティリティを導入し、グリッドの運用を複雑な最適化問題に変える。
正確な電力価格予測(EPF)は、運用上の決定を支援するだけでなく、経済リスクの低減や市場効率の向上にも不可欠である。
正確な予測を生成するためにどのモデルを使うべきかという疑問が残る。これらはタスク固有の機械学習(ML)モデルか、時系列基礎モデル(TSFM)なのか?
論文 参考訳(メタデータ) (2026-04-16T07:53:38Z) - The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification [74.64864354503204]
本稿では,Large Language Models (LLM) を利用した予測自動監視システムであるThe Forecast Criticを提案する。
LLMの時系列予測品質を評価する能力を評価する。
合成および実世界の予測データを含む3つの実験を行った。
論文 参考訳(メタデータ) (2025-12-12T21:59:53Z) - Bayesian Neural Networks with Monte Carlo Dropout for Probabilistic Electricity Price Forecasting [0.0]
本研究は,モンテカルロ(MC)ドロップアウトを用いたベイズニューラルネットワーク(BNN)を用いた確率的電力価格予測の枠組みを提案する。
一般化自己回帰的条件付きヘテロスケダスティック性(GARCHX)とLASSO推定自己回帰モデル(LEAR)のベンチマークモデルに対する批判的評価と比較
論文 参考訳(メタデータ) (2025-11-12T13:33:28Z) - e1: Learning Adaptive Control of Reasoning Effort [88.51897900019485]
AIモデルの思考予算の増大は、精度を大幅に向上させるが、すべての質問が同じ量の推論を保証しているわけではない。
ユーザは、アウトプットの品質を、レイテンシやコストに対してどのように評価するかによって、さまざまな理由付けの労力を割り当てる傾向があります。
本稿では,ユーザが指定したトークン数を用いてモデルを学習する自己適応型強化学習手法であるAdaptive Effort Controlを提案する。
論文 参考訳(メタデータ) (2025-10-30T23:12:21Z) - Early-Exit and Instant Confidence Translation Quality Estimation [46.13074343863971]
本研究では,(1)スケールにおける品質推定のコスト削減,(2)品質推定のための安価な不確実性推定手法の開発,という2つの課題に対処する。
後者に対処するため,従来の手法の性能を若干のコストで一致させる不確実性を考慮した品質評価モデルであるInstant Confidence COMETを導入する。
我々はこれを、初期のモデル層ですでに品質スコアと関連する信頼度を計算できる品質評価モデルであるEarly-Exit COMETに拡張し、計算の早期実行と評価コストの削減を可能にします。
論文 参考訳(メタデータ) (2025-02-20T10:27:13Z) - Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training [68.94373533768501]
我々は、知識保持をモデル化し、そのコーパスから事実情報を記憶するための事前学習言語モデルの能力を示し、学習前にそれを推定する原則的手法を導入する。
本稿では,知識周波数,知識特異度,モデルサイズを統合し,クローズドブック質問応答(QA)の精度を予測する情報理論予測器である,サイズ依存型相互情報(SMI)を提案する。
論文 参考訳(メタデータ) (2025-02-06T13:23:53Z) - How to Estimate Model Transferability of Pre-Trained Speech Models? [84.11085139766108]
事前学習音声モデルの伝達可能性推定のためのスコアベースアセスメントフレームワーク
ベイズ確率推定と最適輸送という2つの表現理論を利用して、PSM候補のランクスコアを生成する。
本フレームワークは,候補モデルやレイヤを実際に微調整することなく,転送可能性スコアを効率的に計算する。
論文 参考訳(メタデータ) (2023-06-01T04:52:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。