論文の概要: Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators
- arxiv url: http://arxiv.org/abs/2608.30110v1
- Date: Mon, 31 Aug 2026 00:53:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.18152
- Title: Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators
- Title(参考訳): LLMは経済の波に乗ることができるか? : マクロ経済指標を用いたLCMのリアルタイム評価
- Abstract要約: 大規模言語モデル (LLM) エージェントは, ヘッドラインマクロ経済指標の候補候補として期待されている。
LiveMacroEval (LiveMacroEval) は、LLMのエージェントが16の主要マクロ経済指標の時限放送を行う、ライブで汚染に強いベンチマークである。
Nowcastの品質は、発表風株のリターンに対するLiveMacro Scoreと、シミュレーションされたPolymarketスタイルのトレーディングによるLiveBetting Scoreを通じて評価される。
- 参考スコア(独自算出の注目度): 28.405337173390247
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Nowcasting headline macroeconomic indicators, i.e., estimating an indicator's value for the current reference period before its official release, is critical for monetary policy and financial markets, and central banks devote dedicated teams of expert economists to producing such estimates. Large language model (LLM) agents are a promising candidate for this task, combining broad world knowledge with real-time web search and supporting queries at higher frequency than institutional nowcasts. Evaluating their nowcasting capability is, however, challenging: headline indicators such as GDP and CPI are widely reported and likely memorized during pretraining, so any evaluation on historical releases is vulnerable to data contamination. To address this, we introduce LiveMacroEval, a live, contamination-resistant benchmark in which LLM agents produce hourly nowcasts for sixteen major U.S. macroeconomic indicators over a pre-release window closing at each official release. Nowcast quality is assessed through a LiveMacro Score against announcement-window equity returns and a LiveBetting Score from simulated Polymarket-style trading, with Federal Reserve regional-bank nowcasts, the Bloomberg ECOS professional consensus, and an auto-ARIMA baseline as comparators. Over six months with four state-of-the-art LLM agents configured with web search, aggregate nowcast accuracy is broadly comparable to the institutional and professional benchmarks, with performance varying widely across individual indicators. This highlights LLM agents' potential as real-time estimators of macroeconomic conditions.
- Abstract(参考訳): 主要なマクロ経済指標、すなわち、公式公開前の現在の基準期間に対する指標の価値を見積もるのは金融政策や金融市場にとって非常に重要であり、中央銀行は専門家経済学者の専用チームをその見積もりに割いている。
大規模言語モデル (LLM) エージェントは,幅広い世界の知識をリアルタイムWeb検索と組み合わせて,機関の現在放送よりも高い頻度でクエリをサポートすることで,この課題に期待できる候補である。
GDPやCPIなどの見出し指標は、事前トレーニング中に広く報告され、記憶されている可能性が高いため、過去のリリースに対する評価はデータ汚染に弱い。
これを解決するために、LiveMacroEvalというライブな汚染耐性ベンチマークを導入し、LLMエージェントは、各公式リリースでリリース前のウィンドウを閉じた16の米国主要マクロ経済指標に対して、時間ごとの放送を作成できる。
米連邦準備制度理事会(FRB)のカウンセリング、ブルームバーグ・ECOSの専門的コンセンサス、オートアリバ(ARIMA)のベースラインをコンパレータとして、発表風の株価リターン(リターン)に対するLiveMacro Scoreと、ポリマーケット(ポリマーケット)スタイルのトレーディングを模擬したLiveBetting Scoreで評価される。
Web検索で設定された4つの最先端のLLMエージェントで6ヶ月にわたって、 nowcastの精度は機関のベンチマークとプロのベンチマークに大きく匹敵し、個々の指標によってパフォーマンスは様々である。
このことは、LLMエージェントがマクロ経済状態のリアルタイム推定者としての可能性を強調している。
関連論文リスト
- FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction [57.909515451254855]
FinDeepIndicatorは、エンドツーエンドの金融指標構築においてDeep Research(DR)エージェントを評価するための最初のベンチマークである。
DRエージェントを、公式仕様、データ収集、インジケータ計算、回答生成の4段階にわたって評価する。
米国と中国の両方の市場から抽出された3350のキュレートされた質問応答ペア、10年間の歴史的財務データ、800の上場企業が含まれている。
論文 参考訳(メタデータ) (2026-08-01T16:54:41Z) - Nexus : An Agentic Framework for Time Series Forecasting [72.73790673303154]
時系列予測は、ニュースやイベントのような構造化されていないコンテキストデータによる推論を必要とする。
予測を特殊なステージに分解するマルチエージェント予測フレームワークであるNexusを紹介します。
本研究では,現在のLLMは,従来よりも強い固有予測能力を有することを示す。
論文 参考訳(メタデータ) (2026-05-14T05:12:13Z) - CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News [21.498084305999992]
大規模言語モデル(LLM)は、静的自然言語処理(NLP)タスクから動的意思決定エージェントへと急速に移行している。
直接のライブトレーディングは非生産的であり、スキルに幸運を抱くことによって結果バイアスを起こす傾向にあるが、既存の静的ベンチマークはエンティティレベルの株式選択に限定され、より広範な市場注目を無視することが多い。
この研究は、一般的な推論と金融決定の整合性に関する新たな洞察を与え、持続可能な金融エージェントの研究を促進するために、すべてのデータ、コード、実験がリリースされる。
論文 参考訳(メタデータ) (2026-03-18T02:31:28Z) - PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction [47.70107097572211]
本稿では,ストック予測タスクを実行する大規模言語モデルを対象としたベンチマークであるPriceSeerを紹介する。
プライスシーアには11の産業セクターから110の米国株が含まれており、それぞれ249の歴史的データポイントが含まれている。
我々は、異なる予測地平の下で6つの最先端LCMを評価し、投資戦略を創出する可能性を実証した。
論文 参考訳(メタデータ) (2025-12-31T08:35:46Z) - CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency [60.83660377169452]
本稿では,Large Language Model (LLM)エージェントの現実的能力を厳格に評価するために設計された,最初の専門家による動的ベンチマークであるCryptoBenchを紹介する。
検索と予測のための汎用エージェントベンチマークとは異なり、プロの暗号分析は特定の課題を提示する。
論文 参考訳(メタデータ) (2025-11-29T09:52:34Z) - How AI Forecasts AI Jobs: Benchmarking LLM Predictions of Labor Market Changes [5.848712585343904]
本稿では,大規模言語モデル(LLM)が仕事需要の変化をどの程度予測できるかを評価するためのベンチマークを紹介する。
当社のベンチマークでは、米国におけるセクターレベルの求職率の高頻度指標と、AIの採用による職業変化のグローバルデータセットの2つのデータセットを組み合わせています。
その結果、構造化タスクは予測安定性を継続的に改善し、ペルソナプロンプトは短期的な傾向に有利であることがわかった。
論文 参考訳(メタデータ) (2025-10-27T14:08:27Z) - StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets? [44.10622904101254]
大規模言語モデル(LLM)は、最近、自律エージェントとして強力な能力を示した。
実時間複数ヶ月の株式トレーディング環境でLLMエージェントを評価するためのベンチマークであるStockBenchを紹介する。
我々の評価では、ほとんどのLLMエージェントは、単純な買い買い得ベースラインよりも優れているが、いくつかのモデルでは、より高いリターンをもたらし、より効果的にリスクを管理する可能性を実証している。
論文 参考訳(メタデータ) (2025-10-02T16:54:57Z) - FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction [92.7392863957204]
FutureXは、将来の予測のための最大かつ最も多様なライブベンチマークである。
リアルタイムの日次更新をサポートし、質問収集と回答収集のための自動パイプラインを通じてデータの汚染を取り除く。
推論,検索機能,外部ツールの統合などを含む25のLLM/エージェントモデルを評価した。
論文 参考訳(メタデータ) (2025-08-16T08:54:08Z) - Can We Reliably Predict the Fed's Next Move? A Multi-Modal Approach to U.S. Monetary Policy Forecasting [2.6396287656676733]
本研究では、構造化データと連邦準備制度の通信からの非構造化テキスト信号を統合することにより、予測精度を向上させることができるかどうかを検討する。
以上の結果から,ハイブリッドモデルは単調なベースラインを一貫して上回ることがわかった。
金融政策予測では、より単純なハイブリッドモデルは正確性と解釈可能性の両方を提供し、研究者と意思決定者に実用的な洞察を提供する。
論文 参考訳(メタデータ) (2025-06-28T05:54:58Z) - Macroeconomic Forecasting with Large Language Models [2.5234156040689233]
本稿では,従来のマクロ時系列予測手法と比較して,Large Language Models(LLM)の精度を評価する。
本研究は, LLMの長所と短所について, 実世界のシナリオにおける適用性に光を当てながら, マクロ経済時系列の予測における長所と短所について, 貴重な知見を提供するものである。
論文 参考訳(メタデータ) (2024-07-01T01:25:26Z) - Can ChatGPT Forecast Stock Price Movements? Return Predictability and Large Language Models [48.87381259980254]
我々は、ChatGPTのような大規模言語モデル(LLM)が、直接の金融トレーニングなしでニュースの見出しから株式市場の反応を予測する能力について文書化している。
GPT-4は、認識後カットオフの見出しを使って、最初の市場の反応を捉え、取引不能な初期反応に対して、ポートフォリオの1日当たりのヒット率を約90%達成している。
論文 参考訳(メタデータ) (2023-04-15T19:22:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。