論文の概要: When Directional Accuracy Lies: A Base-Rate-Honest Benchmark for LoRA-Adapted TimesFM on Equity Forecasting
- arxiv url: http://arxiv.org/abs/2607.12248v2
- Date: Wed, 15 Jul 2026 21:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.212968
- Title: When Directional Accuracy Lies: A Base-Rate-Honest Benchmark for LoRA-Adapted TimesFM on Equity Forecasting
- Title(参考訳): 方向精度が嘘をついたとき - LoRA適応TimeFMのベースレートのベンチマークをequity Forecastingで
- Authors: Taizhen Cheung,
- Abstract要約: 初期のLoRAアダプタは、およそ80%の方向精度に到達したようだ。
これはスキルの証拠ではありません。
セクターごとの特殊化は、単一のプールアダプタよりもかなり悪い。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large pretrained time-series models such as TimesFM are attractive for financial forecasting, but raw directional accuracy is a misleading scoreboard in equity markets. An early LoRA adapter in this project appeared to reach roughly 80% directional accuracy; we show this is not evidence of skill. Over a long horizon in a rising market, a trivial "always-up" rule attains comparably high accuracy without using the input at all. To separate genuine skill from this base-rate artifact, we build a reproducible, frozen-data benchmark with expanding walk-forward folds, a stratified held-out-ticker split, honest baselines (zero-shot TimesFM, always-up, random-walk, persistence, AR(1)), and paired significance tests (McNemar, Diebold-Mariano) under Benjamini-Hochberg FDR control. We apply the identical method to two universes -- a tech-heavy NASDAQ-100 and a broad S&P 500 -- reporting excess accuracy over the always-up base rate. Three findings replicate. First, when the historical ~80% condition is recreated, the high number is a base rate of ~0.70 that the fine-tuned model scores below. Second, pooled LoRA shows no directional skill over the base rate at any horizon on either universe (negative at the six-month horizon). Third, per-sector specialization is significantly worse than a single pooled adapter (Diebold-Mariano p<0.001 on held-out stocks at h=128). Fine-tuning's only measurable benefit is a statistically significant reduction in point-forecast error relative to zero-shot TimesFM, which nonetheless does not beat naive baselines and confers no tradeable directional edge. The contribution is methodological: a defensible, fully seeded protocol that prevents the base-rate trap, together with the replicated negative result it produces.
- Abstract(参考訳): TimesFMのような事前トレーニング済みの大規模な時系列モデルは、財務予測には魅力的だが、生の方向性の正確性は、株式市場において誤解を招くスコアボードである。
このプロジェクトの初期のLoRAアダプタは、およそ80%の方向精度に達したようだ。
上昇する市場の長い地平線上で、自明な"常にアップ"ルールは、入力を全く使わずに、可分に高い精度を達成する。
このベースレートのアーティファクトから真のスキルを分離するため,Benjamini-Hochberg FDR制御下での再現可能な凍結データベンチマーク,階層化されたホールト・アウト・ティカー分割,誠実なベースライン(ゼロショットTimeFM,常時アップ,ランダムウォーク,永続性,AR(1)),およびペア有意義テスト(McNemar,Diebold-Mariano)を構築した。
我々は、この手法を2つの宇宙 ― 技術に富んだNASDAQ-100と広いS&P 500 ― に適用し、常に上昇するベースレートよりも過度な正確さを報告した。
3つの発見が再現された。
第一に、歴史的 ~80% の条件が再現されたとき、高い数値は ~0.70 のベースレートであり、微調整されたモデルが下記のスコアである。
第2に、プールされたLoRAは、どちらの宇宙のどの地平線でも(6ヶ月の地平線では負の)ベースレートに対して、方向性のスキルを示さない。
第3に、セクターごとの特殊化は、単一のプールドアダプターよりも著しく悪い(h=128の保留在庫ではDiebold-Mariano p<0.001)。
ファインチューニングの唯一の測定可能な利点は、ゼロショットのTimesFMに対するポイント予測誤差の統計的に顕著な減少である。
このコントリビューションは方法論的であり、ベースレートトラップが生成する複製された負の結果とともに、防御可能な完全にシードされたプロトコルである。
関連論文リスト
- Full-range Binary Classifier Calibration for Stable Model Updates in Production [0.23689955632456086]
敵対的環境で実行される検出モデルは、良性分布が比較的安定している間に急速にドリフトする悪意のある分布に直面します。
既存のキャリブレーションプリミティブ上に構築されたFPR曲線全体を対象とする手法を提案する。
観察された相対FPR誤差は10%から0.1%FPRに、0.01%FPRに7.2%まで、少なくとも2.3%であった。
論文 参考訳(メタデータ) (2026-07-06T15:44:47Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - DADF: A Distribution-Aware Debiasing Framework for Watch-Time Regression in Recommender Systems [49.99655020662206]
DADFは、ウォッチタイムレグレッションのための分散対応のデバイアスフレームワークである。
公開ショートビデオベンチマークと大規模産業ランキングシステムを用いたDADFの評価を行った。
論文 参考訳(メタデータ) (2026-05-18T05:14:50Z) - Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models [108.26461635308796]
Rationale Consistencyは、モデルの推論プロセスと人間の判断のアライメントを定量化する、きめ細かい計量である。
我々のフロンティアモデルの評価では,最先端モデル間で合理的な一貫性が効果的に識別できることが示されている。
我々は、GenRMトレーニングの合理性一貫性と結果精度を組み合わせたハイブリッド信号を導入する。
論文 参考訳(メタデータ) (2026-02-04T15:24:52Z) - Going All-In on LLM Accuracy: Fake Prediction Markets, Real Confidence Signals [0.0]
検証可能な回答で100の数学と論理の質問を生成しました。
そして、ベースラインが正しく答えられるならば、各質問ベースラインペアに対して3つの予測モデルが予測された。
1条件当たりの予測は5,400回を超え、インセンティブランはわずかに高い精度を示した。
4万枚以上の賭けは99%、小賭け(1000枚)は74%の精度しか示さなかった。
論文 参考訳(メタデータ) (2025-12-01T19:04:25Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - vAttention: Verified Sparse Attention [100.98210818821688]
vAttentionは、ユーザが指定した$(epsilon, delta)$の近似精度保証(thus, confirmed)を備えた実用的なスパースアテンションメカニズムである。
vAttentionはデータセット間のスパースアテンションの質を大幅に改善することを示す。
モデルの品質を損なうことなく高速なデコードを実現するために、推論シナリオにデプロイすることができる。
論文 参考訳(メタデータ) (2025-10-07T08:46:08Z) - Time-Series Foundation AI Model for Value-at-Risk Forecasting [9.090616417812306]
この研究は、VaR(Value-at-Risk)のための時系列基礎AIモデルの性能を初めて分析したものである。
さまざまなデータセットで事前トレーニングされたファンデーションモデルは、最小限のデータを持つゼロショット設定で適用することができる。
微調整は精度を著しく向上させ、VaRにはゼロショットの使用が最適でないことを示す。
論文 参考訳(メタデータ) (2024-10-15T16:53:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。