論文の概要: Evaluating Generative Time-Series Models on Data with Point Masses
- arxiv url: http://arxiv.org/abs/2608.09692v1
- Date: Mon, 10 Aug 2026 14:57:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.323292
- Title: Evaluating Generative Time-Series Models on Data with Point Masses
- Title(参考訳): 点質量データに基づく生成時系列モデルの評価
- Abstract要約: このようなデータを慎重に評価するとどうなるか報告する。
標準的なローリングオリジンプロトコルは、データセットに似ていない原子構造を持つウィンドウ上でモデルをスコアすることができる。
自己回帰的ハードルは、6つのデータセットのうち5つの条件付きフローを最大133ドルまで上回る。
- 参考スコア(独自算出の注目度): 2.5536942228520814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many of the series that generative time-series models are benchmarked on place a large probability mass on a single value --- it does not rain, no ride is requested, no part is ordered. We report what happens when such data is evaluated carefully. First, the standard rolling-origin protocol can score a model on a window whose atom structure bears no resemblance to the dataset: on one benchmark the dataset is $42\%$ zeros and the evaluation windows are $13\%$, on another $47\%$ against $5\%$. This is not a cosmetic problem --- it reversed one of our own conclusions, turning the strongest occurrence model in our study into what looked like a cautionary tale. Second, we give a control in which CRPS is invariant \emph{by construction} while the temporal coupling is destroyed, which measures exactly how much that coupling contributes to a chosen statistic. Third, benchmarking seven models on a matched protocol over five seeds, an autoregressive hurdle beats a conditional flow on five of six datasets, by up to a factor of $153$, while the flow's own occurrence statistics vary by up to $62\%$ across training seeds and every baseline is deterministic. Finally, the model ordering is not the same under five different occurrence statistics, and the two that do not share a construction agree with each other least.
- Abstract(参考訳): 生成時系列モデルが1つの値に対して大きな確率質量の位置にベンチマークされるシリーズの多くは、雨が降らず、乗車が要求されず、一部が注文されない。
このようなデータを慎重に評価するとどうなるか報告する。
まず、標準的なローリングオリジンプロトコルは、データセットに似ていないウィンドウ上のモデルを評価することができる。あるベンチマークでは、データセットは42\%$0で、評価ウィンドウは13\%$で、さらに47%\%$対5\%$である。
これは化粧品の問題ではなく、私たちの結論の1つを逆転させ、我々の研究で最も強い発生モデルから、注意深い物語のように見えるものへと変えた。
第二に、CRPS が不変な 'emph{by construction} であるのに対して、時間的結合が破壊され、結合が選択された統計量にどの程度寄与するかを正確に測定する制御を与える。
第3に、マッチしたプロトコル上の7つのモデルを5つのシードでベンチマークすると、自己回帰的ハードルが6つのデータセットのうち5つの条件フローを最大153ドルまで上回り、フロー自体の発生統計はトレーニングシード全体で最大6,2\%まで変化し、すべてのベースラインは決定論的である。
最後に、モデル順序付けは5つの異なる発生統計の下では同一ではなく、構成を共有しない2つは互いにほとんど一致しない。
関連論文リスト
- A Fragility Spectrum for Recursive Language-Model Training [9.563027159959587]
異なるモデルが同じプロセスで非常に異なる振る舞いをすることを示す。
5世代後のユニークな4グラムの結果は、チェックポイント毎に0.187から0.940まで様々である。
共有プールの構成を変更したり、人文で混合したりすることで、スピアマンの順序の相関は0.91--0.97に保たれる。
論文 参考訳(メタデータ) (2026-09-10T06:56:22Z) - A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out [0.0]
時系列ファウンデーションモデルは、その前の公開アーカイブにのみ評価されるので、事前トレーニング中にテストセットを見たことから、強力なスコアを分離することはできない。
5つのドメインから引き出された7つのグループ上に、13の予測器(4つの古典的、3つの訓練されたデータセット、6つの事前訓練済み)を構築します。
このプロトコルの下で、事前訓練されたモデルは7つのグループのうち5つを獲得し、セタベースラインに1つを失う。
論文 参考訳(メタデータ) (2026-09-09T15:52:55Z) - Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling [0.0]
合成親和性ツールは、独立大規模言語モデル(LLM)エージェントとして各個人を動作させる。
このパラダイムには基本的な障害モードがあることを示し、分散優先の修正をそれに対して設定する。
論文 参考訳(メタデータ) (2026-07-17T15:45:57Z) - CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion [65.53153291902454]
コラボレーティブ・アセスメント(CollabEval)は、異なるモデルの歴史的実行間の依存関係を同じタスクで活用し、統計的効率を改善するための、シンプルで効果的で原則化された方法である。
スコア行列の低ランク近似を構築し、再構成された値を用いて真の評価基準平均の偏りのない推定を保証します。
その結果,CollabEval では,平均信頼区間サイズと点推定値の平均2乗誤差を,同じアノテーション予算における基準手法と比較して大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2026-07-06T13:22:04Z) - Self-Evolving Agents with Anytime-Valid Certificates [1.2691047660244335]
我々は,小型のステアリングアダプタとEmphfrozenベースモデルを中心としたバージョン付きハーネスに自己修正を限定するアーキテクチャである textbfSEA を提案する。
5つのループコントローラが発行された保証を構成しており、そのようなゲートは凍結されたベースが既に生成している動作の中でのみ選択できるため、5つの検証器・イン・ザ・ループ機構はゲートが必要とする高密度でグレーダフリーな信号を供給する。
結果は高価な評価で単回実行され、実行時から実行時までの分散を確認し、タスク毎のアルゴリズムの混合を適用することが今後の作業である。
論文 参考訳(メタデータ) (2026-07-01T12:34:52Z) - Towards Evaluating Data Priors for Tabular Foundation Models [74.75794086564035]
我々は、実際のデータセットから構築された公開事前および事前の統一インターフェースを実装している。
我々は、事前からトレーニングタスクを生成し、同じモデルアーキテクチャを固定されたトレーニングプロトコルでトレーニングし、共有下流分類タスクで得られたモデルを評価する。
以上の結果から,より強い絶対性能を達成できるものや,データセット間の相対的ランキングの一貫性が向上するものもある。
論文 参考訳(メタデータ) (2026-06-28T07:12:45Z) - Nous: A Predictive World Model for Long-Term Agent Memory [1.5229257192293202]
Nousは、知識は記憶ではなく予測である、という原則に基づく新しいエージェントメモリアーキテクチャである。
それぞれの観測は情報理論的サプライズS = -log2 P(obs | D)によって得られる。
第一に保存されたアーティファクトはデルタであり、事実そのものではなく、過去の信念へのシフトの記録である。
論文 参考訳(メタデータ) (2026-06-20T13:07:00Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - QuitoBench: A High-Quality Open Time Series Forecasting Benchmark [32.21290355342465]
時系列予測は、ファイナンス、ヘルスケア、クラウドコンピューティングにおいて重要である。
時系列予測のための状態バランスのベンチマークであるtextscQuitoBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-27T02:24:34Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - Beyond Invariance: Test-Time Label-Shift Adaptation for Distributions
with "Spurious" Correlations [44.99833362998488]
テスト時のデータ分散の変化は、予測モデルのパフォーマンスに有害な影響を及ぼす可能性がある。
本研究では,未ラベルサンプルに適用したEMを用いて,共同分布の$p(y, z)$の変化に適応するテストタイムラベルシフト補正を提案する。
論文 参考訳(メタデータ) (2022-11-28T18:52:33Z) - Automatic sleep stage classification with deep residual networks in a
mixed-cohort setting [63.52264764099532]
我々は,大規模コホートの一般化性を評価するために,新しいディープニューラルネットワークモデルを開発した。
総合的な分類精度はトレーニングデータの分数を増やして向上した。
論文 参考訳(メタデータ) (2020-08-21T10:48:35Z) - On the Discrepancy between Density Estimation and Sequence Generation [92.70116082182076]
log-likelihoodは、同じファミリー内のモデルを考えるとき、BLEUと非常に相関している。
異なる家族間でのモデルランキングの相関はみられない。
論文 参考訳(メタデータ) (2020-02-17T20:13:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。