論文の概要: When Does Text Inform? Benchmarking Information-Theoretic Metrics for Multimodal Time-Series Forecasting
- arxiv url: http://arxiv.org/abs/2609.11282v1
- Date: Thu, 10 Sep 2026 09:15:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.280347
- Title: When Does Text Inform? Benchmarking Information-Theoretic Metrics for Multimodal Time-Series Forecasting
- Title(参考訳): テキストはいつインフォームされるか? マルチモーダル時系列予測のための情報理論メトリクスのベンチマーク
- Abstract要約: 情報理論のメトリクスがアノテーションが提供する予測値を確実に測定できるかどうかを評価する。
我々は、意味論的に正しい、正しくない、無関係な3つのカテゴリにアノテーションを付加した合成時系列信号を作成する。
その結果、6つの推定器が正しいアノテーションを最も有益であると認識し、混合テキストコーパスの品質を評価できることが判明した。
- 参考スコア(独自算出の注目度): 3.2383538639888836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal forecasting models that combine time series with text annotations promise richer prediction through textual context, but how do we know whether a text annotation meaningfully contributes to the forecasters prediction? This is an information-theoretic question, but to evaluate whether information-theoretic metrics can reliably measure the predictive value an annotation provides, a ground truth benchmark is needed, and none currently exist. We create a synthetic time series signal with annotations in three categories: semantically correct, incorrect, and irrelevant. Because the data generation process is fully controlled, ground-truth information content is known exactly, enabling principled evaluation of six complementary mutual information estimators (KSG, MINE, InfoNCE, CCA, PID and V-information). We show that all six estimators identify correct annotations as most informative, and are able to audit the quality of mixed text corpora, choosing the annotations that result in the best downstream forecasting results without the need for model training. Our benchmark identifies limitations of each estimator, and these are validated on seven real-world datasets, which show how estimator performance differs on weak signals. Finally, we establish practical rules for implementing these metrics for annotation auditing and fusion selection.
- Abstract(参考訳): 時系列とテキストアノテーションを組み合わせたマルチモーダル予測モデルは、テキストコンテキストによるよりリッチな予測を約束するが、テキストアノテーションが予測者予測に有意義に寄与するかどうかをどのように知るか。
これは情報理論的な問題であるが、情報理論のメトリクスがアノテーションが提供する予測値を確実に測定できるかどうかを評価するためには、基礎となる真理ベンチマークが必要である。
我々は、意味論的に正しい、正しくない、無関係な3つのカテゴリにアノテーションを付加した合成時系列信号を作成する。
データ生成プロセスが完全に制御されているため、地平情報の内容が正確に把握され、6つの相補的相互情報推定器(KSG、MINE、InfoNCE、CA、PID、V情報)の原理的評価が可能となる。
その結果、6つの推定器が正しいアノテーションを最も有益であると認識し、混合テキストコーパスの品質を監査でき、モデルトレーニングを必要とせず、最高のダウンストリーム予測結果をもたらすアノテーションを選択することができることがわかった。
本ベンチマークでは,各推定器の限界を同定し,これらを実世界の7つのデータセットで検証し,評価器の性能が弱い信号とどのように異なるかを示す。
最後に,アノテーション監査と融合選択のために,これらのメトリクスを実装するための実用的なルールを確立する。
関連論文リスト
- Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - When Does Multimodality Lead to Better Time Series Forecasting? [96.26052272121615]
このようなマルチモーダルな統合が常に利益をもたらすかどうか、どのような条件で検討する。
その結果,マルチモーダリティの利点は条件に依存していることが判明した。
我々の研究は、マルチモーダリティが予測タスクに役立つことをいつ予測できるかを理解するための厳密で定量的な基礎を提供する。
論文 参考訳(メタデータ) (2025-06-20T23:55:56Z) - Context is Key: A Benchmark for Forecasting with Essential Textual Information [87.3175915185287]
コンテキスト is Key" (CiK) は、数値データを多種多様なテキストコンテキストと組み合わせた予測ベンチマークである。
我々は,統計モデル,時系列基礎モデル,LLMに基づく予測モデルなど,さまざまなアプローチを評価する。
提案手法は,提案するベンチマークにおいて,他の試験手法よりも優れる簡易かつ効果的なLCMプロンプト法である。
論文 参考訳(メタデータ) (2024-10-24T17:56:08Z) - Stochastic Online Conformal Prediction with Semi-Bandit Feedback [29.334511328067777]
実例が時間とともに現れるオンライン学習環境について検討し、その目標は予測セットを動的に構築することである。
本稿では,この設定を対象とする新しい共形予測アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-05-22T00:42:49Z) - Embroid: Unsupervised Prediction Smoothing Can Improve Few-Shot
Classification [20.85088711770188]
ラベル付きデータを追加せずに即時学習を改善することができることを示す。
組込み関数の異なるデータセットの複数の表現を演算するEmbroidを提案する。
Embroidはオリジナルのプロンプトよりも性能が大幅に向上することがわかった。
論文 参考訳(メタデータ) (2023-07-20T17:07:28Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - Temporal Knowledge Graph Forecasting Without Knowledge Using In-Context
Learning [23.971206470486468]
本稿では,関連する歴史的事実をプロンプトに変換し,トークン確率を用いてランキング予測を生成する枠組みを提案する。
驚いたことに、LLMは最先端のTKGモデルと同等に動作している。
また,エンティティ/リレーション名の代わりに数値指標を用いると,性能に悪影響を及ぼさないことも判明した。
論文 参考訳(メタデータ) (2023-05-17T23:50:28Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z) - Investigating Crowdsourcing Protocols for Evaluating the Factual
Consistency of Summaries [59.27273928454995]
要約に適用される現在の事前学習モデルは、ソーステキストを誤って表現したり、外部情報を導入したりする事実上の矛盾がちである。
評価ベースのLikertスケールとランキングベースのBest-Worst Scalingプロトコルを用いた,事実整合性のためのクラウドソーシング評価フレームワークを構築した。
ランキングベースのプロトコルは、データセット間の要約品質をより信頼性の高い尺度を提供するのに対して、Likertレーティングの信頼性はターゲットデータセットと評価設計に依存する。
論文 参考訳(メタデータ) (2021-09-19T19:05:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。