論文の概要: TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering
- arxiv url: http://arxiv.org/abs/2605.24703v1
- Date: Sat, 23 May 2026 19:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.338793
- Title: TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering
- Title(参考訳): TSスキル: 時系列質問回答における分析スキルの評価ベンチマーク
- Authors: Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan, Gaofeng Dong, Ozan Baris Mulayim, Sizhe Ma, Yuyang Yuan, Dezhi Hong, Mario Berges, Mani Srivastava,
- Abstract要約: 大きな言語モデル (LLM) と時系列言語モデル (TSLM) は、時系列質問応答 (TSQA) にますます応用されている。
既存のベンチマークは通常、タスクタイプまたはハイレベルな推論カテゴリによって構成される。
TSQAにおける3つの構成可能な分析スキルを評価するためのベンチマークであるTS-Skillを紹介する。
- 参考スコア(独自算出の注目度): 12.405025472599098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) and time-series language models (TSLMs) are increasingly applied to time-series question answering (TSQA). Unlike text-only QA, TSQA requires models to ground answers in temporal signals whose patterns may occur at different scales, specific time locations, or across separated intervals. However, existing benchmarks are typically organized by task types or high-level reasoning categories, making it difficult to diagnose the underlying signal-level capabilities driving model performance. We introduce TS-Skill, a controlled benchmark for evaluating three composable analytical skills in TSQA: temporal scale selection (SK1), temporal localization (SK2), and cross-interval integration (SK3). TS-Skill provides timestamp-aware questions, broad domain coverage, and human-validated QA quality. To construct the benchmark at scale, we develop SKEvol, a skill-guided agentic framework that combines domain-aware time-series seed generation, skill-controlled question generation, metadata- and code-assisted answer construction, multi-phase signal-grounded verification, and human-in-the-loop curation. Experiments on ten state-of-the-art LLMs and TSLMs reveal substantial and uneven capability gaps across SK1-SK3. In particular, SK3 remains consistently challenging for non-agent models, whereas tool-augmented agents show a selective advantage on standalone SK3. These findings demonstrate that skill-level evaluation can uncover temporal reasoning failures that are obscured by aggregate TSQA scores.
- Abstract(参考訳): 大規模言語モデル (LLM) と時系列言語モデル (TSLM) は、時系列質問応答 (TSQA) にますます応用されている。
テキストのみのQAとは異なり、TSQAは、異なるスケール、特定の時間位置、または分離された間隔でパターンが発生する可能性のある時間信号に答えを接地するモデルを必要とする。
しかし、既存のベンチマークは一般的にタスクタイプや高いレベルの推論カテゴリによって構成されるため、基礎となる信号レベル能力の診断が困難である。
本稿では,TSQAにおける3つの構成可能な分析スキル(時間スケール選択(SK1),時間局所化(SK2),時間間隔統合(SK3))を評価するための制御ベンチマークであるTS-Skillを紹介する。
TS-Skillはタイムスタンプ対応の質問、広範なドメインカバレッジ、人為的なQA品質を提供する。
このベンチマークを大規模に構築するために,ドメイン認識型時系列シード生成,スキル制御型質問生成,メタデータおよびコード支援型回答構築,マルチフェーズ信号グラウンド検証,ループ内キュレーションを組み合わせた,スキル誘導型エージェントフレームワークであるSKEvolを開発した。
SK1-SK3間の10種類の最先端LLMとTSLMの実験により、相当かつ不均一な機能ギャップが明らかとなった。
特に、SK3は非エージェントモデルでは一貫して困難であり、ツール拡張されたエージェントはスタンドアロンのSK3に対して選択的に有利である。
これらの結果から,TSQAスコアを集計することにより,時間的推論の失敗が明らかになる可能性が示唆された。
関連論文リスト
- TSAQA: Time Series Analysis Question And Answering Benchmark [85.35545785252309]
時系列データは、金融、医療、交通、環境科学といった分野における重要な応用に不可欠である。
TSAQAはタスクカバレッジを拡大し、多様な時間的分析能力を評価するために設計された新しい統合ベンチマークである。
論文 参考訳(メタデータ) (2026-01-30T17:28:56Z) - QuAnTS: Question Answering on Time Series [50.91478742616324]
時系列データに対する質問応答のための新しい時系列QAデータセットQuAnTSを提案する。
我々は、追跡された骨格軌道の形で、人間の動きに関する様々な疑問と答えを提示する。
大規模なQuAnTSデータセットは、広範囲な実験を通じて十分に形成され、包括的であることを検証する。
論文 参考訳(メタデータ) (2025-11-07T10:07:03Z) - BEDTime: A Unified Benchmark for Automatically Describing Time Series [8.466823017204641]
我々は、成功したマルチモーダルモデルは時系列の言語記述を認識し、区別し、生成することができるべきだと論じる。
次に、各タスクのモデルを評価する最初のベンチマークデータセットであるBEDTimeを作成します。
BEDTimeを用いて、13の最先端モデルを評価し、専用時系列基礎モデルの性能が著しく低下していることを見出した。
論文 参考訳(メタデータ) (2025-09-05T16:18:20Z) - Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models [38.12930048471948]
TDBenchは、タイムセンシティブな質問-回答ペアを体系的に構築する新しいベンチマークである。
時間精度と呼ばれるきめ細かい評価基準は、モデル説明における時間参照の有効性を評価する。
現代のLarge Language Modelsの実験では、スケーラブルで包括的なTSQA評価を実現する方法が示されています。
論文 参考訳(メタデータ) (2025-08-04T04:27:06Z) - Time-MQA: Time Series Multi-Task Question Answering with Context Enhancement [55.2439260314328]
Time Series Multi-Task Question Answering (Time-MQA)は、複数の時系列タスクにわたる自然言語クエリを可能にする統合フレームワークである。
Time-MQAの中心はTSQAデータセットである。
論文 参考訳(メタデータ) (2025-02-26T13:47:13Z) - TimeLogic: A Temporal Logic Benchmark for Video QA [64.32208175236323]
時間的論理的質問を自動的に生成するTimeLogic QA(TLQA)フレームワークを導入する。
私たちはSTAR、Breakfast、AGQA、CrossTaskの4つのデータセットを活用し、カテゴリ毎に2kと10kのQAペアを生成します。
時間的複雑性の異なる16カテゴリの時間論理に対して,ビデオQAモデルの時間的推論性能を評価する。
論文 参考訳(メタデータ) (2025-01-13T11:12:59Z) - UnSeenTimeQA: Time-Sensitive Question-Answering Beyond LLMs' Memorization [34.257914212541394]
本稿では,新しいデータ汚染のない質問応答ベンチマークUnSeenTimeQAを紹介する。
既存のTSQAベンチマークとは異なるのは、現実世界に根ざしたWeb検索可能なクエリを避けることだ。
大きな言語モデル(LLM)は、訓練前の段階で得られた事実知識に依存することなく、真の時間的推論を行う必要がある。
論文 参考訳(メタデータ) (2024-07-03T22:02:07Z) - Conditional Self-Attention for Query-based Summarization [49.616774159367516]
条件依存モデリング用に設計されたニューラルネットワークモジュールであるテキスト条件自己アテンション(CSA)を提案する。
DebatepediaとHotpotQAベンチマークデータセットの実験は、CSAがバニラトランスフォーマーを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2020-02-18T02:22:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。