論文の概要: STQA: A Benchmark for Stock-Focused Tabular Question Answering over Historical and Forecasted Data
- arxiv url: http://arxiv.org/abs/2609.06117v1
- Date: Sat, 05 Sep 2026 14:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:40:38.475285
- Title: STQA: A Benchmark for Stock-Focused Tabular Question Answering over Historical and Forecasted Data
- Title(参考訳): STQA: 歴史的および予測されたデータに対するストックフォーカス付き質問に対する回答ベンチマーク
- Abstract要約: STQA (Stock- Focus Tabular Question Answering) は,歴史データや数値予測,予測に基づく推論などに対する自然言語質問応答の評価を目的とした,エンドツーエンドのベンチマークである。
大規模な財務データセットに基づいて構築されたSTQAは,4,417株をカバーし,専門家が作成したテンプレートから派生した31,400の質問応答ペアと,詳細なインテントとスロットアノテーションを備えている。
- 参考スコア(独自算出の注目度): 9.31186349811686
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stock market analysis inherently requires composite reasoning over historical records and future projections, yet existing benchmarks remain fragmented across isolated tasks. We introduce STQA (Stock-focused Tabular Question Answering), an end-to-end benchmark designed to systematically evaluate natural-language question answering over historical data, numerical forecasts, and forecast-based reasoning. Built on a large-scale financial dataset, STQA covers 4,417 stocks and contains 31,400 question-answer pairs derived from expert-crafted templates, accompanied by fine-grained intent and slot annotations. To operationalize this benchmark, we present SQFRS (Stock Query-Forecast-Reasoning System), an agent-based unified framework that orchestrates SQL retrieval and time-series forecasting tools. Experiments demonstrate that while current large language models perform well on historical queries, forecast-based reasoning poses a substantial challenge, revealing critical bottlenecks in tool coordination and reasoning under uncertainty. The dataset and code are available at https://github.com/xuxubaobaoan/STQA_Project. STQA thus serves as a rigorous testbed for future research on trustworthy, tool-augmented financial agents.
- Abstract(参考訳): 株式市場の分析には、歴史的記録と将来の予測に対する複合的推論が必要であるが、既存のベンチマークは独立したタスクで断片化されている。
STQA (Stock- Focus Tabular Question Answering) は,歴史的データや数値予測,予測に基づく推論などに対する自然言語質問応答の体系的評価を目的とした,エンドツーエンドのベンチマークである。
大規模な財務データセットに基づいて構築されたSTQAは,4,417株をカバーし,専門家が作成したテンプレートから派生した31,400の質問応答ペアと,詳細なインテントとスロットアノテーションを備えている。
このベンチマークを運用するために、SQL検索と時系列予測ツールをオーケストレーションするエージェントベースの統合フレームワークであるSQFRS(Stock Query-Forecast-Reasoning System)を提案する。
実験では、現在の大きな言語モデルは過去のクエリでうまく機能するが、予測に基づく推論は重大な課題を生じさせ、ツールのコーディネーションや不確実性の下での推論において重大なボトルネックを明らかにしている。
データセットとコードはhttps://github.com/xuxubaobaoan/STQA_Projectで公開されている。
したがってSTQAは、信頼できるツール強化された金融エージェントに関する将来の研究のための厳格な試験場として機能する。
関連論文リスト
- ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning [21.778012103067805]
本稿では,将来データ予測と推論のための新しいタスク,オープンドメインタブラリ質問応答を導入する。
本稿では,不動産データを用いた時系列予測と予測に基づく推論シナリオを対象とした最初のデータセットを提案する。
論文 参考訳(メタデータ) (2026-06-01T16:06:20Z) - TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering [80.93487993878836]
現実世界のクエリの一般的なクラスは暗黙的に予測され、単に検索するのではなく、歴史的パターンから観測されていない回答を推測する必要がある。
これらのクエリには、潜在意図を認識することと、大規模テーブル上での信頼性の高い予測推論という2つの課題がある。
単点予測から意思決定,処理効果分析,複雑な推論に至るまで,4つのサブタスクにわたる779のサンプルからなるベンチマークであるTopBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-30T16:22:51Z) - It's TIME: Towards the Next Generation of Time Series Forecasting Benchmarks [87.7937890373758]
時系列基礎モデル(TSFM)は,特定のデータセットモデルから一般化可能なタスク評価に至るまで,予測環境に革命をもたらしている。
我々は、50の新しいデータセットと98の予測タスクからなる次世代タスク中心のベンチマークであるTIMEを紹介する。
静的なメタラベルに基づく従来のデータセットレベルの評価を超える新しいパターンレベルの評価視点を提案する。
論文 参考訳(メタデータ) (2026-02-12T16:31:01Z) - FinDER: Financial Dataset for Question Answering and Evaluating Retrieval-Augmented Generation [65.04104723843264]
ファイナンスにおけるRetrieval-Augmented Generation(RAG)に適したエキスパート生成データセットであるFinDERを提案する。
FinDERは、ドメインの専門家による検索関連証拠の注釈付けに重点を置いており、5,703のクエリ・エビデンス・アンサー・トリプルを提供している。
大きなコーパスから関連する情報を取得するためにモデルに挑戦することで、FinDERはRAGシステムを評価するためのより現実的なベンチマークを提供する。
論文 参考訳(メタデータ) (2025-04-22T11:30:13Z) - Expect the Unexpected: FailSafe Long Context QA for Finance [0.0]
FailSafeQAは、金融におけるヒューマン・インタフェース・インタラクションの6つのバリエーションに対して、LLMの堅牢性とコンテキスト認識性をテストするように設計されている。
我々は,Qwen2.5-72B-Instruct を用いた LLM-as-a-Judge 手法を採用し,ロバストネス,コンテキストグラウンド,コンプライアンススコアを24個のオフザシェルフモデルで定義・算出するために,きめ細かい評価基準を用いた。
論文 参考訳(メタデータ) (2025-02-10T10:29:28Z) - Retrieval-augmented Large Language Models for Financial Time Series Forecasting [29.769616823587594]
我々は、金融時系列予測のための新しいドメイン固有検索器FinSeerを備えた、最初の検索拡張世代(RAG)フレームワークであるFinSragを紹介する。
FinSeer は LLM フィードバックによって改良された候補選択機構と類似性駆動型トレーニング目標を活用し、財務ノイズを除去しながらクエリを歴史的に影響力のあるシーケンスと整合させる。
我々は、より広範な金融指標を統合する新しいデータセットをキュレートすることで、検索コーパスを強化し、これまで見過ごされていた市場のダイナミクスを捉えます。
論文 参考訳(メタデータ) (2025-02-09T12:26:05Z) - Context is Key: A Benchmark for Forecasting with Essential Textual Information [87.3175915185287]
コンテキスト is Key" (CiK) は、数値データを多種多様なテキストコンテキストと組み合わせた予測ベンチマークである。
我々は,統計モデル,時系列基礎モデル,LLMに基づく予測モデルなど,さまざまなアプローチを評価する。
提案手法は,提案するベンチマークにおいて,他の試験手法よりも優れる簡易かつ効果的なLCMプロンプト法である。
論文 参考訳(メタデータ) (2024-10-24T17:56:08Z) - Text2Analysis: A Benchmark of Table Question Answering with Advanced
Data Analysis and Unclear Queries [67.0083902913112]
高度な解析タスクを取り入れたText2Analysisベンチマークを開発した。
また,5つのイノベーティブかつ効果的なアノテーション手法を開発した。
3つの異なる指標を用いて5つの最先端モデルを評価する。
論文 参考訳(メタデータ) (2023-12-21T08:50:41Z) - QTSumm: Query-Focused Summarization over Tabular Data [58.62152746690958]
人々は主に、データ分析を行うか、特定の質問に答えるためにテーブルをコンサルティングします。
そこで本研究では,テキスト生成モデルに人間的な推論を行なわなければならない,クエリ中心のテーブル要約タスクを新たに定義する。
このタスクには,2,934テーブル上の7,111の人間注釈付きクエリ-サマリーペアを含む,QTSummという新しいベンチマークを導入する。
論文 参考訳(メタデータ) (2023-05-23T17:43:51Z) - A Benchmark for Generalizable and Interpretable Temporal Question
Answering over Knowledge Bases [67.33560134350427]
TempQA-WDは時間的推論のためのベンチマークデータセットである。
Wikidataは、最も頻繁にキュレーションされ、公開されている知識ベースである。
論文 参考訳(メタデータ) (2022-01-15T08:49:09Z) - ForecastQA: A Question Answering Challenge for Event Forecasting with
Temporal Text Data [43.400630267599084]
イベント予測は、人間が常に未来に向けて計画しようとするため、難しいが重要な課題である。
タスクを定式化し、データセットを構築し、大量の構造化されていないテキストデータを用いたイベント予測手法を開発するためのベンチマークを提供する。
BERTベースのモデルを用いてForecastQA実験を行い、データセット上で最高のモデルが60.1%の精度で達成していることを確認した。
論文 参考訳(メタデータ) (2020-05-02T11:03:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。