論文の概要: EVENT5Ws: A Large Dataset for Open-Domain Event Extraction from Documents
- arxiv url: http://arxiv.org/abs/2604.21890v1
- Date: Thu, 23 Apr 2026 17:42:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.793814
- Title: EVENT5Ws: A Large Dataset for Open-Domain Event Extraction from Documents
- Title(参考訳): EVENT5Ws: ドキュメントからのオープンドメインイベント抽出のための大規模データセット
- Abstract要約: EVENT5Wsは、手動で注釈付けされ、統計的に検証されたオープンドメインイベント抽出データセットである。
我々は、最先端の事前訓練された大規模言語モデルを評価し、将来の研究のためのベンチマークを確立する。
- 参考スコア(独自算出の注目度): 0.15749416770494704
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Event extraction identifies the central aspects of events from text. It supports event understanding and analysis, which is crucial for tasks such as informed decision-making in emergencies. Therefore, it is necessary to develop automated event extraction approaches. However, existing datasets for algorithm development have limitations, including limited coverage of event types in closed-domain settings and a lack of large, manually verified dataset in open-domain settings. To address these limitations, we create EVENT5Ws , a large, manually annotated, and statistically verified open-domain event extraction dataset. We design a systematic annotation pipeline to create the dataset and provide empirical insights into annotation complexity. Using EVENT5Ws, we evaluate state-of-the-art pre-trained large language models and establish a benchmark for future research. We further show that models trained on EVENT5Ws generalize effectively to datasets from different geographical contexts, which demonstrates its potential for developing generalizable algorithms. Finally, we summarize the lessons learned during the dataset development and provide recommendations to support future large-scale dataset development.
- Abstract(参考訳): イベント抽出は、テキストからイベントの中心的な側面を特定する。
イベント理解と分析をサポートしており、緊急時の情報的意思決定などのタスクに不可欠である。
したがって,自動イベント抽出手法を開発する必要がある。
しかし、アルゴリズム開発のための既存のデータセットには、クローズドドメイン設定におけるイベントタイプの限定的なカバレッジや、オープンドメイン設定における大規模な手作業によるデータセットの欠如など、制限がある。
これらの制限に対処するために、大規模な手動注釈付き、統計的に検証されたオープンドメインイベント抽出データセットであるEVENT5Wsを作成します。
我々は、データセットを作成し、アノテーションの複雑さに関する経験的な洞察を提供するために、体系的なアノテーションパイプラインを設計する。
EVENT5Wsを用いて、最先端の訓練済みの大規模言語モデルを評価し、将来の研究のためのベンチマークを確立する。
さらに、EVENT5Wsで訓練されたモデルは、異なる地理的文脈からのデータセットに効果的に一般化できることを示し、一般化可能なアルゴリズムを開発する可能性を示している。
最後に、データセット開発で学んだ教訓を要約し、将来の大規模データセット開発をサポートするためのレコメンデーションを提供する。
関連論文リスト
- SpatialBench: Is Your Spatial Foundation Model an All-Round Player? [92.031716744172]
空間ベンチ(SpatialBench)は、決定論的サンプリングを伴う空間基盤モデルのための、クロスパラダイムなドメインディバースベンチマークである。
6つのパラダイムにまたがる41のモデルを4つの異なる入力密度設定の下で5つのタスクスイートで包括的に評価する。
厳密なドメインアライメントと高いデータ品質が、単純なデータセットスケーリングよりもパフォーマンスに極めて重要であることを示す。
論文 参考訳(メタデータ) (2026-05-26T17:59:20Z) - A Multimodal Text- and Graph-Based Approach for Open-Domain Event Extraction from Documents [0.0]
オープンドメインイベント抽出のための新しいアプローチであるMODEEを提案する。
グラフベースの学習とLLMからのテキストベースの表現を組み合わせて、文書レベルの推論をモデル化する。
大規模なデータセットに対する実証的な評価は、MODEEが最先端のオープンドメインイベント抽出アプローチより優れていることを示している。
論文 参考訳(メタデータ) (2026-04-23T17:33:44Z) - OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value [74.80873109856563]
OpenDataArena(ODA)は、トレーニング後のデータの本質的な価値をベンチマークするために設計された、総合的でオープンなプラットフォームである。
ODAは4つの主要な柱からなる包括的なエコシステムを確立している。 (i) 多様なモデル間で公平でオープンな比較を保証する統一的なトレーニング評価パイプライン、 (ii) 異なる軸数に沿ってデータ品質をプロファイリングする多次元スコアリングフレームワーク、 (iii) データセットの系図を視覚化してコンポーネントソースを識別するインタラクティブなデータ系統探索である。
論文 参考訳(メタデータ) (2025-12-16T03:33:24Z) - Forecasting Future International Events: A Reliable Dataset for Text-Based Event Modeling [37.508538729757404]
WorldREPは、大規模言語モデル(LLM)の高度な推論能力を活用することで制限に対処するために設計された、新しいデータセットである。
我々のデータセットは、高度なプロンプトモデリングと、政治学の領域の専門家による厳密な検証によって生成される高品質なスコアリングラベルを特徴としている。
データ収集、ラベル付け、ベンチマークのための完全な自動化ソースコードとともに、私たちのデータセットを公開し、テキストベースのイベント予測の研究を支援し、前進させることを目指しています。
論文 参考訳(メタデータ) (2024-11-21T11:44:23Z) - Enabling Advanced Land Cover Analytics: An Integrated Data Extraction Pipeline for Predictive Modeling with the Dynamic World Dataset [1.3757956340051605]
Dynamic Worldデータセットを扱うために、フレキシブルで効率的なエンドツーエンドパイプラインを提示します。
これには、ノイズ除去に取り組む前処理および表現フレームワーク、大量のデータの効率的な抽出、LULCデータの再表現が含まれる。
パイプラインのパワーを実証するために、都市化予測問題のためのデータを抽出し、優れたパフォーマンスで機械学習モデルのスイートを構築する。
論文 参考訳(メタデータ) (2024-10-11T16:13:01Z) - Capture the Flag: Uncovering Data Insights with Large Language Models [90.47038584812925]
本研究では,Large Language Models (LLMs) を用いてデータの洞察の発見を自動化する可能性について検討する。
そこで本稿では,データセット内の意味的かつ関連する情報(フラグ)を識別する能力を測定するために,フラグを捕捉する原理に基づく新しい評価手法を提案する。
論文 参考訳(メタデータ) (2023-12-21T14:20:06Z) - SCTc-TE: A Comprehensive Formulation and Benchmark for Temporal Event Forecasting [63.01035584154509]
私たちは完全に自動化されたパイプラインを開発し、約0.6百万のニュース記事からMidEast-TEという大規模なデータセットを構築しました。
このデータセットは、2015年から2022年まで、主に中東地域での協力と紛争イベントに焦点を当てている。
そこで本稿では,SCTc-TE予測にローカルコンテキストとグローバルコンテキストの両方を活用可能なLoGoを提案する。
論文 参考訳(メタデータ) (2023-12-02T07:40:21Z) - LargeST: A Benchmark Dataset for Large-Scale Traffic Forecasting [65.71129509623587]
道路交通予測はスマートシティのイニシアチブにおいて重要な役割を担い、ディープラーニングの力によって大きな進歩を遂げている。
しかし、現在の公開データセットで達成される有望な結果は、現実的なシナリオには適用できないかもしれない。
カリフォルニアで合計8,600のセンサーと5年間の時間カバレッジを含む、LargeSTベンチマークデータセットを紹介します。
論文 参考訳(メタデータ) (2023-06-14T05:48:36Z) - Coreset Sampling from Open-Set for Fine-Grained Self-Supervised Learning [10.57079240576682]
本稿では,大規模未ラベルのオープンセットが利用可能であるという前提の下で,オープンセットの自己改善型学習問題を新たに導入する。
問題設定では、オープンセットとターゲットデータセットの分布ミスマッチを考慮することが重要である。
実験により,SimCoreは表現学習性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2023-03-20T13:38:29Z) - Challenges for Open-domain Targeted Sentiment Analysis [21.61943346030794]
そこで本研究では、6,013個の人間ラベル付きデータからなる新しいデータセットを提案する。
また、文書中の完全な感情情報を抽出するためのネストされたターゲットアノテーションスキーマも提供します。
論文 参考訳(メタデータ) (2022-04-14T11:44:02Z) - Towards Inheritable Models for Open-Set Domain Adaptation [56.930641754944915]
本稿では、将来、ソースデータセットが存在しない場合の適応を容易にするために、ソース学習モデルを用いた実用的なドメイン適応パラダイムを提案する。
本稿では,ソースデータがない場合でも,対象領域に対して最適なソースモデルの選択を可能にするために,継承可能性の定量化を目的とする手法を提案する。
論文 参考訳(メタデータ) (2020-04-09T07:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。