論文の概要: Grounded Event Extraction from SEC 8-K Filings with a Fine-Grained Taxonomy
- arxiv url: http://arxiv.org/abs/2607.08346v1
- Date: Thu, 09 Jul 2026 10:50:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.503835
- Title: Grounded Event Extraction from SEC 8-K Filings with a Fine-Grained Taxonomy
- Title(参考訳): 細粒分類を用いたSEC8-Kフィリングからの地中イベント抽出
- Authors: Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike,
- Abstract要約: 119の事象の3階層分類に8-Kの開示をタグ付けする2段階システムを提案する。
2022年から2026年までの292,984件にシステムを適用すれば、601,088件のイベントタグが取得できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Form 8-K filings are the primary channel through which U.S. public companies disclose material events, but the SEC item codes attached to them are coarse: a single item spans routine administrative changes and chief executive departures, and many of the most market-moving disclosures fall into a catch-all item. Large language models make fine-grained labelling feasible at corpus scale, but only if the labels can be traced to the source text and shown to be reliable. We present a two-stage system that tags 8-K disclosures against a three-tier taxonomy of 119 event types. The first stage constrains output to valid taxonomy entries and anchors every tag to a verbatim quote via fuzzy n-gram validation; the second re-grades each cited quote against the category definition to produce a quality score. Applying the system to 292,984 filings from 2022 to 2026 yields 601,088 grounded event tags, which we release. Over 5,125 stratified tags, an LLM judge finds precision rises monotonically with the quality score, from 12% to 96%, while unsupported tags fall from 8% to near zero. Ablation shows the score is calibrated only when assigned in a dedicated second pass. An event study on unsigned abnormal returns confirms, without any language model, that the taxonomy separates economically distinct events sharing an item code.
- Abstract(参考訳): フォーム8-Kの申請は、米国公開企業が物質的な出来事を開示する主要なチャンネルであるが、SECの項目コードに添付されているものは粗悪である。
大規模言語モデルは、コーパススケールできめ細かなラベル付けを可能にするが、ラベルがソーステキストにトレースされ、信頼性があることが示される場合に限られる。
119の事象の3階層分類に8-Kの開示をタグ付けする2段階システムを提案する。
第1段階は、有効な分類項目に出力を制限し、ファジィn-gramバリデーションを介して各タグを動詞の引用にアンカーし、第2段階は、各引用された引用をカテゴリ定義に対して再グレードして品質スコアを生成する。
2022年から2026年にかけて292,984件にシステムを適用すれば、601,088件のイベントタグが得られます。
5125以上の階層化されたタグは、LCMの審査員が品質スコアが12%から96%まで単調に上昇するのに対して、サポート対象のタグは8%からほぼ0に低下する。
アブレーションは、スコアが専用第2パスに割り当てられた場合にのみ校正されることを示している。
符号なしの異常リターンに関する事象研究は、言語モデルなしでは、分類がアイテムコードを共有する経済的に異なる事象を分離することを確認する。
関連論文リスト
- Machine Learning for Coding Retail Product Names to Consumer-Price Categories: A Rule-plus-Bag-of-Words Pipeline with Reliability-Weighted Human-in-the-Loop Labeling [0.0]
本稿では,一般的な再現可能な手法としてのマッピングについて検討する。
我々は、アノテータが二項有効/再帰の判断を下す、Human-in-the-loopプロトコルを使用する。
モンテカルロのラベリングプロトコルに関する調査では、信頼性に富んだ投票がほぼ多数派を圧倒している。
論文 参考訳(メタデータ) (2026-06-01T09:59:29Z) - GRAB: A Risk Taxonomy--Grounded Benchmark for Unsupervised Topic Discovery in Financial Disclosures [7.099276510362394]
8,247件の書類から1.61万文の財務特化ベンチマークであるGRABを提示する。
ラベルは5つのマクロクラスの下にネストされた21のきめ細かいタイプに193の用語をマッピングするリスク分類に固定されている。
論文 参考訳(メタデータ) (2025-09-25T23:48:33Z) - Prompt Tuned Embedding Classification for Multi-Label Industry Sector Allocation [2.024620791810963]
本研究では,マルチラベルテキスト分類のためのPrompt Tuningとベースラインの性能をベンチマークする。
企業を投資会社の独自産業分類に分類するために適用される。
このモデルのパフォーマンスは、よく知られた企業とあまり知られていない企業の両方で一貫していることを確認します。
論文 参考訳(メタデータ) (2023-09-21T13:45:32Z) - Bridging the Gap between Model Explanations in Partially Annotated
Multi-label Classification [85.76130799062379]
偽陰性ラベルがモデルの説明にどのように影響するかを考察する。
本稿では,部分ラベルで学習したモデルの属性スコアを向上し,その説明をフルラベルで学習したモデルと類似させる。
論文 参考訳(メタデータ) (2023-04-04T14:00:59Z) - Exploiting Completeness and Uncertainty of Pseudo Labels for Weakly
Supervised Video Anomaly Detection [149.23913018423022]
弱教師付きビデオ異常検出は、ビデオレベルのラベルのみを用いて、ビデオ内の異常事象を特定することを目的としている。
2段階の自己学習法は擬似ラベルの自己生成によって著しく改善されている。
本稿では,自己学習のための完全性と不確実性を利用した強化フレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-08T05:53:53Z) - RankingMatch: Delving into Semi-Supervised Learning with Consistency
Regularization and Ranking Loss [3.5893231087319655]
ラベル付きデータに制限がある場合、ラベル付きデータを活用する上で、半教師付き学習(SSL)が重要な役割を果たす。
そこで我々は,摂動入力だけでなく,同じラベルを持つ入力間の類似性も考慮する新しい手法である RankingMatch を提案する。
当社の RankingMatch は,さまざまなラベル付きデータ量を持つ標準SSLベンチマークにおいて,最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2021-10-09T01:54:29Z) - Rethinking Pseudo Labels for Semi-Supervised Object Detection [84.697097472401]
物体検出に適した確実な擬似ラベルを導入する。
我々は,クラス不均衡問題を緩和するために,各カテゴリの擬似ラベルと再重み付き損失関数を生成するために使用する閾値を動的に調整する。
提案手法では,COCOのラベル付きデータのみを用いて,教師付きベースラインを最大10%改善する。
論文 参考訳(メタデータ) (2021-06-01T01:32:03Z) - Automatic Validation of Textual Attribute Values in E-commerce Catalog
by Learning with Limited Labeled Data [61.789797281676606]
そこで我々はMetaBridgeと呼ばれる新しいメタ学習潜伏変数アプローチを提案する。
限られたラベル付きデータを持つカテゴリのサブセットから、転送可能な知識を学ぶことができる。
ラベルのないデータで、目に見えないカテゴリの不確実性を捉えることができる。
論文 参考訳(メタデータ) (2020-06-15T21:31:05Z) - Few-shot Slot Tagging with Collapsed Dependency Transfer and
Label-enhanced Task-adaptive Projection Network [61.94394163309688]
本稿では,現在最先端の少数ショット分類モデルであるTapNetに基づくラベル強化タスク適応プロジェクションネットワーク(L-TapNet)を提案する。
実験結果から,本モデルは1ショット設定で14.64点のF1スコアで最強の少ショット学習ベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2020-06-10T07:50:44Z) - Unsupervised Person Re-identification via Multi-label Classification [55.65870468861157]
本稿では,教師なしのReIDを多ラベル分類タスクとして定式化し,段階的に真のラベルを求める。
提案手法は,まず,各人物画像に単一クラスラベルを割り当てることから始まり,ラベル予測のために更新されたReIDモデルを活用することで,多ラベル分類へと進化する。
マルチラベル分類におけるReIDモデルのトレーニング効率を高めるために,メモリベースマルチラベル分類損失(MMCL)を提案する。
論文 参考訳(メタデータ) (2020-04-20T12:13:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。