論文の概要: DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods
- arxiv url: http://arxiv.org/abs/2607.15879v2
- Date: Mon, 20 Jul 2026 07:05:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.764749
- Title: DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods
- Title(参考訳): DECODEM:強化手法による企業組織文書からのデータ抽出
- Authors: Jens Frankenreiter,
- Abstract要約: 本稿では,組織文書からコーポレートガバナンス変数の自動抽出を評価するためのベンチマークデータセットであるDECODEMを紹介する。
ベンチマークでは、ランダムにサンプル化した企業憲章と、実証的な作業でよく研究されるさまざまなガバナンス条項をカバーする高品質な人事アノテーションが組み合わされた。
その結果, 自動抽出は多くの条件に対して高い精度で実現可能であり, アプローチを横断する上界付近では中央値の性能が向上することが示唆された。
- 参考スコア(独自算出の注目度): 2.0789144738685956
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Much empirical legal research depends on translating unstructured text into structured variables. In corporate governance research as elsewhere, this translation has traditionally relied on human coding of documents such as charters and bylaws, a process that is costly, difficult to scale, and often opaque. This paper introduces DECODEM, a set of benchmark datasets for evaluating the automated extraction of corporate governance variables from organizational documents. The benchmarks pair randomly sampled corporate charters and bylaws with high-quality human annotations covering a range of governance provisions commonly studied in empirical work. Using these datasets, the paper evaluates several large-language-model extraction pipelines that vary in prompt design, task decomposition, and document handling. The underlying task consists of a set of document-level binary classification problems, one for each governance variable. The results show that automated extraction is feasible at a high level of accuracy for many provisions, with median performance near the upper bound across approaches. At the same time, performance varies systematically across variables, with a small number of provisions accounting for most of the remaining errors. More elaborate prompting strategies and cascading pipelines do not consistently improve performance for frontier models, but substantially narrow the gap between frontier and efficiency-oriented models in some settings, suggesting that pipeline design can partly substitute for model capability. By providing a standardized benchmark and a systematic evaluation of extraction methods, the paper demonstrates that current frontier models can extract legally meaningful information from complex corporate documents with high accuracy and suggests an important future role for automated feature extraction in constructing corporate governance datasets.
- Abstract(参考訳): 多くの実証法的研究は、構造化されていないテキストを構造化された変数に変換することに依拠している。
コーポレートガバナンスの研究では、この翻訳は伝統的にチャーターや法規などの文書の人間のコーディングに依存しており、コストがかかり、スケールが難しく、しばしば不透明である。
本稿では,組織文書からコーポレートガバナンス変数の自動抽出を評価するためのベンチマークデータセットであるDECODEMを紹介する。
ベンチマークでは、ランダムにサンプル化した企業憲章と、実証的な作業でよく研究されるさまざまなガバナンス条項をカバーする高品質な人事アノテーションが組み合わされた。
これらのデータセットを用いて, 素早い設計, タスク分解, 文書処理の異なる大規模言語モデル抽出パイプラインを評価した。
基礎となるタスクは、ドキュメントレベルのバイナリ分類問題の集合から成っている。
その結果, 自動抽出は多くの条件に対して高い精度で実現可能であり, アプローチを横断する上界付近では中央値の性能が向上することが示唆された。
同時に、性能は変数によって体系的に変化し、残りのエラーの大部分を少数の規定が考慮している。
より精巧なプロンプト戦略とカスケードパイプラインは、フロンティアモデルのパフォーマンスを一貫して改善するわけではないが、一部の設定ではフロンティアモデルと効率指向モデルの間のギャップを著しく狭め、パイプライン設計が部分的にモデルの能力に取って代わる可能性があることを示唆している。
標準化されたベンチマークと抽出手法の体系的評価を提供することにより、現在のフロンティアモデルは、複雑な企業文書から法的に意味のある情報を高精度に抽出できることを示し、企業ガバナンスデータセット構築における自動特徴抽出の重要な役割を示唆する。
関連論文リスト
- DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding [63.257540233507626]
本稿では、構造化解析、局所化、推論のワークフローを実行するためにモデルを必要とするパラダイムを提案する。
ショートページトレーニングから超長文書への堅牢な一般化を示し、視覚的検索・拡張生成システムと自然に相乗効果を示す。
論文 参考訳(メタデータ) (2026-04-14T14:39:26Z) - DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM [35.910677096654574]
文書解析は、構造化されていないPDF画像を半構造化データに変換することを目的としており、多様な領域における情報のデジタル化と活用を容易にする。
一般的なプラクティスは、しばしば標準ベンチマークで最高のパフォーマンスモデルを選択する。
本稿では,文書解析評価をきめ細かな誤り検出と解析として形式化するDOCR-Inspectorを紹介する。
論文 参考訳(メタデータ) (2025-12-11T13:16:33Z) - GLiDRE: Generalist Lightweight model for Document-level Relation Extraction [1.8628821924525962]
文書レベルの関係抽出のための新しいコンパクトモデルであるGLiDREを導入する。
低リソースの教師付きトレーニングと数ショットのメタラーニングベンチマークの両方の実験は、我々のアプローチがデータ制約のあるシナリオにおいて既存の手法よりも優れていることを示している。
私たちのコードは公開されます。
論文 参考訳(メタデータ) (2025-08-01T16:33:13Z) - Leveraging Machine Learning and Enhanced Parallelism Detection for BPMN Model Generation from Text [75.77648333476776]
本稿では、テキストからBPMNモデルを抽出する自動パイプラインについて紹介する。
この研究の重要な貢献は、新たに注釈付けされたデータセットの導入である。
モデルトレーニング用の32のパラレルゲートウェイを含む15の注釈付き文書でデータセットを増強する。
論文 参考訳(メタデータ) (2025-07-11T07:25:55Z) - Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking [58.69615583599489]
Deliberate Thinking based Retriever (Debater) は、段階的な思考プロセスを導入することで文書表現を強化する新しいアプローチである。
Debaterは、いくつかのベンチマークで既存のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-18T15:56:34Z) - Summarizing long regulatory documents with a multi-step pipeline [2.2591852560804675]
長い規則文を要約するための2段階アーキテクチャの有効性は、使用するモデルによって異なることを示す。
コンテクスト長の短い抽象エンコーダ・デコーダモデルでは抽出ステップの有効性が異なるが、長文エンコーダ・デコーダモデルでは抽出ステップが性能を悪化させる。
論文 参考訳(メタデータ) (2024-08-19T08:07:25Z) - Efficient Classification of Long Documents Using Transformers [13.927622630633344]
様々なベースラインと多様なデータセットに対して測定された相対的有効性を評価する。
結果として、より複雑なモデルは、単純なベースラインを上回り、データセット間で一貫性のないパフォーマンスを得ることができないことがしばしば示される。
論文 参考訳(メタデータ) (2022-03-21T18:36:18Z) - Long Document Summarization with Top-down and Bottom-up Inference [113.29319668246407]
本稿では、2つの側面の要約モデルを改善するための原則的推論フレームワークを提案する。
我々のフレームワークは、トップレベルが長距離依存性をキャプチャするドキュメントの階層的な潜在構造を前提としています。
本稿では,様々な要約データセットに対して提案手法の有効性を示す。
論文 参考訳(メタデータ) (2022-03-15T01:24:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。