論文の概要: Large-scale dataset of automatically classified rhetorical sections in scientific papers
- arxiv url: http://arxiv.org/abs/2607.03381v1
- Date: Fri, 03 Jul 2026 14:37:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.601827
- Title: Large-scale dataset of automatically classified rhetorical sections in scientific papers
- Title(参考訳): 科学論文における自動的に分類された修辞節の大規模データセット
- Abstract要約: セマンティック・スカラー・オープン・リサーチ・コーポレーション(S2ORC)による数百万の科学論文に対するセクションレベルのアノテーションのデータセットを提示する。
規則に基づく分類アルゴリズムを用いて、1560万の論文に品質フィルタリングを施した後、主要なセクションを特定しラベル付けした。
データセットは主にSTEMの分野をカバーしており、医学や生物学において強い表現がある。
- 参考スコア(独自算出の注目度): 0.09558392439655013
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific papers follow rhetorical structures that organize content into sections such as Introduction, Methods, Results, and Discussion. Automatically identifying these sections at scale enables granular analysis of scientific writing patterns. We present a dataset of section-level annotations for millions of scientific papers from the Semantic Scholar Open Research Corpus (S2ORC). Using a rule-based classification algorithm, we identified and labeled major sections across 15.6 million papers after quality filtering. The dataset covers primarily STEM disciplines, with strong representation in medicine and biology. We provide comprehensive human and LLM-based validation showing that classifier agreement with human annotators is on par with human inter-annotator agreement. This dataset enables large-scale computational studies of scientific discourse and writing patterns.
- Abstract(参考訳): 科学論文は、導入、方法、結果、議論などのセクションにコンテンツを整理する修辞的な構造に従う。
これらのセクションを大規模に自動識別することで、科学的記述パターンの粒度解析が可能になる。
本稿では,セマンティック・スカラー・オープン・リサーチ・コーポレーション(S2ORC)の何百万もの科学論文を対象としたセクションレベルのアノテーションのデータセットを提案する。
規則に基づく分類アルゴリズムを用いて、1560万の論文に品質フィルタリングを施した後、主要なセクションを特定しラベル付けした。
データセットは主にSTEMの分野をカバーしており、医学や生物学において強い表現がある。
我々は,ヒトのアノテーションとの分類器合意が,ヒトのアノテーション間合意と同等であることを示す,包括的な人間およびLDMベースの検証を提供する。
このデータセットは、科学談話や筆記パターンの大規模計算研究を可能にする。
関連論文リスト
- Context-Aware Hierarchical Taxonomy Generation for Scientific Papers via LLM-Guided Multi-Aspect Clustering [59.54662810933882]
既存の分類体系の構築手法は、教師なしクラスタリングや大きな言語モデルの直接的プロンプトを利用しており、コヒーレンスと粒度の欠如が多かった。
LLM誘導型マルチアスペクト符号化と動的クラスタリングを統合したコンテキスト対応階層型階層型分類生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-23T15:12:58Z) - Are Large Language Models Good Classifiers? A Study on Edit Intent Classification in Scientific Document Revisions [62.12545440385489]
大規模言語モデル(LLM)は、テキスト生成の大幅な進歩をもたらしたが、分類タスクの強化の可能性はまだ未検討である。
生成と符号化の両方のアプローチを含む分類のための微調整LDMを徹底的に研究するためのフレームワークを提案する。
我々はこのフレームワークを編集意図分類(EIC)においてインスタンス化する。
論文 参考訳(メタデータ) (2024-10-02T20:48:28Z) - An Instance-based Plus Ensemble Learning Method for Classification of Scientific Papers [2.0794749869068005]
本稿では,科学論文の分類に事例ベース学習とアンサンブル学習を併用した新しい手法を提案する。
実験の結果,提案手法は論文を様々な研究領域に分類する上で効果的かつ効果的であることが示唆された。
論文 参考訳(メタデータ) (2024-09-21T19:42:15Z) - SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature [97.31347312130119]
SciRIFF(Scientific Resource for Instruction-Following and Finetuning)は、トレーニングと評価のための137K命令フォローインスタンスのデータセットで、54のタスクをカバーする。
これらのタスクは、情報抽出、要約、質問応答、クレーム検証、分類の5つの中核的な科学文献理解能力にまたがる。
SciRIFFは、さまざまな科学分野にわたる研究文献から情報を抽出し、合成するための、完全に専門家によって書かれた高品質な命令追跡データセットである。
論文 参考訳(メタデータ) (2024-06-10T21:22:08Z) - Integrating curation into scientific publishing to train AI models [1.6982459897303823]
我々は,複数モーダルデータキュレーションを学術出版プロセスに組み込んで,セグメント化された図形パネルやキャプションに注釈を付ける。
SourceData-NLPというデータセットには、620,000以上の注釈付きバイオメディカルエンティティが含まれている。
我々は、名前付き認識、図形キャプションを構成パネルに分割すること、コンテキスト依存型セマンティックタスクを用いて、AIモデルをトレーニングするためのデータセットの有用性を評価する。
論文 参考訳(メタデータ) (2023-10-31T13:22:38Z) - MuLMS-AZ: An Argumentative Zoning Dataset for the Materials Science
Domain [1.209268134212644]
AZ(Argumentative Zone)の分類は学術文書の処理を改善するために提案されている。
我々は、手動で注釈付けされた研究論文50点の新しいデータセットを提示し、リリースする。
論文 参考訳(メタデータ) (2023-07-05T14:55:18Z) - The Effect of Metadata on Scientific Literature Tagging: A Cross-Field
Cross-Model Study [29.965010251365946]
メタデータが19分野にわたる科学文献のタグ付けに与える影響を体系的に研究した。
全分野にわたるメタデータの効果のユビキタスなパターンを観察する。
論文 参考訳(メタデータ) (2023-02-07T09:34:41Z) - An Informational Space Based Semantic Analysis for Scientific Texts [62.997667081978825]
本稿では、意味分析のための計算手法と、短い科学的テキストの意味の定量化について紹介する。
科学的意味の表現は、心理的特性ではなく、状況表現を置き換えることで標準化される。
本研究は,テキストの意味の幾何学的表現の基礎となる研究である。
論文 参考訳(メタデータ) (2022-05-31T11:19:32Z) - Semantic Analysis for Automated Evaluation of the Potential Impact of
Research Articles [62.997667081978825]
本稿では,情報理論に基づくテキスト意味のベクトル表現のための新しい手法を提案する。
この情報意味論がLeicester Scientific Corpusに基づいてテキスト分類にどのように使用されるかを示す。
テキストの意味を表現するための情報的アプローチは,研究論文の科学的影響を効果的に予測する方法であることを示す。
論文 参考訳(メタデータ) (2021-04-26T20:37:13Z) - Segmenting Scientific Abstracts into Discourse Categories: A Deep
Learning-Based Approach for Sparse Labeled Data [8.635930195821265]
我々は、PubMedから構造化された抽象概念に基づいて深層ニューラルネットワークをトレーニングし、それを手書きのコンピュータサイエンス論文の小さなコーパスで微調整する。
本手法は,データが疎結合である抽象文の自動セグメンテーションにおいて,有望な解であると考えられる。
論文 参考訳(メタデータ) (2020-05-11T20:21:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。