論文の概要: Less is More: Quality-Aware Training Data Selection for Scientific Summarization
- arxiv url: http://arxiv.org/abs/2606.24828v1
- Date: Tue, 23 Jun 2026 17:12:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:49.128356
- Title: Less is More: Quality-Aware Training Data Selection for Scientific Summarization
- Title(参考訳): 科学的な要約のための品質に配慮したトレーニングデータ選択
- Authors: Maria Nefeli Paraskevopoulou, Tatiana Passali, Grigorios Tsoumakas,
- Abstract要約: 我々は,長期文書要約のための生物医学・生命科学のデータセットとして,最大規模のデータセットをリリースする。
著者が書いた要約は、記事全体と一致し、これらの品質信号がトレーニングデータの選択をガイドできることを示します。
その結果, 基準品質は科学的要約の重要な要因であり, 品質に配慮したデータ選択が訓練効率を向上させることが示唆された。
- 参考スコア(独自算出の注目度): 4.893896929103367
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific long-document summarization datasets commonly treat author-written abstracts as gold reference summaries, although their quality and alignment with the source article vary. At the same time, publicly available scientific summarization datasets remain limited in scale and structure for modern long-context models. In this work, we address both challenges by a) constructing and releasing one of the largest biomedical and life science datasets for long-document summarization, containing 1.88 million PMC articles, and b) analyzing the reference quality of author-written abstracts with source-grounded and model-based metrics. We show that author-written abstracts vary in their alignment with the full article and that these quality signals can guide training-data selection. Training on selected high-quality subsets outperforms random sampling at matched training sizes and can match or exceed larger random subsets on factuality-oriented metrics. Our findings suggest that reference quality is an important factor in scientific summarization and that quality-aware data selection can improve training efficiency.
- Abstract(参考訳): 科学的な長期文書要約データセットは、著者が書いた要約をゴールド・リファレンス・サマリーとして扱うのが一般的であるが、その品質とソース・記事との整合性は異なる。
同時に、現在利用可能な科学的要約データセットは、現代長文モデルのスケールと構造に制限されている。
本研究では,両課題に対処する。
a) 長期文書要約のための最大の生物医学・生命科学データセットの1つを構築し、公開し、その1つであって、188万のPMC記事を含むもの
b) 著者による要約の基準品質を、ソースグラウンドおよびモデルベースメトリクスを用いて分析すること。
著者が書いた要約は、記事全体と一致し、これらの品質信号がトレーニングデータの選択をガイドできることを示します。
選択された高品質なサブセットのトレーニングは、一致したトレーニングサイズでランダムサンプリングを上回り、ファクトリティ指向のメトリクスでより大きなランダムサブセットにマッチまたは超過することができる。
その結果, 基準品質は科学的要約の重要な要因であり, 品質に配慮したデータ選択が訓練効率を向上させることが示唆された。
関連論文リスト
- Are Large Language Models Good Classifiers? A Study on Edit Intent Classification in Scientific Document Revisions [62.12545440385489]
大規模言語モデル(LLM)は、テキスト生成の大幅な進歩をもたらしたが、分類タスクの強化の可能性はまだ未検討である。
生成と符号化の両方のアプローチを含む分類のための微調整LDMを徹底的に研究するためのフレームワークを提案する。
我々はこのフレームワークを編集意図分類(EIC)においてインスタンス化する。
論文 参考訳(メタデータ) (2024-10-02T20:48:28Z) - SurveySum: A Dataset for Summarizing Multiple Scientific Articles into a Survey Section [7.366861473623427]
本稿では,複数の学術論文を要約した新しいデータセットについて紹介する。
筆者らの貢献は,(1)ドメイン固有の要約ツールのギャップに対処する新しいデータセットであるサーベイサム,(2)科学論文を1つのセクションにまとめる2つの特定のパイプライン,(3)これらのパイプラインの評価を複数の指標を用いて比較することである。
論文 参考訳(メタデータ) (2024-08-29T11:13:23Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - ACLSum: A New Dataset for Aspect-based Summarization of Scientific
Publications [10.529898520273063]
ACLSumは、ドメインの専門家によって慎重に作成され、評価される新しい要約データセットである。
以前のデータセットとは対照的に、ACLSumは科学論文のマルチアスペクト要約を容易にする。
論文 参考訳(メタデータ) (2024-03-08T13:32:01Z) - Exploring Precision and Recall to assess the quality and diversity of LLMs [82.21278402856079]
我々はtextscLlama-2 や textscMistral のような大規模言語モデル (LLM) のための新しい評価フレームワークを提案する。
このアプローチにより、コーパスの整合を必要とせず、生成したテキストの品質と多様性を微妙に評価できる。
論文 参考訳(メタデータ) (2024-02-16T13:53:26Z) - QuRating: Selecting High-Quality Data for Training Language Models [64.83332850645074]
データ品質に関する人間の直感をキャプチャできる事前学習データを選択するQuRatingを導入する。
本稿では,書体,専門知識,事実とトリビア,教育的価値の4つの特性について検討する。
ペアの判断からスカラー評価を学習するためにQurモデルをトレーニングし、それを4つの基準ごとに品質評価付き260Bのトレーニングコーパスにアノテートするために使用します。
論文 参考訳(メタデータ) (2024-02-15T06:36:07Z) - A Novel Metric for Measuring Data Quality in Classification Applications
(extended version) [0.0]
データ品質を測定するための新しい指標を紹介し説明する。
この尺度は、分類性能とデータの劣化の相関した進化に基づいている。
各基準の解釈と評価レベルの例を提供する。
論文 参考訳(メタデータ) (2023-12-13T11:20:09Z) - Entity-driven Fact-aware Abstractive Summarization of Biomedical
Literature [3.977582258550673]
本稿では, エンド・ツー・エンド・エンド・トランスフォーマーに基づくエンコーダ・デコーダ・モデルを用いて, バイオメディカル・アーティクルの抽象的な要約を学習するためのエンティティ駆動型ファクト・アウェア・フレームワークを提案する。
我々は5つの最先端変換器モデルを用いて実験を行う。
提案手法はICD-11-Summ-1000とPubMed-50kで評価される。
論文 参考訳(メタデータ) (2022-03-30T00:34:56Z) - Method and Dataset Entity Mining in Scientific Literature: A CNN +
Bi-LSTM Model with Self-attention [21.93889297841459]
MDERと呼ばれる新しいエンティティ認識モデルを提案し、科学的論文から効果的にメソッドとデータセットを抽出することができる。
我々は,NLP,CV,データマイニング,AIの4つの研究分野の論文から構築したデータセットのモデルを評価する。
論文 参考訳(メタデータ) (2020-10-26T13:38:43Z) - Improving Zero and Few-Shot Abstractive Summarization with Intermediate
Fine-tuning and Data Augmentation [101.26235068460551]
大規模テキストコーパス上での自己教師対象による事前学習モデルは、英語テキスト要約タスクにおける最先端のパフォーマンスを達成する。
モデルは通常、数十万のデータポイントで微調整されるが、これは新しいニッチなドメインに要約を適用する際に、実現不可能な要件である。
我々は、教師なし、データセット固有の方法で要約のための訓練済みモデルを微調整するための、WikiTransferと呼ばれる新しい一般化可能な手法を紹介した。
論文 参考訳(メタデータ) (2020-10-24T08:36:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。