論文の概要: A Benchmark Framework for Screening Automation in Systematic Reviews
- arxiv url: http://arxiv.org/abs/2609.30298v2
- Date: Mon, 28 Sep 2026 16:41:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.133556
- Title: A Benchmark Framework for Screening Automation in Systematic Reviews
- Title(参考訳): システムレビューにおける自動スクリーニングのためのベンチマークフレームワーク
- Abstract要約: 本稿では,大規模言語モデル(LLM)を体系的レビュー(SR)で評価するための,45,064ドルのラベル付きエントリのベンチマークデータセットを提案する。
これは、クラス不均衡、すなわちSRに含まれる記事と比較して除外された記事の自然発生率を考慮に入れた評価フレームワークを提案する。
また、PLMベースのスクリーニングのための迅速な実験、実験管理、結果分析をサポートするために設計されたPromptSRも導入されている。
- 参考スコア(独自算出の注目度): 0.9569208373364794
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Systematic reviews (SR) are essential for evidence-based research, but their screening phase is highly time-consuming and labor-intensive. Large language models (LLMs) offer a promising opportunity to reduce this workload by assisting with article relevance classification. However, existing evaluation approaches often rely on traditional metrics that may be misleading for highly imbalanced SR screening datasets. This paper presents a benchmark dataset of $45\,064$ labeled entries for evaluating LLM performance in SR screening across 32 curated secondary studies. It proposes an evaluation framework that accounts for class imbalance, i.e., the natural prevalence of excluded articles relative to included articles in SRs. It also introduces PromptSR, a tool designed to support prompt experimentation, experiment management, and result analysis for LLM-based screening. We also present a use case demonstrating the application of SRBench and PromptSR.
- Abstract(参考訳): システムレビュー(SR)はエビデンスベースの研究には不可欠であるが、スクリーニングフェーズは非常に時間がかかり、労働集約的である。
大型言語モデル(LLM)は、記事の関連分類を支援することで、このワークロードを減らすための有望な機会を提供する。
しかし、既存の評価アプローチは、しばしば、高度に不均衡なSRスクリーニングデータセットに対して誤解を招く可能性のある従来のメトリクスに依存している。
SR検定におけるLLM性能を評価するために, ラベル付き45,064ドルのベンチマークデータセットを提案する。
これは、クラス不均衡、すなわちSRに含まれる記事と比較して除外された記事の自然発生率を考慮に入れた評価フレームワークを提案する。
また、PLMベースのスクリーニングのための迅速な実験、実験管理、結果分析をサポートするために設計されたPromptSRも導入されている。
また,SRBenchとPromptSRの適用例を示した。
関連論文リスト
- Deliberate Evolution: Agentic Reasoning for Sample-Efficient Symbolic Regression with LLMs [52.89778838903305]
Deliberate Evolution (DE) は、検索制御からシンボル生成を分離するエージェントフレームワークである。
LLM-SRBenchの実験では、DEMは様々な科学領域でLLMベースのSRベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-03T02:22:16Z) - LLM4SCREENLIT: Recommendations on Assessing the Performance of Large Language Models for Screening Literature in Systematic Reviews [2.2175470459999636]
我々は、系統的なレビューにおいて、関連する文献を特定するために、Gen-AIツールのパフォーマンスを評価するために伝統的なメトリクスを使用する際の問題を特定する。
主な弱点は、不均衡なデータに対して堅牢で、結果が偶然よりも優れているかどうかを直接示さないメトリクスを使用できないことであった。
ポジティブな面では、研究者や実践者や政策立案者に対する勧告が構築される優れた(評価)プラクティスを抽出する。
論文 参考訳(メタデータ) (2025-11-16T15:04:50Z) - SSR: Socratic Self-Refine for Large Language Model Reasoning [78.62319252287938]
Socratic Self-Refine (SSR)は、大規模言語モデル(LLM)のきめ細かい評価と精度向上のための新しいフレームワークである。
提案したSSRはモデル応答を検証可能な(サブクエスト,サブサブアンサー)ペアに分解し,ステップレベルの信頼度推定を可能にする。
5つの推論ベンチマークと3つのLCMによる実証的な結果から、SSRは一貫して最先端の反復的自己修正ベースラインを上回っていることが分かる。
論文 参考訳(メタデータ) (2025-11-13T18:47:07Z) - SESR-Eval: Dataset for Evaluating LLMs in the Title-Abstract Screening of Systematic Reviews [0.9421843976231371]
我々は,大言語モデル (LLM) の性能を評価するためのベンチマークデータセットを,体系的レビュー (SR) のタイトル別スクリーニングプロセスで作成する。
ソフトウェア工学(SE)ジャーナルに掲載された24の二次研究から,34,528のラベル付き一次研究を含むSESR-Evalデータセットを提案する。
我々のベンチマークは、ソフトウェア工学におけるSRのスクリーニングタスクにおけるAIパフォーマンスのモニタリングを可能にする。
論文 参考訳(メタデータ) (2025-07-25T07:27:03Z) - LGAR: Zero-Shot LLM-Guided Neural Ranking for Abstract Screening in Systematic Literature Reviews [0.9314555897827079]
体系的な文献レビューは、トピックに関するすべての関連論文を特定し評価することを目的としている。
現在までに、大型言語モデル(LLM)を用いた抽象的なスクリーニング手法はバイナリ分類設定に重点を置いている。
ゼロショットLLMガイド付き抽象ランクラであるLGARを提案する。
論文 参考訳(メタデータ) (2025-05-30T16:18:50Z) - RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework [66.93260816493553]
本稿では,様々なシナリオにまたがってRAGシステムを評価するためのフレームワークであるRAGvalを紹介する。
事実の正確性に焦点をあてて,完全性,幻覚,不適切性の3つの新しい指標を提案する。
実験結果から, RAGEvalは, 生成した試料の明瞭度, 安全性, 適合性, 豊かさにおいて, ゼロショット法とワンショット法より優れていた。
論文 参考訳(メタデータ) (2024-08-02T13:35:11Z) - Coverage-based Example Selection for In-Context Learning [27.215972147196805]
BERTScore-Recall (BSR) がテスト入力の健全な側面をよりよく示すより良い例を選択していることを示す。
6つのタスクにまたがる15のデータセットと7つの LLM に対して、(1) BSR は、ボード全体のコンテキスト内サンプル選択において優れた指標であり、(2) 構成タスクでは、Set-BSR は、平均17ポイントまで独立したランキングを上回ります。
論文 参考訳(メタデータ) (2023-05-24T08:58:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。