論文の概要: MasterSet: A Large-Scale Benchmark for Must-Cite Citation Recommendation in the AI/ML Literature
- arxiv url: http://arxiv.org/abs/2604.17680v1
- Date: Mon, 20 Apr 2026 00:34:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.635881
- Title: MasterSet: A Large-Scale Benchmark for Must-Cite Citation Recommendation in the AI/ML Literature
- Title(参考訳): MasterSet: AI/ML文学におけるマスタチェーン引用推奨のための大規模ベンチマーク
- Authors: Md Toyaha Rahman Ratul, Zhiqian Chen, Kaiqun Fu, Taoran Ji, Lei Zhang,
- Abstract要約: MasterSetは、AI/MLドメインで必須のレコメンデーションを評価するために設計された大規模なベンチマークである。
15の主要な会場の公的な会議手続きやWebサイトから収集された15万以上の論文が組み込まれている。
ベンチマークタスクでは、クエリペーパーのタイトルと抽象性のみを考慮すれば、候補プールから必須論文を取得する必要がある。
- 参考スコア(独自算出の注目度): 14.082854604879572
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The explosive growth of AI and machine learning literature -- with venues like NeurIPS and ICLR now accepting thousands of papers annually -- has made comprehensive citation coverage increasingly difficult for researchers. While citation recommendation has been studied for over a decade, existing systems primarily focus on broad relevance rather than identifying the critical set of ``must-cite'' papers: direct experimental baselines, foundational methods, and core dependencies whose omission would misrepresent a contribution's novelty or undermine reproducibility. We introduce MasterSet, a large-scale benchmark specifically designed to evaluate must-cite recommendation in the AI/ML domain. MasterSet incorporates over 150,000 papers collected from official conference proceedings/websites of 15 leading venues, serving as a comprehensive candidate pool for retrieval. We annotate citations with a three-tier labeling scheme: (I) experimental baseline status, (II) core relevance (1--5 scale), and (III) intra-paper mention frequency. Our annotation pipeline leverages an LLM-based judge, validated by human experts on a stratified sample. The benchmark task requires retrieving must-cite papers from the candidate pool given only a query paper's title and abstract, evaluated by Recall@$K$. We establish baselines using sparse retrieval, dense scientific embeddings, and graph-based methods, demonstrating that must-cite retrieval remains a challenging open problem.
- Abstract(参考訳): AIと機械学習の文学が爆発的に成長し、NeurIPSやICLRが毎年数千の論文を受け入れているため、研究者にとって包括的な引用のカバレッジはますます困難になっている。
引用レコメンデーションは10年以上研究されてきたが、既存のシステムは主に'must-cite'論文の重要セットである直接的な実験ベースライン、基礎的メソッド、省略が貢献の斬新さや再現性を損なうコア依存関係を識別するよりも、幅広い関連性に焦点を当てている。
我々は、AI/MLドメインで必須のレコメンデーションを評価するために特別に設計された大規模ベンチマークであるMasterSetを紹介する。
MasterSetには15の主要な会場の公的な会議手続き/Webサイトから収集された15万以上の論文が組み込まれており、検索のための総合的な候補プールとして機能している。
提案手法は, (I) 実験ベースライン状態, (II) コア関連度(1~5スケール), (III) 紙内言及頻度(III) の3層ラベリング方式で注釈する。
我々のアノテーションパイプラインは、成層試料上で人間の専門家によって検証されたLLMに基づく判断を利用する。
ベンチマークタスクでは、クエリペーパーのタイトルと抽象化のみを指定して、候補プールから必須の論文を取得する必要がある。
我々は,スパース検索,密度の高い科学的埋め込み,グラフベースの手法を用いてベースラインを確立する。
関連論文リスト
- Context-Aware Hierarchical Taxonomy Generation for Scientific Papers via LLM-Guided Multi-Aspect Clustering [59.54662810933882]
既存の分類体系の構築手法は、教師なしクラスタリングや大きな言語モデルの直接的プロンプトを利用しており、コヒーレンスと粒度の欠如が多かった。
LLM誘導型マルチアスペクト符号化と動的クラスタリングを統合したコンテキスト対応階層型階層型分類生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-23T15:12:58Z) - Let's Use ChatGPT To Write Our Paper! Benchmarking LLMs To Write the Introduction of a Research Paper [64.50822834679101]
SciIGは、タイトル、抽象、および関連する作品からコヒーレントな紹介を生成するLLMの能力を評価するタスクである。
オープンソース (DeepSeek-v3, Gemma-3-12B, LLaMA 4-Maverick, MistralAI Small 3.1) およびクローズドソース GPT-4o システムを含む5つの最先端モデルを評価する。
結果は、特に意味的類似性と忠実性において、ほとんどのメトリクスにおいて、LLaMA-4 Maverickの優れたパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-08-19T21:11:11Z) - LGAR: Zero-Shot LLM-Guided Neural Ranking for Abstract Screening in Systematic Literature Reviews [0.9314555897827079]
体系的な文献レビューは、トピックに関するすべての関連論文を特定し評価することを目的としている。
現在までに、大型言語モデル(LLM)を用いた抽象的なスクリーニング手法はバイナリ分類設定に重点を置いている。
ゼロショットLLMガイド付き抽象ランクラであるLGARを提案する。
論文 参考訳(メタデータ) (2025-05-30T16:18:50Z) - Can LLMs Generate Tabular Summaries of Science Papers? Rethinking the Evaluation Protocol [83.90769864167301]
文献レビュー表は、科学論文の集合を要約し比較するために欠かせないものである。
学術論文の収集にあたり,ユーザの情報ニーズを最大限に満たす表を作成するタスクについて検討する。
我々の貢献は、現実世界で遭遇する3つの重要な課題に焦点を当てている: (i)ユーザープロンプトは、しばしば未特定である; (ii)検索された候補論文は、しばしば無関係な内容を含む; (iii)タスク評価は、浅いテキスト類似性技術を超えて進むべきである。
論文 参考訳(メタデータ) (2025-04-14T14:52:28Z) - JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking [81.88787401178378]
本稿では,文書関連性を評価する際に,人間の認知過程をエミュレートする新しいエージェント・リランカであるJiceRankを紹介する。
我々は,推論集約型BRIGHTベンチマークを用いて判定Rankを評価し,第1段階の検索手法よりも性能が大幅に向上したことを示す。
さらに、JiceRankは、人気の高いBEIRベンチマークの細調整された最先端リランカと同等に動作し、ゼロショットの一般化能力を検証している。
論文 参考訳(メタデータ) (2024-10-31T18:43:12Z) - Learning Neural Textual Representations for Citation Recommendation [7.227232362460348]
サブモジュラースコアリング機能において,シームズとトリプルトネットワークを併用した文書(センテンス-BERT)の深部表現を用いた引用推薦手法を提案する。
我々の知る限りでは、これは引用推薦のタスクに対して、ディープ表現とサブモジュラー選択を組み合わせるための最初のアプローチである。
論文 参考訳(メタデータ) (2020-07-08T12:38:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。