論文の概要: SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction
- arxiv url: http://arxiv.org/abs/2604.17141v1
- Date: Sat, 18 Apr 2026 20:33:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.355908
- Title: SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction
- Title(参考訳): SciImpact: 科学的影響予測のための多次元マルチフィールドベンチマーク
- Abstract要約: SciImpactは19分野にわたる科学的影響予測のための大規模多次元ベンチマークである。
215,928枚のコントラスト紙で構成され、短期と長期の両方で有意義な影響差を反映している。
我々は、SciImpact上で広く使われている11の大規模言語モデル(LLM)を評価した。
- 参考スコア(独自算出の注目度): 10.526822187607658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid growth of scientific literature calls for automated methods to assess and predict research impact. Prior work has largely focused on citation-based metrics, leaving limited evaluation of models' capability to reason about other impact dimensions. To this end, we introduce SciImpact, a large-scale, multi-dimensional benchmark for scientific impact prediction spanning 19 fields. SciImpact captures various forms of scientific influence, ranging from citation counts to award recognition, media attention, patent reference, and artifact adoption, by integrating heterogeneous data sources and targeted web crawling. It comprises 215,928 contrastive paper pairs reflecting meaningful impact differences in both short-term (e.g., Best Paper Award) and long-term settings (e.g., Nobel Prize). We evaluate 11 widely used large language models (LLMs) on SciImpact. Results show that off-the-shelf models exhibit substantial variability across dimensions and fields, while multi-task supervised fine-tuning consistently enables smaller LLMs (e.g., 4B) to markedly outperform much larger models (e.g., 30B) and surpass powerful closed-source LLMs (e.g., o4-mini). These results establish SciImpact as a challenging benchmark and demonstrate its value for multi-dimensional, multi-field scientific impact prediction. Our project homepage is https://flypig23.github.io/sciimpact-homepage/
- Abstract(参考訳): 科学文献の急速な成長は、研究影響を評価し予測するための自動的な方法を要求する。
先行研究は引用に基づくメトリクスに主に焦点を合わせており、他の影響次元を推論するためにモデルの能力について限られた評価を残している。
この目的のために、19分野にわたる科学的影響予測のための大規模多次元ベンチマークであるSciImpactを紹介した。
SciImpactは、引用数からメディアの注目、特許参照、アーティファクトの採用に至るまで、異種データソースとターゲットWebクローリングを統合することで、様々な科学的影響を捉えている。
215,928枚のコントラスト紙で、短期(例えば、ベストペーパー賞)と長期(例えば、ノーベル賞)の両方に有意義な影響差を反映している。
我々は、SciImpact上で広く使われている11の大規模言語モデル(LLM)を評価した。
一方,マルチタスク制御による微調整により,より小さなLCM(e g , 4B)がより大きなモデル(e g , 30B)を著しく上回り,強力なクローズドソースLCM(e g , o4-mini)を上回った。
これらの結果は、SciImpactを挑戦的なベンチマークとして確立し、多次元の多分野科学的影響予測にその価値を実証する。
私たちのプロジェクトのホームページはhttps://flypig23.github.io/sciimpact-homepage/です。
関連論文リスト
- AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era [55.37558486468993]
AgentIdeaBenchは、静的観測とアクティブ探索という2つの一致した条件下で科学的思考を評価するベンチマークである。
5つの分野にまたがる40の高密度サブフィールドにおける33個のLDMの静的アクティブ評価を一致させた。
アクティブな探索により、ヘッドルームの能力は大幅に向上し、ヘッドルームはモデル間で不均一に分散される。
論文 参考訳(メタデータ) (2026-09-07T15:19:13Z) - Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery [41.32793603340132]
大型言語モデル(LLM)は科学的な発見にますます関与している。
それらが複雑な実験室科学を支えられるかどうかは不明だ。
19の大規模言語モデル(MLLM)の評価は、最高の性能モデルでさえ48.7%の精度しか達成していないことを示している。
論文 参考訳(メタデータ) (2026-08-07T08:06:31Z) - LLM-Metrics: Measuring Research Impact Through Large Language Model Memory [0.09685837672183746]
大規模言語モデル(LLM)のパラメトリックメモリから導出した研究・インパクト評価指標であるLLM-Metricsを提案する。
2023-2024年に発行された549のコンピュータサイエンス論文を,6つのベンダーから0.5Bから72Bのパラメータにまたがる17のLLMで評価した。
17モデルのうち15モデルが肯定的な予測を行い、そのうち9モデルが0.05未満のpで有意であり、rho = 0.1495 と p = 0.0004 のスピアマンの総合的な相関は引用数に対して有意であった。
論文 参考訳(メタデータ) (2026-05-21T08:45:57Z) - Evaluating Large Language Models in Scientific Discovery [91.732562776782]
大規模言語モデル (LLMs) は科学研究にますます応用されてきているが、科学ベンチマークでは非文脈化された知識を探索している。
生物, 化学, 材料, 物理にまたがるLSMを評価するシナリオグラウンドベンチマークを提案する。
このフレームワークは、(i)シナリオタイドアイテムの質問レベル精度と(ii)プロジェクトレベルのパフォーマンスの2つのレベルでモデルを評価する。
論文 参考訳(メタデータ) (2025-12-17T16:20:03Z) - Does Tone Change the Answer? Evaluating Prompt Politeness Effects on Modern LLMs: GPT, Gemini, LLaMA [0.6263481844384227]
本研究は,インタラクショントーンがモデル精度に与える影響を検討するためのシステム評価フレームワークを提案する。
GPT-4o mini (OpenAI)、Gemini 2.0 Flash (Google DeepMind)、Llama 4 Scout (Meta) の3つのメジャー言語モデルにこのフレームワークを適用した。
以上の結果から,トーン感受性はモデル依存的かつドメイン依存的であることが示唆された。中性または超親和性は概してVery Rudeのプロンプトよりも高い精度が得られるが,統計的に有意な影響はヒューマニティタスクのサブセットにのみ現れる。
論文 参考訳(メタデータ) (2025-12-14T19:25:20Z) - Optimizing Research Portfolio For Semantic Impact [55.2480439325792]
サイテーション指標は学術的影響を評価するために広く用いられているが、社会的偏見に悩まされている。
本稿では,研究効果を予測する新しいフレームワークであるrXiv Semantic Impact (XSI)を紹介する。
XSIは学術知識グラフにおける研究概念の進化を追跡している。
論文 参考訳(メタデータ) (2025-02-19T17:44:13Z) - From Words to Worth: Newborn Article Impact Prediction with LLM [69.41680520058418]
本稿では, LLMの能力を活用して, 新生記事の今後の影響を予測する, 有望なアプローチを提案する。
提案手法はLLMを用いて,高インパクトな論文の共有意味的特徴をタイトルと抽象的なペアの集合から識別する。
提案手法は, 0.216のMAEと0.901のNDCG@20を用いて, 提案手法が最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2024-08-07T17:52:02Z) - Smoke and Mirrors in Causal Downstream Tasks [59.90654397037007]
本稿では, 治療効果推定の因果推論タスクについて検討し, 高次元観察において利害関係が記録されている。
最先端の視覚バックボーンから微調整した6つの480モデルを比較し、サンプリングとモデリングの選択が因果推定の精度に大きく影響することを発見した。
以上の結果から,今後のベンチマークでは,下流の科学的問題,特に因果的な問題について慎重に検討すべきであることが示唆された。
論文 参考訳(メタデータ) (2024-05-27T13:26:34Z) - Mapping the Increasing Use of LLMs in Scientific Papers [99.67983375899719]
2020年1月から2024年2月にかけて、arXiv、bioRxiv、Natureのポートフォリオジャーナルで950,965の論文をまとめて、体系的で大規模な分析を行った。
計算機科学の論文では, LLMの使用が着実に増加し, 最大, 最速の成長が観察された。
論文 参考訳(メタデータ) (2024-04-01T17:45:15Z) - Time to Cite: Modeling Citation Networks using the Dynamic Impact
Single-Event Embedding Model [0.33123773366516646]
引用ネットワークはシングルイベント動的ネットワークの顕著な例である。
このような単一イベントネットワークのキャラクタリゼーションのための新しい可能性関数を提案する。
Dynamic Impact Single-Event Embedding Model (DISEE)は、静的潜伏距離ネットワークの埋め込みアプローチを古典的な動的影響評価と照合する。
論文 参考訳(メタデータ) (2024-02-28T22:59:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。