論文の概要: Can Large Language Models Forecast What Researchers Study Next?
- arxiv url: http://arxiv.org/abs/2609.00747v1
- Date: Tue, 01 Sep 2026 05:26:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.40223
- Title: Can Large Language Models Forecast What Researchers Study Next?
- Title(参考訳): 大規模言語モデルは次の研究を予測できるのか?
- Authors: Fenghai Li, Zihan Tang, Haofei Yu, Yining Zhao, Jiaxuan You,
- Abstract要約: コミュニティの文献が切り離されてしまうと、システムは最大5つのランクのアイデアを生み出し、それが後の論文に対して評価される。
GPT-4.1、Qwen2.5-7B/14B、Qwen3.5-9Bの5つの履歴圧縮戦略と学習モード分割予測器(MDF)を比較した。
結果盲検評価では、Qwen2.5はより広範な予測を生成するが、その利点にどの程度の幅が貢献するかは特定していない。
- 参考スコア(独自算出の注目度): 26.392349686051173
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models increasingly generate research ideas, yet judging their novelty or feasibility at generation time does not establish whether they anticipate subsequent work. We introduce IdeaForecastBench to evaluate research idea forecasting. Given a community's literature up to a cutoff, a system produces up to five ranked ideas, which are evaluated against later papers. The benchmark comprises 624 rolling episodes across 52 topics, with a fixed retrieve-then-judge protocol and separately reported results from two judges. We compare five history-compression strategies across GPT-4.1, Qwen2.5-7B/14B, and Qwen3.5-9B, together with a learned Mode-Decomposition Forecaster (MDF). Under the primary GPT-4.1-mini judge, Summary improves on Direct in Hit@5 and Precision@5 across all four backbones. Qwen2.5 scores above GPT-4.1, whereas Qwen3.5 scores below it. An outcome-blind assessment finds that Qwen2.5 produces broader forecasts, but does not identify how much breadth contributes to its advantage. Threshold and judge diagnostics further clarify the limits of interpreting realization as precise anticipation. IdeaForecastBench provides a common task for studying which research ideas a community subsequently pursues and how reliably this outcome can be measured.
- Abstract(参考訳): 大規模言語モデルは研究のアイデアをますます生み出すが、その斬新さや実現可能性を世代ごとに判断することは、彼らがその後の研究を予想するかどうかを定めていない。
我々はIdeanForecastBenchを導入し、研究アイデアの予測を評価する。
コミュニティの文献が切り離されてしまうと、システムは最大5つのランクのアイデアを生み出し、それが後の論文に対して評価される。
ベンチマークは52のトピックにわたる624回のローリングエピソードで構成され、固定された検索テーマ・ジャッジプロトコルと、2人の審査員による結果が別々に報告されている。
GPT-4.1、Qwen2.5-7B/14B、Qwen3.5-9Bの5つの履歴圧縮戦略と学習モード分割フォアキャスター(MDF)を比較した。
GPT-4.1-mini のプライマリ・ジャッジでは、4つのバックボーンで Hit@5 の Direct と Precision@5 が改善されている。
Qwen2.5はGPT-4.1以上、Qwen3.5はそれ以下である。
結果盲検評価では、Qwen2.5はより広範な予測を生成するが、その利点にどの程度の幅が貢献するかは特定していない。
閾値と判断診断により、現実化を正確に予測することの限界がより明確になる。
IdeaForecastBenchは、コミュニティが次に追求する研究のアイデアと、この結果がどの程度確実に測定できるかを研究するための共通のタスクを提供する。
関連論文リスト
- Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies [5.8079638399400375]
レコンストラクション(Reコンストラクション)は、種紙とすべての同時または将来の文献を無視するブラインド・アイデア・リカバリのベンチマークである。
我々は,独立系大規模言語モデル裁判官が持たない根本真理に一致するという仮説をモデルに提案する。
論文 参考訳(メタデータ) (2026-08-17T14:44:30Z) - SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? [51.154921661608675]
我々は、ICLRの投稿から再構成された1,099の機械学習研究提案のキュレートされたベンチマークであるSoundnessBenchを紹介する。
SoundnessBenchは、完全なレビュー結果の正確な予測よりも、復元可能な提案段階の音質のベンチマークとして解釈されるべきである。
論文 参考訳(メタデータ) (2026-05-28T17:57:37Z) - Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs [1.7470133607730627]
BLF (Bayesian Linguistic Forecaster) は二進予測のためのエージェントシステムである。
ForecastBenchのリーダーボードからの400のバックテスト質問に対して、BLFはすべての主要な公開メソッドを上回ります。
論文 参考訳(メタデータ) (2026-04-20T17:57:51Z) - GIANTS: Generative Insight Anticipation from Scientific Literature [84.95947892931142]
本稿では、下流紙のコアインサイトを基礎となる親論文から予測する世代課題であるインサイト予測を導入する。
実測値と実測値の類似性を評価するLM判定器を用いてモデル評価を行い,これらの類似性スコアが有能な人間の評価値と相関していることを示す。
GIANTS-4Bは、強化学習(RL)を用いて訓練されたLMで、これらの類似度スコアをプロキシ報酬として用いた洞察予測を最適化する。
論文 参考訳(メタデータ) (2026-04-10T18:13:55Z) - Learning to Predict Future-Aligned Research Proposals with Language Models [59.79457676644722]
我々は目標から得られた17,771の論文とそれらの事前カットオフ引用の時間一貫性のあるデータセットを構築した。
モデルをトレーニングするために、ターゲットとそれらのカットオフ前の引用から17,771枚のタイム一貫性のあるデータセットを構築します。
Llama-3.1 と Qwen2.5 のモデル全体で、将来のアライメントチューニングは、非アライメントベースラインに対する将来のアライメントを改善する。
論文 参考訳(メタデータ) (2026-03-28T05:41:15Z) - Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination [67.67725938962798]
大規模なWebスケールコーパスの事前トレーニングは、広く使用されているベンチマークでデータ汚染の影響を受けやすいQwen2.5が残る。
我々はRandomCalculationと呼ばれる任意の長さと難易度を持つ完全クリーンな算術問題を生成するジェネレータを導入する。
精度の高い報酬信号のみがベースモデルの性能境界を超える安定した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-07-14T17:55:15Z) - Deep Transfer Learning Based Peer Review Aggregation and Meta-review Generation for Scientific Articles [2.0778556166772986]
論文の受理決定とメタレビュー生成という2つのピアレビューアグリゲーション課題に対処する。
まず,従来の機械学習アルゴリズムを適用し,受理決定のプロセスを自動化することを提案する。
メタレビュー生成では,T5モデルに基づく移動学習モデルを提案する。
論文 参考訳(メタデータ) (2024-10-05T15:40:37Z) - News Summarization and Evaluation in the Era of GPT-3 [73.48220043216087]
GPT-3は,大規模な要約データセット上で訓練された微調整モデルと比較する。
我々は,GPT-3サマリーが圧倒的に好まれるだけでなく,タスク記述のみを用いることで,現実性に乏しいようなデータセット固有の問題に悩まされることも示している。
論文 参考訳(メタデータ) (2022-09-26T01:04:52Z) - Back to Square One: Bias Detection, Training and Commonsense
Disentanglement in the Winograd Schema [106.79804048131253]
Winograd(WS)は、モデルの常識能力を測定するテストとして提案されている。
本稿では,WS の現在評価手法が準最適であることを示し,その評価にツイン文を用いる修正を提案する。
私たちは、WSの明らかな進歩の多くは、必ずしも常識推論の進歩を反映していないと結論付けています。
論文 参考訳(メタデータ) (2021-04-16T15:17:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。