論文の概要: Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies
- arxiv url: http://arxiv.org/abs/2608.16645v2
- Date: Wed, 19 Aug 2026 00:55:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.197426
- Title: Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies
- Title(参考訳): レコンストラクション: 出版前の文献から研究思想を復元するためのブラインドベンチマーク
- Authors: Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das,
- Abstract要約: レコンストラクション(Reコンストラクション)は、種紙とすべての同時または将来の文献を無視するブラインド・アイデア・リカバリのベンチマークである。
我々は,独立系大規模言語モデル裁判官が持たない根本真理に一致するという仮説をモデルに提案する。
- 参考スコア(独自算出の注目度): 6.001213285107465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can a language model recover the true research idea of a published paper when given only that paper's pre-publication bibliography? We introduce Reconstruction, a blind idea-recovery benchmark that withholds the seed paper and all contemporaneous or future literature, and asks models to propose hypotheses that an independent large language model judge matches against the held-out ground-truth idea. A strict anti-leakage protocol-temporal citation cutoff, anonymous reference IDs, and frozen per-paper bibliographies, which prevents prompt-time leakage of the seed idea. Across six scientific domains and 643 evaluated papers, seven frontier models achieve only modest Match rates (approx. 3-15%). We then evaluate a reference-only multi-agent (top 4) pipeline that combines cross-model review with a Swiss tournament over aligned hypothesis slots, without external web search. Cross-model review plus tournament selection raises Match rates to approx. 23-42% across all six domains, which is an observed approx. 2.4x lift over the best single-model baseline. This draft reports the protocol, anti-leakage design, and current results as an arXiv timestamp.
- Abstract(参考訳): 言語モデルは、その論文の出版前書誌のみを与えられたとき、発行された論文の真の研究思想を回復できるだろうか?
我々は、シード紙とすべての同時または将来の文献を無視するブラインド・アイデア・リカバリ・ベンチマークであるRecontainationを導入し、独立した大規模言語モデルが保持された基盤的真実と一致するという仮説をモデルに提案する。
厳格なアンチリーカゲプロトコル-時間的引用遮断、匿名参照ID、およびシードアイデアの即時リークを防止する紙毎の書誌。
6つの科学的領域と643の論文のうち、7つのフロンティアモデルが適度なマッチング率(約3.15%)しか達成していない。
次に、参照のみのマルチエージェント(トップ4)パイプラインを評価し、クロスモデルレビューとスイスのトーナメントを、外部Web検索なしで整列した仮説スロット上で組み合わせる。
クロスモデルレビューとトーナメント選択は、マッチレートを近似に引き上げる。
23-42%であった。
2.4倍は最高の単モデルベースラインを上回ります。
このドラフトでは、プロトコル、アンチリーカゲ設計、および現在の結果をarXivタイムスタンプとして報告している。
関連論文リスト
- The Half-Lives of Generative-AI Evidence: A 40-Record Audit, a Claim-Currency Framework, and a Reflexive Case of Frontier-Model-Assisted Research [0.0]
生成AI評価は出版前に歴史的になりうるが、カレンダー年代は全ての結論に等しく影響しない。
本稿は,2025年7月18日から2026年7月17日までに出現した40件の実証記録の最大変量解析コーパスを検証した。
監査コード化されたパブリッシュルート、実行タイミング、モデルアイデンティティ、最新の名前付きジェネレーションまたは不変スナップショットの年齢、同ファミリーのスーパーセッション、リフレッシュ動作。
論文 参考訳(メタデータ) (2026-07-27T05:59:49Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers [0.0]
ResearchQAは、494のオープンアクセス論文から6,211のシングルペーパー質問応答ペアのベンチマークである。
ResearchQAは引用地上評価のために設計されている。
提案手法は,8つの先行したクローズドウェイトモデルとオープンウェイトモデルについて,引用グラウンド・チャット・ウィズ・ペーパー・セッティングで評価する。
論文 参考訳(メタデータ) (2026-07-13T04:26:51Z) - SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? [51.154921661608675]
我々は、ICLRの投稿から再構成された1,099の機械学習研究提案のキュレートされたベンチマークであるSoundnessBenchを紹介する。
SoundnessBenchは、完全なレビュー結果の正確な予測よりも、復元可能な提案段階の音質のベンチマークとして解釈されるべきである。
論文 参考訳(メタデータ) (2026-05-28T17:57:37Z) - Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation [24.044079363031035]
グラフ・オブ・リサーチ (Graphs of Research, GoR) は、各シード紙の2ホップ基準近傍を抽出する教師付き微調整法である。
GoRは参照を論文進化指向非巡回グラフ(DAG)に整理する
5つの主要ML/NLP会場からデータを引き出す自動抽出パイプラインを構築した。
論文 参考訳(メタデータ) (2026-05-14T12:57:56Z) - GIANTS: Generative Insight Anticipation from Scientific Literature [84.95947892931142]
本稿では、下流紙のコアインサイトを基礎となる親論文から予測する世代課題であるインサイト予測を導入する。
実測値と実測値の類似性を評価するLM判定器を用いてモデル評価を行い,これらの類似性スコアが有能な人間の評価値と相関していることを示す。
GIANTS-4Bは、強化学習(RL)を用いて訓練されたLMで、これらの類似度スコアをプロキシ報酬として用いた洞察予測を最適化する。
論文 参考訳(メタデータ) (2026-04-10T18:13:55Z) - Learning to Predict Future-Aligned Research Proposals with Language Models [59.79457676644722]
我々は目標から得られた17,771の論文とそれらの事前カットオフ引用の時間一貫性のあるデータセットを構築した。
モデルをトレーニングするために、ターゲットとそれらのカットオフ前の引用から17,771枚のタイム一貫性のあるデータセットを構築します。
Llama-3.1 と Qwen2.5 のモデル全体で、将来のアライメントチューニングは、非アライメントベースラインに対する将来のアライメントを改善する。
論文 参考訳(メタデータ) (2026-03-28T05:41:15Z) - Alien Science: Sampling Coherent but Cognitively Unavailable Research Directions from Idea Atoms [53.907293349123506]
大規模な言語モデルは、しばしば、現在のコミュニティにとって一貫性があり、無関心なアイデアを生み出すのに失敗する。
我々は、このギャップを認知的可用性によって形式化し、研究の方向性が典型的な研究者によって自然に提案される可能性について述べる。
我々は、原子の集合が実行可能な方向を構成するかどうかをスコアするコヒーレンスモデルと、その方向が生成される確率をスコアするアベイラビリティモデルという2つの補完モデルを学ぶ。
論文 参考訳(メタデータ) (2026-03-01T13:05:19Z) - A Unified Evaluation of Textual Backdoor Learning: Frameworks and
Benchmarks [72.7373468905418]
我々は,テキストバックドア学習の実装と評価を促進するオープンソースツールキットOpenBackdoorを開発した。
また,単純なクラスタリングに基づく防御ベースラインであるCUBEを提案する。
論文 参考訳(メタデータ) (2022-06-17T02:29:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。