論文の概要: Historical Backtesting for Scientific Question Discovery: A Protocol and Astronomy Pilot
- arxiv url: http://arxiv.org/abs/2608.16795v1
- Date: Mon, 17 Aug 2026 16:51:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.797687
- Title: Historical Backtesting for Scientific Question Discovery: A Protocol and Astronomy Pilot
- Title(参考訳): 科学的疑問発見のための歴史的バックアップ:プロトコルと天文学のパイロット
- Authors: Hui Mao,
- Abstract要約: 我々は、時間的に分離されたコーパス、凍結した質問、監査可能なラベル、4つの基準ベースライン、および入力インターフェースを備えた再現可能な天文学のインスタンスをリリースする。
2026-08-17(2027-2030)を凍結した200の質問が公表された。
- 参考スコア(独自算出の注目度): 0.5028072215868231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Systems that generate scientific research questions are evaluated today by expert scores, LLM-as-judge ratings, or curated case studies -- all subjective, none falsifiable. We formalize historical backtesting as an alternative: a system generates questions from a corpus frozen at a historical cutoff, the questions are frozen before any access to later literature, and a temporally isolated future corpus then determines whether each question was subsequently answered, partially addressed, independently posed, or ignored, and whether its underlying premise was supported or refuted. The protocol is model-agnostic: any system that emits frozen questions can be scored. We release reproducible astronomy instances with temporally isolated corpora, frozen questions, auditable labels, four reference baselines, and a submission interface. Two findings result. First, evidence-structure-first generation outperforms LLM-only prompting: across a generator decomposition crossed with a four-cutoff stress test (2010-2024, 798 judged questions) whose last window postdates model training, LLM-only generation shows memorized relevance without specific foresight, while a generator using no model weights at all finds questions whose premises the future refutes in every era. Second, a seven-rater agreement study (two blinded human annotators, five judge models, 90 items) indicts the outcome taxonomy rather than the judge: two careful humans agree at kappa = 0.17, every judge model agrees with the professional annotator as well or better (0.17-0.26), and frontier models agree with one another at 0.60 -- certifying an LLM judge by model-model agreement would have overstated its reliability threefold. A prospective instance -- 200 questions frozen 2026-08-17, scored 2027-2030 -- is released so the central claims become contamination-free tests that time itself will grade.
- Abstract(参考訳): 科学的研究の疑問を生み出すシステムは今日、専門家のスコア、LSM-as-judge評価、またはキュレートされたケーススタディによって評価されている。
歴史的バックテストは、あるシステムが歴史的カットオフで凍結されたコーパスから質問を生成し、その質問は後続の文献にアクセスする前に凍結され、時間的に孤立した将来のコーパスは、各質問がその後回答されたか、部分的に対応されたか、独立に提案されたか、無視されたか、そしてその前提が支持されたか、あるいは反証されたかを決定する。
このプロトコルはモデルに依存しない:凍結した質問を発行するシステムはすべて得点できる。
我々は、時間的に分離されたコーパス、凍結した質問、監査可能なラベル、4つの基準ベースライン、および入力インターフェースを備えた再現可能な天文学のインスタンスをリリースする。
2つの結果が得られた。
第一に、エビデンス構造第一世代は、LCMのみよりも優れており、最後のウィンドウがモデルトレーニングを延期した4カットオフストレステスト(2010-2024, 798 の判断された質問)と交差するジェネレータ分解において、LCMのみ世代は特定のフォアシスタンスなしで記憶された関連性を示し、モデルウェイトを全く使用しないジェネレータは、あらゆる時代の未来が反響する問題を見つける。
第二に、7レーターの合意研究(盲目人間2名、審査員5名、審査員90名)では、審査員よりも結果の分類を起訴している: 2人の慎重な人間がカッパ=0.17で合意し、すべての審査員モデルはプロの注釈官と合意する(0.17-0.26)、フロンティアモデルは0.60で合意する。
2026-08-17(2027-2030)を凍結した200の質問が公表された。
関連論文リスト
- TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs [0.0]
下流検証が存在しない領域では、科学的なエージェントとして大きな言語モデルが提案されている。
筆者らは,42枚の抽出,不正,疑似科学的論文からなるプローブコーパスを,各論文のフレーミングと単発モデルエンゲージメントを抽出・評価する手法と組み合わせて導入した。
プローブは、5つのクレームタイプ、製造された観測、擬似物理機構、魔法の前提、合法化橋、貨物カルト実験である。
論文 参考訳(メタデータ) (2026-08-11T20:30:32Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation [79.03892269184145]
LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
論文 参考訳(メタデータ) (2026-06-19T06:20:58Z) - Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses [6.004875368104112]
大規模な言語モデル(LLM)は治療として提案されているが、完全なサーベイワークフロー全体にわたる厳密な評価はほとんど残っていない。
アンケート設計, サンプル選択, パイロットテスト, 欠落データ計算, および収集後の分析を対象とする, LLM 統合のための5段階フレームワークを提示し, 評価した。
保護モチベーション理論 (PMT) 制約付き共起知識グラフを導入し, ゼロショット推論, 検索拡張ベースライン, 新規な理論インフォームド変種にまたがる7つのLLM構成を開発する。
論文 参考訳(メタデータ) (2026-05-19T00:58:36Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge [17.555073770285095]
大規模言語モデル(LLM)は、要約、対話、創造的執筆といったタスクにおいてシステム出力を評価する自動判断器として、ますます多くデプロイされている。
提案手法では,現行のLLM審査員は,プロンプトに導入したショートカットに頼って,両方のカウントでフェールすることを示す。
論文 参考訳(メタデータ) (2025-09-30T10:48:08Z) - Are You Sure? Challenging LLMs Leads to Performance Drops in The
FlipFlop Experiment [82.60594940370919]
大規模言語モデル(LLM)のマルチターン動作を研究するためのFlipFlop実験を提案する。
モデルが平均46%の時間で回答を反転させ、全てのモデルが最初の予測と最終予測の間に精度を低下させ、平均17%の低下(FlipFlop効果)を示す。
我々はオープンソースのLLMで微調整実験を行い、合成されたデータに対する微調整は、性能劣化を60%低減させることができるが、サイコファンティックな振る舞いを完全には解決できないことを発見した。
論文 参考訳(メタデータ) (2023-11-14T23:40:22Z) - Realistic Conversational Question Answering with Answer Selection based
on Calibrated Confidence and Uncertainty Measurement [54.55643652781891]
対話型質問回答モデル(ConvQA)は,会話中に複数回発生した質問文と過去の質問文のペアを用いて質問に回答することを目的としている。
本稿では,会話履歴における不正確な回答を,ConvQAモデルから推定された信頼度と不確実性に基づいてフィルタリングすることを提案する。
我々は2つの標準ConvQAデータセット上で、回答選択に基づくリアルな会話質問回答モデルの有効性を検証する。
論文 参考訳(メタデータ) (2023-02-10T09:42:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。