論文の概要: Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery
- arxiv url: http://arxiv.org/abs/2607.15766v1
- Date: Fri, 17 Jul 2026 08:56:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.805933
- Title: Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery
- Title(参考訳): アクション前:先天的な仮説発見に関するLLMのベンチマーク
- Authors: Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han,
- Abstract要約: 大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
- 参考スコア(独自算出の注目度): 95.44432473367836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) excel at answering pre-specified questions, yet their ability to navigate the open-ended, pre-conclusion stage of discovery remains largely unmeasured. We introduce Prospective Hypothesis Discovery (PHD), which asks models to autonomously construct grounded, discriminative, and testable hypothesis spaces from inconclusive evidence, including anomalous observations and fragmented records, to guide subsequent investigation. To evaluate this capability, we introduce HypoArena, comprising HypoData, a benchmark of 988 cases across six scientific and analytical domains, and HypoEval, an evaluation framework for open-ended hypothesis sets. To construct HypoData at scale, we propose Retrospective Context Regression, a Forge--Audit pipeline that reconstructs pre-conclusion contexts from completed expert documents by removing explicit conclusions, target hypotheses, and retrospective causal attributions while preserving the factual substrate. Because PHD admits multiple valid outputs, HypoEval combines bidirectional pairwise judgments with Bradley--Terry--Davidson aggregation for ranking and six-dimensional rubric scoring for diagnosis. Experiments on 15 frontier LLMs reveal clear capability stratification and model-dependent effects of structured analytical skills, with gains for several lower-performing models on HypoArena but regressions for other systems, including a top-performing model. Compared with absolute rubric scoring, arena evaluation resolves finer-grained differences among models, with aggregated rankings showing strong agreement with human experts and an independent judge. Together, these results support treating PHD as a distinct target for evaluating how LLMs formulate investigative directions when final conclusions are withheld. Our code and data are publicly available at github.com/SKYLENAGE-AI/HypoArena and github.com/SKYLENAGE-AI/HypoArena.
- Abstract(参考訳): 大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
本稿では,予測仮説発見(PHD)について紹介する。これは,異常な観測や断片化された記録を含む不確定な証拠から,自律的に基底,識別,検証可能な仮説空間を構築するようモデルに求めるものである。
この能力を評価するために、HypoArenaは6つの科学的・分析的な領域にわたる988のケースのベンチマークであり、HypoEvalはオープンな仮説セットの評価フレームワークである。
提案するレトロスペクティブコンテキスト回帰(Retrospective Context Regression, Retrospective Context Regression, Forge-Audit Pipelines)は, 現実の基質を保ちながら, 明確な結論, 仮説, 帰納的因果属性を除去することにより, 完成した専門家文書から事前結論のコンテキストを再構築するパイプラインである。
PHDには複数の有効な出力があるため、HypoEvalは双方向のペアワイズ判定と、ランク付けのためのBradley-Terry-Davidsonアグリゲーションと診断のための6次元ルーリックスコアを組み合わせた。
15基のフロンティア LLM の実験では、構造解析技術による明らかな能力成層化とモデル依存効果が示され、HypoArena の低性能モデルにはいくつかの効果があるが、上位性能モデルを含む他のシステムにはレグレッションがある。
絶対的ルーリックスコアと比較すると、アリーナ評価はモデル間のきめ細かい相違を解消する。
これらの結果は,最終結論が得られなかった場合,PLMが探索方向をどのように定式化するかを評価するために,PHDを個別の標的として扱うことを支援する。
我々のコードとデータはgithub.com/SKYLENAGE-AI/HypoArenaとgithub.com/SKYLENAGE-AI/HypoArenaで公開されている。
関連論文リスト
- DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs [71.85279836937578]
我々は、注意深く設計されたエージェントを用いたLVLMにおける社会バイアスの奥行き探索のための適応的フレームワークDeepBiasを紹介する。
私たちは、私たちのフレームワークを使ってDeepBiasBenchという名のベンチマークを構築します。5つの異なる最先端のLVLMをアンカーとして使用することで、このベンチマークはアーキテクチャ間で共有される脆弱性をキャプチャします。
論文 参考訳(メタデータ) (2026-07-13T08:19:09Z) - Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses [6.004875368104112]
大規模な言語モデル(LLM)は治療として提案されているが、完全なサーベイワークフロー全体にわたる厳密な評価はほとんど残っていない。
アンケート設計, サンプル選択, パイロットテスト, 欠落データ計算, および収集後の分析を対象とする, LLM 統合のための5段階フレームワークを提示し, 評価した。
保護モチベーション理論 (PMT) 制約付き共起知識グラフを導入し, ゼロショット推論, 検索拡張ベースライン, 新規な理論インフォームド変種にまたがる7つのLLM構成を開発する。
論文 参考訳(メタデータ) (2026-05-19T00:58:36Z) - Beyond Memorization: Reasoning-Driven Synthesis as a Mitigation Strategy Against Benchmark Contamination [77.69093448529455]
本稿では,arXiv論文から直接研究レベルのQAを合成するために,無限にスケーラブルなフレームワークを用いて実証的研究を行う。
各種サイズ,開発者,リリース日といったモデルについて,知識カットオフ日に近い性能劣化の欠如を評価した。
合成パイプラインで要求される多段階の推論は、浅い記憶よりも深い複雑さをもたらしたと仮定する。
論文 参考訳(メタデータ) (2025-08-26T16:41:37Z) - Policy Testing with MDPFuzz (Replicability Study) [13.133263651395865]
本論文の重要な発見のいくつかを検証し,再現と複製によるMDPFuzzの限界について検討する。
以上の結果から,MDPFuzz より優れていることが判明し,提案したカバレッジモデルが欠点の発見に繋がらないという結論が得られた。
論文 参考訳(メタデータ) (2025-02-26T13:11:52Z) - Prediction-Powered Causal Inferences [59.98498488132307]
予測型因果推論(PPCI)に焦点をあてる
まず, 条件付きキャリブレーションにより, 人口レベルでの有効なPPCIが保証されることを示す。
次に、実験間での十分な表現制約伝達の妥当性を導入する。
論文 参考訳(メタデータ) (2025-02-10T10:52:17Z) - Source-Free Unsupervised Domain Adaptation with Hypothesis Consolidation
of Prediction Rationale [53.152460508207184]
Source-Free Unsupervised Domain Adaptation (SFUDA)は、モデルがターゲットのドメインラベルやソースドメインデータにアクセスせずに新しいドメインに適応する必要がある、という課題である。
本稿では,各サンプルについて複数の予測仮説を考察し,各仮説の背景にある理論的根拠について考察する。
最適性能を達成するために,モデル事前適応,仮説統合,半教師付き学習という3段階の適応プロセスを提案する。
論文 参考訳(メタデータ) (2024-02-02T05:53:22Z) - Data Association Aware POMDP Planning with Hypothesis Pruning
Performance Guarantees [7.928094304325113]
あいまいなデータアソシエーションによるプランニングのためのプルーニングに基づくアプローチを導入する。
我々の重要な貢献は、仮説の完全な集合に基づく値関数と仮説のプルーンド・サブセットに基づく値関数とのバウンダリを導出することである。
我々は,これらの境界が,ふりかえりにおけるプルーニングの証明にどのように使用できるかを実証し,その損失に対する事前定義された限界を確保するために,どの仮説がプルーンであるかを決定する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-03-03T18:35:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。