論文の概要: IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs
- arxiv url: http://arxiv.org/abs/2607.01431v1
- Date: Wed, 01 Jul 2026 19:49:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.58203
- Title: IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs
- Title(参考訳): IsoSci: LLMにおける推論と知識検索の等方的クロスドメイン科学問題のベンチマーク
- Abstract要約: 異型なクロスドメイン・サイエンス・ペアのベンチマークであるISOSCIを紹介する。
各ペアは同じ論理構造を共有するが、異なるドメイン固有の知識を必要とする。
推論モードゲインの91.3%が構造不変ではなく知識に依存していることがわかった。
- 参考スコア(独自算出の注目度): 2.680633756465714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce ISOSCI, a benchmark of isomorphic cross-domain science problem pairs that separates reasoning ability from domain knowledge retrieval in LLM evaluation. Each pair shares identical logical structure but requires different domain-specific knowledge, enabling controlled attribution of reasoning-mode gains. Across five model pairs spanning four model families, we find that 91.3% of reasoning-mode gains are knowledge-dependent rather than structure-invariant (63/69 gains; Wilson 95% CI [82.3%, 96.0%]), directly challenging the assumption that chain-of-thought reasoning improves short-horizon procedural scientific problem-solving. Reasoning toggles on highly capable models provide less than 5 percentage points accuracy gain across all domains, and a reasoning-specialized model (o3-mini) that outperforms its standard counterpart on GPQA Diamond (+19.2 percentage points) underperforms on ISOSCI (-24.7 percentage points), showing that benchmark choice determines conclusions about reasoning utility. We release ISOSCI at https://huggingface.co/datasets/isosci/isosci
- Abstract(参考訳): LLM評価において、推論能力とドメイン知識検索を分離する同型クロスドメイン・サイエンス・ペアのベンチマークであるISOSCIを紹介する。
各ペアは同じ論理構造を共有するが、異なるドメイン固有の知識を必要とし、推論モードゲインの制御された帰属を可能にする。
4つのモデルファミリーにまたがる5つのモデルペアのうち、91.3%は構造不変ではなく知識に依存している(63/69ゲイン; Wilson 95% CI [82.3%, 96.0%])。
高い能力を持つモデルの推論トグルは、すべてのドメインで5パーセント未満の精度向上をもたらし、GPQAダイアモンド(+19.2ポイント)の標準モデル(o3-mini)はISOSCI(-24.7ポイント)で低パフォーマンスであり、ベンチマーク選択が推論ユーティリティに関する結論を決定することを示している。
私たちはISOSCIをhttps://huggingface.co/datasets/isosci/isosciでリリースします。
関連論文リスト
- Measuring the Authority Stack of AI Systems: Empirical Analysis of 366,120 Forced-Choice Responses Across 8 AI Models [3.7184769644515896]
オーソリティスタックフレームワークの3つのレイヤすべてにまたがる、AI意思決定に関する大規模な実証的なマッピングを初めて紹介する。
温度0では8つの主要なAIモデルを評価し、366,120の回答を得た。
論文 参考訳(メタデータ) (2026-04-13T09:13:32Z) - DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles [5.647839536820347]
著者間の不一致構造を抽出し活用し,信頼度を良好に推定するフレームワークであるDiscoUQを紹介する。
DiscoUQ-LLM の平均 AUROC は 0.802 であり、最高のベースラインを上回っている。
学習した機能は、ほぼゼロに近いパフォーマンス劣化を伴うベンチマークで一般化される。
論文 参考訳(メタデータ) (2026-03-21T23:24:12Z) - Causal Circuit Tracing Reveals Distinct Computational Architectures in Single-Cell Foundation Models: Inhibitory Dominance, Biological Coherence, and Cross-Model Convergence [0.0]
SAE特徴と下流応答を損なうことで因果回路をトレースする手法を提案する。
我々はGeneformer V2-316M と scGPT に4つの条件で適用した。
論文 参考訳(メタデータ) (2026-03-02T11:21:44Z) - Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing [0.0]
Chain of Simulation(CoS)は、動的に問題を特別な推論戦略にルーティングする新しいデュアルモード推論フレームワークである。
CoSは、数学的問題に対する自己整合性を伴う計算フロー、空間的推論のための表現を伴う記号的状態追跡、マルチホップ推論のためのハイブリッド事実抽出という3つの異なる推論モードを採用している。
論文 参考訳(メタデータ) (2026-02-02T21:44:01Z) - Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward [67.00373428443879]
サブゴールレベルの評価と学習へのパラダイムシフトを導入する。
まず,厳密な形式検証データエンジンを用いたベンチマークであるGeoGoalを構築した。
本研究では,スケルトンレートに基づいて,スパース信号を高密度な報酬に置き換えるサブゴール検証リワード(SGVR)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-08T16:17:56Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models [0.0]
AA-Omniscienceは6000の質問に対する事実的リコールと知識のキャリブレーションを測定するために設計されたベンチマークである。
モデルの評価は、事実のリコールを測定する有界メトリック(-100から100)であるOmniscience Indexを測定する。
その結果、フロンティアモデル全体の持続的な事実性とキャリブレーションの弱点が明らかになった。
論文 参考訳(メタデータ) (2025-11-17T06:27:16Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - A Comparative Study on Reasoning Patterns of OpenAI's o1 Model [69.08287909042421]
OpenAIのo1モデルは、ほとんどのデータセットで最高のパフォーマンスを実現しています。
また、いくつかの推論ベンチマークについて詳細な分析を行う。
論文 参考訳(メタデータ) (2024-10-17T15:09:03Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。