論文の概要: Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification
- arxiv url: http://arxiv.org/abs/2607.26397v1
- Date: Wed, 29 Jul 2026 02:16:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.524255
- Title: Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification
- Title(参考訳): 推論前の知識: LLM酵素分類のためのトレーニング不要診断ベンチマークEC-Reason-Bench
- Abstract要約: 本稿では,EC-Reason-Benchを提案する。
第一に、外部知識は決定的であり、推論に先立っていなければならない。
第二に、クローズドブックの設定では、カスケードやチェーン・オブ・シンクが役に立つか傷つくかは、モデルが控える傾向に依存する。
- 参考スコア(独自算出の注目度): 36.44850004100564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enzyme function prediction is a hierarchical, knowledge-intensive form of protein function classification. Existing benchmarks expose an anomaly: general LLMs often get the coarse first level right, yet once asked for a complete EC number their accuracy at levels two through four drops to almost zero, while specialized models and tools stay usable. We propose EC-Reason-Bench, a training-free, diagnostic evaluation protocol built to answer two questions: why general LLMs score close to nothing on EC number prediction, and how much of that loss can be recovered without updating a single weight. We break enzyme classification ability into four orthogonal levers that can each be measured on their own: output structure, external knowledge, reasoning structure, and reasoning robustness. We test each lever with an inference-time method against a shared zero-shot baseline reproducing previously reported near-zero performance. Experiments with several strong reasoning LLMs yield four main findings. First, external knowledge is decisive and must precede reasoning: uniformly low closed-book performance rises sharply with open-book access, narrowing model gaps. Second, in closed-book settings, whether cascading and chain-of-thought help or hurt depends on a model's tendency to abstain. Third, once evidence is available the aggregate score of the best LLM setting is indistinguishable from simply voting the EC numbers of the nearest retrieved neighbors; that tie is an artifact of averaging, and it hides a large gain on adversarial evidence set against an equally large loss on multi-functional enzymes. Reasoning over evidence therefore acts as an arbiter of conflicting neighbors rather than as a source of knowledge, and no single-number leaderboard can see it. Fourth, accuracy obeys a law of homology availability.
- Abstract(参考訳): 酵素機能予測は、タンパク質機能分類の階層的で知識集約的な形態である。
既存のベンチマークは異常を露呈する: 一般的なLLMは、しばしば粗い第一レベルを正しく取得するが、一度、完全なEC番号の精度を2から4ドロップからほぼゼロに要求した。
本報告では,2つの質問に答えるために,EC-Reason-Benchというトレーニングフリーの診断評価プロトコルを提案する。
酵素の分類能力は、4つの直交レバーに分解され、それぞれがそれぞれ、出力構造、外部知識、推論構造、ロバスト性などを測定することができる。
我々は,従来報告されていたほぼゼロに近い性能のゼロショットベースライン再生に対して,推定時間法を用いて各レバーを試験した。
いくつかの強い推論 LLM による実験は、4つの主要な発見をもたらす。
均一に低いクローズドブックのパフォーマンスは、オープンブックアクセスによって急上昇し、モデルギャップを狭める。
第二に、クローズドブックの設定では、カスケードやチェーン・オブ・シンクが役に立つか傷つくかは、モデルが控える傾向に依存する。
第三に、一度証拠が得られれば、最高のLCM設定の集合スコアは、単に最も近い隣人のEC番号を投票することと区別できない;ネクタイは平均化の成果であり、多官能酵素に対する等しく大きな損失に対して設定された敵のエビデンスに大きな利益を隠蔽する。
したがって、証拠に関する推論は知識の源としてではなく隣人との対立の仲介者として機能し、単一の数のリーダーボードでそれを見ることはできない。
第4に、正確性はホモロジーの可利用性の法則に従う。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - Zero-Shot Active Feature Acquisition via LLM-Elicitation [33.792645413345845]
大規模言語モデル(LLM)は教師なしのドメイン知識を提供するが、シーケンシャルプランナーは乏しい。
我々は、規律的な勧誘を通じてゼロショットAFAのためのフレームワークを開発する。
フレームワークをバイナリ分類とトップ$kの識別という2つの設定に適用します。
論文 参考訳(メタデータ) (2026-06-17T11:15:38Z) - CauTion: Knowing When to Trust LLMs for Ensemble Causal Discovery [51.07538881798502]
大規模言語モデル(LLM)は、統計的推論を補完する将来的なドメイン知識の源を提供する。
我々は、LLMドメイン知識を統計的因果探索アルゴリズムのアンサンブルに確実に統合するフレームワークであるCauTionを提案する。
CauTionは、データ中心とLLM拡張ベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2026-06-02T13:07:43Z) - DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations [0.0]
既存の幻覚は、アウトプットの誤りによってエラーを分類します。
これらは診断に役立ちますが、別の質問に答えることはできません。
本稿では,検出可能性シグネチャによってエラーを分類する補完的な分類法を提案する。
論文 参考訳(メタデータ) (2026-06-01T14:11:11Z) - A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - RAudit: A Blind Auditing Protocol for Large Language Model Reasoning [0.8594140167290097]
推論時間のスケーリングは、梅毒、暴走崩壊、早さの確実性といった推論の病理を増幅することができる。
基礎的な真理アクセスを伴わずにLCM推論を監査するための診断プロトコルであるRAuditを提案する。
論文 参考訳(メタデータ) (2026-01-30T16:22:45Z) - Realizing LLMs' Causal Potential Requires Science-Grounded, Novel Benchmarks [20.409472830397455]
因果発見に関するLLM(Large Language Models)による最近の強いパフォーマンスの主張は、重要な欠陥によって損なわれている。
LLMは因果構造を本当に理由付けていますか?
LLMの因果解析の可能性を実現するには、(P.1)最近の科学的研究に基づく堅牢な評価プロトコルを開発し、(P.2)LLM由来の知識とデータ駆動統計を組み合わせたハイブリッドな手法を設計することが必要である。
論文 参考訳(メタデータ) (2025-10-18T14:58:04Z) - Retrieving Classes of Causal Orders with Inconsistent Knowledge Bases [0.8192907805418583]
大規模言語モデル(LLM)は、テキストベースのメタデータから因果的知識を抽出するための有望な代替手段として登場した。
LLMは信頼できない傾向があり、幻覚を起こす傾向があり、その限界を考慮に入れた戦略を必要とする。
本稿では,非循環型トーナメントのクラスを導出する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-12-18T16:37:51Z) - Evaluating Human Alignment and Model Faithfulness of LLM Rationale [66.75309523854476]
大規模言語モデル(LLM)が,その世代を理論的にどのように説明するかを考察する。
提案手法は帰属に基づく説明よりも「偽り」が少ないことを示す。
論文 参考訳(メタデータ) (2024-06-28T20:06:30Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Making Large Language Models Better Reasoners with Alignment [57.82176656663245]
推論(Reasoning)とは、証拠を使って結論に達する認知過程である。
近年の研究では、思考の連鎖(COT)推論プロセスによるデータ上の微調整LDMは、その推論能力を著しく向上させることができることが示されている。
テキストアライメントファインチューニング(AFT)パラダイムを3ステップで導入する。
論文 参考訳(メタデータ) (2023-09-05T11:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。