論文の概要: Benchmarking LLM Competence on Logical Inference over Probability Operators
- arxiv url: http://arxiv.org/abs/2607.27405v2
- Date: Fri, 31 Jul 2026 02:03:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.310871
- Title: Benchmarking LLM Competence on Logical Inference over Probability Operators
- Title(参考訳): 確率演算子に対する論理的推論におけるLLM能力のベンチマーク
- Abstract要約: 大規模言語モデルは、論理的推論タスクでますます評価される。
確率演算子に対する推論のためのベンチマークを導入する。
29のモデルを評価した結果,解答のバイアスは論理形式とは無関係であることが判明した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Both expressions of uncertainty and inferences are ubiquitous in natural language, and valid inferences over natural-language expressions of uncertainty are necessary for not only everyday conversations but also for high-stakes domains such as medicine and law. While large language models are increasingly evaluated on logical reasoning tasks, disentangling principled, symbolic reasoning from clever surface-level pattern matching is fraught with difficulty. We introduce a benchmark for reasoning over probability operators--inference over sentences with gradable epistemic modals (e.g., probably, might, must) containing 14,320 procedurally-generated English prompts across fifteen inference templates, systematically varying question form, negation strategy, and surface content. Evaluating 29 models, we find that most show answer biases independent of the logical form, a systematic preference for Yes or No. We summarize this with a competence floor: the worse of a model's accuracy on Yes-correct and No-correct items. Only 9 of 29 models exceed random chance. We also test variations in question form, verb phrases/activity, and both the gender and origin of names used in the prompts, finding biases across every axis.
- Abstract(参考訳): 不確実性の表現も推論も自然言語ではユビキタスであり、日常的な会話だけでなく、医学や法律などの高度な領域においても、不確実性の自然言語表現に対する有効な推論が必要である。
大きな言語モデルは、論理的推論タスクでますます評価されるが、巧妙な表面レベルのパターンマッチングによる記号的推論は難解である。
本稿では,14,320の韻律的に生成された英語のプロンプトを15の推論テンプレート,体系的に異なる質問形式,否定戦略,および表面内容を含む,段階的エピステマティックモーダルを持つ文に対する推論(例えば,おそらくは,必要かもしれない)について,確率演算子に対する推論のベンチマークを導入する。
29のモデルを評価すると、ほとんどの解答バイアスは論理形式とは無関係であり、Yes または No の体系的な選好であることがわかった。
モデルの正確さは,Yes-correct とNo-correct の項目で悪くなります。
29モデルのうち9モデルのみがランダムな確率を超える。
また、質問形式、動詞句/活動性、およびプロンプトで使用される名前の性別と起源の両方を検査し、各軸に偏りを見いだした。
関連論文リスト
- Are Language Models Efficient Reasoners? A Perspective from Logic Programming [109.47572890883248]
現代言語モデル(LM)は、強い推論能力を示すが、標準的な評価は、人間のような推論の重要な側面である効率性を見越しながら、正確性を強調する。
本稿では、論理プログラミングのレンズを用いて、LM推論効率を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-29T15:30:31Z) - DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models [58.439517684779936]
本稿では,多種多様な文からなる自然文からなる古典論理ベンチマークDivLogicEvalを提案する。
また,より信頼性の高い評価を実現するために,大規模言語モデルに固有のバイアスやランダム性の影響を緩和する新たな評価指標を導入する。
論文 参考訳(メタデータ) (2025-09-19T04:40:46Z) - Large Language Model probabilities cannot distinguish between possible and impossible language [0.11726720776908521]
モデル-内部表現を使用して、大言語モデルが'文法-非文法'の区別を表現する方法を直接タップします。
文字列確率が文法の限界のプロキシとして機能すると、非文法的条件は言語的違反を含む条件の中で際立つと予測する。
この結果から,非文法的プロンプトに対する特異な副次的シグネチャは明らかにされていない。
論文 参考訳(メタデータ) (2025-09-18T16:17:48Z) - QUITE: Quantifying Uncertainty in Natural Language Text in Bayesian Reasoning Scenarios [15.193544498311603]
本稿では,カテゴリー的確率変数と複雑な関係を持つ実世界のベイズ推論シナリオのデータセットであるQUITEを提案する。
我々は幅広い実験を行い、論理ベースのモデルが全ての推論型において、アウト・オブ・ボックスの大規模言語モデルより優れていることを発見した。
以上の結果から,ニューロシンボリックモデルが複雑な推論を改善する上で有望な方向であることを示す。
論文 参考訳(メタデータ) (2024-10-14T12:44:59Z) - A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners [58.15511660018742]
本研究では,大規模言語モデル (LLM) が真の推論能力を持つかどうかを評価するための仮説検証フレームワークを提案する。
我々は,相補的な誤りとシロジカルな問題を特徴とする,注意深く制御された合成データセットを開発した。
論文 参考訳(メタデータ) (2024-06-16T19:22:53Z) - Scaling Synthetic Logical Reasoning Datasets with Context-Sensitive Declarative Grammars [0.6537995248511139]
複数の言語を結合するフレキシブルなコンテキスト依存ルールを持つ宣言型フレームワークを提案する。
最大32の前提と1つの仮説を選択して一階述語論理問題を構築する。
生成中の意味的制約と述語に対する注意深い英語の動詞化は、自然な英語のタスクを損なうことなく論理的推論を促進することを実証する。
論文 参考訳(メタデータ) (2024-06-16T18:10:49Z) - How often are errors in natural language reasoning due to paraphrastic variability? [29.079188032623605]
本稿では,自然言語推論モデルのパラフラスティック一貫性を評価するための指標を提案する。
我々は、この計量をパラフレーズ化に起因するモデルの正しさの分散の比率に数学的に結合する。
そこで我々は,7,782人の人間による記述・検証された推論問題のデータセットであるParaNLUを収集した。
論文 参考訳(メタデータ) (2024-04-17T20:11:32Z) - UNcommonsense Reasoning: Abductive Reasoning about Uncommon Situations [62.71847873326847]
異常、予期せぬ、そしてありそうもない状況をモデル化する能力について検討する。
予期せぬ結果のコンテキストが与えられた場合、このタスクは説明を生成するために故意に推論する必要がある。
私たちはUNcommonsenseという新しい英語コーパスをリリースします。
論文 参考訳(メタデータ) (2023-11-14T19:00:55Z) - Teaching Probabilistic Logical Reasoning to Transformers [21.335836561959887]
本研究では,不確実なテキストに対する推論において,トランスフォーマーに基づく言語モデルの有効性を評価する。
本稿では,確率的制約学習という,エンドツーエンドのファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2023-05-22T16:08:20Z) - Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation
in Natural Language Generation [37.37606905433334]
我々は,「意味的同値性」により,自然言語の不確実性の測定が困難であることを示す。
意味的エントロピー(semantic entropy)は、共有された意味によって生成される言語的不変性を含むエントロピーである。
本手法は教師なしで,単一のモデルのみを使用し,既製の言語モデルの変更は不要である。
論文 参考訳(メタデータ) (2023-02-19T20:10:07Z) - Maieutic Prompting: Logically Consistent Reasoning with Recursive
Explanations [71.2950434944196]
ノイズや一貫性のない言語モデルでさえも問題に対する正しい答えを推測するMaieutic Promptingを開発する。
Maieutic Promptingは最先端のプロンプト法よりも最大20%精度が高い。
論文 参考訳(メタデータ) (2022-05-24T06:36:42Z) - Interpreting Language Models with Contrastive Explanations [99.7035899290924]
言語モデルは、音声、数字、時制、意味論など、トークンを予測するための様々な特徴を考慮しなければならない。
既存の説明手法は、これらの特徴の証拠を1つの説明に分割するが、人間の理解には理解できない。
比較的な説明は、主要な文法現象の検証において、非対照的な説明よりも定量的に優れていることを示す。
論文 参考訳(メタデータ) (2022-02-21T18:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。