論文の概要: Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.03038v1
- Date: Tue, 04 Aug 2026 02:40:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.999911
- Title: Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models
- Title(参考訳): 精度を超えて:大規模言語モデルにおける統計的推論の多次元的評価
- Authors: Monnie McGee, Mateo Langston Smith, Julian Cabrera,
- Abstract要約: 本研究では,応答精度,応答挙動,構造的トピックモデリング,語彙的類似性解析を組み合わせることで,多次元評価の価値を実証する。
精度は55%から78%の範囲で大きく異なっていた。
同じベンダーによって開発されたモデルは、異なるベンダーのモデルと少し似ている説明を生み出した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Statistical reasoning is multidimensional, yet evaluations of large language models (LLMs) typically emphasize response accuracy while overlooking how models construct and communicate statistical explanations. This study demonstrates the value of a multidimensional evaluation by combining response accuracy, response behavior, structural topic modeling, and lexical similarity analysis. The framework is applied to explanations generated by 15 current-generation LLMs responding to 90 questions drawn from four statistics examinations spanning high school, undergraduate, and graduate levels. Accuracy varied substantially across models, ranging from 55\% to 78\%. In contrast, structural topic modeling revealed a common conceptual organization of statistical reasoning across all models, while lexical similarity analysis identified modest but consistent vendor-specific differences in explanatory style. Models developed by the same vendor (e.g. Anthropic, OpenAI) produced explanations that were slightly more similar than models from different vendors. These findings demonstrate that statistical reasoning in contemporary LLMs cannot be characterized by accuracy alone and illustrate how complementary analyses of response behavior and model-generated explanations provide a more comprehensive evaluation of statistical reasoning in generative AI.
- Abstract(参考訳): 統計的推論は多次元であるが、大規模言語モデル(LLM)の評価は、モデルがどのように統計的説明を構築し、伝達するかを見極めながら、応答精度を強調するのが一般的である。
本研究では,応答精度,応答挙動,構造的トピックモデリング,語彙的類似性解析を組み合わせることで,多次元評価の価値を実証する。
この枠組みは、高校、学部、大学院の4つの統計試験から得られた90の質問に応答する15の次世代LCMによって生成された説明に適用される。
精度は55\%から78\%の範囲で大きく異なっていた。
対照的に、構造的トピックモデリングは、すべてのモデルに共通する統計的推論の概念的組織を明らかにし、語彙的類似性分析は、説明スタイルにおいて、控えめだが一貫したベンダー固有の違いを特定した。
同じベンダー(例えば、OpenAI)によって開発されたモデルは、異なるベンダーのモデルと少し似ている説明を生み出しました。
これらの結果から,現代のLCMにおける統計的推論は,精度だけでは特徴付けることができないことが示され,また,応答行動の相補的解析とモデルによる説明が,生成AIにおける統計的推論のより包括的な評価にどのように貢献するかが示唆された。
関連論文リスト
- Hypothesis Class Determines Explanation: Why Accurate Models Disagree on Feature Attribution [0.0]
同一の予測行動を持つモデルでは,特徴属性が著しく異なることが判明した。
我々は,この現象の構造的要因として仮説クラスを同定し,これを説明ロタリーと呼ぶ。
実験の結果,モデル選択は説明中立ではないことが明らかとなった。
論文 参考訳(メタデータ) (2026-03-16T18:55:50Z) - How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns [51.02752099869218]
大きな言語モデル(LLM)は、非常に異なる一般化の振る舞いを示す。
推論を原子核スキルに分解する新しいベンチマークを導入する。
SFTモデルはよりシャープなドリフトと表面パターンへの過度な適合を示すのに対し、RL型モデルはより安定した行動プロファイルを維持し、推論スキルの崩壊に抵抗することを示す。
論文 参考訳(メタデータ) (2025-12-30T08:16:20Z) - Schoenfeld's Anatomy of Mathematical Reasoning by Language Models [56.656180566692946]
我々は、Schoenfeldのエピソード理論を誘導型中間スケールレンズとして採用し、ThinkARM(モデルにおける推論の解剖学)を紹介する。
ThinkARMは、推論トレースを分析、探索、実装、検証などの機能的推論ステップに明示的に抽象化する。
エピソードレベルの表現は推論ステップを明確にし、現代の言語モデルにおける推論がどのように構造化され、安定化され、変更されるかの体系的な分析を可能にする。
論文 参考訳(メタデータ) (2025-12-23T02:44:25Z) - From Black-box to Causal-box: Towards Building More Interpretable Models [57.23201263629627]
本稿では, 因果解釈可能性の概念を導入し, 特定のモデルのクラスから対実的クエリを評価できるときの形式化について述べる。
我々は、与えられたモデルアーキテクチャが与えられた偽物クエリをサポートするかどうかを決定する完全なグラフィカルな基準を導出する。
論文 参考訳(メタデータ) (2025-10-24T20:03:18Z) - Explaining word embeddings with perfect fidelity: Case study in research impact prediction [0.0]
本稿では,単語埋め込みに基づいて学習したロジスティック回帰に基づく分類モデルに対して,新たな特徴重要度手法である自己モデルRated Entities(SMER)を提案する。
SMERは理論上、説明されたモデルに完全に忠実である。
SMERはLIME,SHAP,Global Tree surrogatesよりもよく説明できることを示した。
論文 参考訳(メタデータ) (2024-09-24T09:28:24Z) - Evaluating Consistency and Reasoning Capabilities of Large Language Models [0.0]
大規模言語モデル(LLM)は現在、学術、研究、ビジネス、金融など様々な分野で広く使われている。
広く採用されているにもかかわらず、これらのモデルはしばしば誤った誤解を招く情報を生み出し、幻覚の傾向を示す。
本稿では,パブリックおよびプロプライエタリLLMの整合性と推論能力を評価・比較することを目的とする。
論文 参考訳(メタデータ) (2024-04-25T10:03:14Z) - A Comprehensive Evaluation and Analysis Study for Chinese Spelling Check [53.152011258252315]
音声とグラフィックの情報を合理的に使用することは,中国語のスペルチェックに有効であることを示す。
モデルはテストセットのエラー分布に敏感であり、モデルの欠点を反映している。
一般的なベンチマークであるSIGHANは、モデルの性能を確実に評価できない。
論文 参考訳(メタデータ) (2023-07-25T17:02:38Z) - A Mechanistic Interpretation of Arithmetic Reasoning in Language Models
using Causal Mediation Analysis [128.0532113800092]
算数問題に対するトランスフォーマーに基づくLMの機械的解釈を提案する。
これにより、算術に関連する情報がLMによってどのように処理されるかについての洞察が得られる。
論文 参考訳(メタデータ) (2023-05-24T11:43:47Z) - A comprehensive comparative evaluation and analysis of Distributional
Semantic Models [61.41800660636555]
我々は、静的DSMによって生成されたり、BERTによって生成された文脈化されたベクトルを平均化して得られるような、型分布ベクトルの包括的評価を行う。
その結果、予測ベースモデルの優越性は現実よりも明らかであり、ユビキタスではないことが明らかとなった。
我々は認知神経科学からRepresentational similarity Analysis(RSA)の方法論を借りて、分布モデルによって生成された意味空間を検査する。
論文 参考訳(メタデータ) (2021-05-20T15:18:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。