論文の概要: Investigating LLM's Problem Solving Capability -- a Study on Statics Questions
- arxiv url: http://arxiv.org/abs/2606.26103v1
- Date: Thu, 30 Apr 2026 20:17:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.94094
- Title: Investigating LLM's Problem Solving Capability -- a Study on Statics Questions
- Title(参考訳): LLMの問題解決能力に関する調査研究-静的質問の検討
- Abstract要約: 大規模言語モデル(LLM)は、社会の多くの側面、特に教育に急速に影響を与えている。
本研究では, モデル蒸留法を用いて, 静的問題の解法におけるLLM機能の評価を行う。
実験の結果, LLMはテキストのみの静的問題では良好に動作するが, ダイアグラムを導入すると精度が低下することがわかった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have rapidly influenced many aspects of society, particularly education, due to their demonstrated ability to complete assignments and examinations across a wide range of subjects. Although prior studies have examined the educational impact of LLMs, much of the existing work relies on public or open problem datasets and lacks topic-specific analysis. In engineering education, especially within mechanical engineering, systematic investigations of LLM performance on specific problem types remain limited. Instead of using traditional methods that directly ask textbook questions to an LLM tool, our study adopts a model distillation process to evaluate LLM capabilities in solving statics problems. By distilling ChatGPT, we extracted 25 text-only statics questions and further constructed two additional datasets by adding diagrams and modifying their numerical values. Experimental results show that while LLMs perform well on text-only statics problems, their accuracy decreases when diagrams are introduced and the problems require multi-step reasoning. Further analysis suggests that this performance drop is not primarily caused by limitations in image recognition, but rather by difficulties in multi-step reasoning and in consistently applying extracted visual information across successive solution stages.
- Abstract(参考訳): 大規模言語モデル (LLM) は社会、特に教育の多くの側面に急速に影響を与えてきた。
以前の研究では、LLMの教育的影響について検討されてきたが、既存の研究の多くは、公開またはオープンな問題データセットに依存しており、トピック固有の分析が欠如している。
工学教育、特に機械工学の分野では、特定の問題に対するLLMの性能に関する体系的な研究は限られている。
本研究は, LLMツールに直接教科書質問を行う従来の手法の代わりに, LLMの静的問題を解くためのモデル蒸留プロセスを採用する。
ChatGPTを蒸留することにより、25のテキストのみの静的質問を抽出し、ダイアグラムの追加と数値の修正によりさらに2つのデータセットを構築した。
実験結果から, LLMはテキストのみの静的問題では良好に動作するが, ダイアグラムを導入すると精度が低下し, 複数ステップの推論が要求されることがわかった。
さらに解析したところ、この性能低下は主に画像認識の限界によるものではなく、多段階推論の難しさや、連続した解段階にわたって抽出された視覚情報を一貫して適用することによるものであることが示唆された。
関連論文リスト
- ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models [70.33764118171463]
大きな言語モデル(LLM)は、解決不可能な問題やその能力を超える問題に直面した時に、信頼できない応答を作る傾向があります。
我々はオープンソースの解決可能問題と高品質の未解決問題を含むReliableMathデータセットを開発した。
LLMは解決不可能な問題を直接特定できず、常に生成された応答を生成する。
論文 参考訳(メタデータ) (2025-07-03T19:19:44Z) - Evaluating Large Language Models for Real-World Engineering Tasks [75.97299249823972]
本稿では,実運用指向のエンジニアリングシナリオから得られた100以上の質問をキュレートしたデータベースを提案する。
このデータセットを用いて、4つの最先端の大規模言語モデル(LLM)を評価する。
以上の結果から,LLMは時間的および構造的推論において強みを示すが,抽象的推論や形式的モデリング,文脈に敏感な工学的論理にはかなり苦労することがわかった。
論文 参考訳(メタデータ) (2025-05-12T14:05:23Z) - A Knapsack by Any Other Name: Presentation impacts LLM performance on NP-hard problems [64.05451567422342]
自然言語で表現されたNPハード問題の集合であるEveryday Hard Optimization Problems (EHOP) のデータセットを紹介する。
EHOPには、コンピュータサイエンスの教科書(例えば、グラフカラー化)で見られる問題の定式化が含まれている。
複数のプロンプト戦略にまたがる最先端のLCMは、実生活や逆転よりも正確な教科書問題を解くことができる。
論文 参考訳(メタデータ) (2025-02-19T14:39:59Z) - Feasibility Study for Supporting Static Malware Analysis Using LLM [0.8057006406834466]
大規模言語モデル(LLM)はより進歩し、広く普及している。
本研究は,静的解析を支援するためにLLMを使用できるかどうかに焦点を当てる。
論文 参考訳(メタデータ) (2024-11-22T13:03:07Z) - The LLM Effect: Are Humans Truly Using LLMs, or Are They Being Influenced By Them Instead? [60.01746782465275]
大規模言語モデル(LLM)は、様々な分析タスクにおいて、人間のパフォーマンスに近い能力を示している。
本稿では,Human-LLMパートナーシップに着目した構造化ユーザスタディにより,特殊作業におけるLLMの効率と精度について検討する。
論文 参考訳(メタデータ) (2024-10-07T02:30:18Z) - Adversarial Math Word Problem Generation [6.92510069380188]
大規模言語モデル(LLM)の公平な評価を保証するための新しいパラダイムを提案する。
評価を目的とした質問の構造と難易度を保持する逆例を生成するが,LLMでは解けない。
我々は様々なオープン・クローズド・ソース LLM の実験を行い、定量的かつ質的に、我々の手法が数学の問題解決能力を著しく低下させることを示した。
論文 参考訳(メタデータ) (2024-02-27T22:07:52Z) - Factuality of Large Language Models: A Survey [29.557596701431827]
我々は、主要な課題とその原因を特定することを目的として、既存の研究を批判的に分析する。
オープンエンドテキスト生成における事実自動評価の障害を解析する。
論文 参考訳(メタデータ) (2024-02-04T09:36:31Z) - SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models [70.5763210869525]
拡張ベンチマークスイートSciBench for Large Language Model (LLM)を導入する。
SciBenchには、数学、化学、物理学の分野から、さまざまな大学レベルの科学的問題を含むデータセットが含まれている。
その結果、現在のLLMは満足のいく性能を達成できないことが判明し、全体のスコアは43.22%に過ぎなかった。
論文 参考訳(メタデータ) (2023-07-20T07:01:57Z) - Sentiment Analysis in the Era of Large Language Models: A Reality Check [69.97942065617664]
本稿では,大規模言語モデル(LLM)の様々な感情分析タスクの実行能力について検討する。
26のデータセット上の13のタスクのパフォーマンスを評価し、ドメイン固有のデータセットに基づいて訓練された小言語モデル(SLM)と比較した。
論文 参考訳(メタデータ) (2023-05-24T10:45:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。