論文の概要: Large Language Models Have Unreliable Understanding of Software Engineering Terminology
- arxiv url: http://arxiv.org/abs/2607.06004v1
- Date: Tue, 07 Jul 2026 08:46:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.458767
- Title: Large Language Models Have Unreliable Understanding of Software Engineering Terminology
- Title(参考訳): 大規模言語モデルはソフトウェア工学の用語を信頼できない
- Abstract要約: 大規模言語モデル(LLM)は、ソフトウェア工学(SE)でますます使われている
これらのLSMが実際に標準化されたSE項を理解する程度を決定する体系的な研究は存在しない。
このような理解の欠如は、誤解や誤解につながる可能性がある。
- 参考スコア(独自算出の注目度): 5.652196062649331
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly used in software engineering (SE), yet there is no systematic study that determines to which degree these LLMs actually understand standardized SE terminology. Lack of such understanding can lead to miscommunication and misunderstanding, both by LLMs consuming text but also by human-developers acting on LLM-generated text. Within this paper, we investigate to which degree state-of-the-art LLMs are able to identify whether definitions from the ISO/IEC/IEEE 24765:2017 Systems and Software Engineering - Vocabulary are correct. We prompt LLMs both with correct definitions, as well as systematically falsified definitions. The falsifications are both semantic (substitution of key terms) and structural (removing critical information). We measure both classification accuracy and whether reasoning tokens generated by the LLMs make sense with respect to understanding the definition. While most LLMs detect falsified definitions with high accuracy, they also reject many correct definitions, indicating a systematic rejection bias rather than genuine discriminative understanding. Explicit reasoning does not consistently improve results and may even hinder performance through over-thinking. Our work demonstrates that while the performance of LLMs (including their agentic use) in many SE tasks is impressive, there are still fundamental issues to understand how this will impact SE, including the consistent use of terminology.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ソフトウェア工学(SE)においてますます使われているが、これらのLLMが実際に標準化されたSEの用語を理解する程度を決定する体系的な研究は存在しない。
このような理解の欠如は、LLMがテキストを消費するだけでなく、LLMが生成したテキストに作用する人間開発者によっても、誤ったコミュニケーションと誤解を引き起こす可能性がある。
本稿では,ISO/IEC/IEEE 24765:2017 Systems and Software Engineering - Vocabulary の定義が正しいかどうかを,最先端の LLM がどの程度特定できるかを検討する。
我々は LLM を正しい定義と体系的にファルシフィケートした定義の両方で促す。
ファルシフィケーションは意味論的(キー用語の置換)と構造的(臨界情報の除去)の両方である。
分類精度と LLM が生成する推論トークンが定義を理解する上で理にかなっているかどうかを測る。
ほとんどのLCMは偽造定義を高い精度で検出するが、多くの正しい定義を拒絶し、真の識別的理解よりも体系的な拒絶バイアスを示している。
明示的な推論は結果を継続的に改善しないため、過度に考えることでパフォーマンスを阻害する可能性がある。
我々の研究は、多くのSEタスクにおけるLLMのパフォーマンス(エージェントの使用を含む)が印象的である一方で、このことがSEにどのような影響を及ぼすかを理解するための根本的な問題がまだ残っていることを実証している。
関連論文リスト
- LLMs Explain't: A Post-Mortem on Semantic Interpretability in Transformer Models [3.7965260744113163]
大きな言語モデル(LLM)は、その汎用性と強力なパフォーマンスのために、広範にコンピューティングで人気が高まっている。
本稿では,LLMにおいて言語的抽象化がどのように現れるのかを考察し,異なるモジュール間で言語的抽象化を検出することを目的とする。
注意に基づく説明は、後層表現がトークンに対応しているというコア仮定をテストすると、崩壊します。
埋め込みに適用される特性推論法も、その高い予測スコアが、方法論的アーティファクトとデータセット構造によって駆動されたため失敗した。
論文 参考訳(メタデータ) (2026-01-30T12:46:37Z) - Do LLMs Adhere to Label Definitions? Examining Their Receptivity to External Label Definitions [46.08795043966853]
複数の説明ベンチマークデータセット(一般およびドメイン固有)にまたがる実験を行う。
以上の結果から,明示的なラベル定義は精度と説明可能性を高めることができるが,LLMのタスク解決プロセスへの統合は保証されず,一貫性も持たないことが明らかとなった。
これらの知見は、LLMが既存の能力とともに外部知識をどのように処理するかをより深く理解する必要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-09-02T16:01:47Z) - Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications [0.6813925418351435]
大規模言語モデル(LLM)はソフトウェア開発において不可欠なツールとなり、要求工学、コード生成、レビュータスクに広く利用されている。
本稿では,LLMが自然言語の要求に適合するかどうかを評価する上で,体系的に失敗していることを明らかにする。
以上の結果から,LCMは要件を満たすことのできないコード実装や潜在的な欠陥を含むコード実装を誤って分類することが多いことが判明した。
論文 参考訳(メタデータ) (2025-08-17T13:07:26Z) - How Accurately Do Large Language Models Understand Code? [4.817546726074033]
大規模言語モデル(LLM)は、コードの修復やテストといった開発後のタスクでますます使われています。
コードの理解の定量化は、その抽象的な性質と標準化されたメトリクスの欠如のために難しい。
本稿では,LLMのコード理解能力に関する大規模な実証的研究を行った。
論文 参考訳(メタデータ) (2025-04-06T05:59:29Z) - Computation Mechanism Behind LLM Position Generalization [59.013857707250814]
大規模言語モデル(LLM)は、テキストの位置を扱う際の柔軟性を示す。
彼らは位置摂動のあるテキストを理解し、より長いテキストに一般化することができる。
この研究は言語現象とLLMの計算機構を結びつける。
論文 参考訳(メタデータ) (2025-03-17T15:47:37Z) - Disparities in LLM Reasoning Accuracy and Explanations: A Case Study on African American English [66.97110551643722]
本研究では,Large Language Models (LLMs) 推論タスクにおける方言の相違について検討する。
LLMは、AAE入力に対するより正確な応答とより単純な推論チェーンと説明を生成する。
これらの知見は、LLMの処理方法と異なる言語品種の理由の体系的差異を浮き彫りにした。
論文 参考訳(メタデータ) (2025-03-06T05:15:34Z) - Do LLMs Really Adapt to Domains? An Ontology Learning Perspective [2.0755366440393743]
大規模言語モデル(LLM)は、様々なアプリケーション領域において、様々な自然言語処理タスクに対して前例のない進歩を見せている。
近年の研究では、LLMが知識ベースコンプリート(KBC)やオントロジー学習(OL)などの語彙意味タスクに活用できることが示されている。
LLMは本当にドメインに適応し、構造化知識の抽出に一貫性を持ち続けるのか、それとも推論の代わりに語彙感覚のみを学ぶのか?
論文 参考訳(メタデータ) (2024-07-29T13:29:43Z) - To Know or Not To Know? Analyzing Self-Consistency of Large Language Models under Ambiguity [27.10502683001428]
本稿では, 実体型あいまいさに着目し, 不明瞭な実体を刺激した場合の事実知識の適用において, 最先端のLCMの習熟度と一貫性を解析する。
実験の結果、LLMは正しいエンティティの読み取りを選択するのに苦労し、平均精度は85%、未特定のプロンプトで75%と低いことがわかった。
論文 参考訳(メタデータ) (2024-07-24T09:48:48Z) - Potential and Limitations of LLMs in Capturing Structured Semantics: A Case Study on SRL [78.80673954827773]
大きな言語モデル(LLM)は、言語理解を高め、解釈可能性を改善し、バイアスを減らすために構造化セマンティクスをキャプチャする上で重要な役割を果たす。
セマンティック・ロール・ラベルリング(SRL)を,構造化意味論を抽出するLLMの能力を探るための基本課題として用いることを提案する。
LLMは実際にセマンティック構造をキャプチャすることができ、スケールアップは常にポテンシャルを反映するわけではない。
エラーのかなりの重複は、LLMと訓練されていない人間の両方によって行われ、全てのエラーの約30%を占めることに私たちは驚いています。
論文 参考訳(メタデータ) (2024-05-10T11:44:05Z) - The Strong Pull of Prior Knowledge in Large Language Models and Its Impact on Emotion Recognition [74.04775677110179]
In-context Learning (ICL) は、Large Language Models (LLM) を用いた自然言語処理のための強力なパラダイムとして登場した。
LLMには、感情認識において強いが矛盾する先行性があり、その予測に影響を及ぼすことが示される。
以上の結果から,ICLをより大きなLCMで事前学習領域外の情動中心タスクに使用する場合,注意が必要であることが示唆された。
論文 参考訳(メタデータ) (2024-03-25T19:07:32Z) - FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition [56.76951887823882]
大規模言語モデル(LLM)は、主に様々なテキスト理解および生成タスクにおける全体的なパフォーマンスによって評価される。
FAC$2$E, FAC$2$Eについて述べる。
論文 参考訳(メタデータ) (2024-02-29T21:05:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。