論文の概要: LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB
- arxiv url: http://arxiv.org/abs/2604.14437v1
- Date: Wed, 15 Apr 2026 21:30:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:31.621725
- Title: LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB
- Title(参考訳): テスト生成におけるショートカットのLLM:SAP HANAとLevelDBによる検討
- Authors: Vekil Bekmyradov, Noah C. Pütz, Thomas Bartz-Beielstein,
- Abstract要約: 大規模言語モデル(LLM)は、しばしば高度な推論の主張につながる、公開ベンチマークで印象的な結果を得た。
本稿では,ソフトウェアメモリ化のための自動テスト生成の動作を,オープンソースシステムの性能と対比して検討する。
結果は、LLMはよく知られたオープンソースのベンチマークに優れているが、目立たない複雑で、多くの場合、有効性よりもコンパイル可能性に優先順位をつけるのに苦労していることを示している。
- 参考スコア(独自算出の注目度): 0.22940141855172033
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Models (LLMs) have achieved impressive results on public benchmarks, often leading to claims of advanced reasoning and understanding. However, recent research in cognitive science reveals that these models sometimes rely on shallow heuristics and memorization, taking shortcuts rather than demonstrating genuine cognitive abilities. This paper investigates LLM behavior in automated test generation for software, contrasting performance on an open-source system (LevelDB) with SAP HANA, one of the most widely deployed commercial database systems worldwide, whose proprietary codebase is guaranteed to be absent from training data. We combine cognitive evaluation principles, drawing on Mitchell's mechanism-focused assessment methodology, with empirical software testing, employing mutation score and iterative compiler-feedback repair loops to assess both accuracy and underlying reasoning strategies. Results show that LLMs excel on familiar, open-source benchmarks but struggle with unseen, complex domains, often prioritizing compilability over semantic effectiveness. These findings provide independent software engineering evidence for the broader claim that current LLMs lack robust reasoning, and highlight the need for evaluation frameworks that penalize trivial shortcuts and reward true generalization.
- Abstract(参考訳): 大規模言語モデル(LLM)は、しばしば高度な推論と理解の主張に繋がる、公開ベンチマークで印象的な結果を得た。
しかし、認知科学における最近の研究は、これらのモデルが真の認知能力を示すのではなく、しばしば浅いヒューリスティックと記憶に頼っていることを明らかにしている。
本稿では,ソフトウェアの自動テスト生成におけるLCMの挙動について検討し,オープンソースのシステム(LevelDB)における性能と,トレーニングデータがないことが保証されている,世界で最も広くデプロイされている商用データベースシステムの一つであるSAP HANAとを比較した。
我々は認知評価の原則とミッチェルのメカニズムに着目した評価手法、経験的ソフトウェアテスト、突然変異スコアと反復的コンパイラフィードバック修復ループを併用し、精度と基礎となる推論戦略の両方を評価する。
その結果、LLMはよく知られたオープンソースのベンチマークに優れているが、目に見えない複雑なドメインに悩まされ、セマンティックな効率性よりもコンパイル性を優先することが多い。
これらの発見は、現在のLLMには堅牢な推論が欠けているという広い主張を裏付ける独立したソフトウェアエンジニアリングの証拠を提供し、自明なショートカットを罰し、真の一般化に報いる評価フレームワークの必要性を強調している。
関連論文リスト
- Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy [62.32144504442516]
SOTA LLMが形式言語の構造的・階層的複雑性を把握できるかどうかは不明である。
ChomskyBench はchomsky Hierarchy のレンズを通して LLM を体系的に評価するためのベンチマークである。
ChomskyBenchは、各レベルで機能をテストするように設計された、言語認識と生成タスクの包括的なスイートで構成されている。
論文 参考訳(メタデータ) (2026-04-03T04:06:39Z) - SelfAI: Building a Self-Training AI System with LLM Agents [79.10991818561907]
SelfAIは、高レベルの研究目的を標準化された実験構成に変換するためのUser Agentを組み合わせた、一般的なマルチエージェントプラットフォームである。
実験マネージャは、連続的なフィードバックのための構造化知識ベースを維持しながら、異種ハードウェアをまたいだ並列かつフォールトトレラントなトレーニングを編成する。
回帰、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、冗長な試行を減らしている。
論文 参考訳(メタデータ) (2025-11-29T09:18:39Z) - Toward Automated and Trustworthy Scientific Analysis and Visualization with LLM-Generated Code [6.068120728706316]
大規模言語モデル(LLM)は、自然言語記述からコードを生成することで、有望なソリューションを提供する。
実際の研究課題を反映したドメインインスパイアされたプロンプトのベンチマークスイートを構築した。
人間の介入なしには, LLM生成コードの信頼性は限られている。
論文 参考訳(メタデータ) (2025-11-26T21:27:03Z) - Beyond Synthetic Benchmarks: Evaluating LLM Performance on Real-World Class-Level Code Generation [3.9189409002585567]
大規模言語モデル(LLM)は関数レベルのコード生成ベンチマークで強い性能を示している。
本稿では,実環境下での一般化を評価するために,実世界のオープンソースリポジトリから得られたベンチマークを紹介する。
入力仕様の完全性と検索拡張生成が複数の最先端LCMのクラスレベルの正しさにどのように影響するかを検討する。
論文 参考訳(メタデータ) (2025-10-30T04:30:23Z) - OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics [82.0813150432867]
我々は,大規模言語モデル(LLM)のアンラーニング手法とメトリクスをベンチマークするための標準フレームワークであるOpenUnlearningを紹介する。
OpenUnlearningは、13のアンラーニングアルゴリズムと16のさまざまな評価を3つの主要なベンチマークで統合する。
また、多様なアンラーニング手法をベンチマークし、広範囲な評価スイートとの比較分析を行う。
論文 参考訳(メタデータ) (2025-06-14T20:16:37Z) - Larger Is Not Always Better: Exploring Small Open-source Language Models in Logging Statement Generation [33.501853395036534]
自動ロギングステートメント生成のための大規模言語モデル(LLM)には、プライバシとリソースの問題がある。
本稿では,ロギングステートメントの自動生成のための小規模なオープンソース言語モデル(SOLM)を評価するための大規模な実証的研究について述べる。
論文 参考訳(メタデータ) (2025-05-22T12:26:53Z) - The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance? [1.3810901729134184]
大きな言語モデル(LLM)は、真の言語理解と適応性を示すのに失敗しながら、標準化されたテストで優れている。
NLP評価フレームワークの系統的解析により,評価スペクトルにまたがる広範囲にわたる脆弱性が明らかになった。
我々は、操作に抵抗し、データの汚染を最小限に抑え、ドメイン固有のタスクを評価する新しい評価方法の土台を築いた。
論文 参考訳(メタデータ) (2024-12-02T20:49:21Z) - Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More? [54.667202878390526]
長文言語モデル(LCLM)は、従来、検索システムやデータベースといった外部ツールに依存していたタスクへのアプローチに革命をもたらす可能性がある。
実世界のタスクのベンチマークであるLOFTを導入し、文脈内検索と推論においてLCLMの性能を評価するために設計された数百万のトークンを出力する。
以上の結果からLCLMは,これらのタスクを明示的に訓練したことがないにも関わらず,最先端の検索システムやRAGシステムと競合する驚くべき能力を示した。
論文 参考訳(メタデータ) (2024-06-19T00:28:58Z) - LLMs for Relational Reasoning: How Far are We? [8.840750655261251]
大規模言語モデル(LLM)は、下流タスクで最先端のパフォーマンスを達成することで、多くの領域に革命をもたらした。
近年の取り組みにより,LSMは逐次決定問題の解決に乏しいことが示されている。
論文 参考訳(メタデータ) (2024-01-17T08:22:52Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。