論文の概要: Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions
- arxiv url: http://arxiv.org/abs/2607.08885v1
- Date: Thu, 09 Jul 2026 19:22:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.732949
- Title: Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions
- Title(参考訳): プログラマはLLM生成アサーションの粗悪で過信な審査員である
- Abstract要約: 生成したアサーションの正確性と完全性を評価する開発者の能力を評価するため,86人のPythonプログラマによる制御実験を行った。
一般的な仮定に反して、AIアシストはコードの理解とレビューの信頼性を向上しない可能性がある。
- 参考スコア(独自算出の注目度): 12.758916403043207
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code comprehension and code review are already critically important software engineering tasks, and the rising use of AI code generation tools is only increasing that importance. Generative AI has the possibility of supporting these activities, for example by augmenting code with assertions and natural-language explanations describing code behavior. However, little is known about how effective such support may be. We conduct a controlled experiment with 86 Python programmers and a follow-up think-aloud study to examine developers' ability to assess the correctness and completeness of generated assertions of varying quality, and to investigate how natural-language explanations influence these assessments. While programmers can somewhat accurately judge correct assertions (74% accuracy), they perform poorly when shown incorrect assertions (49% accuracy), despite reporting similar levels of confidence in both judgments. This difference in judgment accuracy is statistically significant (p < 0.001): the odds of a developer accurately judging a correct assertion was nearly three times higher than the odds of accurately judging an incorrect assertion (OR = 2.94). Surprisingly, natural-language explanations of assertions provided no overall benefit. Furthermore, low-quality explanations could impair specification assessment accuracy (p = 0.037, OR = 0.58) while simultaneously increasing developer confidence (p = 0.005, 3.99/5 vs. 4.25/5). Our findings suggest that, contrary to common assumptions, AI assistance may not improve the reliability of code comprehension and review. More broadly, our findings highlight the importance of helping developers evaluate machine-generated reliability artifacts, in addition to generating them.
- Abstract(参考訳): コード理解とコードレビューは、すでに重要なソフトウェアエンジニアリングタスクであり、AIコード生成ツールの利用の増加は、その重要性を増しているに過ぎない。
生成AIは、例えば、アサーションによるコード拡張や、コード振る舞いを記述する自然言語の説明など、これらのアクティビティをサポートする可能性がある。
しかし、そのような支援がどの程度効果的かは分かっていない。
我々は、86人のPythonプログラマによる制御された実験と、様々な品質の生成されたアサーションの正しさと完全性を評価する開発者の能力と、自然言語による説明がこれらの評価にどのように影響するかを考察する。
プログラマは正確なアサーション(精度74%)をある程度正確に判断できるが、誤ったアサーション(精度49%)を示すと、どちらの判断にも同様の信頼度が報告されているにもかかわらず、パフォーマンスが良くない。
正確なアサーションを正確に判断する確率は、誤ったアサーションを正確に判断する確率(OR = 2.94)の約3倍である。
驚くべきことに、アサーションに関する自然言語の説明は全体的な利益を与えなかった。
さらに、低品質な説明は仕様評価の精度(p = 0.037, OR = 0.58)を損なう可能性があり、同時に開発者の自信を増す(p = 0.005, 3.99/5 vs. 4.25/5)。
我々の知見は、一般的な仮定に反して、AIアシストはコードの理解とレビューの信頼性を向上しない可能性があることを示唆している。
より広い範囲で、我々の発見は、開発者がマシン生成の信頼性アーティファクトとそれを生成することを支援することの重要性を強調しています。
関連論文リスト
- Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning [7.228124845671868]
ニューロフォーマル検証(NFV)は、主流プログラミング言語の開発者の自動化を活用する。
AI符号化エージェントが翻訳し、確立された検証者が決定し、機械チェックされた証明により、音質よりも経験的精度で、主流言語で提起された質問にプッシュボタンで回答する。
正誤のPython問題のデータセットの結果は、llm-as-judgeベースラインと比較して推奨されている。
論文 参考訳(メタデータ) (2026-08-21T18:00:02Z) - Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors [52.619793817715326]
本稿では,LLM生成したPythonエラーメッセージを,多段階のクラウドソースで評価する。
LLMで書き直されたメッセージは主観評価を著しく向上させたが、これらの評価結果は客観的デバッグ性能の統計的に有意な改善には至らなかった。
これは重要なヒューマンとAIの相補性ギャップを浮き彫りにしている。
論文 参考訳(メタデータ) (2026-08-21T09:14:28Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Do What? Teaching Vision-Language-Action Models to Reject the Impossible [53.40183895299108]
VLA(Vision-Language-Action)モデルは、さまざまなロボットタスクにおいて強力なパフォーマンスを示している。
Instruct-Verify-and-Act(IVA)を提案する。
実験の結果,IVAはベースラインよりも97.56%の精度で虚偽の前提検出精度を向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-22T10:54:33Z) - Do AI models help produce verified bug fixes? [62.985237003585674]
大規模言語モデルは、ソフトウェアバグの修正に使用される。
本稿では,プログラマが大規模言語モデルを用いて,自身のスキルを補完する方法について検討する。
その結果は、プログラムバグに対する保証された修正を提供するAIとLLMの適切な役割への第一歩となる。
論文 参考訳(メタデータ) (2025-07-21T17:30:16Z) - Understanding Code Understandability Improvements in Code Reviews [79.16476505761582]
GitHub上のJavaオープンソースプロジェクトからの2,401のコードレビューコメントを分析した。
改善提案の83.9%が承認され、統合され、1%未満が後に復活した。
論文 参考訳(メタデータ) (2024-10-29T12:21:23Z) - AI-enhanced Auto-correction of Programming Exercises: How Effective is
GPT-3.5? [0.0]
本稿では、パーソナライズされたコード修正とフィードバック生成におけるAIの可能性について検討する。
GPT-3.5は、実際のエラーではないエラーのローカライズや、幻覚的エラーなど、評価の弱点を示した。
論文 参考訳(メタデータ) (2023-10-24T10:35:36Z) - When Good and Reproducible Results are a Giant with Feet of Clay: The Importance of Software Quality in NLP [23.30735117217225]
本稿では,最先端コンフォーマーアーキテクチャの実装で広く使用されている3つのバグを特定し,修正するケーススタディを提案する。
我々は、ニューラルネットワークのテスト専用のライブラリである、コード品質チェックリストとリリースパンゴリNNを提案する。
論文 参考訳(メタデータ) (2023-03-28T17:28:52Z) - Generation Probabilities Are Not Enough: Uncertainty Highlighting in AI Code Completions [54.55334589363247]
本研究では,不確実性に関する情報を伝達することで,プログラマがより迅速かつ正確にコードを生成することができるかどうかを検討する。
トークンのハイライトは、編集される可能性が最も高いので、タスクの完了が早くなり、よりターゲットを絞った編集が可能になることがわかりました。
論文 参考訳(メタデータ) (2023-02-14T18:43:34Z) - Invalidator: Automated Patch Correctness Assessment via Semantic and
Syntactic Reasoning [6.269370220586248]
本稿では,意味論的および統語論的推論により,APR生成パッチの正当性を自動的に評価する手法を提案する。
我々は、Defects4Jの現実世界のプログラムで生成された885パッチのデータセットについて実験を行った。
実験の結果,INVALIDATORは79%のオーバーフィッティングパッチを正しく分類し,最高のベースラインで検出されたパッチを23%上回った。
論文 参考訳(メタデータ) (2023-01-03T14:16:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。