論文の概要: The Mind Is a Powerful Place: How Showing Code Comprehensibility Metrics
Influences Code Understanding
- arxiv url: http://arxiv.org/abs/2012.09590v2
- Date: Wed, 10 Feb 2021 12:52:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2023-04-20 10:42:40.744735
- Title: The Mind Is a Powerful Place: How Showing Code Comprehensibility Metrics
Influences Code Understanding
- Title(参考訳): 心は強力な場所である:コードの理解度がコード理解にどのように影響するか
- Abstract要約: ソースコードの理解度を示す指標が,ソースコードの理解度を主観的に評価する上で,開発者を悩ませるかどうかを検討する。
その結果、理解度測定値の表示値は、開発者のコード理解度評価に大きく、かつ大きなアンカー効果があることがわかった。
- 参考スコア(独自算出の注目度): 10.644832702859484
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Static code analysis tools and integrated development environments present
developers with quality-related software metrics, some of which describe the
understandability of source code. Software metrics influence overarching
strategic decisions that impact the future of companies and the prioritization
of everyday software development tasks. Several software metrics, however, lack
in validation: we just choose to trust that they reflect what they are supposed
to measure. Some of them were even shown to not measure the quality aspects
they intend to measure. Yet, they influence us through biases in our
cognitive-driven actions. In particular, they might anchor us in our decisions.
Whether the anchoring effect exists with software metrics has not been studied
yet. We conducted a randomized and double-blind experiment to investigate the
extent to which a displayed metric value for source code comprehensibility
anchors developers in their subjective rating of source code comprehensibility,
whether performance is affected by the anchoring effect when working on
comprehension tasks, and which individual characteristics might play a role in
the anchoring effect. We found that the displayed value of a comprehensibility
metric has a significant and large anchoring effect on a developer's code
comprehensibility rating. The effect does not seem to affect the time or
correctness when working on comprehension questions related to the code
snippets under study. Since the anchoring effect is one of the most robust
cognitive biases, and we have limited understanding of the consequences of the
demonstrated manipulation of developers by non-validated metrics, we call for
an increased awareness of the responsibility in code quality reporting and for
corresponding tools to be based on scientific evidence.
- Abstract(参考訳): 静的コード解析ツールと統合開発環境は、開発者が品質関連のソフトウェアメトリクスを提供する。
ソフトウェアメトリクスは、企業の未来と日々のソフトウェア開発タスクの優先順位に影響を与える戦略的決定全体に影響を与える。
しかし、いくつかのソフトウェアメトリクスには検証の欠如がある。
それらの一部は、彼らが測定しようとしている品質の側面を測ることさえできなかった。
しかし、認知主導的な行動のバイアスによって影響を受けます。
特に、私たちの決定に固執するかもしれません。
ソフトウェアメトリクスにアンカー効果が存在するかどうかはまだ研究されていない。
我々は,ソースコード理解度を示す指標値が,ソースコード理解度に対する主観評価において,開発者に対してどのような影響を及ぼすか,理解タスクにおけるアンカー効果の影響の有無,アンカー効果における個々の特性の役割について,ランダム化および二重盲検実験を行った。
理解度メトリクスの表示された値は、開発者のコード理解度に有意かつ大きなアンカー効果をもたらすことが分かりました。
この影響は、研究中のコードスニペットに関連する理解的質問に取り組む際の時間や正確性に影響しないように思われる。
アンカリング効果は最も堅牢な認知バイアスの1つであり、非バリデードメトリクスによる開発者操作の結果を限定的に理解しているため、コード品質報告における責任の認識の高まりと、それに対応するツールの科学的証拠に基づくことを求めている。
関連論文リスト
- Using Agentic AI for contextualized and multifaceted code review at Ericsson [2.718493331100771]
コード変更の多面的評価を提供するマルチエージェントベースのソリューションを提案する。
私たちのソリューションは、特殊なエージェントスキルとコンテキスト固有の知識を組み合わせて、コード変更のアンチパターンを特定します。
私たちのソリューションは、調査されたコードコミットの問題を正確に識別する上で、96%の精度を実現しています。
論文 参考訳(メタデータ) (2026-09-14T17:05:38Z) - Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors [52.619793817715326]
本稿では,LLM生成したPythonエラーメッセージを,多段階のクラウドソースで評価する。
LLMで書き直されたメッセージは主観評価を著しく向上させたが、これらの評価結果は客観的デバッグ性能の統計的に有意な改善には至らなかった。
これは重要なヒューマンとAIの相補性ギャップを浮き彫りにしている。
論文 参考訳(メタデータ) (2026-08-21T09:14:28Z) - Offloading Score: Measuring AI Reliance Through Counterfactual Workflows [70.84727355516559]
私たちは、AIツールにオフロードされた認知活動の分断を定量化する、信頼度尺度であるオフロードスコアを導入します。
本研究は,本質的な計量妥当性評価と制御されたユーザスタディにより,オフロードスコアの検証を行う。
オフロードスコアは、時間制約設定における依存度を著しく高めることを示す。
論文 参考訳(メタデータ) (2026-05-28T05:44:31Z) - What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code [72.9921566968371]
ドメイン分離のきめ細かい10T-tokenコーパスにおける事前学習の制御実験により,コードが推論を改善するという主張を再考する。
コードはプログラミング能力を大幅に改善するが、一般的な推論エンハンサーとして機能しない。
コード-テキストと数学-テキストの混合のようなドメイン間構造的推論トレースがよりうまく説明されている。
論文 参考訳(メタデータ) (2026-05-19T12:37:01Z) - An Eye for Trust: An Exploration of Developers' Trust Perceptions Through Urgency and Reputation [1.6332728502735252]
この研究は、緊急性と評判が開発者のコードの信頼性に対する認識にどのように影響するかを考察する。
コードパッチに割り当てられた優先度は,開発者のコードレビュー行動に大きく影響した。
コードレビューの行動に顕著な変化があったにも関わらず、私たちの参加者は、コード変更のレビューと再利用に関する決定に対して、緊急性と評価の実質的な影響を、驚くほど見落としていました。
論文 参考訳(メタデータ) (2026-04-09T19:05:27Z) - That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation [55.78914774437411]
大規模言語モデル(LLM)は、パラメトリック知識とプロンプトに含まれる矛盾する情報との相違に直面して振る舞う。
このような対立を構築・解釈するためのドメインに依存しないフレームワークを提案する。
本研究では, アクティベーションレベルのステアリングが, ランダムベースライン上でのステアリング成功率を最大12.6%向上させることができることを示す。
論文 参考訳(メタデータ) (2025-10-21T22:27:56Z) - Compute Optimal Scaling of Skills: Knowledge vs Reasoning [50.76705503978189]
計算-最適スケーリングの振る舞いがスキルに依存しているかどうかを問う。
特に,知識に基づくQAやコード生成といった知識と推論に基づくスキルについて検討する。
本研究は,検証セットを用いた標準的な計算-最適スケーリングとの関連性について分析した。
論文 参考訳(メタデータ) (2025-03-13T05:21:22Z) - Interactive Agents to Overcome Ambiguity in Software Engineering [61.40183840499932]
AIエージェントは、あいまいで不明確なユーザー指示に基づいて、タスクを自動化するためにますますデプロイされている。
不安定な仮定をし、明確な質問をしないことは、最適以下の結果につながる可能性がある。
対話型コード生成設定において,LLMエージェントが不明瞭な命令を処理する能力について,プロプライエタリモデルとオープンウェイトモデルを評価して検討する。
論文 参考訳(メタデータ) (2025-02-18T17:12:26Z) - Understanding Code Understandability Improvements in Code Reviews [79.16476505761582]
GitHub上のJavaオープンソースプロジェクトからの2,401のコードレビューコメントを分析した。
改善提案の83.9%が承認され、統合され、1%未満が後に復活した。
論文 参考訳(メタデータ) (2024-10-29T12:21:23Z) - Impact of the Availability of ChatGPT on Software Development: A Synthetic Difference in Differences Estimation using GitHub Data [49.1574468325115]
ChatGPTは、ソフトウェア生産効率を向上させるAIツールである。
10万人あたりのgitプッシュ数、リポジトリ数、ユニークな開発者数に対するChatGPTの影響を見積もっています。
これらの結果は、ChatGPTのようなAIツールが開発者の生産性を大幅に向上させる可能性があることを示唆している。
論文 参考訳(メタデータ) (2024-06-16T19:11:15Z) - Towards Understanding the Impact of Code Modifications on Software Quality Metrics [1.2277343096128712]
本研究の目的は、コード修正がソフトウェアの品質指標に与える影響を評価し、解釈することである。
基礎となる仮説は、ソフトウェア品質のメトリクスに類似した変更を誘発するコード修正は、異なるクラスタにグループ化できる、というものである。
結果は、コード修正の異なるクラスタを明らかにし、それぞれに簡潔な記述が伴い、ソフトウェアの品質指標に対する全体的な影響を明らかにした。
論文 参考訳(メタデータ) (2024-04-05T08:41:18Z) - Free Open Source Communities Sustainability: Does It Make a Difference
in Software Quality? [2.981092370528753]
本研究は,サステナビリティの異なる側面がソフトウェア品質に与える影響を実証的に検討することを目的とする。
4つのカテゴリにわたる16のサステナビリティ指標をサンプリングし、217のOSSプロジェクトに適用した。
論文 参考訳(メタデータ) (2024-02-10T09:37:44Z) - Investigating the Impact of Vocabulary Difficulty and Code Naturalness
on Program Comprehension [3.35803394416914]
本研究の目的は,言語習得の観点から可読性と可読性を評価することである。
我々は,それらの相関関係を理解するために統計的解析を行い,可読性および可読性予測法の性能向上にコード自然性および語彙難易度を用いることができるか分析する。
論文 参考訳(メタデータ) (2023-08-25T15:15:00Z) - CRITIC: Large Language Models Can Self-Correct with Tool-Interactive
Critiquing [139.77117915309023]
CRITICは、大規模な言語モデルに対して、ツールとのヒューマンインタラクションに似た方法で、自分たちのアウトプットの検証と修正を可能にする。
自由形式の質問応答、数学的プログラム合成、毒性低減を含む包括的評価は、CRITICがLLMの性能を一貫して向上することを証明している。
論文 参考訳(メタデータ) (2023-05-19T15:19:44Z) - Breaks and Code Quality: Investigating the Impact of Forgetting on
Software Development. A Registered Report [15.438443553618896]
開発者がそのことを明確に理解し、長時間中断しても効率的に効果的に機能できることは、非常に重要です。
本報告では,開発者の活動が持続時間とコード品質の異なる特性に与える影響を調査するための実証的研究を提案する。
論文 参考訳(メタデータ) (2023-05-01T10:33:17Z) - Generation Probabilities Are Not Enough: Uncertainty Highlighting in AI Code Completions [54.55334589363247]
本研究では,不確実性に関する情報を伝達することで,プログラマがより迅速かつ正確にコードを生成することができるかどうかを検討する。
トークンのハイライトは、編集される可能性が最も高いので、タスクの完了が早くなり、よりターゲットを絞った編集が可能になることがわかりました。
論文 参考訳(メタデータ) (2023-02-14T18:43:34Z) - Uncertainty Quantification 360: A Holistic Toolkit for Quantifying and
Communicating the Uncertainty of AI [49.64037266892634]
我々は、AIモデルの不確実性定量化のためのオープンソースのPythonツールキットUncertainty Quantification 360 (UQ360)について述べる。
このツールキットの目標は2つある: ひとつは、AIアプリケーション開発ライフサイクルにおける不確実性を定量化し、評価し、改善し、伝達する共通のプラクティスを育むとともに、合理化するための幅広い能力を提供すること、もうひとつは、信頼できるAIの他の柱とのUQの接続をさらに探求することである。
論文 参考訳(メタデータ) (2021-06-02T18:29:04Z) - Influence Functions in Deep Learning Are Fragile [52.31375893260445]
影響関数は、テスト時間予測におけるサンプルの効果を近似する。
影響評価は浅いネットワークでは かなり正確です
ヘッセン正則化は、高品質な影響推定を得るために重要である。
論文 参考訳(メタデータ) (2020-06-25T18:25:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。