論文の概要: Same Scrutiny, More Time: Eye Tracking Insights into Reviewing LLM-Labelled Code
- arxiv url: http://arxiv.org/abs/2606.26505v1
- Date: Thu, 25 Jun 2026 01:23:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.137339
- Title: Same Scrutiny, More Time: Eye Tracking Insights into Reviewing LLM-Labelled Code
- Title(参考訳): LLMで書かれたコードのレビューを視線追跡してみる(動画あり)
- Authors: Ranim Khojah, Francisco Gomes de Oliveira Neto, Mazen Mohamad, Julian Frattini, Philipp Leitner,
- Abstract要約: We conduct a Wizard-of-Oz experiment to examine how software engineers behavior when code is clearly labeled as LLM- generated during a code review task。
コードレビューの徹底性は参加者にとって変わらなかったが、ラベル自体が注意に影響を及ぼすことを示すLCMに多くの時間を費やした。
実践者は、特定の基準に基づいてコードを評価したり、そのプロンプトを使ってレビューをガイドすることで、LLMをラベル付けしたコードに対するレビュー戦略にも適応した。
- 参考スコア(独自算出の注目度): 3.7910079742785787
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern software development increasingly involves the use of large language models (LLMs) to generate code. Despite their rapid advancement, LLMs remain prone to errors and hallucinations, emphasizing the importance of careful code inspection. However, in practice, developers' trust in LLM-generated code and their willingness to review it thoroughly may differ from these recommendations. How developers actually behave when reviewing LLM-generated code remains largely unexplored. In this study, we conduct a Wizard-of-Oz experiment to examine how software engineers behave when code is explicitly labeled as LLM-generated during a code review task. We collect both behavioral data and participant feedback through eye-tracking and exit interviews. Combining Bayesian data analysis with qualitative analysis, we found that while the thoroughness of code review did not change for participants, they spent more time fixating on LLM-labelled code, indicating that the label itself influences attention. Practitioners also adapted their review strategy for LLM-labelled code by assessing the code based on specific criteria (e.g., logical correctness), or using the prompt to guide their review. These findings inform LLM-based tool design on labelling while incorporating the prompt as a software artifact. Our study reveals a gap between reviewers' intentions and actual reviewing behaviour, highlighting the need for software companies to revisit their AI policies (particularly regarding LLM-assisted development) to better support developers in reviewing LLM-generated code.
- Abstract(参考訳): 現代のソフトウェア開発では、コードを生成するために大きな言語モデル(LLM)が使われるようになっています。
急速な進歩にもかかわらず、LSMはエラーや幻覚に悩まされがちであり、注意深いコード検査の重要性を強調している。
しかし、実際には、LLM生成コードに対する開発者の信頼と、それを徹底的にレビューする意思は、これらのレコメンデーションとは異なる可能性がある。
LLMの生成したコードをレビューする場合、開発者は実際にどのように振る舞うかは、まだ明らかになっていない。
本研究では,Wizad-of-Oz実験を行い,コードレビュー作業中にLLMと明示的にラベル付けされた場合のソフトウェア技術者の振る舞いについて検討する。
我々は、視線追跡と出口インタビューを通じて行動データと参加者のフィードバックを収集する。
ベイジアンのデータ分析と質的な分析を組み合わせることで、コードレビューの徹底性は参加者にとって変わらなかったが、LLMでラベル付けされたコードの修正により多くの時間を費やし、ラベル自体が注意に影響を及ぼすことを示した。
実践者は、特定の基準(例えば、論理的正当性)に基づいてコードを評価したり、そのプロンプトを使ってレビューをガイドすることで、LLMをラベル付けしたコードに対するレビュー戦略にも適応した。
これらの結果から,ソフトウェアアーティファクトとしてプロンプトを組み込んでラベル付けを行うLLMベースのツール設計が示唆された。
我々の研究は、レビュー担当者の意図と実際のレビュー行動のギャップを明らかにし、ソフトウェア企業が(特にLLM支援開発に関する)AIポリシーを再検討し、LLM生成コードのレビューにおいて開発者を支援する必要性を強調している。
関連論文リスト
- Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement [8.059802912761919]
我々は,大規模言語モデル(LLM)が自然言語要求にマッチするコードの体系的失敗を明らかにする。
より詳細なプロンプト設計、特に説明や修正提案を必要とするものは、より高い誤判定率をもたらす。
そこで本稿では,提案した修正を実効的証拠として扱う固定誘導検証フィルタを提案する。
論文 参考訳(メタデータ) (2026-02-28T08:35:25Z) - CodeSimpleQA: Scaling Factuality in Code Large Language Models [55.705748501461294]
本稿では,コード関連質問への回答において,LLMの実際の精度を評価するための総合的なベンチマークであるCodeSimpleQAを提案する。
また,66万サンプルの大規模インストラクションコーパスであるCodeSimpleQA-Instructを作成し,教師付き微調整と強化学習を組み合わせたポストトレーニングフレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-22T14:27:17Z) - Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications [0.6813925418351435]
大規模言語モデル(LLM)はソフトウェア開発において不可欠なツールとなり、要求工学、コード生成、レビュータスクに広く利用されている。
本稿では,LLMが自然言語の要求に適合するかどうかを評価する上で,体系的に失敗していることを明らかにする。
以上の結果から,LCMは要件を満たすことのできないコード実装や潜在的な欠陥を含むコード実装を誤って分類することが多いことが判明した。
論文 参考訳(メタデータ) (2025-08-17T13:07:26Z) - How Accurately Do Large Language Models Understand Code? [4.817546726074033]
大規模言語モデル(LLM)は、コードの修復やテストといった開発後のタスクでますます使われています。
コードの理解の定量化は、その抽象的な性質と標準化されたメトリクスの欠如のために難しい。
本稿では,LLMのコード理解能力に関する大規模な実証的研究を行った。
論文 参考訳(メタデータ) (2025-04-06T05:59:29Z) - What's Wrong with Your Code Generated by Large Language Models? An Extensive Study [92.62952504133926]
本研究は,3つの一般的なベンチマーク上で,3つの主要なクローズドソースLLMと6つの人気のあるオープンソースLLMの性能評価を行った。
間違ったコードに対するバグの分類を開発し、一般的なバグタイプに対する根本原因を分析した。
本稿では,自己批判を導入し,LLMが生成したコードに対する批判と修正を可能にする,新たな学習自由反復手法を提案する。
論文 参考訳(メタデータ) (2024-07-08T17:27:17Z) - A Study on Developer Behaviors for Validating and Repairing LLM-Generated Code Using Eye Tracking and IDE Actions [13.58143103712]
GitHub Copilotは、LLM(Big Language Model)ベースのコード生成ツールである。
本稿では,Copilotが生成したコードを開発者がどのように検証し,修復するかを検討する。
コードの存在を認識したことにより、パフォーマンスの向上、検索努力の向上、コパイロットの使用頻度の向上、認知作業負荷の向上につながった。
論文 参考訳(メタデータ) (2024-05-25T06:20:01Z) - InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models [56.723509505549536]
InfiBenchは、私たちの知識に合ったコードのための、最初の大規模フリーフォーム質問回答(QA)ベンチマークです。
慎重に選択された234の高品質なStack Overflow質問で構成されており、15のプログラミング言語にまたがっている。
InfiBench上で100以上の最新のコードLLMに対して,系統的評価を行い,新しい知見と洞察に富んだ結果を得た。
論文 参考訳(メタデータ) (2024-03-11T02:06:30Z) - Assured LLM-Based Software Engineering [51.003878077888686]
この記事では,2024年4月15日にポルトガルのリスボンで開催された International Workshop on Interpretability, Robustness, and Benchmarking in Neural Software Engineering で,Mark Harman 氏による基調講演の内容の概要を紹介する。
論文 参考訳(メタデータ) (2024-02-06T20:38:46Z) - Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs [65.2379940117181]
自然言語の問題をコードに変換する一連のプロンプトであるコードプロンプトを導入します。
コードプロンプトは複数のLLMに対して高速に向上することがわかった。
GPT 3.5を解析した結果,入力問題のコードフォーマッティングが性能向上に不可欠であることが判明した。
論文 参考訳(メタデータ) (2024-01-18T15:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。