論文の概要: LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments
- arxiv url: http://arxiv.org/abs/2604.10834v1
- Date: Sun, 12 Apr 2026 22:01:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.239434
- Title: LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments
- Title(参考訳): 人体実験におけるセキュリティ特化要因の質的データ解析のためのLCM
- Authors: Maria Camporese, Fabio Massacci, Yuanjun Gong,
- Abstract要約: 大型言語モデル(LLM)は、人間のアノテーションを置き換えるのに理想的な候補である。
我々はLiveBench上での4つの最高性能LCMに、人間による自由テキストコメント中の9つのセキュリティ関連コードを検出するよう促す。
詳細なコード記述を使用する場合にのみ、顕著な改善が見られた。
- 参考スコア(独自算出の注目度): 12.772995358118507
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: [Background:] Thematic analysis of free-text justifications in human experiments provides significant qualitative insights. Yet, it is costly because reliable annotations require multiple domain experts. Large language models (LLMs) seem ideal candidates to replace human annotators. [Problem:] Coding security-specific aspects (code identifiers mentioned, lines-of-code mentioned, security keywords mentioned) may require deeper contextual understanding than sentiment classification. [Objective:] Explore whether LLMs can act as automated annotators for technical security comments by human subjects. [Method:] We prompt four top-performing LLMs on LiveBench to detect nine security-relevant codes in free-text comments by human subjects analyzing vulnerable code snippets. Outputs are compared to human annotators using Cohen's Kappa (chance-corrected accuracy). We test different prompts mimicking annotation best practices, including emerging codes, detailed codebooks with examples, and conflicting examples. [Negative Results:] We observed marked improvements only when using detailed code descriptions; however, these improvements are not uniform across codes and are insufficient to reliably replace a human annotator. [Limitations:] Additional studies with more LLMs and annotation tasks are needed.
- Abstract(参考訳): [背景:]人間の実験における自由文正当化のテーマ分析は、有意義な質的な洞察を与える。
しかし、信頼できるアノテーションには複数のドメインの専門家が必要であるため、コストがかかる。
大型言語モデル(LLM)は、人間のアノテーションを置き換えるのに理想的な候補である。
[Problem:] セキュリティ固有の側面(コード識別子、コード行、セキュリティキーワード)をコーディングするには、感情分類よりも深いコンテキスト理解が必要です。
[目的:]人間による技術セキュリティコメントのための自動アノテータとしてLLMが機能するかどうかを探る。
方法:] 脆弱性のあるコードスニペットを解析し, 自由テキストコメント中の9つのセキュリティ関連コードを検出するためにLiveBench上で4つのトップパフォーマンスLLMを誘導する。
出力はコーエンのカッパ(精度補正)を用いて人間のアノテータと比較される。
アノテーションのベストプラクティスを模倣するさまざまなプロンプトをテストします。
[Negative Results:] 詳細なコード記述を使用する場合にのみ顕著な改善が見られたが、これらの改善はコード間で均一ではなく、人間のアノテーションを確実に置き換えるには不十分である。
[制限:] LLMとアノテーションタスクのさらなる研究が必要である。
関連論文リスト
- Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data Analysis [44.08932633077333]
この研究は、6つのオープンソースの大規模言語モデル(LLM)の性能を、人間の専門家と比較して評価する。
人間のコーダーは、複雑な文をラベル付けするときに常にうまく機能するが、単純な文では苦労するが、LSMは反対の傾向を示す。
論文 参考訳(メタデータ) (2025-11-17T13:03:27Z) - Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors [77.82885394684202]
テキスト検出を効果的に欺く訓練不要な方法である textbfContrastive textbfParaphrase textbfAttack (CoPA) を提案する。
CoPAは、大規模言語モデルによって生成される人間のような分布とは対照的に、補助的な機械的な単語分布を構築している。
我々の理論的分析は、提案された攻撃の優越性を示唆している。
論文 参考訳(メタデータ) (2025-05-21T10:08:39Z) - Large Language Models as Span Annotators [5.488183187190419]
大規模言語モデル(LLM)は柔軟性とコスト効率のよいアノテーションバックボーンとして機能することを示す。
出力アノテーションあたりのコストのごく一部で,LLMが人間のアノテーションに匹敵するアノテータ間合意(IAA)を達成することを示す。
論文 参考訳(メタデータ) (2025-04-11T17:04:51Z) - What You See Is Not Always What You Get: An Empirical Study of Code Comprehension by Large Language Models [0.5735035463793009]
ソースコードに隠された文字操作がLLMの動作を誤認し,人間のレビュアーには検出不能なままにしておくという,大きな言語モデル(LLM)の攻撃に対する脆弱性について検討する。
これらの攻撃には、コードリオーダー、見えないコーディング文字、コード削除、コードホモグリフが含まれる。
以上の結果より,LLMは摂動の大きさと性能に異なる負の相関性を示す一方,LLMは認識不能なコードキャラクタ攻撃に対する感受性を示すことが明らかとなった。
論文 参考訳(メタデータ) (2024-12-11T04:52:41Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Software Vulnerability and Functionality Assessment using LLMs [0.8057006406834466]
我々は,Large Language Models (LLMs) がコードレビューに役立つかどうかを検討する。
我々の調査は、良質なレビューに欠かせない2つの課題に焦点を当てている。
論文 参考訳(メタデータ) (2024-03-13T11:29:13Z) - Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs [65.2379940117181]
自然言語の問題をコードに変換する一連のプロンプトであるコードプロンプトを導入します。
コードプロンプトは複数のLLMに対して高速に向上することがわかった。
GPT 3.5を解析した結果,入力問題のコードフォーマッティングが性能向上に不可欠であることが判明した。
論文 参考訳(メタデータ) (2024-01-18T15:32:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。