論文の概要: Code Detectors Have a Half-Life: Obsolescence and Metric Illusions in LLM-Generated Code Detection
- arxiv url: http://arxiv.org/abs/2610.01664v1
- Date: Thu, 01 Oct 2026 13:24:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.148763
- Title: Code Detectors Have a Half-Life: Obsolescence and Metric Illusions in LLM-Generated Code Detection
- Title(参考訳): コード検出器の半生:LCM生成コード検出における可視光とメトリックイリュージョン
- Abstract要約: 我々は,C++,Java,Pythonの7つのジェネレータが生成するコードとコードに対して,汎用LLM判事8名と専用検出器3名を評価した。
以上の結果から,汎用LLMはコード証明のトレーニング不要な判断を約束し,専用検出器よりも優れた性能を発揮することが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code detectors can become obsolete as code-generating models evolve: a detector validated on one generation of models may not transfer to the next. We call this limited useful life a detector half-life. We evaluate eight general-purpose LLM judges and three dedicated detectors on human-written code and code produced by seven generators across C++, Java, and Python. Our results reveal two problems. First, performance varies considerably across generators and prompting strategies, suggesting that some detectors rely on generator-specific patterns rather than general evidence of code provenance. Second, accuracy can conceal severe prediction bias. DetectCodeGPT and GPT-Sniffer achieved an accuracy of 0.50 but an F1 score of 0.00 across all generators because they classified almost every sample as AI-generated. However, general-purpose LLM judges achieved stronger accuracy and F1 scores. Our results show that general-purpose LLMs are promising training-free judges of code provenance and can outperform dedicated detectors. However, their reliability depends on the judge model, the code generator, and the prompting strategy. We therefore recommend evaluating LLM judges across multiple generators and reporting macro-F1 alongside class-specific precision and recall.
- Abstract(参考訳): コード生成モデルが進化するにつれて、コード検出器は時代遅れになり、ある世代のモデルで検証された検出器は次のモデルに転送されない。
我々はこの限られた有用寿命を半減期と呼ぶ。
我々は,C++,Java,Pythonの7つのジェネレータが生成するコードとコードに対して,汎用LLM判事8名と専用検出器3名を評価した。
私たちの結果は2つの問題を明らかにします。
第一に、性能はジェネレータ間で大きく異なり、いくつかの検出器はコード証明の一般的な証拠ではなく、ジェネレータ固有のパターンに依存していることを示唆している。
第二に、精度は深刻な予測バイアスを隠蔽することができる。
DetectCodeGPTとGPT-Snifferは精度0.50に達したが、ほとんどのサンプルをAI生成と分類したため、すべてのジェネレータでF1スコア0.00を記録した。
しかし、汎用LLM審査員はより精度が高く、F1スコアを得た。
以上の結果から,汎用LLMはコード証明のトレーニング不要な判断を約束し,専用検出器よりも優れた性能を発揮することが示唆された。
しかし、その信頼性は、審査モデル、コードジェネレータ、およびプロンプト戦略に依存します。
したがって,複数のジェネレータにまたがるLCM判定の評価と,クラス固有の精度とリコールとともにマクロF1を報告することを推奨する。
関連論文リスト
- Using LLMs to Detect LLM-Generated Texts: A Cross-Generation Analysis [17.309340310783032]
汎用 LLM は説明的根拠を持つ柔軟なゼロショットの著者分類を提供する。
3つのモデル世代にまたがる15個のLLMをジェネレータおよび検出器として評価した。
本結果より, 検出効率は, ジェネレータ前駆体ではなく, 検出能力によって駆動されることが明らかとなった。
論文 参考訳(メタデータ) (2026-09-28T09:13:26Z) - Where Detectors Fail: Probing Generative Space for Generalizable AI-Generated Image Detection [69.6123714120735]
AI生成画像(AIGI)の検出は、検出器が見えないジェネレータに一般化できないことが多いため、依然として難しい。
本稿では, 生成過程の挑戦領域を積極的に探究することで, 検出器の一般化を改善するフレームワーク PROBE を提案する。
論文 参考訳(メタデータ) (2026-05-24T07:15:06Z) - Detecting the Machine: A Comprehensive Benchmark of AI-Generated Text Detectors Across Architectures, Domains, and Adversarial Conditions [0.0]
既存のベンチマークでは、理想的な条件下で単一のデータセット上の1つの検出器を評価する。
本稿では,2つのコーパスにまたがる多様な検出手法を評価するベンチマークを提案する。
その結果, 変圧器モデルでは, ほぼ完全な分散性能が得られるが, ドメインシフト下では劣化することがわかった。
論文 参考訳(メタデータ) (2026-03-18T09:27:27Z) - CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs [15.25980318643715]
大規模言語モデル(LLM)は現代のソフトウェア開発に不可欠なものとなり、膨大な量のAI生成ソースコードを生み出している。
既存のベンチマークは不足している -- ほとんどの場合、限られたプログラム言語のみをカバーし、能力の低い生成モデルに依存している。
私たちは、広く使われている10のプログラミング言語にまたがるベンチマークであるCodeMirageを紹介します。
論文 参考訳(メタデータ) (2025-05-27T03:25:12Z) - Uncovering LLM-Generated Code: A Zero-Shot Synthetic Code Detector via Code Rewriting [78.48355455324688]
原符号とLLM書き換え版との類似性に基づく新しいゼロショット合成符号検出器を提案する。
以上の結果から,既存のSOTA合成コンテンツ検出装置よりも顕著な改善が得られた。
論文 参考訳(メタデータ) (2024-05-25T08:57:28Z) - Zero-Shot Detection of Machine-Generated Codes [83.0342513054389]
本研究は,LLMの生成したコードを検出するためのトレーニング不要な手法を提案する。
既存のトレーニングベースまたはゼロショットテキスト検出装置は、コード検出に効果がないことがわかった。
本手法は,リビジョン攻撃に対する堅牢性を示し,Javaコードによく適応する。
論文 参考訳(メタデータ) (2023-10-08T10:08:21Z) - Code Detection for Hardware Acceleration Using Large Language Models [0.0]
本研究は,大規模言語モデル(LLM)を用いたコード検出の最初の解析である。
コード検出のための予備的かつ素直なプロンプトと,新しいプロンプト戦略を提案する。
その結果, GEMM, 畳み込み, FFTでは68.8%, 22.3%, 79.2%の精度が得られた。
我々の新たなプロンプト戦略は偽陽性を大幅に減らし, 総合的精度(91.1%, 97.9%, 99.7%)は良好である。
論文 参考訳(メタデータ) (2023-07-19T17:21:58Z) - Fault-Aware Neural Code Rankers [64.41888054066861]
サンプルプログラムの正しさを予測できる故障認識型ニューラルネットワークローダを提案する。
我々のフォールト・アウェア・ローダは、様々なコード生成モデルのpass@1精度を大幅に向上させることができる。
論文 参考訳(メタデータ) (2022-06-04T22:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。