論文の概要: Type-IV Code Clone Detection via Layer-Wise Non-Contrastive Representation Learning
- arxiv url: http://arxiv.org/abs/2609.17338v1
- Date: Tue, 15 Sep 2026 15:42:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.602766
- Title: Type-IV Code Clone Detection via Layer-Wise Non-Contrastive Representation Learning
- Title(参考訳): レイヤワイズ非競合表現学習によるタイプIVコードクローンの検出
- Abstract要約: ソフトウェアクローンは、互いに似ているか機能的に等価なコードの断片である。
意味論的に等価だが構文的に異なるType-IVクローンの検出は、従来のトークンベースのメソッドや構文ベースのメソッドでは困難である。
タイプIVのクローン検出に特化して設計された非競合表現学習手法であるLWVIC4Codeを提案する。
- 参考スコア(独自算出の注目度): 1.1386245013335434
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Software clones are fragments of code that are similar or functionally equivalent to each other. They pose significant challenges for maintenance, refactoring, and bug detection. Detecting Type-IV clones, which are semantically equivalent but may differ syntactically, is particularly difficult for traditional token- or syntax-based methods. Recent machine learning approaches rely on contrastive learning, which requires careful negative sampling and can introduce bias. In this paper, we propose LWVIC4Code, a non-contrastive representation learning approach specifically designed for Type-IV clone detection. Building on the Variance-Invariance-Covariance Regularization (VICReg) framework and prior layer-wise VICReg training, LWVIC4Code introduces cross-layer consistency regularization and depth-dependent layer weighting to progressively refine semantic information across transformer layers, producing robust and discriminative code representations. We conduct an empirical study comparing LWVIC4Code against a contrastive learning baseline and zero-shot large language models on Python (Kamino) and multi-language (GPTCloneBench) datasets. Results show that LWVIC4Code achieves competitive or superior performance without negative samples, benefits from layer-wise supervision, and generalizes effectively from Python to other languages, particularly Java and C#. These results demonstrate that non-contrastive, layer-wise representation learning is a promising direction for robust semantic code clone detection.
- Abstract(参考訳): ソフトウェアクローンは、互いに似ているか機能的に等価なコードの断片である。
メンテナンスやリファクタリング,バグ検出などには,大きな課題があります。
意味論的に等価だが構文的に異なるType-IVクローンの検出は、従来のトークンベースのメソッドや構文ベースのメソッドでは特に困難である。
最近の機械学習アプローチは、注意深いネガティブサンプリングを必要とし、バイアスをもたらすことができる、対照的な学習に依存している。
本稿では,Type-IVクローン検出に特化して設計された非コントラスト表現学習手法であるLWVIC4Codeを提案する。
可変不変共分散正規化(VICReg)フレームワークと、それ以前のレイヤワイドVICRegトレーニングに基づいて、LWVIC4Codeは、トランスフォーマー層間のセマンティック情報を段階的に洗練し、堅牢で差別的なコード表現を生成するために、層間整合性正規化と深さ依存層重み付けを導入している。
我々はLWVIC4CodeをPython(Kamino)とGPTCloneBench(GPTCloneBench)データセット上の対照的な学習ベースラインとゼロショット大言語モデルと比較した実証的研究を行った。
結果は、LWVIC4Codeが、ネガティブなサンプルなしで競合や優れたパフォーマンスを実現し、レイヤワイドな監視の恩恵を受け、Pythonから他の言語(特にJavaとC#)へ効果的に一般化していることを示している。
これらの結果から,非コントラスト型レイヤワイド表現学習は,ロバストなセマンティックコードクローン検出において有望な方向であることが示された。
関連論文リスト
- Invariant Pretraining for Robust Code Representations [8.667720376952728]
不変プログラムの下では、意味論的に等価なコードは異なる構文形式で書かれ、学習された表現は著しく劣化する。
本研究では,4つのエンコーダベースライン,2つの下流タスク,4つのデータセットにまたがるロバスト性ギャップについて実験的検討を行った。
Invariant pretraining (InvPT) はコーパスに意味保存変換を適用する。
論文 参考訳(メタデータ) (2026-08-15T21:01:43Z) - Semantic Code Clone Detection: Are We There Yet? [30.160018956984853]
コードクローンの検出は数十年にわたって広く研究されてきた。
最近のアプローチでは、ベンチマークデータセット上でのセマンティック(Type-4)クローンのパフォーマンスが著しく向上している。
本研究では,最先端のセマンティックコードクローン検出器の一般化可能性について,最初の系統的研究を行った。
論文 参考訳(メタデータ) (2026-06-24T01:11:40Z) - CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment [98.87395842351627]
大きな言語モデル(LLM)は、巨大なコードコーパスから学習することで、コード生成において優れています。
テキストパターンのトレーニングと機能的正しさの目標の間には、基本的な意味的ギャップが残っている。
我々は、コード生成のためのRLVRトレーニングパイプラインに実行セマンティクスアライメントを統合する新しいアプローチであるCodeRL+を提案する。
論文 参考訳(メタデータ) (2025-10-21T09:48:06Z) - HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection [3.2167919219391474]
コードクローン検出(Code clone detection)は、ソフトウェア工学において重要なタスクであり、ソフトウェアシステム内の重複や類似のコードフラグメントを識別することを目的としている。
大規模言語モデル(LLM)の最近の進歩は、コードセマンティクスの理解において有望であることを示している。
LLMに基づくスクリーニングと,Pythonプログラムのセマンティッククローンを検出するための実行ベースの検証を組み合わせた,新しい2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-02T13:11:56Z) - OASIS: Order-Augmented Strategy for Improved Code Search [13.64129055694081]
コード検索の改善のための新しい秩序強化戦略を提案する。
オーダーベースの類似性ラベルを活用してモデルをトレーニングし、負のペア間の類似性の微妙な違いを捉えます。
これは、効果的なコード埋め込みトレーニングのために、オーダラベルと負のペア間の微妙な違いを利用する価値を強調している。
論文 参考訳(メタデータ) (2025-03-11T08:26:37Z) - Binary Code Similarity Detection via Graph Contrastive Learning on Intermediate Representations [52.34030226129628]
バイナリコード類似度検出(BCSD)は、脆弱性検出、マルウェア分析、コードの再利用識別など、多くの分野で重要な役割を果たしている。
本稿では,LLVM-IRと高レベルのセマンティック抽象化を利用して,コンパイル差を緩和するIRBinDiffを提案する。
IRBinDiffは1対1の比較と1対多の検索シナリオにおいて,他の主要なBCSD手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-10-24T09:09:20Z) - ZC3: Zero-Shot Cross-Language Code Clone Detection [79.53514630357876]
ゼロショットクロスランゲージコードクローン検出のためのZC3という新しい手法を提案する。
ZC3は、異なるプログラミング言語間で同型表現空間を形成するために、対照的なスニペット予測を設計する。
これに基づいて、ZC3はドメイン認識学習とサイクル一貫性学習を利用して、異なる言語間で整合した表現を生成する。
論文 参考訳(メタデータ) (2023-08-26T03:48:10Z) - CONCORD: Clone-aware Contrastive Learning for Source Code [64.51161487524436]
セルフ教師付き事前トレーニングは、多くのダウンストリームSEタスクに価値のあるジェネリックコード表現を学ぶための牽引役になった。
汎用的な表現学習のために、開発者が日々どのようにコードをコーディングするかは、要因としても不可欠である、と私たちは主張する。
特に,表現空間に良性クローンを近づける自己教師型コントラスト学習戦略であるCONCORDを提案する。
論文 参考訳(メタデータ) (2023-06-05T20:39:08Z) - Enhancing Semantic Code Search with Multimodal Contrastive Learning and
Soft Data Augmentation [50.14232079160476]
コード検索のためのマルチモーダルコントラスト学習とソフトデータ拡張を用いた新しい手法を提案する。
我々は,6つのプログラミング言語を用いた大規模データセットにおけるアプローチの有効性を評価するために,広範囲な実験を行った。
論文 参考訳(メタデータ) (2022-04-07T08:49:27Z) - An Exploratory Study on Code Attention in BERT [8.488193857572211]
コード上でのPLMの注意行動を調査し,それを自然言語と比較する。
BERT は NLP において最も注目されているトークンとは対照的に,特に識別子やセパレータといった構文上のエンティティに注意を払っている。
この発見は、NLPで使われる一般的な埋め込みを使わずに、コード固有の表現を使用することで、研究コミュニティの恩恵を受けることができる。
論文 参考訳(メタデータ) (2022-04-05T21:23:10Z) - Prototypical Contrastive Learning of Unsupervised Representations [171.3046900127166]
原型コントラスト学習(Prototypeal Contrastive Learning, PCL)は、教師なし表現学習法である。
PCLは暗黙的にデータのセマンティック構造を学習された埋め込み空間にエンコードする。
PCLは、複数のベンチマークで最先端のインスタンスワイド・コントラスト学習法より優れている。
論文 参考訳(メタデータ) (2020-05-11T09:53:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。