論文の概要: Evaluating LLMs on Java Code Snippet Adaptation Using a Mutation-Injection Framework
- arxiv url: http://arxiv.org/abs/2606.28618v1
- Date: Fri, 26 Jun 2026 21:34:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.620939
- Title: Evaluating LLMs on Java Code Snippet Adaptation Using a Mutation-Injection Framework
- Title(参考訳): 突然変異注入フレームワークを用いたJavaコードスニペット適応におけるLCMの評価
- Authors: Ali Aman, Muhammad Asaduzzaman, Shaowei Wang, Chanchal K. Roy,
- Abstract要約: 開発者はフラグメントをコピーして新しいコンテキストに適合させることで、コードの再利用を頻繁に行う。
コード適応における大きな言語モデル(LLM)を評価するための既存のベンチマークは、明示的なステップバイステップ命令に依存するか、変数の配線のような狭い変更タイプのみをカバーするか、関数レベルの粒度でのみ動作するかのいずれかである。
命令不要なコードスニペットの適応について検討し、LLMは明示的な編集ガイダンスを使わずに目的のコンテキストに適合するようにコードフラグメントを適応させなければならない。
- 参考スコア(独自算出の注目度): 9.514883757685725
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Developers frequently reuse code by copying fragments and adapting them to fit new contexts. Existing benchmarks for evaluating large language models (LLMs) on code adaptation either rely on explicit step-by-step instructions, cover only narrow change types such as variable wiring, or operate exclusively at function-level granularity. It remains unknown how well LLMs can adapt code fragments without explicit edit guidance when the required changes are varied and controlled. Objective: We investigate instruction-free code snippet adaptation in which an LLM must adapt a code fragment to fit its target context without any explicit edit guidance. We study three dimensions: which adaptation types are hardest (RQ1), how performance scales with adaptation complexity (RQ2), and how much surrounding context the model needs (RQ3). Method: We will construct a dataset of Java code fragments from open-source repositories with strong test coverage and apply a taxonomy of adaptation operators, derived from empirical findings on how developers adapt copied code, using a mutation-injection framework. Working at the code fragment level and controlling the injected changes lets us know exactly what adaptations the model must perform. The unmutated fragment serves as a plausible reference for the changes the model needs to make. LLMs will be evaluated on instruction-free adaptation tasks across three context granularity levels. Correctness will be measured primarily via test-suite re-insertion, complemented by mutation-level inspection.
- Abstract(参考訳): 背景: 開発者はフラグメントをコピーして新しいコンテキストに適合させることで、頻繁にコードを再利用する。
コード適応における大きな言語モデル(LLM)を評価するための既存のベンチマークは、明示的なステップバイステップ命令に依存するか、変数の配線のような狭い変更タイプのみをカバーするか、関数レベルの粒度でのみ動作するかのいずれかである。
必要な変更が変更され、制御された場合、明示的な編集ガイダンスなしで、LLMがコードフラグメントをどの程度うまく適応できるかは、まだ分かっていない。
目的: 明示的な編集ガイダンスを使わずに, LLM が対象コンテキストに適合するようにコードフラグメントを適応させなければならない命令不要のコードスニペット適応について検討する。
適応型が最も難しい(RQ1)3次元、適応複雑性を伴うパフォーマンスのスケール(RQ2)、モデルに必要なコンテキスト(RQ3)について検討する。
メソッド: 強力なテストカバレッジを持つオープンソースリポジトリからJavaコードフラグメントのデータセットを構築し、開発者が突然変異注入フレームワークを使用してコピーコードの適応方法に関する実証的な知見から、適応演算子の分類を適用します。
コードのフラグメントレベルで作業し、注入された変更を制御することで、モデルが実行しなければならない適応を正確に知ることができます。
変更されていないフラグメントは、モデルが行わなければならない変更のもっともらしい参照として機能します。
LLMは3つの文脈の粒度レベルにわたる命令なし適応タスクで評価される。
正確性は主に、突然変異レベルの検査によって補完されるテストスーツの再挿入によって測定される。
関連論文リスト
- Feedback-based Automated Verification in Vibe Coding of CAS Adaptation Built on Constraint Logic [0.0]
CAS適応では、システムの動的アーキテクチャと振る舞いの変化を定義することが課題である。
生成LDMの進歩により、システム仕様と望ましいAM動作に基づいてAMコードを生成することは魅力的な機会である。
提案手法は, 動作条件の極めて正確な定式化に基づいて生成したAMの検証を行う場合, ビブ符号化フィードバックループによるAM生成が有効な選択肢であることを示す。
論文 参考訳(メタデータ) (2026-02-20T20:49:12Z) - Coding in a Bubble? Evaluating LLMs in Resolving Context Adaptation Bugs During Code Adaptation [16.969255848886693]
重要な課題は、コンテキスト適応バグ(CtxBugs)を解決することです。
分離されたバグとは異なり、CtxBugsは局所的な修正によって解決できず、コンテキスト間の推論を必要とする。
LLM(Large Language Models)は、コード関連のタスクを自動化する大きな可能性を示しているが、CtxBugsを解決する能力は、コード適応における実践的使用に対する重要な、未調査の障害である。
論文 参考訳(メタデータ) (2026-01-10T09:14:00Z) - AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation [22.341339973062702]
AdaptEvalは、コードスニペット適応の大規模言語モデル(LLM)を評価するために設計されたベンチマークである。
各タスクには、タスクレベルと適応レベルの両方の要件がアノテートされ、さまざまな適応シナリオにおけるLCMの評価をサポートする。
コードスニペット適応における6つの命令調整LDM, 特に3つの理由付けLDMを評価するための実験的検討を行った。
論文 参考訳(メタデータ) (2026-01-08T03:13:20Z) - Exploring Direct Instruction and Summary-Mediated Prompting in LLM-Assisted Code Modification [10.964060011243234]
本稿では,大規模言語モデル(LLM)を用いた既存コードの変更について検討する。
プロンプティング(prompting)は、開発者がLLMにインテントを伝えるための主要なインターフェースである。
本研究では,LLM支援符号修正のための2つの手順について検討した。
論文 参考訳(メタデータ) (2025-08-02T23:52:49Z) - Joint Localization and Activation Editing for Low-Resource Fine-Tuning [73.64004083269424]
本稿では,JoLA(Joal Localization and activation editing)法を提案する。
JoLAは(1)Transformerのどのヘッダーを編集するか、(2)介入が加法的、乗法的、または両方であるべきか、(3)介入パラメータ自体を学習する。
JoLAは既存のメソッドよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-02-03T09:13:09Z) - Instruct or Interact? Exploring and Eliciting LLMs' Capability in Code Snippet Adaptation Through Prompt Engineering [19.019004855931676]
大規模言語モデル(LLM)は、コード生成タスクにおいて、有望な結果でその有効性を確認した。
再利用指向でコンテキスト依存のコード変更予測タスクであるアダプティブのパフォーマンスはまだ不明だ。
LLMの適応性を引き出すためのインタラクティブなプロンプト手法を提案する。
論文 参考訳(メタデータ) (2024-11-23T09:40:36Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z) - DARG: Dynamic Evaluation of Large Language Models via Adaptive Reasoning Graph [70.79413606968814]
本稿では,適応推論グラフ展開(DARG)によるLCMの動的評価を導入し,複雑性と多様性を制御した現在のベンチマークを動的に拡張する。
具体的には、まず現在のベンチマークでデータポイントの推論グラフを抽出し、それから推論グラフを摂動させて新しいテストデータを生成する。
このような新しく生成されたテストサンプルは、元のベンチマークと同様の言語的多様性を維持しながら、複雑さのレベルが異なる可能性がある。
論文 参考訳(メタデータ) (2024-06-25T04:27:53Z) - CorDA: Context-Oriented Decomposition Adaptation of Large Language Models for Task-Aware Parameter-Efficient Fine-tuning [101.81127587760831]
現在の微調整手法は、学習すべき下流タスクのコンテキストや、維持すべき重要な知識のコンテキストに広く適用できるアダプタを構築している。
学習可能なタスク対応アダプタを構築するコンテキスト指向の分解適応手法であるCorDAを提案する。
本手法は,知識保存型適応と指導レビュー型適応の2つの選択肢を実現する。
論文 参考訳(メタデータ) (2024-06-07T19:10:35Z) - Towards Modular LLMs by Building and Reusing a Library of LoRAs [64.43376695346538]
マルチタスクデータに対して最適なアダプタライブラリを構築する方法について検討する。
モデルベースクラスタリング(MBC)を導入し,パラメータの類似性に基づいてタスクをグループ化する手法を提案する。
ライブラリを再使用するために,最も関連性の高いアダプタの動的選択を可能にする新しいゼロショットルーティング機構であるArrowを提案する。
論文 参考訳(メタデータ) (2024-05-18T03:02:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。