論文の概要: Finetuning Lightweight LLMs for Control Flow Graph Generation
- arxiv url: http://arxiv.org/abs/2607.04582v1
- Date: Mon, 06 Jul 2026 01:19:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.984742
- Title: Finetuning Lightweight LLMs for Control Flow Graph Generation
- Title(参考訳): 制御フローグラフ生成のための微調整軽量LDM
- Abstract要約: 本稿では,CFG生成のための微調整軽量大言語モデル (LLM) について検討する。
まず、統合されたCFG出力フォーマットと、CFG生成のためのタスク固有の微調整プロンプトを設計する。
我々は,CFGの自動生成とエラー増大により,既存のLeetCodeデータセットに基づくデータセットを構築した。
- 参考スコア(独自算出の注目度): 7.718926822172738
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Control Flow Graph (CFG) is an important program representations for software analysis, code understanding, and software maintenance. Traditional CFG generation techniques mainly rely on bytecode or abstract syntax trees. However, these approaches usually require complete, compilable, and syntax error-free code, which limits their applicability to incomplete or erroneous code. Furthermore, they often depend on language specific tools, making it difficult to support multiple programming languages in a unified manner. To address these limitations, this paper investigates the use of fine-tuned lightweight large language models (LLMs) for CFG generation. We first design a unified CFG output format and a task-specific fine-tuning prompt for CFG generation. Then, we construct a dataset based on an existing LeetCode dataset through automatic CFG generation and error augmentation. We evaluate the proposed approach on six lightweight LLM models, including three code-specific LLMs: CodeLlama, QwenCoder, and DeepSeekCoder; and three general purpose LLMs: Llama3.2-3B, Qwen-4B, and Phi-4B. The experimental results show that, through fine-tuning, lightweight LLMs achieve promising results for CFG generation, particularly when the input code is incomplete or erroneous. It also demonstrates cross-language generalization capability on programming language not included in the fine-tuning data.
- Abstract(参考訳): 制御フローグラフ(CFG)は、ソフトウェア分析、コード理解、ソフトウェア保守のための重要なプログラム表現である。
従来のCFG生成技術は主にバイトコードや抽象構文木に依存している。
しかしながら、これらのアプローチは通常、完全で、コンパイル可能で、構文上のエラーのないコードを必要とする。
さらに、それらはしばしば言語固有のツールに依存しており、複数のプログラミング言語を統一的にサポートすることは困難である。
これらの制約に対処するために,CFG生成のための微調整軽量大言語モデル (LLM) について検討する。
まず、統合されたCFG出力フォーマットと、CFG生成のためのタスク固有の微調整プロンプトを設計する。
そこで我々は,CFGの自動生成とエラー増大により,既存のLeetCodeデータセットに基づくデータセットを構築した。
提案手法は,CodeLlama,QwenCoder,DeepSeekCoderの3つのコード固有LLMと,Llama3.2-3B,Qwen-4B,Phi-4Bの3つの汎用LLMを含む6つの軽量LLMモデルに対して評価を行った。
実験結果から,特に入力コードが不完全あるいは誤った場合,微調整により軽量LLMがCFG生成に有望な結果をもたらすことが示された。
また、微調整データに含まれないプログラミング言語の言語間一般化機能も示す。
関連論文リスト
- Evaluating and Achieving Controllable Code Completion in Code LLM [89.64782747840225]
命令誘導型コード補完ベンチマークである制御可能コード補完ベンチマーク(C3-Bench)を提案する。
コード補完作業中に,オープンソースのプロプライエタリモデルと高度なプロプライエタリモデルの間に,命令追従機能にかなりのギャップがあることを明らかにする。
結果として得られたQwen2.5-Coder-C3は、C3-Bench上で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-22T11:40:04Z) - Aligning Requirement for Large Language Model's Code Generation [9.205909320363247]
Specineは、大規模言語モデル(LLM)コード生成のための新しい仕様アライメント技術である。
その鍵となる考え方は、不整合入力仕様を特定し、LLMが認識した仕様を引き上げ、LLMのコード生成性能を高めるためにそれらを整合させることである。
例えば、Specineは最も効果的なベースラインを上回り、Pass@1ですべての被験者の平均29.60%の改善を達成した。
論文 参考訳(メタデータ) (2025-09-01T09:56:13Z) - IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Type-Constrained Code Generation with Language Models [51.03439021895432]
本稿では,型システムを利用してコード生成を誘導する型制約デコード手法を提案する。
そこで本研究では,新しい接頭辞オートマトンと,在来型を探索する手法を開発し,LLM生成コードに適切な型付けを強制するための健全なアプローチを構築した。
提案手法は,コード合成,翻訳,修復作業において,コンパイルエラーを半分以上削減し,機能的正しさを著しく向上させる。
論文 参考訳(メタデータ) (2025-04-12T15:03:00Z) - GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding [35.536478348255315]
最近のコード言語モデルは数十億のパラメータに拡張されているが、ソースコードはテキストトークンとしてのみモデル化されている。
GALLa - Graph Aligned Large Language Modelsで両世界のベストを尽くします。
論文 参考訳(メタデータ) (2024-09-06T10:57:34Z) - Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs [57.27982780697922]
大規模言語モデルは、自然言語の理解と生成において例外的な能力を示した。
しかし、それらの生成速度は、その復号過程の本質的にシーケンシャルな性質によって制限される。
本稿では,データ駆動方式で実装された新しいデコーディング手法であるLexical Unit Decodingを紹介する。
論文 参考訳(メタデータ) (2024-05-24T04:35:13Z) - CodeGRAG: Bridging the Gap between Natural Language and Programming Language via Graphical Retrieval Augmented Generation [58.84212778960507]
CodeGRAGは、制御フローとそれらのデータフローに基づいて、コードブロックのグラフィカルなビューを構築し、プログラミングドメインの知識をよりよく解釈する。
CodeGRAGはLLMのコード生成能力を大幅に改善し、言語間コード生成のパフォーマンス向上も実現している。
論文 参考訳(メタデータ) (2024-05-03T02:48:55Z) - Using LLM such as ChatGPT for Designing and Implementing a RISC
Processor: Execution,Challenges and Limitations [11.07566083431614]
この論文は、解析、トークン化、エンコーディング、アテンションメカニズム、コード生成時のトークンとイテレーションのサンプリングなど、関連するステップについてレビューする。
RISCコンポーネントの生成されたコードは、FPGA基板上でテストベンチとハードウェア実装によって検証される。
論文 参考訳(メタデータ) (2024-01-18T20:14:10Z) - The potential of LLMs for coding with low-resource and domain-specific
programming languages [0.0]
本研究は,オープンソースソフトウェアGreetlのハンスル(Hansl)という,econometricスクリプティング言語に焦点を当てたものである。
この結果から, LLMはグレタブルコードの記述, 理解, 改善, 文書化に有用なツールであることが示唆された。
論文 参考訳(メタデータ) (2023-07-24T17:17:13Z) - CodeT5+: Open Code Large Language Models for Code Understanding and
Generation [72.1638273937025]
大きな言語モデル (LLM) は膨大なソースコードで事前訓練されており、コードインテリジェンスにおいて顕著な進歩を遂げている。
CodeT5+は、コンポーネントモジュールを柔軟に組み合わせて、幅広い下流のコードタスクに適合させることができるコードのためのエンコーダ-デコーダLLMのファミリーである。
我々は、ゼロショット、微調整、命令調整を含む20以上のコード関連ベンチマークでCodeT5+を広範囲に評価した。
論文 参考訳(メタデータ) (2023-05-13T14:23:07Z) - On Codex Prompt Engineering for OCL Generation: An Empirical Study [10.184056098238765]
Object Constraint Language (OCL)は、MOFモデルに制約とオブジェクトクエリ式を追加する宣言型言語である。
GPT-3のような最近のLPMの進歩は、多くのNLPタスクにおいてその能力を示している。
自然言語仕様からCodexが生成するOCL制約の信頼性について検討する。
論文 参考訳(メタデータ) (2023-03-28T18:50:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。