論文の概要: LLM4CodeRE: Generative AI for Code Decompilation Analysis and Reverse Engineering
- arxiv url: http://arxiv.org/abs/2604.06095v1
- Date: Tue, 07 Apr 2026 17:08:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.95377
- Title: LLM4CodeRE: Generative AI for Code Decompilation Analysis and Reverse Engineering
- Title(参考訳): LLM4CodeRE: コードデコンパイル分析とリバースエンジニアリングのための生成AI
- Authors: Hamed Jelodar, Samita Bai, Tochukwu Emmanuel Nwankwo, Parisa Hamedi, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani,
- Abstract要約: LLM4CodeREは、双方向コードリバースエンジニアリングのためのドメイン適応型LLMフレームワークである。
アセンブリからソースへの逆コンパイルとソースからアセンブリへの変換の両方を統一モデル内でサポートする。
LLM4CodeREは既存の逆コンパイルツールや汎用コードモデルよりも優れていることを示す実験結果が得られた。
- 参考スコア(独自算出の注目度): 4.240884806677703
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code decompilation analysis is a fundamental yet challenging task in malware reverse engineering, particularly due to the pervasive use of sophisticated obfuscation techniques. Although recent large language models (LLMs) have shown promise in translating low-level representations into high-level source code, most existing approaches rely on generic code pretraining and lack adaptation to malicious software. We propose LLM4CodeRE, a domain-adaptive LLM framework for bidirectional code reverse engineering that supports both assembly-to-source decompilation and source-to-assembly translation within a unified model. To enable effective task adaptation, we introduce two complementary fine-tuning strategies: (i) a Multi-Adapter approach for task-specific syntactic and semantic alignment, and (ii) a Seq2Seq Unified approach using task-conditioned prefixes to enforce end-to-end generation constraints. Experimental results demonstrate that LLM4CodeRE outperforms existing decompilation tools and general-purpose code models, achieving robust bidirectional generalization.
- Abstract(参考訳): コードの逆コンパイル解析は、特に高度な難読化技術が普及しているために、マルウェアのリバースエンジニアリングにおける基本的な課題である。
最近の大規模言語モデル(LLM)は、低レベルな表現を高レベルなソースコードに翻訳する可能性を示しているが、既存のアプローチのほとんどは、ジェネリックコードの事前訓練と悪意のあるソフトウェアへの適応の欠如に依存している。
LLM4CodeREは、双方向コードリバースエンジニアリングのためのドメイン適応型LLMフレームワークであり、アセンブリからソースへの逆コンパイルとソースからアセンブリへの変換の両方を統一モデルでサポートする。
効果的なタスク適応を実現するために,2つの相補的な微調整戦略を導入する。
(i)タスク固有の統語的・意味的アライメントのためのマルチアダプタアプローチ
(ii)タスク条件付きプレフィックスを用いたSeq2Seq統一アプローチにより、エンドツーエンド生成制約を強制する。
LLM4CodeREは、既存の逆コンパイルツールや汎用コードモデルよりも優れており、堅牢な双方向の一般化を実現している。
関連論文リスト
- Context-Guided Decompilation: A Step Towards Re-executability [50.71992919223209]
バイナリ逆コンパイルは、ソフトウェアセキュリティ分析、リバースエンジニアリング、マルウェア理解において重要な役割を果たす。
大規模言語モデル (LLMs) の最近の進歩により、ニューラルデコンパイルが可能になったが、生成されたコードは一般的に意味論的にのみ使用可能である。
In-context Learning(ICL)を活用して,再実行可能なソースコードを生成するためのILC4Decompを提案する。
論文 参考訳(メタデータ) (2025-11-03T17:21:39Z) - TIT: A Tree-Structured Instruction Tuning Approach for LLM-Based Code Translation [11.882496324328905]
LLMに基づくコード翻訳のためのツリー構造化命令チューニングパラダイムであるTITを提案する。
構文的混乱を軽減するため、構文的情報表現モジュールは言語に依存しない構文的特徴を統合する。
高品質の粒度並列データを生成するために、細粒度並列データセット拡張モジュールは、ノードとコードセグメントを整列する。
論文 参考訳(メタデータ) (2025-10-10T13:53:46Z) - Towards Large Language Model Aided Program Refinement [10.089955747110444]
プログラムの洗練には、正式なハイレベルな仕様文から実行可能なプログラムへの正当性保存の変換が含まれる。
大型言語モデル(LLM)は、非公式な自然言語仕様から自動コード生成を可能にする。
LLM4PRは,形式的プログラム改善手法と非公式なLCMベースの手法を組み合わせたツールである。
論文 参考訳(メタデータ) (2024-06-26T04:29:27Z) - DECIDER: A Dual-System Rule-Controllable Decoding Framework for Language Generation [57.07295906718989]
制約付き復号法は,事前訓練された大言語(Ms と PLMs)が生成するテキストの意味やスタイルを,推論時に様々なタスクに対して制御することを目的としている。
これらの方法は、しばしば、欲求的かつ明示的にターゲットを選択することによって、もっともらしい連続を導く。
認知二重プロセス理論に着想を得て,新しい復号化フレームワークDECDERを提案する。
論文 参考訳(メタデータ) (2024-03-04T11:49:08Z) - StepCoder: Improve Code Generation with Reinforcement Learning from
Compiler Feedback [58.20547418182074]
2つの主要コンポーネントからなるコード生成の新しいフレームワークであるStepCoderを紹介します。
CCCSは、長いシーケンスのコード生成タスクをCurriculum of Code Completion Subtaskに分割することで、探索課題に対処する。
FGOは、未実行のコードセグメントをマスクすることでのみモデルを最適化し、Fine-Grained Optimizationを提供する。
提案手法は,出力空間を探索し,対応するベンチマークにおいて最先端の手法より優れた性能を発揮する。
論文 参考訳(メタデータ) (2024-02-02T13:14:31Z) - Fixing Large Language Models' Specification Misunderstanding for Better Code Generation [13.494822086550604]
muFiXは、大きな言語モデル(LLM)のコード生成性能を改善する新しいプロンプト技術である。
まず、テストケース分析を利用して仕様の理解を得、自己改善プロセスを可能にする。
muFiXはさらに、提供された理解と実際の理解の間のギャップを減らす方向に向けた仕様理解を修正している。
論文 参考訳(メタデータ) (2023-09-28T02:58:07Z) - CodeT5+: Open Code Large Language Models for Code Understanding and
Generation [72.1638273937025]
大きな言語モデル (LLM) は膨大なソースコードで事前訓練されており、コードインテリジェンスにおいて顕著な進歩を遂げている。
CodeT5+は、コンポーネントモジュールを柔軟に組み合わせて、幅広い下流のコードタスクに適合させることができるコードのためのエンコーダ-デコーダLLMのファミリーである。
我々は、ゼロショット、微調整、命令調整を含む20以上のコード関連ベンチマークでCodeT5+を広範囲に評価した。
論文 参考訳(メタデータ) (2023-05-13T14:23:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。