論文の概要: Binary Decompilation LLM with Feedback-Driven Multi-Turn Refinement
- arxiv url: http://arxiv.org/abs/2606.16162v1
- Date: Mon, 15 Jun 2026 03:25:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.05496
- Title: Binary Decompilation LLM with Feedback-Driven Multi-Turn Refinement
- Title(参考訳): フィードバック駆動型マルチTurnリファインメントを用いたバイナリ逆コンパイルLDM
- Authors: Peipei Liu, Jian Sun, Mingzhe Xing, Yicheng Zeng, Zhaoteng Yan, Lixiao Zhang, Li Chen, Dan Li,
- Abstract要約: 本稿では、フィードバック駆動型マルチターンバイナリ逆コンパイルのための強化学習で訓練された逆コンパイル特化LDMであるAutoDecompilerを提案する。
コード妥当性、再コンパイル可能性、実行一貫性、セマンティック忠実性をキャプチャする、逆コンパイル固有の報酬を設計する。
AutoDecompilerファミリをトレーニングし、異なる入力設定、モデルスケール、ベンチマークで評価します。
- 参考スコア(独自算出の注目度): 39.339662640253785
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Binary decompilation is fundamental to security tasks such as vulnerability discovery, malware inspection, and executable-only program understanding. Recent LLM-based decompilation methods have shown promising results, but most still follow a single-turn generation paradigm: given assembly code or decompiler-produced pseudo-code, the model generates one output and stops. Consequently, the generated code may appear readable or even compile successfully, yet still deviate from the behavior of the original binary and mislead downstream analysis. This paper presents AutoDecompiler, a decompilation-specialized LLM trained with reinforcement learning for feedback-driven multi-turn binary decompilation. Instead of treating decompilation as one-shot code generation, AutoDecompiler formulates it as an iterative refinement process, where the model revises generated code based on compilation, execution, and input/output testing feedback. To enable this process, we design decompilation-specific rewards that capture code validity, recompilability, execution consistency, and semantic fidelity. We further construct stage-aware diagnostic feedback from compiler errors, execution failures, and failed test cases, and introduce progress-aware trajectory rewarding and turn-aware advantage reweighting to encourage beneficial revisions while suppressing regressions. We train the AutoDecompiler family and evaluate it across different input settings, model scales, and benchmarks. Experimental results show that AutoDecompiler consistently outperforms its single-turn counterparts under the same model size and input setting, achieving clear improvements in behavioral re-executability. These results demonstrate that learning to exploit program feedback with reinforcement learning is an effective direction for improving the functional correctness of LLM-based binary decompilation.
- Abstract(参考訳): バイナリ逆コンパイルは、脆弱性発見、マルウェア検査、実行可能のみのプログラム理解といったセキュリティタスクの基本である。
最近のLCMベースの逆コンパイル手法は有望な結果を示しているが、ほとんどの場合、アセンブリコードやデコンパイラが生成した擬似符号が与えられた場合、モデルは1つの出力を生成して停止する単一ターン生成パラダイムに従っている。
その結果、生成されたコードは読みやすくなり、コンパイルも成功しても、元のバイナリの動作と誤解を招くダウンストリーム分析から逸脱する可能性がある。
本稿では、フィードバック駆動型マルチターンバイナリ逆コンパイルのための強化学習で訓練された逆コンパイル専用LLMであるAutoDecompilerを提案する。
逆コンパイルをワンショットコード生成として扱う代わりに、AutoDecompilerはそれを反復的な洗練プロセスとして定式化し、モデルがコンパイル、実行、入出力テストフィードバックに基づいて生成されたコードを修正する。
このプロセスを実現するために、コード妥当性、再コンパイル可能性、実行一貫性、セマンティック忠実性をキャプチャする逆コンパイル固有報酬を設計する。
さらに,コンパイラのエラーや実行障害,テストケースの失敗などからのステージアウェアな診断フィードバックを構築するとともに,進行アウェアな軌道報奨やターンアウェアによる有利な再重み付けを導入し,レグレッションを抑えながら改善を促す。
AutoDecompilerファミリをトレーニングし、異なる入力設定、モデルスケール、ベンチマークで評価します。
実験結果から、AutoDecompilerはモデルサイズと入力設定が同じ単一ターンで一貫してパフォーマンスを向上し、動作の再実行可能性の明確な改善を実現していることがわかった。
これらの結果から,プログラムフィードバックを強化学習で活用する学習が,LLMに基づくバイナリ逆コンパイルの機能的正しさの向上に有効な方向であることが示唆された。
関連論文リスト
- PCodeTrans: Translate Decompiled Pseudocode to Compilable and Executable Equivalent [8.576619291429969]
PCodeTransは、逆コンパイル、再コンパイル、厳密な関数レベルの動的検証のギャップを埋める。
99.55%と99.89%のテスト検証された動作一貫性とともに、ストリップされていないバイナリ上で100%の関数レベルのコンパイルが可能となる。
論文 参考訳(メタデータ) (2026-03-16T05:54:24Z) - Can LLMs Recover Program Semantics? A Systematic Evaluation with Symbolic Execution [1.5377279217726239]
難読化は、プログラムの理解、メンテナンス、テスト、脆弱性検出といったソフトウェアエンジニアリングタスクに永続的な課題をもたらす。
微調整言語モデルがプログラムを効果的に難読化し、分析可能性を取り戻すことができるかどうかを検討する。
論文 参考訳(メタデータ) (2025-11-24T13:55:20Z) - Context-Guided Decompilation: A Step Towards Re-executability [50.71992919223209]
バイナリ逆コンパイルは、ソフトウェアセキュリティ分析、リバースエンジニアリング、マルウェア理解において重要な役割を果たす。
大規模言語モデル (LLMs) の最近の進歩により、ニューラルデコンパイルが可能になったが、生成されたコードは一般的に意味論的にのみ使用可能である。
In-context Learning(ICL)を活用して,再実行可能なソースコードを生成するためのILC4Decompを提案する。
論文 参考訳(メタデータ) (2025-11-03T17:21:39Z) - D-LiFT: Improving LLM-based Decompiler Backend via Code Quality-driven Fine-tuning [49.16469288280772]
逆コンパイラは、バイナリから可読なソースコードを再構築する。
近年の進歩にもかかわらず、そのアウトプットは構文上の誤りや意味的な誤りに悩まされ、読みにくいままである。
大規模言語モデル (LLMs) の出現により、研究者は逆コンパイラ出力を洗練するためのLLMの可能性を探り始めた。
D-LIFTは、微調整強化学習を施した拡張逆コンパイラLLMパイプラインである。
論文 参考訳(メタデータ) (2025-06-11T19:09:08Z) - ReF Decompile: Relabeling and Function Call Enhanced Decompile [50.86228893636785]
逆コンパイルの目標は、コンパイルされた低レベルコード(アセンブリコードなど)を高レベルプログラミング言語に変換することである。
このタスクは、脆弱性識別、マルウェア分析、レガシーソフトウェアマイグレーションなど、さまざまなリバースエンジニアリングアプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-02-17T12:38:57Z) - Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement [43.2637367483626]
逆コンパイルは、ソースコードが利用できない場合、コンパイルされたコードをハイレベルなプログラミング言語に変換する。
これまでの研究は主に、モデルパラメータのスケールや事前トレーニングのためのトレーニングデータを増やすことで、デコンパイル性能の向上に重点を置いてきた。
これら2つの手法を統合することで、Decompile-Evalベンチマークで約3.90%の再実行可能性向上を実現し、新しい最先端性能52.41%を確立した。
論文 参考訳(メタデータ) (2024-06-25T02:37:53Z) - StepCoder: Improve Code Generation with Reinforcement Learning from
Compiler Feedback [58.20547418182074]
2つの主要コンポーネントからなるコード生成の新しいフレームワークであるStepCoderを紹介します。
CCCSは、長いシーケンスのコード生成タスクをCurriculum of Code Completion Subtaskに分割することで、探索課題に対処する。
FGOは、未実行のコードセグメントをマスクすることでのみモデルを最適化し、Fine-Grained Optimizationを提供する。
提案手法は,出力空間を探索し,対応するベンチマークにおいて最先端の手法より優れた性能を発揮する。
論文 参考訳(メタデータ) (2024-02-02T13:14:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。