論文の概要: ASAP: Assembly-Source Aligned Pseudocode Refinement For Binary Decompilation
- arxiv url: http://arxiv.org/abs/2610.06900v1
- Date: Wed, 30 Sep 2026 02:41:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.460348
- Title: ASAP: Assembly-Source Aligned Pseudocode Refinement For Binary Decompilation
- Title(参考訳): ASAP: バイナリ逆コンパイルのためのアセンブリソースアライメントされた擬似コードリファインメント
- Abstract要約: 本稿では,バイナリ・デコンパイルのためのアセンブリ・ソース・アライン・アライメント・コード・リファインメント・フレームワークであるASAPについて述べる。
Q-Formerはチャンクレベルのアセンブリ機能を一定数のアセンブリトークンに圧縮する。
複数のコンパイラ最適化レベルの2つの逆コンパイルベンチマークにおいて、ASAPは平均再実行率を64.7%から71.9%に改善し、平均再コンパイル率を91.6%から96.6%に改善した。
- 参考スコア(独自算出の注目度): 25.933923879342995
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used in binary decompilation to refine the C-like pseudocode produced by traditional rule-based decompilers. While this pseudocode is useful, it is a heuristic and lossy abstraction rather than a faithful copy of the source code. It often contains decompiler errors, especially for aggressively optimized binaries where critical low-level details are obscured. We present ASAP, an assembly-source aligned pseudocode refinement framework for binary decompilation. ASAP learns source-aligned assembly representations from paired source and binary functions using joint function-level and snippet-level contrastive alignment. A Q-Former then compresses chunk-level assembly features into a fixed number of assembly tokens that condition the decompilation LLM alongside the decompiler-produced pseudocode. During refinement, we use stochastic pseudocode masking and a relative assembly-advantage loss to reduce the model's tendency to ignore assembly features and rely only on pseudocode refining. On two decompilation benchmarks across multiple compiler optimization levels, ASAP improves the average re-execution rate from 64.7% to 71.9% and the average recompilation rate from 91.6% to 96.6% compared with the strongest baseline, offering both a new perspective and a practical solution to binary decompilation.
- Abstract(参考訳): 大型言語モデル(LLM)は、従来のルールベースのデコンパイラによって生成されるCのような擬似コードを洗練するために、バイナリ・デコンパイルでますます使われている。
この擬似コードは有用であるが、ソースコードの忠実なコピーではなく、ヒューリスティックでロッキーな抽象化である。
特に、重要な低レベルの詳細が隠蔽されている攻撃的に最適化されたバイナリでは、デコンパイラエラーが頻繁に発生する。
本稿では,バイナリ・デコンパイルのためのアセンブリ・ソース・アライン・アライメント・コード・リファインメント・フレームワークであるASAPについて述べる。
ASAPは、結合関数レベルとスニペットレベルのコントラストアライメントを使用して、ペアのソースとバイナリ関数からソース整列アセンブリ表現を学習する。
Q-Formerは、チャンクレベルのアセンブリ機能を固定数のアセンブリトークンに圧縮し、デコンパイラが生成した擬似コードとともに、逆コンパイル LLM を条件とする。
改良の過程では,確率的擬似符号マスキングと相対的な組立アドバンテージ損失を用いて,組立機能を無視する傾向を低減し,擬似符号精製のみに依存する。
複数のコンパイラ最適化レベルにわたる2つの逆コンパイルベンチマークにおいて、ASAPは平均再実行率を64.7%から71.9%に改善し、平均再コンパイル率を91.6%から96.6%に改善した。
関連論文リスト
- Decaf: Improving Neural Decompilation with Automatic Feedback and Search [64.02615739798277]
高レベルな構文、識別子、カスタムデータ型は一般的に失われ、コンパイラは人間可読なコードを低レベルなマシンコードに変換する。
生成AIモデルは、ハイレベルな構文、識別子、型を再構築するのに自然なものだ。
コンパイラフィードバックは,サーチによるニューラルデコンパイラ出力のセマンティックな正当性の向上に有効である,と我々は主張する。
論文 参考訳(メタデータ) (2026-05-12T04:21:26Z) - Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery [47.704311990064554]
脱コンパイルは、セキュリティ分析、マルウェアのリバースエンジニアリング、レガシーソフトウェアメンテナンスに不可欠である。
マルチレベル制約誘導型デコンパイル(MCGD)により,デコンパイルされたコードを再実行可能なソースに変換するマルチエージェントフレームワークを提案する。
本フレームワークは,84~97%の再実行性を実現し,28~89ポイントのベースラインデコンパイラ出力を改善した。
論文 参考訳(メタデータ) (2026-04-27T01:28:11Z) - PCodeTrans: Translate Decompiled Pseudocode to Compilable and Executable Equivalent [8.576619291429969]
PCodeTransは、逆コンパイル、再コンパイル、厳密な関数レベルの動的検証のギャップを埋める。
99.55%と99.89%のテスト検証された動作一貫性とともに、ストリップされていないバイナリ上で100%の関数レベルのコンパイルが可能となる。
論文 参考訳(メタデータ) (2026-03-16T05:54:24Z) - Context-Guided Decompilation: A Step Towards Re-executability [50.71992919223209]
バイナリ逆コンパイルは、ソフトウェアセキュリティ分析、リバースエンジニアリング、マルウェア理解において重要な役割を果たす。
大規模言語モデル (LLMs) の最近の進歩により、ニューラルデコンパイルが可能になったが、生成されたコードは一般的に意味論的にのみ使用可能である。
In-context Learning(ICL)を活用して,再実行可能なソースコードを生成するためのILC4Decompを提案する。
論文 参考訳(メタデータ) (2025-11-03T17:21:39Z) - SALT4Decompile: Inferring Source-level Abstract Logic Tree for LLM-Based Binary Decompilation [17.58664677898224]
Saltmはバイナリとソースコードの間の安定した論理的特徴を抽象化する新しいバイナリ逆コンパイル法である。
Saltmはソースコードのロジックを回復するのに非常に効果的で、最先端のメソッドよりもはるかに優れている。
論文 参考訳(メタデータ) (2025-09-18T05:57:15Z) - D-LiFT: Improving LLM-based Decompiler Backend via Code Quality-driven Fine-tuning [49.16469288280772]
逆コンパイラは、バイナリから可読なソースコードを再構築する。
近年の進歩にもかかわらず、そのアウトプットは構文上の誤りや意味的な誤りに悩まされ、読みにくいままである。
大規模言語モデル (LLMs) の出現により、研究者は逆コンパイラ出力を洗練するためのLLMの可能性を探り始めた。
D-LIFTは、微調整強化学習を施した拡張逆コンパイラLLMパイプラインである。
論文 参考訳(メタデータ) (2025-06-11T19:09:08Z) - Decompile-Bench: Million-Scale Binary-Source Function Pairs for Real-World Binary Decompilation [18.28488002922524]
Decompile-Benchは、収集された1億の関数ペアから凝縮された200万のバイナリソース関数ペアからなる、最初のオープンソースデータセットである。
評価のために、よく確立されたHumanEvalとMBPPから手作業で作成したバイナリを含むDecompile-Bench-Evalのベンチマークを開発した。
Decompile-Benchによる微調整は、再実行可能性率の観点から、以前のベンチマークよりも20%改善されていることが分かりました。
論文 参考訳(メタデータ) (2025-05-19T03:34:33Z) - ReF Decompile: Relabeling and Function Call Enhanced Decompile [50.86228893636785]
逆コンパイルの目標は、コンパイルされた低レベルコード(アセンブリコードなど)を高レベルプログラミング言語に変換することである。
このタスクは、脆弱性識別、マルウェア分析、レガシーソフトウェアマイグレーションなど、さまざまなリバースエンジニアリングアプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-02-17T12:38:57Z) - Improving type information inferred by decompilers with supervised
machine learning [0.0]
ソフトウェアリバースエンジニアリングでは、逆コンパイルはバイナリファイルからソースコードを回復するプロセスである。
関数によって返される高レベルな型を推測できる異なる分類モデルを構築する。
私たちのシステムは、79.1%のF1測定で関数戻り型を予測できますが、最良の逆コンパイラは30%のF1測定を得ます。
論文 参考訳(メタデータ) (2021-01-19T11:45:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。