論文の概要: CODEFUSE-DEBENCH: An Empirical Study on Readability, Recompilability, and Functionality
- arxiv url: http://arxiv.org/abs/2605.29490v1
- Date: Thu, 28 May 2026 07:17:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.928128
- Title: CODEFUSE-DEBENCH: An Empirical Study on Readability, Recompilability, and Functionality
- Title(参考訳): CODEFUSE-DEBENCH:可読性、再コンパイル性、機能に関する実証的研究
- Authors: Puzhuo Liu, Yuhan Huang, Jianlei Chi, Peng Di, Yu Jiang,
- Abstract要約: 本稿では, 可読性, 再コンパイル性, 機能性の3次元に沿って, 再コンパイル品質を測定する再利用可能な評価パラダイムを提案する。
我々は,多次元デコンパイル評価のための最初の自動フレームワークであるDEBENCHを提案する。
- 参考スコア(独自算出の注目度): 14.354022325641088
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Binary decompilation aims to recover binaries into high-level source code, but existing evaluations mainly rely on syntactic similarity or single-axis readability metrics, which fail to capture practical reusability. We propose a reusability-driven evaluation paradigm that measures decompiler quality along three orthogonal dimensions: readability, recompilability, and functionality. We present DEBENCH, the first automated framework for multidimensional decompilation evaluation. DEBENCH contains 240 atomic test functions, organized into 8 source files and compiled into 640 binaries. It combines LLM-as-judge readability scoring with URAF (18 sub-dimensions), iterative compile-and-repair under a fixed 50-iteration budget, and Frida-based differential dynamic tracing at the program, function, and instruction levels. We evaluate five mainstream decompilers and three repair LLMs. Our study reveals four findings. First, the reusability cliff is steep: the best decompiler-LLM pair reaches 22.3% Exact+Partial program-level behavioral overlap but only 1.2% exact stdout match, nearly 50 points below recompilability. Second, settings that maximize readability do not maximize functionality: -O3 yields the lowest readability but the highest functionality, and Clang gives lower readability than GCC but 2.6x higher functionality. Third, cross-decompiler variation at the functional level is 20x, far larger than the 1.6x cross-LLM variation, showing that progress depends more on decompiler engines than larger repair models. Fourth, failures fall into three categories: syntactic noise, type-system collapse (about 19% of repair errors), and irreversible upstream losses such as ARM64 relocation idioms and C++ ABI features.
- Abstract(参考訳): バイナリの逆コンパイルは、バイナリを高レベルなソースコードにリカバリすることを目的としているが、既存の評価は主に構文的類似性や単一軸可読性メトリクスに依存しており、実用的再利用性は得られない。
本稿では, 可読性, 再コンパイル性, 機能という3つの直交次元に沿って, 逆コンパイラ品質を測定する再利用可能な評価パラダイムを提案する。
我々は,多次元デコンパイル評価のための最初の自動フレームワークであるDEBENCHを提案する。
DEBENCHは240のアトミックテスト関数を含み、8つのソースファイルに編成され、640のバイナリにコンパイルされる。
LLM-as-judgeの可読性スコアとURAF(18サブディメンジョン)、50イテレーション予算の下で反復的なコンパイル・アンド・リペア、プログラム、関数、命令レベルでのFridaベースの微分動的トレースを組み合わせる。
我々は5つのメインストリーム逆コンパイラと3つの補修LSMを評価した。
私たちの研究は4つの発見を公表した。
まず、再利用可能な崖は急勾配で、最高の逆コンパイラとLLMのペアは22.3%のExact+Partialプログラムレベルの動作オーバーラップに達するが、正確なstdoutマッチは1.2%に過ぎず、リコンパイル可能性より50ポイント近く低い。
第二に、可読性を最大化する設定は機能を最大化しない: -O3は可読性が最も低いが、最も高い機能、ClangはGCCよりも低い可読性を持つが、2.6倍高い機能を持つ。
第3に、機能レベルでのクロスコンパイラのバリエーションは20倍であり、1.6倍のクロスLLMのバリエーションよりもはるかに大きい。
第4に、障害は3つのカテゴリに分類される: 構文ノイズ、型システム崩壊(修理エラーの約19%)、ARM64リロケーションイディオムやC++ ABI機能など、アップストリームの損失は不可逆である。
関連論文リスト
- Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery [47.704311990064554]
脱コンパイルは、セキュリティ分析、マルウェアのリバースエンジニアリング、レガシーソフトウェアメンテナンスに不可欠である。
マルチレベル制約誘導型デコンパイル(MCGD)により,デコンパイルされたコードを再実行可能なソースに変換するマルチエージェントフレームワークを提案する。
本フレームワークは,84~97%の再実行性を実現し,28~89ポイントのベースラインデコンパイラ出力を改善した。
論文 参考訳(メタデータ) (2026-04-27T01:28:11Z) - SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation [1.0010193170880752]
本稿では,高レベルのプログラム意図とポインタ演算と手動メモリ管理の厳密な構文制約とのギャップを埋める,ニューロシンボリックなシナリオベースのフレームワークを提案する。
我々は、59の現実世界およびアルゴリズムの被験者で評価し、バニラプロンプト生成ベースラインを31.36%、分岐カバレッジ26.01%、突然変異スコア20.78%で上回り、シンボリック実行ツールKLEEに適合または超えている。
論文 参考訳(メタデータ) (2026-02-18T18:09:03Z) - HELIOS: Hierarchical Graph Abstraction for Structure-Aware LLM Decompilation [11.110675371854988]
textscHELIOSは、バイナリの逆コンパイルを構造化推論タスクとして再構成するフレームワークである。
textscHELIOSは、セキュリティ設定のリバースエンジニアリングのための実用的なビルディングブロックである。
論文 参考訳(メタデータ) (2026-01-21T02:37:33Z) - Improving Compiler Bug Isolation by Leveraging Large Language Models [14.679589768900621]
本稿では,AutoCBIという新しいコンパイラバグ分離手法を提案する。
我々は、広く使われているGCCおよびLLVMコンパイラの120の現実世界バグに対して、最先端のアプローチ(DiWi、RecBi、FuseFL)に対してAutoCBIを評価した。
特に、GCC/LLVMの上位1位では、AutoCBIは66.67%/69.23%、300%/340%、100%/57.14%のバグをRecBi、DiWi、FuseFLより分離している。
論文 参考訳(メタデータ) (2025-06-21T09:09:30Z) - D-LiFT: Improving LLM-based Decompiler Backend via Code Quality-driven Fine-tuning [49.16469288280772]
逆コンパイラは、バイナリから可読なソースコードを再構築する。
近年の進歩にもかかわらず、そのアウトプットは構文上の誤りや意味的な誤りに悩まされ、読みにくいままである。
大規模言語モデル (LLMs) の出現により、研究者は逆コンパイラ出力を洗練するためのLLMの可能性を探り始めた。
D-LIFTは、微調整強化学習を施した拡張逆コンパイラLLMパイプラインである。
論文 参考訳(メタデータ) (2025-06-11T19:09:08Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - ReF Decompile: Relabeling and Function Call Enhanced Decompile [50.86228893636785]
逆コンパイルの目標は、コンパイルされた低レベルコード(アセンブリコードなど)を高レベルプログラミング言語に変換することである。
このタスクは、脆弱性識別、マルウェア分析、レガシーソフトウェアマイグレーションなど、さまざまなリバースエンジニアリングアプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-02-17T12:38:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。