論文の概要: CoDe-R: Refining Decompiler Output with LLMs via Rationale Guidance and Adaptive Inference
- arxiv url: http://arxiv.org/abs/2604.12913v1
- Date: Tue, 14 Apr 2026 15:58:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.549584
- Title: CoDe-R: Refining Decompiler Output with LLMs via Rationale Guidance and Adaptive Inference
- Title(参考訳): CoDe-R: Rationale Guidance と Adaptive Inference による LLM による逆コンパイラ出力の精製
- Authors: Qiang Zhang, Zhongnian Li,
- Abstract要約: バイナリ逆コンパイルは、削除された実行ファイルから高レベルのソースコードを再構築することを目的とした、重要なリバースエンジニアリングタスクである。
大規模言語モデル(LLM)は、最近、約束を示すが、しばしば「科学的幻覚」と「セマンティックなミスアライメント」に悩まされる。
本稿では,2段階の軽量コード精錬フレームワークであるCoDe-Rを提案する。
- 参考スコア(独自算出の注目度): 10.71961188176124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Binary decompilation is a critical reverse engineering task aimed at reconstructing high-level source code from stripped executables. Although Large Language Models (LLMs) have recently shown promise, they often suffer from "logical hallucinations" and "semantic misalignment" due to the irreversible semantic loss during compilation, resulting in generated code that fails to re-execute. In this study, we propose Cognitive Decompiler Refinement with Robustness (CoDe-R), a lightweight two-stage code refinement framework. The first stage introduces Semantic Cognitive Enhancement (SCE), a Rationale-Guided Semantic Injection strategy that trains the model to recover high-level algorithmic intent alongside code. The second stage introduces a Dynamic Dual-Path Fallback (DDPF) mechanism during inference, which adaptively balances semantic recovery and syntactic stability via a hybrid verification strategy. Evaluation on the HumanEval-Decompile benchmark demonstrates that CoDe-R (using a 1.3B backbone) establishes a new State-of-the-Art (SOTA) in the lightweight regime. Notably, it is the first 1.3B model to exceed an Average Re-executability Rate of 50.00%, significantly outperforming the baseline and effectively bridging the gap between efficient models and expert-level performance. Our code is available at https://github.com/Theaoi/CoDe-R.
- Abstract(参考訳): バイナリ逆コンパイルは、削除された実行ファイルから高レベルのソースコードを再構築することを目的とした、重要なリバースエンジニアリングタスクである。
LLM(Large Language Models)は最近、将来性を示しているが、コンパイル中に不可逆的なセマンティックな損失が原因で、しばしば「論理的幻覚」と「意味的ミスアライメント」に悩まされる。
本研究では,ロバストネスを用いた認知的デファイナリファインメント(CoDe-R)を提案する。
最初のステージでは、コードとともに高レベルのアルゴリズム意図を回復するようにモデルをトレーニングするRationale-Guided Semantic Injection戦略であるSemantic Cognitive Enhancement (SCE)が導入されている。
第2段階では、推論中に動的デュアルパスフォールバック(DDPF)機構を導入し、ハイブリッド検証戦略を通じてセマンティックリカバリと構文安定性を適応的にバランスさせる。
HumanEval-Decompileベンチマークの評価では、CoDe-R(1.3Bのバックボーンを使用する)が軽量なシステムに新たなステート・オブ・ザ・アート(SOTA)を確立することが示されている。
特に、平均再実行率50.00%を超えた最初の1.3Bモデルであり、ベースラインを著しく上回り、効率的なモデルとエキスパートレベルのパフォーマンスのギャップを効果的に埋めている。
私たちのコードはhttps://github.com/Theaoi/CoDe-R.comで公開されています。
関連論文リスト
- Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models [28.741175254258422]
本研究では,新しい多次元ジェイルブレイク攻撃フレームワークであるStructured Semantic Cloaking (S2C)を提案する。
S2Cはマルチステップ推論を必要とするようなセマンティックキューを戦略的に分散し、再結合する。
我々は、HarmBench と JBB-Behaviors を用いて、複数のオープンソースおよびプロプライエタリ LLM 上でS2Cを評価した。
論文 参考訳(メタデータ) (2026-03-17T07:20:48Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - Context-Guided Decompilation: A Step Towards Re-executability [50.71992919223209]
バイナリ逆コンパイルは、ソフトウェアセキュリティ分析、リバースエンジニアリング、マルウェア理解において重要な役割を果たす。
大規模言語モデル (LLMs) の最近の進歩により、ニューラルデコンパイルが可能になったが、生成されたコードは一般的に意味論的にのみ使用可能である。
In-context Learning(ICL)を活用して,再実行可能なソースコードを生成するためのILC4Decompを提案する。
論文 参考訳(メタデータ) (2025-11-03T17:21:39Z) - When Retriever Meets Generator: A Joint Model for Code Comment Generation [3.6781644685120924]
RAGSumは、単一のCodeT5バックボーンを使用して、ヒューズ検索と生成の上に構築されている。
対照的な事前学習フェーズは、最寄りの探索のためのコード埋め込みを形作る。
最終出力を研磨するために、軽量な自己精製ループが配置される。
論文 参考訳(メタデータ) (2025-07-16T18:12:27Z) - DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation [68.19756761027351]
拡散大言語モデル(dLLM)は自己回帰(AR)モデルの魅力的な代替品である。
本研究は,それらの認知過程と強化学習手法について考察する。
我々の研究は、dLLM生成のメカニズムについて深い洞察を与え、効果的な拡散ネイティブなRLトレーニングフレームワークを提供します。
論文 参考訳(メタデータ) (2025-06-25T17:35:47Z) - ReF Decompile: Relabeling and Function Call Enhanced Decompile [50.86228893636785]
逆コンパイルの目標は、コンパイルされた低レベルコード(アセンブリコードなど)を高レベルプログラミング言語に変換することである。
このタスクは、脆弱性識別、マルウェア分析、レガシーソフトウェアマイグレーションなど、さまざまなリバースエンジニアリングアプリケーションをサポートする。
論文 参考訳(メタデータ) (2025-02-17T12:38:57Z) - Progressive Binarization with Semi-Structured Pruning for LLMs [36.91249209658632]
半構造化プルーニング(PBS$2$P)によるプログレッシブバイナリ化を提案し,バイナライゼーションと半構造化プルーニングをシームレスに統合する新しいポストトレーニングフレームワークを提案する。
PBS$2$P は,2進法(SOTA) の2進法を複雑度と下流精度の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-02-03T13:30:29Z) - Reward-Guided Speculative Decoding for Efficient LLM Reasoning [80.55186052123196]
Reward-Guided Speculative Decoding (RSD)は,大規模言語モデル(LLM)における推論の効率向上を目的とした新しいフレームワークである。
RSDは、厳密な偏りを強制する既存の投機的復号法とは対照的に、制御されたバイアスをハイリワード出力の優先順位付けに取り入れている。
RSDは,対象モデルのみでの復号化に対して,高い効率向上を実現し,並列復号法よりも高い精度を実現している。
論文 参考訳(メタデータ) (2025-01-31T17:19:57Z) - UniASM: Binary Code Similarity Detection without Fine-tuning [2.2329530239800035]
モデルがバイナリコードの複雑なニュアンスをキャプチャすることを保証するために,新しいリッチ・セマンティック関数表現手法を提案する。
新たに設計された2つのトレーニングタスクを含むUniASMという,UniLMベースのバイナリコード埋め込みモデルを紹介した。
実験の結果,UniASMは評価データセットに対する最先端(SOTA)アプローチよりも優れていた。
論文 参考訳(メタデータ) (2022-10-28T14:04:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。