論文の概要: Statistical Analysis of Executability and Program Equivalence in Decompilation for IoT Vulnerability Detection
- arxiv url: http://arxiv.org/abs/2608.06960v1
- Date: Fri, 07 Aug 2026 08:36:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.417912
- Title: Statistical Analysis of Executability and Program Equivalence in Decompilation for IoT Vulnerability Detection
- Title(参考訳): IoT脆弱性検出のためのデコンパイルにおける実行可能性とプログラム等価性の統計的解析
- Abstract要約: 本研究では,構造的,行動的,意味的類似性の3つのカテゴリからなる9次元品質評価尺度を提案する。
脆弱性は、エラー処理フローや境界チェックなど、このプロセスで簡単に失われる詳細で生じることが多い。
本研究はIoTデバイスの実装欠陥の定量化のための統計的評価基盤を提供する。
- 参考スコア(独自算出の注目度): 1.9637266103693347
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Internet of Things (IoT) devices handle sensitive privacy-related information such as user audio, video, and authentication data, making it essential to detect vulnerabilities in their firmware. Decompilation, a key detection technique, has recently attracted attention because Large Language Models (LLMs) enable high readability and high recompilation success rates. However, because LLM outputs depend on probabilistic token prediction, they tend to prioritize syntactic correctness and may generate plausible-looking code that is semantically different from the original binary. Vulnerabilities often arise in details that are easily lost in this process, such as error-handling flows and boundary checks. Existing evaluation metrics focus mainly on passing test cases and cannot sufficiently identify code whose internal structure has been altered despite appearing behaviorally valid, so a metric that quantifies the internal structure of decompiled code from multiple perspectives is needed. We propose a nine-dimensional quality evaluation metric consisting of three categories: structural, behavioral, and semantic similarity. Targeting 318 programs from OpenWrt, an open-source router platform underlying many commercial routers, we generated 19,625 decompilation results using five methods (one rule-based and four LLM-based) and analyzed them statistically. The recompilation-success group achieved significantly higher overall scores than the failure group (Cohen's d=0.92); behavioral similarity showed d=0.96 and structural similarity d=0.69, demonstrating that these metrics are important predictors of decompilation quality. This study provides a statistical evaluation foundation for quantifying implementation defects in IoT devices and a framework that generalizes to quality evaluation of black-box generative models.
- Abstract(参考訳): Internet of Things(IoT)デバイスは、ユーザのオーディオ、ビデオ、認証データなどの機密性の高いプライバシー関連の情報を処理し、ファームウェアの脆弱性を検出することが不可欠である。
大規模な言語モデル(LLM)は高い可読性と高い再コンパイル成功率を可能にするため、重要な検出手法であるデコンパイルが最近注目を集めている。
しかし、LLM出力は確率的トークン予測に依存するため、構文的正しさを優先し、元のバイナリと意味的に異なる可視的なコードを生成する傾向がある。
脆弱性は、エラー処理フローや境界チェックなど、このプロセスで簡単に失われる詳細で生じることが多い。
既存の評価指標は主にテストケースの通過に重点を置いており、動作に有効なように見えるが、内部構造が変更されているコードを十分に識別できないため、複数の観点から逆コンパイルされたコードの内部構造を定量化するメトリクスが必要である。
本研究では,構造的,行動的,意味的類似性の3つのカテゴリからなる9次元品質評価尺度を提案する。
多くの商用ルータを基盤とするオープンソースのルータプラットフォームであるOpenWrtから318のプログラムをターゲットとして、5つのメソッド(1つのルールベースと4つのLLMベース)を用いて19,625個の逆コンパイル結果を生成し、統計的に解析した。
Recompilation-success group は失敗群よりもはるかに高い総合スコア(Cohen's d=0.92)を達成し、挙動類似性は d=0.96 と構造類似性 d=0.69 を示し、これらの指標が分解品質の重要な予測因子であることを示した。
本研究は,IoTデバイスにおける実装欠陥の定量化のための統計的評価基盤と,ブラックボックス生成モデルの品質評価を一般化するフレームワークを提供する。
関連論文リスト
- Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection [16.007199928732614]
DREAはリポジトリレベルの脆弱性検出のための仮説駆動型フレームワークである。
ゴール指向コンテキスト取得は、この設計における検出改善の主な原因である。
RepoPairBenchは,実世界のプロジェクトから検証済みのPython脆弱性修正ペアの,リポジトリを基盤としたベンチマークである。
論文 参考訳(メタデータ) (2026-07-15T04:49:05Z) - Understanding Binary Code Similarity for Real-World Vulnerability Detection: A Large-Scale Empirical Study [15.569141472526502]
BCSDを用いて,200ベンダから6万のファームウェアイメージに対する脆弱性検出を大規模に実施する。
脆弱な機能バージョン,脆弱性検索スペース,関数サイズ,コンパイルツールチェーンの4つの要因がBCSD性能に与える影響について検討する。
TPL対応の2段階探索プロセスは精度を大幅に向上し、検索スペースを制限してMRRを18.5%改善する。
論文 参考訳(メタデータ) (2026-06-27T11:26:28Z) - Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms [18.10438822471092]
ディープニューラルネットワークの堅牢性は、安全クリティカルなデプロイメントに不可欠である。
本稿では,Fisher Information Matrixのスペクトル規範に基づく,攻撃非依存のロバスト性指標を提案する。
我々のフレームワークは、攻撃に基づく評価を補完する解釈可能な診断ツールとして機能する。
論文 参考訳(メタデータ) (2026-06-03T11:50:38Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Evaluating Line-level Localization Ability of Learning-based Code Vulnerability Detection Models [9.543689542888599]
脆弱性検出のための説明可能性に基づく評価手法を提案する。
提案手法は検出アライメント(DA)として定義され,入力されたソースコード間の一致を定量化する。
このようなモデルの予測は、常に非負の線に偏っていることを示す。
論文 参考訳(メタデータ) (2025-10-13T09:34:40Z) - Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation [69.8237598448941]
本研究では,ソースコードの脆弱性検出において,Large Language Models(LLM)の性能を高めるためのアンサンブル学習の可能性を検討する。
脆弱性検出に適したスタック機能であるDynamic Gated Stacking (DGS)を提案する。
論文 参考訳(メタデータ) (2025-09-16T03:48:22Z) - SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection [8.440793630384546]
大規模言語モデル(LLM)は、ソフトウェア工学のタスクにおいて有望であることを示している。
高品質なデータセットがないため、脆弱性検出の有効性を評価するのは難しい。
このベンチマークには、1999年から2024年までのC/C++プロジェクトで5,867のCVEをカバーする25,440の関数サンプルが含まれている。
論文 参考訳(メタデータ) (2025-05-26T11:06:03Z) - Reasoning with LLMs for Zero-Shot Vulnerability Detection [0.9208007322096533]
textbfVulnSageは,多種多様な大規模オープンソースソフトウェアプロジェクトから収集した,総合的な評価フレームワークである。
このフレームワークは、関数レベル、ファイルレベル、関数間の複数の粒度解析をサポートする。
Baseline、Chain-of-context、Think、Think & verifyの4つの異なるゼロショットプロンプト戦略を採用している。
論文 参考訳(メタデータ) (2025-03-22T23:59:17Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI [58.29510889419971]
コード生成大型言語モデル(LLM)のセキュリティリスクと能力を評価するための既存のベンチマークは、いくつかの重要な制限に直面している。
手動で検証し、高品質なシード例から始める、汎用的でスケーラブルなベンチマーク構築フレームワークを導入し、ターゲット突然変異を通じて拡張する。
このフレームワークをPython、C/C++、Javaに適用すると、44のCWEベースのリスクカテゴリと3つのセキュリティ機能にまたがる5.9k以上のサンプルデータセットであるSeCodePLTが構築されます。
論文 参考訳(メタデータ) (2024-10-14T21:17:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。