論文の概要: Pretraining on Call Graphs: When Binary Analysis Tasks Profit From Context
- arxiv url: http://arxiv.org/abs/2608.02084v1
- Date: Mon, 03 Aug 2026 11:44:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.512565
- Title: Pretraining on Call Graphs: When Binary Analysis Tasks Profit From Context
- Title(参考訳): コールグラフの事前トレーニング:コンテキストからバイナリ分析タスクが利益を得るとき
- Abstract要約: 2つの最先端のバイナリ関数埋め込みモデルによって生成された埋め込みについて、グラフベースモデルを用いて実験を行う。
意味的類似性タスクの最適化は,構文的タスクの性能の低下と相関することがわかった。
- 参考スコア(独自算出の注目度): 7.347989843033034
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Binary function embedding models are trained to encode the semantics of binary code in such a way that they can be generalized to a variety of reverse engineering tasks, such as binary code search, vulnerability detection, or malware classification. While many models only take the function in question as contextual input, there have been successful attempts to improve function embeddings by leveraging information from the call graph. In this study, we dissect the implications of these embedding refinements. We conduct experiments using a range of graph-based models on the embeddings generated by two state-of-the-art binary function embedding models. Integrating inter-procedural context, we show that improvements on binary code similarity detection (BCSD) will not necessarily generalize to downstream tasks, neither of semantic nor of syntactic nature. More generally, we find that optimizing for semantic similarity tasks correlates with worse performance on syntactic tasks. By conducting an explanatory analysis on the dataset, we find that the call graph-based enhancements significantly enhance the robustness of embeddings, particularly in scenarios where the initial models struggle. Furthermore, we observe that the added context is more beneficial for namespace-related functions than for those focused on individual logic, confirming that the call graph can be leveraged most effectively in context-dependent scenarios.
- Abstract(参考訳): バイナリ関数の埋め込みモデルは、バイナリコードのセマンティクスを、バイナリコード検索や脆弱性検出、マルウェアの分類など、さまざまなリバースエンジニアリングタスクに一般化できるようにエンコードするように訓練されている。
多くのモデルは、問題となる関数を文脈入力としてのみ扱うが、コールグラフからの情報を活用することで、関数の埋め込みを改善する試みは成功した。
本研究は, これらの埋込み微細化の意義を解明するものである。
2つの最先端のバイナリ関数埋め込みモデルによって生成された埋め込みについて、グラフベースモデルを用いて実験を行う。
言語間コンテキストを統合することで、バイナリコード類似性検出(BCSD)の改善は、必ずしも下流タスクに一般化するとは限らない。
より一般的には、意味的類似性タスクの最適化は、構文的タスクにおけるパフォーマンスの悪化と相関する。
データセット上で説明分析を行うことで,特に初期モデルが苦戦するシナリオにおいて,コールグラフに基づく拡張が埋め込みの堅牢性を大幅に向上することがわかった。
さらに、個別の論理に焦点を絞ったものよりも、名前空間に関連した関数に付加されたコンテキストの方が有益であることを確認し、コールグラフがコンテキスト依存のシナリオで最も効果的に活用できることを確認する。
関連論文リスト
- Combating Spurious Correlations in Graph Interpretability via Self-Reflection [4.81017678027464]
解釈可能なグラフ学習は、機械学習において人気のある研究トピックである。
最も難しいのは、ICLR 2022で導入されたSpurious-Motifベンチマークである。
本稿では,既存の解釈可能なグラフ学習手法と統合可能な自己回帰フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-16T06:31:16Z) - Cross-modal Retrieval Models for Stripped Binary Analysis [62.89251403093734]
BinSeekは、取り除かれたバイナリコード分析のための最初の2段階のクロスモーダル検索フレームワークである。
BinSeekEmbeddingは、バイナリコードのセマンティックな関連性を学ぶために、大規模なデータセットでトレーニングされている。
BinSeek-Rerankerは、コンテキスト拡張による記述に対する候補コードの関連性を慎重に判断することを学ぶ。
論文 参考訳(メタデータ) (2025-12-11T07:58:10Z) - Learning Binarized Representations with Pseudo-positive Sample Enhancement for Efficient Graph Collaborative Filtering [35.82405808653398]
効率的な協調フィルタリングのためのグラフ表現バイナライゼーションの問題について検討する。
その結果, バイナライゼーションの様々な段階における情報損失の低減は, 性能に有意な影響を及ぼすことが示唆された。
前者のBiGeaRと比較して、BiGeaR++は微細な推論蒸留機構と効果的な埋め込みサンプル合成手法を導入している。
論文 参考訳(メタデータ) (2025-06-03T11:11:43Z) - Binary Code Similarity Detection via Graph Contrastive Learning on Intermediate Representations [52.34030226129628]
バイナリコード類似度検出(BCSD)は、脆弱性検出、マルウェア分析、コードの再利用識別など、多くの分野で重要な役割を果たしている。
本稿では,LLVM-IRと高レベルのセマンティック抽象化を利用して,コンパイル差を緩和するIRBinDiffを提案する。
IRBinDiffは1対1の比較と1対多の検索シナリオにおいて,他の主要なBCSD手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-10-24T09:09:20Z) - Know Your Neighborhood: General and Zero-Shot Capable Binary Function Search Powered by Call Graphlets [0.7646713951724013]
本稿では,コールグラフレットと呼ばれる新しいグラフデータ表現を組み合わせた,新しいグラフニューラルネットワークアーキテクチャを提案する。
専門的なグラフニューラルネットワークモデルは、このグラフ表現に基づいて動作し、セマンティックバイナリコードの類似性を符号化する特徴ベクトルにマッピングすることを学ぶ。
実験結果から,コールグラフレットと新しいグラフニューラルネットワークアーキテクチャを組み合わせることで,同等あるいは最先端の性能が得られることがわかった。
論文 参考訳(メタデータ) (2024-06-02T18:26:50Z) - FASER: Binary Code Similarity Search through the use of Intermediate
Representations [0.8594140167290099]
クロスアーキテクチャバイナリコード類似性検索は、多くの研究で研究されている。
本稿では,Function as a String Encoded Representation (FASER)を提案する。
論文 参考訳(メタデータ) (2023-10-05T15:36:35Z) - Mutual Exclusivity Training and Primitive Augmentation to Induce
Compositionality [84.94877848357896]
最近のデータセットは、標準的なシーケンス・ツー・シーケンスモデルにおける体系的な一般化能力の欠如を露呈している。
本稿では,セq2seqモデルの振る舞いを分析し,相互排他バイアスの欠如と全例を記憶する傾向の2つの要因を同定する。
広範に使用されている2つの構成性データセット上で、標準的なシーケンス・ツー・シーケンスモデルを用いて、経験的改善を示す。
論文 参考訳(メタデータ) (2022-11-28T17:36:41Z) - Software Vulnerability Detection via Deep Learning over Disaggregated
Code Graph Representation [57.92972327649165]
この研究は、コードコーパスから安全でないパターンを自動的に学習するためのディープラーニングアプローチを探求する。
コードには解析を伴うグラフ構造が自然に認められるため,プログラムの意味的文脈と構造的規則性の両方を利用する新しいグラフニューラルネットワーク(GNN)を開発する。
論文 参考訳(メタデータ) (2021-09-07T21:24:36Z) - Learning What Makes a Difference from Counterfactual Examples and
Gradient Supervision [57.14468881854616]
ニューラルネットワークの一般化能力を改善するための補助的学習目標を提案する。
我々は、異なるラベルを持つ最小差の例のペア、すなわち反ファクトまたはコントラストの例を使用し、タスクの根底にある因果構造を示す信号を与える。
このテクニックで訓練されたモデルは、配布外テストセットのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2020-04-20T02:47:49Z) - Probing Linguistic Features of Sentence-Level Representations in Neural
Relation Extraction [80.38130122127882]
ニューラルリレーション抽出(RE)に関連する言語特性を対象とした14の探索タスクを導入する。
私たちは、40以上の異なるエンコーダアーキテクチャと2つのデータセットでトレーニングされた言語的特徴の組み合わせによって学習された表現を研究するためにそれらを使用します。
アーキテクチャによって引き起こされるバイアスと言語的特徴の含意は、探索タスクのパフォーマンスにおいて明らかに表現されている。
論文 参考訳(メタデータ) (2020-04-17T09:17:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。