論文の概要: From Signals to Behaviors: Evidence-Based Android Malware Detection
- arxiv url: http://arxiv.org/abs/2607.23272v1
- Date: Sat, 25 Jul 2026 16:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.045823
- Title: From Signals to Behaviors: Evidence-Based Android Malware Detection
- Title(参考訳): 信号から行動へ:証拠に基づくAndroidマルウェア検出
- Authors: Shiwen Song, Yiheng Xiong, Sen Chen, Xiaofei Xie,
- Abstract要約: Androidのマルウェアは依然として永続的な脅威であり、それを正確に検出することは長年のオープンな問題だ。
本稿では,仮説-確認-判断パイプラインとして検出を構造化するPraxについて述べる。
全体的な検出性能は87.4%で、18.6-34.8ポイントでベースラインを上回っている。
- 参考スコア(独自算出の注目度): 17.16103824394101
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Android malware remains a persistent threat, and detecting it accurately is a long-standing open problem. Whether an app is malicious depends on what it actually does and the context in which it does it, not on the surface signals it happens to exhibit. Existing detectors instead reason about proxies for behavior, such as learned features or local code slices, and flag whatever deviates from these proxies as malicious. But deviation is not maliciousness: benign apps that merely look unusual are over-flagged, evolving malware that looks ordinary slips through. We argue that detection should be behavior-oriented: recover an app's potentially malicious behaviors and judge which are truly malicious. To realize this, we present Praxis, which structures detection as a hypothesize-confirm-judge pipeline: it hypothesizes candidate behaviors from coarse static signals, confirms each by grounding it in code evidence verified with program analysis, and judges the confirmed behaviors in context: the user's awareness, the app's functional context, and how they compose into an attack. For a malicious app, Praxis returns a verdict and the supported behaviors. We evaluate Praxis against seven baselines across three challenging settings. It achieves the best overall detection performance (87.4% F1), outperforming the baselines by 18.6-34.8 percentage points. On high-permission benign apps, it reduces the false-positive rate to 13.0%, a reduction of 41.1-67.0 percentage points compared with the baselines. Beyond binary detection, Praxis recovers fine-grained malicious behaviors at 87.3% F1, outperforming prior behavior-level approaches by 56.5-73.4 percentage points. Ablation studies show that each stage of the pipeline contributes to the final performance.
- Abstract(参考訳): Androidのマルウェアは依然として永続的な脅威であり、それを正確に検出することは長年のオープンな問題だ。
アプリに悪意があるかどうかは、実際に何をしているか、その状況によって異なり、表示される表面信号には依存しない。
既存の検出器は、学習した特徴やローカルコードスライスといった振る舞いのプロキシを推論し、これらのプロキシから逸脱したものを悪意のあるものとしてフラグ付けする。
しかし、偏見は悪意に満ちたものではない。異常に見えるだけの良質なアプリは、行き過ぎで進化するマルウェアが、通常通り抜けるように見える。
私たちは、検出は行動指向であるべきだと論じています。アプリの潜在的悪意のある振る舞いを回復し、真に悪意のある行動を判断するのです。
そこで本研究では,プログラム解析で検証されたコードエビデンスに根拠を置き,ユーザの認識,アプリの機能的コンテキスト,それらがどのようにして攻撃を構成するかという,検証された振る舞いを判断する。
悪意のあるアプリの場合、Praxisは判断とサポート対象の動作を返す。
Praxisを3つの困難な設定で7つのベースラインに対して評価する。
全体的な検出性能は87.4%で、18.6-34.8ポイントでベースラインを上回っている。
ハイパーミッションの良性アプリでは、偽陽性率を13.0%に下げ、ベースラインと比較して41.1-67.0ポイントを下げる。
2値検出の他に、Praxisは87.3% F1できめ細かい悪意のある振る舞いを回復し、56.5-73.4ポイントの行動レベルのアプローチよりも優れている。
アブレーション研究は、パイプラインの各ステージが最終的なパフォーマンスに寄与していることを示している。
関連論文リスト
- ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis [0.0]
敵対的なコメントは、検出精度に小さな、統計的に重要でない効果をもたらす。
複雑な敵戦略は単純な操作的コメントに勝るものではない。
コメントストリッピングは、有用なコンテキストを削除することで、より弱いモデルの検出を減らす。
論文 参考訳(メタデータ) (2026-02-18T00:34:17Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence [0.0]
本稿では,防衛インシデント対応エージェントの評価を行う,二重制御強化学習環境であるOpenSecを紹介する。
静的な能力ベンチマークとは異なり、OpenSecは敵のエビデンスの下で世界状態を変える封じ込めアクションをスコアする。
GPT-5.2、Gemini 3、DeepSeekは100%のエピソードを90-97%の偽陽性率で封じ込めている。
論文 参考訳(メタデータ) (2026-01-28T22:12:54Z) - Cutting the Gordian Knot: Detecting Malicious PyPI Packages via a Knowledge-Mining Framework [14.0015860172317]
Python Package Index(PyPI)は悪意のあるアクターのターゲットとなっている。
現在の検出ツールは偽陽性率15~30%を生成し、不正に正規パッケージの3分の1を悪意のあるものとフラグ付けしている。
我々は,検出障害を有用な行動知識に変換する知識駆動型フレームワークであるPyGuardを提案する。
論文 参考訳(メタデータ) (2026-01-23T05:49:09Z) - BinCtx: Multi-Modal Representation Learning for Robust Android App Behavior Detection [14.968903026957603]
我々は,グローバルバイトコード・アズ・イメージ・ビューからアプリのマルチモーダル表現を構築する学習手法であるBINCTXを提案する。
現実世界のマルウェアや良性アプリでは、BINCTXは94.73%のマクロF1を獲得し、少なくとも14.92%の強いベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-16T06:29:06Z) - TED++: Submanifold-Aware Backdoor Detection via Layerwise Tubular-Neighbourhood Screening [62.75464575596457]
TED++は、微妙なバックドアを効果的に検出するサブマニフォールド対応フレームワークである。
進化するクラスのサブ多様体上で、許容可能な入力がいかに忠実に残っているかをキャプチャする。
ほぼ完全な検出を実現し、AUROCの14%のゲインを次のベストメソッドで達成する。
論文 参考訳(メタデータ) (2025-10-16T04:51:25Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。