論文の概要: Johnny Still Receives Spam SMS: Assessing the Robustness of SMS Spam Detection
- arxiv url: http://arxiv.org/abs/2609.01171v1
- Date: Tue, 01 Sep 2026 12:47:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.664223
- Title: Johnny Still Receives Spam SMS: Assessing the Robustness of SMS Spam Detection
- Title(参考訳): SMSのスパム検出のロバストさをジョニーが評価
- Authors: Muhammad Salman, Muhammad Islam, Muhammad Ikram, Mohamed Ali Kaafar,
- Abstract要約: エンドユーザーが実際に依存するSMSアンチスパムシステムの堅牢性を評価する。
実験の結果,既存のスパム検知器が相手に操作されたメッセージを識別する能力に,大きなギャップがあることが判明した。
これらの弱点に対処するため,アーキテクチャやトークン化の多種多様なスパム分類器と敵対的訓練を組み合わせたマルチモデルアンサンブルを提案する。
- 参考スコア(独自算出の注目度): 0.7533748789378176
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: SMS spam detection systems often achieve high accuracy in controlled environments but struggle against adversarial attacks and increasingly sophisticated spam tactics in real-world deployments. In this paper, we evaluate the robustness of SMS anti-spam systems that end users actually rely on, including commercial messaging applications, third-party anti-spam services, and publicly available open-weight models hosted on Hugging Face. We evaluate these systems under both standard and adversarial conditions, considering perceptible and state-of-the-art imperceptible attacks. We include only perturbations that we verify survive real SMS or RCS delivery, rather than lab-only artifacts. Our experiments reveal significant gaps in existing spam detectors' ability to identify adversarially manipulated messages. We further demonstrate that adversarial training alone is insufficient. Using an explicit held-out evaluation protocol, we find that robustness transfers well within a perturbation family but degrades sharply against structurally distinct, encoding-level attacks. To address these weaknesses, we propose a multi-model ensemble that combines adversarial training with spam classifiers diverse in architecture and tokenization. Our results show that this ensemble, particularly when using a minority-voting strategy, substantially improves robustness against both perceptible and imperceptible adversarial attacks while maintaining competitive classification accuracy. We also characterize the resulting precision-recall trade-off and recommend operating points for false-positive-sensitive and recall-critical deployments. These findings highlight the need for comprehensive robustness evaluations and ensemble-based defenses for building more secure SMS spam detection systems in real-world settings.
- Abstract(参考訳): SMSスパム検出システムは、制御された環境では高い精度を達成するが、現実の展開において敵攻撃や高度なスパム戦術に苦戦することが多い。
本稿では,エンドユーザが実際に依存するSMSアンチスパムシステムの堅牢性を評価する。例えば,商用メッセージングアプリケーション,サードパーティのアンチスパムサービス,Hugging Faceでホストされている公開オープンウェイトモデルなどだ。
本研究は,これらのシステムに対して,非知覚的攻撃と非知覚的攻撃を考慮し,標準的・対人的攻撃の両条件で評価する。
実験室のみのアーティファクトではなく、実際のSMSやRCS配信を生き残るための摂動のみを含む。
実験の結果,既存のスパム検知器が相手に操作されたメッセージを識別する能力に,大きなギャップがあることが判明した。
さらに、敵の訓練だけでは不十分であることを示す。
明確なホールドアウト評価プロトコルを用いて、ロバスト性は摂動系内では良好に伝達されるが、構造的に異なるエンコーディングレベルの攻撃に対して著しく低下する。
これらの弱点に対処するために,アーキテクチャやトークン化の多種多様なスパム分類器と敵対的訓練を組み合わせたマルチモデルアンサンブルを提案する。
以上の結果から,このアンサンブルは,特にマイノリティー投票戦略を用いた場合,競争的分類精度を維持しつつも,知覚的かつ知覚不能な敵攻撃に対する堅牢性を大幅に向上させることが明らかとなった。
また、その結果の高精度リコールトレードオフを特徴付けるとともに、偽陽性やリコールクリティカルなデプロイメントに対してオペレーティングポイントを推奨します。
これらの結果は、より安全なSMSスパム検出システムを構築するために、包括的な堅牢性評価とアンサンブルベースの防御の必要性を強調している。
関連論文リスト
- Breaking and Defending LLM-Powered Social Media Bot Detection Systems [0.0]
ソーシャルメディアボットは、誤情報、意見操作、オンラインプラットフォームにおける信頼の侵食を可能にする、永続的な脅威となる。
これに対抗するために、ボットの活動を検出して制限するために機械学習システムが開発されたが、攻撃者は敵の学習や行動模倣といった手法を通じて継続的に適応する。
大規模言語モデル(LLM)の最近の進歩は、アカウントとその内容のより深い意味的・文脈的分析を可能にすることにより、ボット検出を大幅に改善している。
本稿では,適応的対向条件下で検出信頼性を維持するために,堅牢なマルチLLMディフェンスアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-08-16T18:56:01Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems [18.461135869777316]
大規模言語モデル (LLM) を利用したマルチエージェントシステム (MAS) により、エージェントは情報通信と共有が可能となり、複雑なタスクにおいて高いパフォーマンスを達成できる。
既存の埋め込みベースの防御は、疑わしいエージェントを検出してプルークすることを目的としているが、その効果は悪意のあるメッセージと良心的なメッセージの埋め込みを明確に分離することに依存する。
我々は,この障害モードを理論的に解析し,Slow Drift, Benign Wrapper, Chaos Seedingの3つの攻撃を経験的に検証する。
論文 参考訳(メタデータ) (2026-05-01T22:15:11Z) - Prompt-Unknown Promotion Attacks against LLM-based Sequential Recommender Systems [51.504307822017985]
大規模言語モデルを用いたシーケンシャルレコメンデータシステム(LLM-SRS)は,最近顕著な性能を示した。
本稿では, LLM-SRSにおけるアイテムプロモーション攻撃について, 攻撃者に対してシステムプロンプトと被害者モデルの両方が未知な状況下で, より現実的な状況下で検討する。
論文 参考訳(メタデータ) (2026-04-26T10:09:26Z) - MultiPhishGuard: An LLM-based Multi-Agent System for Phishing Email Detection [3.187381965457262]
MultiPhishGuardは動的マルチエージェント検出システムである。
本フレームワークでは, 政策最適化強化学習アルゴリズムを用いて, 自動決定重み付けを行う5つの協調エージェントを用いる。
実験により、MultiPhishGuardは偽陽性(2.73%)と偽陰性率(0.20%)で高い精度(97.89%)を達成することが示された。
論文 参考訳(メタデータ) (2025-05-26T23:27:15Z) - SpaLLM-Guard: Pairing SMS Spam Detection Using Open-source and Commercial LLMs [1.3198171962008958]
我々は,SMSスパム検出における大規模言語モデル (LLM) の可能性を評価する。
ゼロショット、少数ショット、微調整、チェーン・オブ・プルーピングのアプローチでパフォーマンスを比較します。
ファインチューニングは最も効果的な戦略として現れ、Mixtralの精度は98.6%、偽陽性と偽陰性率は2%以下である。
論文 参考訳(メタデータ) (2025-01-09T06:00:08Z) - Jailbreaking as a Reward Misspecification Problem [80.52431374743998]
本稿では,この脆弱性をアライメントプロセス中に不特定性に対処する新たな視点を提案する。
本稿では,報酬の相違の程度を定量化し,その有効性を実証する指標ReGapを紹介する。
ReMissは、報酬ミスの空間で敵のプロンプトを生成する自動レッドチームリングシステムである。
論文 参考訳(メタデータ) (2024-06-20T15:12:27Z) - SpamDam: Towards Privacy-Preserving and Adversary-Resistant SMS Spam Detection [2.0355793807035094]
SpamDamはSMSスパムの検出と理解において重要な課題を克服するために設計されたSMSスパム検出フレームワークである。
われわれは2018年から2023年にかけて、TwitterとWeiboから76万件以上のSMSスパムメッセージを収集した。
我々は、SMSスパム検出モデルの対角的堅牢性を厳格に検証し、新しいリバースバックドア攻撃を導入した。
論文 参考訳(メタデータ) (2024-04-15T06:07:10Z) - Token-Level Adversarial Prompt Detection Based on Perplexity Measures
and Contextual Information [67.78183175605761]
大規模言語モデルは、敵の迅速な攻撃に影響を受けやすい。
この脆弱性は、LLMの堅牢性と信頼性に関する重要な懸念を浮き彫りにしている。
トークンレベルで敵のプロンプトを検出するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-20T03:17:21Z) - Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks [76.35478518372692]
エプシロン・イリューソリー(epsilon-illusory)は、シーケンシャルな意思決定者に対する敵対的攻撃の新たな形態である。
既存の攻撃と比較して,エプシロン・イリューソリーの自動検出は極めて困難である。
以上の結果から, より優れた異常検知器, 効果的なハードウェアおよびシステムレベルの防御の必要性が示唆された。
論文 参考訳(メタデータ) (2022-07-20T19:49:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。