論文の概要: Breaking and Defending LLM-Powered Social Media Bot Detection Systems
- arxiv url: http://arxiv.org/abs/2608.15893v1
- Date: Sun, 16 Aug 2026 18:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.461628
- Title: Breaking and Defending LLM-Powered Social Media Bot Detection Systems
- Title(参考訳): LLMを利用したソーシャルメディアボット検出システム
- Abstract要約: ソーシャルメディアボットは、誤情報、意見操作、オンラインプラットフォームにおける信頼の侵食を可能にする、永続的な脅威となる。
これに対抗するために、ボットの活動を検出して制限するために機械学習システムが開発されたが、攻撃者は敵の学習や行動模倣といった手法を通じて継続的に適応する。
大規模言語モデル(LLM)の最近の進歩は、アカウントとその内容のより深い意味的・文脈的分析を可能にすることにより、ボット検出を大幅に改善している。
本稿では,適応的対向条件下で検出信頼性を維持するために,堅牢なマルチLLMディフェンスアーキテクチャを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rise of social media bots poses a persistent threat, enabling misinformation, opinion manipulation, and the erosion of trust in online platforms. To combat this, machine learning systems have been developed to detect and limit bot activity, but attackers continuously adapt through techniques such as adversarial learning and behavior imitation, fueling an ongoing arms race between bots and detection tools. Recent advances in large language models (LLMs) have significantly improved bot detection by enabling deeper semantic and contextual analysis of accounts and their content. However, this shift also introduces new attack surfaces, allowing adversaries to craft exploits that directly target the reasoning and generation mechanisms of LLM-based classifiers. Industry tools such as Anthropic's Claude Code Security similarly leverage LLMs for security-critical decisions, further motivating a careful study of their attack surfaces. In this work, we investigate both the offensive and defensive aspects of LLM-powered, threat-specific cybersecurity applications. While centered on the challenge of social media bot detection, our methodology and insights generalize to a broad class of LLM-powered cybersecurity systems, including phishing detection, email classification, and fraud analysis. We introduce two novel adversarial attack strategies that systematically exploit the semantic and contextual weaknesses of LLM-based classifiers, degrading their detection accuracy by up to 48%. To counter these threats, we propose a robust multi-LLM defense architecture designed to preserve detection reliability under adaptive adversarial conditions. Our solution, LSABRE (LLM-powered Social Adversarial Bot Recognition Ensemble), is a multi-LLM framework that substantially improves robustness across a range of attacks, maintaining 86% detection accuracy even under strong, adaptive adversarial pressure.
- Abstract(参考訳): ソーシャルメディアボットの台頭は、誤情報、意見操作、オンラインプラットフォームにおける信頼の侵食を可能にする、永続的な脅威を引き起こす。
これに対抗するために、ボットの活動を検出して制限するために機械学習システムが開発されたが、攻撃者は敵の学習や行動模倣といった技術を通じて継続的に適応し、ボットと検出ツールの間の武器競争を加速している。
大規模言語モデル(LLM)の最近の進歩は、アカウントとその内容のより深い意味的・文脈的分析を可能にすることにより、ボット検出を大幅に改善している。
しかし、このシフトは新たな攻撃面を導入し、敵はLSMベースの分類器の推論と生成メカニズムを直接ターゲットとしたエクスプロイトを作成できる。
AnthropicのClaude Code Securityのような業界ツールも同様に、LLMをセキュリティクリティカルな決定に活用し、攻撃面の慎重な調査を動機付けている。
本研究では,LLMによる脅威特異的サイバーセキュリティアプリケーションの攻撃的および防御的側面について検討する。
ソーシャルメディアボット検出の課題を中心に、我々の方法論と洞察は、フィッシング検出、メール分類、不正分析など、幅広い種類のLLMによるサイバーセキュリティシステムに一般化されている。
我々は,LLMに基づく分類器の意味的および文脈的弱点を体系的に活用し,検出精度を最大48%低下させる新しい2つの攻撃戦略を導入する。
これらの脅威に対処するために,適応的対向条件下で検出信頼性を維持するために,堅牢なマルチLLM防御アーキテクチャを提案する。
LSABRE(LSABRE)はマルチLLMフレームワークであり,強い適応的対向圧の下でも検出精度を86%維持し,攻撃範囲の堅牢性を大幅に向上する。
関連論文リスト
- Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability [65.56750741053266]
大規模言語モデル(LLM)は、誤情報をコンテンツ中心の問題からより広範なエコシステムレベルのセキュリティ課題に転換した。
本稿では,これらのリスクと防御を統一する役割層フレームワークを提案する。
この役割はLLMを攻撃者、ディフェンダー、検証システムの脆弱なコンポーネントとして特徴づけ、層次元はコンテンツ、社会的コンテキスト、エビデンス環境、検証をカバーしている。
論文 参考訳(メタデータ) (2026-07-11T17:04:17Z) - RoBCtrl: Attacking GNN-Based Social Bot Detectors via Reinforced Manipulation of Bots Control Interaction [51.46634975923564]
本稿では,ソーシャルボット制御攻撃(RoBCtrl)のための対向型マルチエージェント強化学習フレームワークを提案する。
具体的には、拡散モデルを用いて、既存のアカウントデータを小さな修正で再構築することで、高忠実度ボットアカウントを生成する。
次に,MARL(Multi-Agent Reinforcement Learning)法を用いて,ボットの逆動作をシミュレートする。
論文 参考訳(メタデータ) (2025-10-16T02:41:49Z) - NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models [68.09675063543402]
NeuroBreakは、ニューロンレベルの安全性メカニズムを分析し、脆弱性を軽減するために設計されたトップダウンのジェイルブレイク分析システムである。
レイヤワイドな表現探索分析を取り入れることで、NeuroBreakはモデルの意思決定プロセスに関する新たな視点を提供する。
本システムの有効性を検証するために,定量的評価とケーススタディを実施している。
論文 参考訳(メタデータ) (2025-09-04T08:12:06Z) - A Systematic Survey of Model Extraction Attacks and Defenses: State-of-the-Art and Perspectives [65.3369988566853]
近年の研究では、敵が対象モデルの機能を複製できることが示されている。
モデル抽出攻撃は知的財産権、プライバシー、システムのセキュリティに脅威をもたらす。
本稿では,攻撃機構,防衛手法,計算環境に応じてMEAを分類する新しい分類法を提案する。
論文 参考訳(メタデータ) (2025-08-20T19:49:59Z) - Quantifying Loss Aversion in Cyber Adversaries via LLM Analysis [2.798191832420146]
IARPAのReSCINDプログラムは、攻撃的な認知特性を推論し、防御し、悪用しようと試みている。
本稿では,大規模言語モデル(LLM)を利用して,ハッカー行動からの損失回避の認知バイアスに関する定量的知見を抽出する手法を提案する。
論文 参考訳(メタデータ) (2025-08-18T05:51:30Z) - MultiPhishGuard: An LLM-based Multi-Agent System for Phishing Email Detection [3.187381965457262]
MultiPhishGuardは動的マルチエージェント検出システムである。
本フレームワークでは, 政策最適化強化学習アルゴリズムを用いて, 自動決定重み付けを行う5つの協調エージェントを用いる。
実験により、MultiPhishGuardは偽陽性(2.73%)と偽陰性率(0.20%)で高い精度(97.89%)を達成することが示された。
論文 参考訳(メタデータ) (2025-05-26T23:27:15Z) - AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models [0.0]
大規模言語モデル(LLM)は、ジェイルブレイク攻撃の脆弱性を示し続けている。
本稿では,敵対的即時生成を自動化する新しいフレームワークであるAutoAdvを紹介する。
我々の攻撃は、有害なコンテンツ生成に対して最大86%のジェイルブレイク成功率を達成したことを示す。
論文 参考訳(メタデータ) (2025-04-18T08:38:56Z) - Jailbreaking and Mitigation of Vulnerabilities in Large Language Models [8.345554966569479]
大規模言語モデル(LLM)は、自然言語の理解と生成を前進させることで、人工知能を変革した。
これらの進歩にもかかわらず、LSMは、特に注射と脱獄攻撃を急ぐために、かなりの脆弱性を示してきた。
このレビューでは、これらの脆弱性についての研究状況を分析し、利用可能な防衛戦略を提示する。
論文 参考訳(メタデータ) (2024-10-20T00:00:56Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z) - On the Vulnerability of LLM/VLM-Controlled Robotics [54.57914943017522]
大規模言語モデル(LLM)と視覚言語モデル(VLM)を統合するロボットシステムの脆弱性を,入力モダリティの感度によって強調する。
LLM/VLM制御型2つのロボットシステムにおいて,単純な入力摂動がタスク実行の成功率を22.2%,14.6%減少させることを示す。
論文 参考訳(メタデータ) (2024-02-15T22:01:45Z) - Unveiling Vulnerabilities in Interpretable Deep Learning Systems with
Query-Efficient Black-box Attacks [16.13790238416691]
解釈可能なディープラーニングシステム(IDLS)は、システムの透明性と説明性を高めるために設計されている。
本稿では,ターゲットモデルとその解釈モデルに関する事前知識を必要としない新規な微生物遺伝アルゴリズムによるIDLSに対するブラックボックス攻撃を提案する。
論文 参考訳(メタデータ) (2023-07-21T21:09:54Z) - Enhanced Adversarial Strategically-Timed Attacks against Deep
Reinforcement Learning [91.13113161754022]
本稿では,DRLに基づくナビゲーションシステムに対して,選択した時間フレーム上の物理ノイズパターンを妨害することにより,タイミングに基づく逆方向戦略を導入する。
実験結果から, 対向タイミング攻撃は性能低下を引き起こす可能性が示唆された。
論文 参考訳(メタデータ) (2020-02-20T21:39:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。