論文の概要: Memetic Trojans: Social Contagions as Carriers of Adversarial Payloads in Agent Networks
- arxiv url: http://arxiv.org/abs/2610.00430v1
- Date: Wed, 30 Sep 2026 16:43:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.655171
- Title: Memetic Trojans: Social Contagions as Carriers of Adversarial Payloads in Agent Networks
- Title(参考訳): メメティック・トロイの木馬 : エージェントネットワークにおける敵対的報酬の担い手としての社会的感染
- Abstract要約: 我々は、エージェントがコンテンツを再送信し増幅する傾向を利用するネットワーク経由の攻撃のクラスである、エンフェメメティック・トロイの木馬を紹介した。
繁殖が逆行的に誘導されるエージェントワームとは異なり、メメティックトロイの木馬は敵のペイロードを埋め込むことで、外因性伝達を利用する。
- 参考スコア(独自算出の注目度): 1.8352113484137629
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Autonomous large language model (LLM) agents increasingly interact in network environments where adversarial content can propagate between agents. Known attacks include agent worms, which spread through self-replicating prompt injections or configuration compromises. We introduce \emph{memetic trojans}, a distinct class of network-mediated attack that exploits agents' tendencies to retransmit and amplify content. Unlike agent worms, whose propagation is adversarially induced, memetic trojans exploit \emph{endogenous} transmission by embedding adversarial payloads in \emph{social contagions}: content agents have internal reasons to share. As part of our work, we extract social contagions from Moltbook, a social media platform for LLM agents. Controlled transmission experiments reveal large differences in virality: the most effective contagion is retransmitted in approximately 50\% of subsequent agent posts and upvoted at 2.5x the average post's rate. Its memetic trojan counterpart largely inherits these properties. Monte Carlo attack simulations show that memetic trojans amplify expected exposure by up to 3.19x. Network structure and amplification mechanisms strongly shape propagation, producing heavy-tailed outcomes with near network-wide exposure. These results identify endogenous social transmission as a distinct security vulnerability in multi-agent systems. Because propagation does not require agents to follow malicious retransmission instructions, defenses focused on prompt-injection detection or preventing agent compromise cannot alone prevent memetic trojan propagation. Securing large-scale agent ecosystems may require network-level defenses that account for how agent preferences, recommendation mechanisms, and network topology amplify adversarial payloads.
- Abstract(参考訳): 自律型大規模言語モデル(LLM)エージェントは、エージェント間で敵対的コンテンツが伝播するネットワーク環境において、ますます相互作用する。
既知の攻撃には、自己複製のプロンプトインジェクションやコンフィグレーションの妥協を通じて広がるエージェントワームが含まれる。
エージェントの傾向を利用してコンテンツを再送信し増幅するネットワーク経由の攻撃クラスである 'emph{memetic Trojans} を紹介する。
増殖が逆行的に誘導されるエージェントワームとは異なり、メメティックトロイの木馬は、敵のペイロードをemph{social contagions}に埋め込むことで、 \emph{endogenous}トランスミッションを利用する。
本研究の一環として, LLMエージェントのためのソーシャルメディアプラットフォームであるMoltbookから, ソーシャル・コントリビューションを抽出した。
コントロールされた感染実験では、ウイルス性に大きな違いが示され、最も効果的な伝染は、約50%のエージェントポストで再感染し、平均ポストレートの2.5倍に上昇する。
そのメメティックなトロヤ群は、これらの性質をほとんど継承している。
モンテカルロの攻撃シミュレーションでは、メメティック・トロヤ群は3.19倍の露光を増幅している。
ネットワーク構造と増幅機構が強く形成され, ほぼ網幅の露光による重み付き結果が得られた。
これらの結果から,内因性社会伝達はマルチエージェントシステムにおける新たなセキュリティ脆弱性として認識される。
伝播には悪意のある再送命令に従う必要がないので、プロンプト・インジェクション検出やエージェントの侵入防止に焦点をあてた防御は、メメティック・トロイの木馬の伝播を防げない。
大規模エージェントエコシステムの確保には、エージェントの好み、レコメンデーションメカニズム、ネットワークトポロジが敵のペイロードを増幅する方法を考慮に入れたネットワークレベルの防御が必要である。
関連論文リスト
- The Like Trap: Multi-Stage Poisoning against Agents in Similarity-based Recommendation Systems [11.614473236446962]
ソーシャルメディアプラットフォームに展開する自動エージェントの脆弱性について検討する。
エージェント中毒に関する既存の研究は、敵がエージェントに有毒物質を暴露できると仮定している。
我々は、現実的な有毒なポストを作るアルゴリズムを開発した。
論文 参考訳(メタデータ) (2026-09-22T23:39:24Z) - Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems [2.7149912403371226]
単純な進化的アルゴリズムを用いてマインドウイルスを構築し、2つの相補的な設定で拡散可能であることを示す。
ホストモデル,エージェントの既存命令,ペイロードの有害性,ネットワークトポロジなど,拡散に影響を与える要因を特定した。
我々はマインドウイルスが真のリスクをもたらすと結論付けている。
論文 参考訳(メタデータ) (2026-08-10T20:37:57Z) - Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents [64.80318459073526]
敵のコンテンツは、同一のエージェントによって提供される相互作用にまたがって持続できることを示し、そのような脅威を検知し緩和することを困難にしている。
具体的には、敵対的コンテンツはエージェント状態に留まり、相互作用をまたいだ休眠状態に留まり、その後、良心的なユーザクエリによって活性化される。
我々は、このタイプの安全脅威をスリーパー攻撃として形式化し、評価するために、現実世界の有害な結果6つ、攻撃戦略3つ、エージェント状態の目標3つをカバーする1,896件のベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-27T09:25:37Z) - Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection [21.293197417946192]
我々は、自律エージェントをゾンビノードに武器にしてDDoS攻撃を開始する高度な攻撃であるMobius Injectionを紹介した。
この攻撃は、従来のDDoSモニターと、現代のAI安全フィルタの両方に対して、非常に軽量でステルス的であることを実証しています。
論文 参考訳(メタデータ) (2026-05-12T02:51:12Z) - Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems [1.641189223782504]
サブリミナル・プロンプト(Subliminal prompting)とは、意味的に無関係なトークンによるプロンプトを通じて、言語モデルが特定の概念や特徴に偏っている現象である。
1つのサブリミナルに誘導されるエージェントが、ネットワーク全体に弱みはあるが持続するバイアスを拡大できることを示す。
以上の結果から,サブリミナルプロンプトはマルチエージェントセキュリティにおいて新たなアタックベクターを導入し,このようなシステムのアライメントに寄与することが示唆された。
論文 参考訳(メタデータ) (2026-02-23T13:46:26Z) - INFA-Guard: Mitigating Malicious Propagation via Infection-Aware Safeguarding in LLM-Based Multi-Agent Systems [70.37731999972785]
本稿では,感染防止対策の枠組みであるINFA-Guardを提案する。
修復中、INFA-Guardは攻撃者を置き換え、感染した者を修復し、トポロジカルな整合性を維持しながら悪意のある伝播を避ける。
論文 参考訳(メタデータ) (2026-01-21T05:27:08Z) - Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks [0.0]
本稿ではエージェントAIシステムのためのクロスエージェントマルチモーダル・プロベナンク・アウェアディフェンス・フレームワークを提案する。
フレームワークには、テキストサニタイザエージェント、ビジュアルサニタイザエージェント、および出力バリデータエージェントが含まれており、いずれも前駆体台帳によって調整されている。
実験の結果,マルチモーダル噴射検出精度は著しく向上し,クロスエージェント信頼リークを最小限に抑えることができた。
論文 参考訳(メタデータ) (2025-12-29T15:54:33Z) - It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents [52.81924177620322]
大規模な言語モデルを利用したWebベースのエージェントは、メール管理やプロフェッショナルネットワーキングといったタスクにますます利用されている。
動的Webコンテンツへの依存は、インジェクション攻撃の引き金に弱い: インターフェース要素に隠された敵対的命令は、エージェントが元のタスクから逸脱するように説得する。
本稿では,タスクリダイレクトエージェントの説得ベンチマーク(TRAP)について紹介する。
論文 参考訳(メタデータ) (2025-12-29T01:09:10Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Adversarial Attacks On Multi-Agent Communication [80.4392160849506]
現代の自律システムはすぐに大規模に展開され、協調型マルチエージェントシステムの可能性を広げる。
このような利点は、セキュリティ侵害に対して脆弱であることが示されている通信チャネルに大きく依存している。
本稿では,エージェントが学習した中間表現を共有してコミュニケーションする新しいマルチエージェント環境において,このような攻撃を探索する。
論文 参考訳(メタデータ) (2021-01-17T00:35:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。