論文の概要: SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.25255v2
- Date: Wed, 29 Jul 2026 23:58:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.259356
- Title: SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems
- Title(参考訳): SafeFlow:マルチエージェントシステムにおける悪意伝播阻止のための意味情報フロー制御
- Authors: Haowen Dai, Zonghao Ying, Wenfeng Li, Xiangfan Wu, Yisong Xiao, Tianyuan Zhang, Jiaye Lin, Lei Wei, Guangyuan Dong, Xitong Ling, Xixun Lin, Quanchen Zou, Xiangzheng Zhang,
- Abstract要約: SafeFlowは、セマンティックな情報フロー問題として悪意あるクロスエージェントの伝搬を形式化するマルチエージェントシステムのための防御フレームワークである。
プロンプトインジェクション、Jailbreakベースの安全でないツール使用、リスクの高いコード実行、有害なWebエージェント動作の4つのベンチマークで評価された。
- 参考スコア(独自算出の注目度): 9.486092743924472
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent systems improve capability through task decomposition and role specialization, but these same mechanisms introduce an important safety blind spot: a harmful objective can be fragmented into locally plausible subtasks, allowing malicious intent to evade detection by any single agent. This is a growing social-impact challenge: systems handling sensitive information or consequential tools can turn routine delegation into unauthorized disclosure or unsafe action. We argue that this failure mode is better understood as a semantic information-flow problem than as a single-turn prompt classification task. To address this, we propose SafeFlow, a defense framework for multi-agent systems that formalizes malicious cross-agent propagation as a semantic information-flow problem. SafeFlow attaches structured semantic taints to root requests, propagates them through a dynamic collaboration graph, and performs workflow-level validation to reconstruct the global risk context before irreversible actions are committed. Evaluated on four benchmarks spanning prompt injection, jailbreak-based unsafe tool use, risky code execution, and harmful web-agent behavior, SafeFlow reduces attack success rates compared to undefended baselines and external defenses while retaining high benign task completion and a high paired safe--harm success rate. Our findings show that multi-agent systems still lack mechanisms for preserving risk semantics across delegation boundaries. This gap can turn routine delegation into privacy harms or unsafe actions that affect people and organizations. SafeFlow keeps this risk visible throughout the workflow, before it results in harm.
- Abstract(参考訳): マルチエージェントシステムはタスクの分解と役割の特殊化を通じて能力を向上させるが、これらの機構は重要な安全失点をもたらす。
センシティブな情報や連続的なツールを扱うシステムは、ルーチンデリゲートを不正な開示や安全でないアクションに変えることができる。
我々は,この障害モードを単一ターンプロンプト分類タスクよりも意味情報フロー問題として理解した方がよいと論じる。
そこで本稿では,悪意あるエージェント間伝搬を意味情報フロー問題として定式化するマルチエージェントシステムのための防御フレームワークであるSafeFlowを提案する。
SafeFlowはルートリクエストに構造化セマンティックテインをアタッチし、動的なコラボレーティブグラフを通じてそれらを伝達し、ワークフローレベルのバリデーションを実行して、不可逆的なアクションがコミットされる前にグローバルリスクコンテキストを再構築する。
プロンプトインジェクション、ジェイルブレイクベースのアンセーフツールの使用、リスクの高いコード実行、有害なWebエージェント動作を含む4つのベンチマークで評価され、SafeFlowは、高い良識のあるタスク完了と高いペアのセーフハーム成功率を維持しながら、未定義のベースラインと外部防御と比較して、攻撃成功率を低減している。
以上の結果から,マルチエージェントシステムには,デリゲート境界を越えたリスクセマンティクスの保存機構が依然として欠如していることが示唆された。
このギャップは、日常的なデリゲートを、人々や組織に影響を与えるプライバシー上の問題や、安全でない行動に変える可能性がある。
SafeFlowはワークフロー全体を通してこのリスクを可視化する。
関連論文リスト
- AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking [40.259937753172224]
LLMエージェントの台頭は、計画、コーディング、さらにはエキスパートレベルの攻撃のエンドツーエンド実行を可能にすることで、新たな脅威をもたらす。
本稿では,この脅威表面のリスクを明らかにするための実用的なエージェントジェイルブレイクフレームワークであるTRACEを提案する。
論文 参考訳(メタデータ) (2026-05-29T06:13:58Z) - FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems [34.804293844500926]
FlowSteerはプロンプトのみのワークフローステアリング攻撃で、脆弱性の優先順位をひとつのプロンプトに変換する。
インプットサイドのディフェンスであるFlowGuardを導入し、迅速なユーティリティを保ちながら、悪意のある成功を最大34%削減する。
論文 参考訳(メタデータ) (2026-05-12T04:35:57Z) - SafeHarbor: Hierarchical Memory-Augmented Guardrail for LLM Agent Safety [10.846727385398589]
悪意のあるアクターは、Large Language Model (LLM)エージェントを操作して、有害なコンテンツを生成するツールを実行することができる。
textscSafeHarborは、LLMエージェントの正確な決定境界を確立するために設計された新しいフレームワークである。
textscSafeHarborは曖昧な良質なタスクと明示的な悪意のある攻撃の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-07T05:50:45Z) - Tracking Capabilities for Safer Agents [2.9897366166831265]
ツールを直接呼び出す代わりに、エージェントは機能安全な言語でコードとして意図を表現している。
Scalaの型システムは静的に機能を追跡し、エージェントができることをきめ細かいコントロールを提供する。
実験の結果,エージェントはタスク性能を著しく損なうことなく,機能セーフなコードを生成することができることがわかった。
論文 参考訳(メタデータ) (2026-03-01T08:39:37Z) - CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents [60.98294016925157]
AIエージェントは、悪意のあるコンテンツがエージェントの行動をハイジャックして認証情報を盗んだり、金銭的損失を引き起こすような、インジェクション攻撃に弱い。
CUAのためのシングルショットプランニングでは、信頼できるプランナーが、潜在的に悪意のあるコンテンツを観察する前に、条件付きブランチで完全な実行グラフを生成する。
このアーキテクチャ分離は命令インジェクションを効果的に防止するが、ブランチステアリング攻撃を防ぐには追加の対策が必要であることを示す。
論文 参考訳(メタデータ) (2026-01-14T23:06:35Z) - Exposing Weak Links in Multi-Agent Systems under Adversarial Prompting [5.544819942438653]
本稿では,マルチエージェントシステムのセキュリティ評価を行うフレームワークであるSafeAgentsを提案する。
広く採用されている5つのマルチエージェントアーキテクチャについて検討する。
この結果から,一般的なデザインパターンには重大な脆弱性があることが判明した。
論文 参考訳(メタデータ) (2025-11-14T04:22:49Z) - SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents [58.21223208538351]
本研究は,モバイルマルチモーダルエージェントを取り巻くセキュリティ問題について考察する。
行動シーケンス情報を組み込んだリスク識別機構の構築を試みる。
また、大規模言語モデルに基づく自動アセスメントスキームも設計している。
論文 参考訳(メタデータ) (2025-07-01T15:10:00Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts [88.96201324719205]
大規模言語モデル(LLM)の安全性に関する懸念は、事前訓練中に潜在的に有害なデータに曝されることにより、大きな注目を集めている。
我々は、有害なコンテンツに意味的に関連していると思われる良心的なプロンプトが、安全性のメカニズムを回避できる新しい安全性脆弱性をLSMで特定する。
我々は,事前学習における有害なプロンプトに関連するアクターを識別する新しい攻撃手法,textitActorBreakerを導入する。
論文 参考訳(メタデータ) (2024-10-14T16:41:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。