論文の概要: When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.11751v1
- Date: Mon, 13 Jul 2026 16:08:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.546303
- Title: When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems
- Title(参考訳): ローカルモニタのミスコンポジションハーム:マルチエージェントシステムにおける分散バックドアの診断
- Abstract要約: 地域安全は、害が構成的である場合、地球規模の安全ではない。
ローカルモニターは、局所的な証拠が消えると信号を失う。
フルトレースモニタとデコーダは、ペイロードが露出した表現に到達しなければ、依然として失敗する。
- 参考スコア(独自算出の注目度): 4.695509706472705
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As multi-agent, tool-using LLM systems are deployed, a common safety net is a runtime monitor that checks each message, tool call, or step on its own. We show this net has a fundamental hole. A distributed backdoor splits a harmful payload across agents, so every local check passes while the assembled object is the attack. The monitor can be right on every step and still miss the attack. The problem is not splitting itself: split fragments can still leak suspicious tokens or provenance edges. The hard case is \emph{local benignness}. No fragment carries the harm, and what is left looks like ordinary benign traffic. We formalize this as an \emph{observability boundary}: a monitor catches only what its view can tell apart from benign traffic. We prove that once the fragments look benign in the monitored view, no detector on that view can catch them, however strong it is. Across a controlled testbed, an external benchmark, and end-to-end agent runs, local monitors lose the signal exactly as local evidence disappears, and it returns only when the monitor sees the assembled object. A monitor trained only on benign traffic recovers the attack's code structure across held-out encodings (0.874 mean AUROC). A decoded-view gate, given the encoding family, blocks every tested attack. But seeing more is not enough: full-trace monitors and decoders still fail unless they reach the representation where the payload is exposed. Local safety is not global safety when harm is compositional, and the open problem is finding that representation.
- Abstract(参考訳): マルチエージェントでツールを使用するLLMシステムがデプロイされるため、共通のセーフティネットは、各メッセージ、ツールコール、あるいは独自のステップをチェックするランタイムモニターである。
このネットには根本的な穴がある。
分散バックドアは、エージェント間で有害なペイロードを分割するので、アセンブルされたオブジェクトが攻撃である間に、すべてのローカルチェックが通過する。
モニターはすべてのステップで使えるが、それでも攻撃を見逃している。
フラグメントの分割は、疑わしいトークンや前兆のエッジをリークする可能性がある。
ハードケースは \emph{local beinignness} である。
被害を負う破片はなく、残ったものは普通の良心的な交通のように見える。
我々はこれを \emph{observability boundary} として形式化する: モニターは、そのビューが良質なトラフィックと区別できるものだけをキャッチする。
観察されたビューで断片が良さそうに見えると、そのビュー上の検出器がそれらを捕まえることはできないが、それは強い。
制御されたテストベッド、外部ベンチマーク、エンドツーエンドエージェントが実行され、ローカルモニタは、ローカルエビデンスが消えると信号を失う。
良質なトラフィックのみにトレーニングされたモニタは、ホールドアウトエンコーディング(0.874平均AUROC)で攻撃のコード構造を回復する。
デコードされたビューゲートは、エンコードされたファミリーによって、テストされたすべての攻撃をブロックする。
フルトレースモニタとデコーダは、ペイロードが露出した表現に到達しなければ、依然として失敗する。
地域安全は、害が構成的である場合のグローバルな安全ではなく、オープンな問題は、その表現を見つけることである。
関連論文リスト
- Privacy-Preserving Topology-Guided Safety for LLM-Based Multi-Agent Systems via Federated Graph Learning [67.04448659688579]
FGLGuardは、AgentDojoのグランドサクセスレートを、ほぼ無防備なユーティリティ、APIコストゼロ、無視可能な機能損失で43%削減する。
フェデレーションはオプションではなく、オフ・ザ・シェルフ・トランスファーは流通シフトによって崩壊する。
Live FGLGuardは、AgentDojoのグランドサクセスレートを、ほぼ無防備なユーティリティ、APIコストゼロ、無視可能な機能損失で43%削減する。
論文 参考訳(メタデータ) (2026-09-02T07:57:12Z) - LMSM: LLM Security Framework Inspired by Linux Security Modules [56.93644694627783]
大規模言語モデル(LLM)は階層化されたディフェンスでデプロイされることが多いが、悪意のあるプロンプトはそれらをバイパスすることができる。
我々は,Language Model Security Modules (LMSM) という,Linux Security Modules (LSM) の背後にある分離を LLM サービスに適応させるセキュリティフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-26T12:13:05Z) - A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense [1.0742675209112622]
CoT(Chain-of- Thought)モニタリングは、アクションできれいに見える報酬のハックをキャッチし、推論でのみ自分自身を裏切ることを目的としている。
ここでは、理屈をコントロールしている敵が、まさにそれを倒せる場所であることを示す。
論文 参考訳(メタデータ) (2026-08-01T10:42:41Z) - Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study [3.799596277597438]
マルチエージェントLLMシステムは、単一のエージェントが完全に保持しないペイロードによって攻撃される。
ランがまだ展開されている間、そのような攻撃がどれほど早く検出できるかを示す。
次に、その警告のどれ程が、その分散構造ではなく、取り外し可能な表面のキューにかかっているかを測定する。
論文 参考訳(メタデータ) (2026-07-27T15:18:06Z) - Stateful Online Monitoring Catches Distributed Agent Attacks [63.00394432922707]
我々は、リアルタイムクラスタリングを用いて、多くのエージェントの転写にまたがる弱い疑わしい信号を収集するオンラインステートフルモニターを開発した。
本研究の結果は,孤立したテキストではなく,ユーザグループを優先する,新たな安全モニタのクラスに向けられたものである。
論文 参考訳(メタデータ) (2026-05-29T17:57:00Z) - From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors [89.92617739143846]
ローカルエージェントハーネスにおけるマルチステップトロイの木馬攻撃を識別するベンチマークであるClawTrojanを紹介する。
そこで我々は,DASGuardを提案する。DASGuardは,コントロールライクなテキストをセンシティブなローカルファイルでスキャンし,その起源を辿り,信頼されたソースから派生しないコントロールコンテンツを除去する。
この結果から, DASGuardは, 実行時の攻撃ブロックと作業空間への衛生的コミットを組み合わせることで, 強力な動的防御を実現することがわかった。
論文 参考訳(メタデータ) (2026-05-29T09:19:07Z) - SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors [3.989565392866092]
SLEIGHT-Bench (Subtle Low-itEration Insight-Guided Harmful Transcripts) は、11カテゴリにわたる40の攻撃を含む合成写本のベンチマークである。
40件中20件はOpus 4.6モニターで捕捉されず、10回の試験で1%の偽陽性率で思考を延長し、全体のキャッチレートは32%である。
論文 参考訳(メタデータ) (2026-05-15T20:46:46Z) - PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors [14.336100401626062]
大規模言語モデル(LLM)エージェントは、最終結果チェックが介入するには遅すぎるような、長時間のツール使用タスクを実行する。
PrefixGuardは、オフラインのStepView誘導ステップと監視監視トレーニングを備えたトレース・ツー・モニタフレームワークである。
WebArena, $2$-Bench, SkillsBench, TerminalBench, 最も強力なPrefixGuardモニタは0.900/0.70.533/0.557 AUPRCである。
論文 参考訳(メタデータ) (2026-05-07T15:49:48Z) - TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol [1.0195618602298684]
TraceGuardは5次元にわたるエージェントアクションを評価する構造化多次元監視プロトコルである。
オープンソースのControlArenaフレームワーク用の新しいモニタタイプとして実装されている。
論文 参考訳(メタデータ) (2026-04-05T05:05:59Z) - Beyond Linear Probes: Dynamic Safety Monitoring for Language Models [67.15793594651609]
従来の安全モニタは、クエリ毎に同じ量の計算を必要とする。
動的アクティベーションモニタリングのための線形プローブの自然な拡張であるTrncated Polynomials (TPCs)を紹介する。
我々の重要な洞察は、TPCを段階的に、短期的に訓練し、評価できるということです。
論文 参考訳(メタデータ) (2025-09-30T13:32:59Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - EmInspector: Combating Backdoor Attacks in Federated Self-Supervised Learning Through Embedding Inspection [53.25863925815954]
フェデレートされた自己教師付き学習(FSSL)は、クライアントの膨大な量の未ラベルデータの利用を可能にする、有望なパラダイムとして登場した。
FSSLはアドバンテージを提供するが、バックドア攻撃に対する感受性は調査されていない。
ローカルモデルの埋め込み空間を検査し,悪意のあるクライアントを検知する埋め込み検査器(EmInspector)を提案する。
論文 参考訳(メタデータ) (2024-05-21T06:14:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。