論文の概要: Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures
- arxiv url: http://arxiv.org/abs/2609.15293v3
- Date: Wed, 23 Sep 2026 09:29:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.631341
- Title: Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures
- Title(参考訳): LLMエージェントが過剰な監視なしに崩壊する理由:世界大失敗の背後にあるメカニズムとしての強化ギャップ
- Abstract要約: リフレクションスタイルのエージェントで監査フラグをバインドすると、監査官を変更することなく、攻撃の成功率が大幅に低下する。
実行確率から検出確率を分離する$p_d$$$p_e$は、すべてのフレームワークでデフォルトで$p_e approx 0$を確立する。
- 参考スコア(独自算出の注目度): 19.162716475205308
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Binding the audit flag in Reflexion-style agents --- without changing the auditor --- reduces attack success rate substantially, reaching near zero on models whose flags parse cleanly. This single control-flow change exposes the \textbf{enforcement gap}: the controller receives a safety flag and executes anyway. Separating detection probability $p_d$ from enforcement probability $p_e$ establishes that $p_e \approx 0$ by default across every framework we tested, making detection quality \emph{formally irrelevant} to security when enforcement is absent --- a finding consistent with the spontaneous collapses recorded in unsupervised frontier-agent deployments~\citep{emergence2026}. Residual attack success concentrates where flags are unparseable or auditors leak; an RL-trained enforcement controller handles hedged and malformed verdicts that rule-based parsing cannot, cutting ambiguous-critique failure to a fraction of the rule-based baseline. Concurrent filtering and information-flow defenses address detection, not enforcement, leaving the binding constraint untouched. The Audit Enforcement Specification (AES) packages three concrete requirements that close each residue independently; each primitive is adoptable without redesigning the host framework, and no deployed framework currently implements any of them.
- Abstract(参考訳): リフレクションスタイルのエージェントで監査フラグをバインドすると -- 監査者を変更することなく -- 攻撃の成功率が大幅に低下し、フラグがきれいにパースされたモデルではゼロ近くに達する。
この単一の制御フローの変更は、 \textbf{enforcement gap} を公開する: コントローラは安全フラグを受け取り、いずれにせよ実行する。
実行確率から$p_d$を分離する $p_e$$$p_e \approx 0$は、テスト対象のすべてのフレームワークでデフォルトで設定され、実行時にセキュリティに検出品質 \emph{formally unlevant} を提供する。
RLで訓練された執行コントローラは、ルールベースの解析ができないというヘッジドと不正な判断を処理し、曖昧で批判的な失敗をルールベースのベースラインのごく一部に削減する。
同時フィルタリングと情報フロー防御は、強制ではなく、アドレス検出に対処する。
AES(Audit Enforcement Specification)は、各残余を独立して閉じる3つの具体的な要件をパッケージしている。
関連論文リスト
- Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents [16.24087700490158]
大規模言語モデルエージェントは、自律ループとしてますますデプロイされる。
これは実装の詳細ではなく、構成の失敗であることを示す。
LoopHarnessは、ループレベルでの永続的非遅延安全状態を復元する。
論文 参考訳(メタデータ) (2026-08-27T13:52:31Z) - HANSARD: A Reference Architecture for Forensic Readiness, Runtime Witnessing, and Graded Attribution in Autonomous Multi-Agent AI Systems [3.7015952547586832]
現在、自律型マルチエージェントシステムは、金融、ソフトウェアサプライチェーン、セキュリティオペレーションで機能している。
何が起きたのか、何を引き起こしたのか、誰が責任を負うのかをしっかりと決める方法はありません。
これは、証明法医学が間違った抽象化で機能し、形式的因果関係は因果関係を仮定し、エージェント監査は自己記録を信頼するからである。
ターゲットの障害モードは、帰属的な洗浄であり、いかなる原因にもならないまで、冗長なエージェントに作用を広げる。
本稿では,説明責任をライフサイクル特性として扱う参照アーキテクチャであるHANSARDを提案する。
論文 参考訳(メタデータ) (2026-08-23T17:18:22Z) - POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems [0.07783271875179179]
システム独自のエージェントを診断層として再利用するプロトコルであるPOIROTを提案する。
評価された設定全体で、POIROTは単一LLMベースライン評価器より優れている。
我々は,安全クリティカルなマルチエージェントシステムにおけるフォールト属性のベンチマークであるBLAMEとともに,オープンソースのライブラリとしてPOIROTをリリースした。
論文 参考訳(メタデータ) (2026-06-01T14:05:35Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - Auditing Agent Harness Safety [81.22315979618612]
LLMエージェントは、ツールをディスパッチし、リソースを割り当て、特別なコンポーネント間でメッセージをルーティングする実行ハーネスの中でますます動作します。
ほとんどの安全ベンチマークは最終出力または終端状態のみをスコアするが、多くの違反は終端ではなく、軌道の途中で発生する。
HarnessAuditは、境界コンプライアンス、実行の忠実さ、システムの安定性など、完全な実行軌跡を監査するフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T02:14:28Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems [38.44649280816596]
マルチエージェントシステムの障害注入と信頼性評価のための体系的フレームワークMAS-FIREを提案する。
エージェント内認知障害とエージェント間協調障害を対象とする15種類の障害分類を定義した。
MAS-FIREを3つの代表的なMASアーキテクチャに適用することにより、フォールトトレラントな動作の豊富なセットを明らかにする。
論文 参考訳(メタデータ) (2026-02-23T13:47:43Z) - Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection [76.91230292971115]
大規模言語モデル (LLM) に基づくマルチエージェントシステム (MAS) は複雑なタスクを解く上で強力な能力を示している。
XG-Guardは、MAS内の悪意のあるエージェントを検出するための、説明可能な、きめ細かい保護フレームワークである。
論文 参考訳(メタデータ) (2025-12-21T13:46:36Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z) - Why Do Multi-Agent LLM Systems Fail? [87.90075668488434]
MAST-Dataは7つの人気のあるMASフレームワークで収集された1600以上の注釈付きトレースの包括的なデータセットである。
我々はMAST(Multi-Agent System Failure Taxonomy)を初めて構築する。
MASTとMAST-Dataを利用して、モデル(GPT4、Claude 3、Qwen2.5、CodeLlama)とタスク(コーディング、数学、汎用エージェント)の障害パターンを分析します。
論文 参考訳(メタデータ) (2025-03-17T19:04:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。