論文の概要: Deny Without Disabling: Authorization-Paired Evaluation and Control for Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2610.00371v1
- Date: Wed, 30 Sep 2026 06:55:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.624481
- Title: Deny Without Disabling: Authorization-Paired Evaluation and Control for Multi-Agent Systems
- Title(参考訳): ディザブルのないデニー:マルチエージェントシステムの認可型評価と制御
- Abstract要約: マルチエージェントシステムは、エビデンスを共有し、タスクを委譲し、エージェント間で情報を結合する能力から導かれる。
敏感な行動をすべてブロックすることは開示を避けるが、コラボレーションの目的を破る。
禁止された使用を禁止し、要求された使用を完了させる認証ペア評価を共同成功基準として導入する。
- 参考スコア(独自算出の注目度): 25.428898825230235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent systems derive their capabilities from sharing evidence, delegating tasks, and combining information across agents. The same process creates a safety problem: contributions that are admissible in isolation can jointly enable a prohibited use. Blocking every sensitive action avoids disclosure but defeats the purpose of collaboration. We introduce authorization-paired evaluation, which makes blocking prohibited uses and completing required authorized uses a joint success criterion, and FlowReview, a framework connecting object resolution, permission ranking, and deterministic enforcement. In controlled composition experiments, reviewing combined artifacts reduces the denied-commit rate from 86.0% to zero with no loss of authorized supply. Our findings show that preserving information and lineage alone does not ensure correct permission attribution. Object identity and permission must remain connected to execution through components whose outputs can be verified. Together, these findings establish a system-level requirement for multi-agent safety: govern composed information flows while preserving the authorized capabilities that make collaboration useful.
- Abstract(参考訳): マルチエージェントシステムは、エビデンスを共有し、タスクを委譲し、エージェント間で情報を結合する能力から導かれる。
同じプロセスが安全上の問題を生み出します – 単独で許可されたコントリビューションは、禁止された使用を共同で有効化することができます。
敏感な行動をすべてブロックすることは開示を避けるが、コラボレーションの目的を破る。
本稿では,禁止された使用を禁止し,要求された使用を完了させる認証ペア評価と,オブジェクトの解決,許可ランキング,決定的強制を接続するフレームワークであるFlowReviewを紹介する。
制御された合成実験では、複合アーティファクトのレビューにより、承認された供給を失うことなく、否定されたコミット率を86.0%から0に下げる。
以上の結果から,情報と系統の保存だけでは適切な権限帰属が得られないことが示唆された。
オブジェクトのアイデンティティとパーミッションは、出力を検証可能なコンポーネントを通して実行に接続されなければならない。
これらの知見は,複数エージェントの安全のためのシステムレベルの要件を確立することを目的としている。
関連論文リスト
- Verify Claims, Not Scores: Evidence-Based Verification of Modular Agents [0.0]
我々は,モジュールエージェントに対して,計画,行動,検査,精査を行うクレーム固有の検証監査を導入する。
エージェントをスコアする代わりに、監査はエビデンスをスコアする。
論文 参考訳(メタデータ) (2026-10-01T09:17:47Z) - Trust propagation and structural containment in Multi-agent LLM pipelines [0.9274656542624661]
本研究では,4エージェントLangGraphパイプラインにおける攻撃伝搬について検討する。
検索した文書に埋め込まれた偽書による共有メモリ中毒と間接的プロンプト注入について検討した。
我々の貢献は、攻撃伝播、認証境界のコンポーネントレベルのアブレーション、および最終行動ではなく攻撃エージェントに対する妥協度を測定するJBR(Judgment Bypass Rate)に関する実証的研究である。
論文 参考訳(メタデータ) (2026-09-15T15:46:01Z) - Who Can Make the Action Happen? An Authority-Decomposition Framework for High-Risk Automated Systems [8.71734630214811]
本稿では,信頼領域の連立関係が保護された実行を引き起こすのに十分である行動関連手法を提案する。
これは、実行に対する因果制御と、操作の権威的アカウントの制御を分離する。
インクルージョン最小限の連立と、要求される実行境界が指定された上流ドメインから独立しているかどうかのテストが導かれる。
論文 参考訳(メタデータ) (2026-08-19T14:30:58Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - A Five-Plane Reference Architecture for Runtime Governance of Production AI Agents [0.0]
本稿では,生産AIエージェントのガバナンスのための参照アーキテクチャを提案する。
我々は、許容と否定を一般化する6つの割り込みプリミティブの分類を定義し、4つの正当性不変量について主張する。
5つの具体的判断にまたがる7つの生産エージェントの脅威の隠蔽を実証する。
論文 参考訳(メタデータ) (2026-06-10T16:54:47Z) - AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents [0.2864713389096699]
本稿では,AgentSecBenchを,この問題に対する正式なセキュリティフレームワークの実証的なインスタンス化として紹介する。
3つのゲーム・インストラクション・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)を定めている。
これは、承認された観察と能力に対するプロジェクションとしてのアプリケーションポリシーを表し、プロジェクションの即時アノテーションとプロジェクションの強化を区別し、敵のアドバンテージと、防衛が生成前に関連するモデル可視チャネルを閉鎖するかどうかを計測する。
論文 参考訳(メタデータ) (2026-05-25T18:53:22Z) - The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents [111.54911637435269]
オーソライゼーション・実行ギャップ(英: Authorization-Execution Gap、AEG)は、オープンワールドエージェントの安全性とセキュリティの問題である。
AEGは、プリンシパルが認可しようとするものと、オープンワールドエージェントが最終的に実行するものとの違いである。
論文 参考訳(メタデータ) (2026-05-10T04:05:31Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - Towards Verifiably Safe Tool Use for LLM Agents [53.55621104327779]
大規模言語モデル(LLM)ベースのAIエージェントは、データソース、API、検索エンジン、コードサンドボックス、さらにはその他のエージェントなどのツールへのアクセスを可能にすることで、機能を拡張する。
LLMは意図しないツールインタラクションを起動し、機密データを漏洩したり、クリティカルレコードを上書きしたりするリスクを発生させる。
モデルベースセーフガードのようなリスクを軽減するための現在のアプローチは、エージェントの信頼性を高めるが、システムの安全性を保証することはできない。
論文 参考訳(メタデータ) (2026-01-12T21:31:38Z) - The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration [72.33801123508145]
大規模言語モデル(LLM)はマルチエージェントシステムに不可欠なものである。
プライバシーリスクは、暗記、直接推論、シングルターン評価を超えて現れる。
特に、相互作用によって構成される一見無害な反応は、敵が機密情報の回復を累積的に行うことができる。
論文 参考訳(メタデータ) (2025-09-16T16:57:25Z) - CoTGuard: Using Chain-of-Thought Triggering for Copyright Protection in Multi-Agent LLM Systems [55.57181090183713]
我々は、Chain-of-Thought推論内でトリガーベースの検出を活用する著作権保護のための新しいフレームワークであるCoTGuardを紹介する。
具体的には、特定のCoTセグメントをアクティベートし、特定のトリガクエリをエージェントプロンプトに埋め込むことで、未許可コンテンツ再生の中間的推論ステップを監視する。
このアプローチは、協調エージェントシナリオにおける著作権侵害の微細かつ解釈可能な検出を可能にする。
論文 参考訳(メタデータ) (2025-05-26T01:42:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。