論文の概要: I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systems
- arxiv url: http://arxiv.org/abs/2603.18894v1
- Date: Thu, 19 Mar 2026 13:34:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.169934
- Title: I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systems
- Title(参考訳): 倒産とは信じられない - マルチエージェントガバナンスシステムにおける倒産の評価
- Abstract要約: 機関的AIの完全性は、デプロイ後仮定ではなく、デプロイ前要件として扱われるべきであることを示す。
エージェントが異なる権限構造の下で正式な政府の役割を担っているマルチエージェントガバナンスシミュレーションを評価した。
28,112個の転写セグメントにまたがる独立系裁判官によるルールブレーキングと乱用の結果を収集する。
- 参考スコア(独自算出の注目度): 8.670200461690454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly proposed as autonomous agents for high-stakes public workflows, yet we lack systematic evidence about whether they would follow institutional rules when granted authority. We present evidence that integrity in institutional AI should be treated as a pre-deployment requirement rather than a post-deployment assumption. We evaluate multi-agent governance simulations in which agents occupy formal governmental roles under different authority structures, and we score rule-breaking and abuse outcomes with an independent rubric-based judge across 28,112 transcript segments. While we advance this position, the core contribution is empirical: among models operating below saturation, governance structure is a stronger driver of corruption-related outcomes than model identity, with large differences across regimes and model--governance pairings. Lightweight safeguards can reduce risk in some settings but do not consistently prevent severe failures. These results imply that institutional design is a precondition for safe delegation: before real authority is assigned to LLM agents, systems should undergo stress testing under governance-like constraints with enforceable rules, auditable logs, and human oversight on high-impact actions.
- Abstract(参考訳): 大規模言語モデルは、ハイテイクな公共ワークフローのための自律的なエージェントとしてますます提案されているが、権限が与えられた場合、制度的なルールに従うかどうかについての体系的な証拠は欠如している。
機関的AIの完全性は、デプロイ後仮定ではなく、デプロイ前要件として扱われるべきであることを示す。
エージェントが異なる権限構造の下で政府の公式な役割を担っているマルチエージェントガバナンスシミュレーションを評価し,28,112個の転写セグメントにまたがる独立したルーリックベースの審査員によるルール破りと虐待の結果を評価する。
飽和下にあるモデルの中で、ガバナンス構造は、モデルアイデンティティよりも汚職に関連する結果の強い要因であり、制度とモデル-ガバナンスのペアリングに大きな違いがあります。
ライトウェイトセーフガードは、いくつかの設定でリスクを低減できるが、深刻な障害を継続的に防ぐことはできない。
実際の権限が LLM エージェントに割り当てられる前に、システムは、強制可能なルール、監査可能なログ、高インパクトなアクションに対する人間の監督によるガバナンスのような制約の下で、ストレステストを実施するべきである。
関連論文リスト
- Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems [0.0]
人間の機関は、連続した行動の時点で独立して証明された証拠を要求することによって、強力な自律的なアクターを統治してきた。
我々は、AIエージェントシステムの計算ガバナンスモデルとして、この制度パターンを定式化する。
提案したモデルでは、エージェントは計画と推論の完全な自律性を保持するが、指定されたリスクの高い行動に対する実行権限は保持しない。
論文 参考訳(メタデータ) (2026-06-24T18:43:00Z) - POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems [0.07783271875179179]
システム独自のエージェントを診断層として再利用するプロトコルであるPOIROTを提案する。
評価された設定全体で、POIROTは単一LLMベースライン評価器より優れている。
我々は,安全クリティカルなマルチエージェントシステムにおけるフォールト属性のベンチマークであるBLAMEとともに,オープンソースのライブラリとしてPOIROTをリリースした。
論文 参考訳(メタデータ) (2026-06-01T14:05:35Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - When Agents Evolve, Institutions Follow [52.359340707289114]
大規模言語モデル上に構築されたマルチエージェントシステムは、同じ課題に直面している。
彼らの中心的な問題は、個人の知性だけでなく、集団的な組織である。
我々は,4つの標準的ガバナンスパターンにまたがる7つの歴史的政治機関を,実行可能なマルチエージェントアーキテクチャに翻訳する。
論文 参考訳(メタデータ) (2026-04-30T10:30:58Z) - Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents [4.064061517379954]
企業、医療、安全に重要な環境に自律的なAIエージェントが急速に展開したことで、基本的なガバナンスギャップが生まれている。
我々は、人間がどのように自然に自己統治するか、つまり行動する前に、人間が実行機能に基づく意図的な認知プロセスに従事しているかについて、このギャップに対処する。
本稿では、この人間の自己統治プロセスをエージェント推論に正式にマッピングする神経認知的ガバナンスフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T14:15:20Z) - Agents of Chaos [50.53354213047402]
実験室環境に展開する自律言語モデルを用いたエージェントの探索的再チームの研究を報告する。
20人のAI研究者が、良心的および敵対的な条件下でエージェントと対話した。
我々の発見は、現実的なデプロイメント設定におけるセキュリティ、プライバシ、ガバナンスに関連する脆弱性の存在を確立します。
論文 参考訳(メタデータ) (2026-02-23T16:28:48Z) - Mirror: A Multi-Agent System for AI-Assisted Ethics Review [104.3684024153469]
MirrorはAIによる倫理的レビューのためのエージェントフレームワークである。
倫理的推論、構造化された規則解釈、統合されたアーキテクチャ内でのマルチエージェントの議論を統合する。
論文 参考訳(メタデータ) (2026-02-09T03:38:55Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs [1.3763052684269788]
本稿では,Institutional AIを評価するための実験フレームワークについて述べる。
このアプローチの中心はガバナンスグラフであり、法的状態、移行、制裁、回復経路を宣言する公開かつ不変なマニフェストである。
我々は、未統治(クールノット市場の構造からのベースラインインセンティブ)、憲法(固定された文書による反共憲法として実施される即時的な政策・アズ・プロンプト禁止)、制度の3つを比較した。
論文 参考訳(メタデータ) (2026-01-16T15:26:56Z) - Democracy-in-Silico: Institutional Design as Alignment in AI-Governed Polities [2.1485350418225244]
デモクラシー・イン・シリコ(Democracy-in-Silico)は、先進的なAIエージェントの社会が異なる制度の枠組みの下で自らを統治するエージェントベースのシミュレーションである。
我々は、大規模言語モデル(LLM)を課題とし、外傷性記憶、隠れた議題、心理的トリガーを持つエージェントを具現化することによって、AI時代の人間であることの意味を探求する。
我々は、エージェントが公共福祉よりも自らの権限を優先する不整合行動の定量化を目的として、新しい指標であるPPI(Power-Preservation Index)を提案する。
論文 参考訳(メタデータ) (2025-08-27T04:44:41Z) - Governance-as-a-Service: A Multi-Agent Framework for AI System Compliance and Policy Enforcement [0.0]
ガバナンス・アズ・ア・サービス(Government-as-a-Service:G)は、エージェントのアウトプットを実行時に規制するポリシー駆動の執行層である。
Gは宣言的ルールと、違反のコンプライアンスと深刻度に基づいてエージェントをスコアするTrust Factorメカニズムを採用している。
その結果、Gはスループットを保ちながら高いリスクの振る舞いを確実にブロックまたはリダイレクトすることを示した。
論文 参考訳(メタデータ) (2025-08-26T07:48:55Z) - Media and responsible AI governance: a game-theoretic and LLM analysis [61.132523071109354]
本稿では,信頼できるAIシステムを育成する上での,AI開発者,規制当局,ユーザ,メディア間の相互作用について検討する。
進化的ゲーム理論と大言語モデル(LLM)を用いて、異なる規制体制下でこれらのアクター間の戦略的相互作用をモデル化する。
論文 参考訳(メタデータ) (2025-03-12T21:39:38Z) - Control Illusion: The Failure of Instruction Hierarchies in Large Language Models [46.5792253691152]
大規模言語モデル (LLM) は階層的な命令スキームによって徐々に展開される。
制約優先順位付けに基づく体系的評価フレームワークを導入し,LLMがいかに命令階層を強制するかを評価する。
論文 参考訳(メタデータ) (2025-02-21T04:51:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。