論文の概要: Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.09766v1
- Date: Tue, 07 Jul 2026 06:40:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.185234
- Title: Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems
- Title(参考訳): AIエージェントのノーム強化:マルチエージェントシステムにおけるロバストな形状挙動
- Authors: Yaowen Ye, Jacob Steinhardt,
- Abstract要約: 言語モデルエージェントの規範執行機構について検討する。
単純な強制機構は、競争上の優位性のために、ミスアライメントされたエージェントによって悪用される。
本研究は,標準執行機構をエージェントの振る舞いを形作るスケーラブルなレバーとして位置づけるが,それらが支配するシステムの一部となることを期待する設計の場合のみである。
- 参考スコア(独自算出の注目度): 41.0957339989053
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents are increasingly deployed in shared environments where they pursue diverse goals and compete for rewards. This multi-agent competition can lead to behaviors that serve individual gains at collective cost -- for instance, marketing agents may post misleading content as a result of competing for engagement on social media. Human societies address such problems through norms that constrain acceptable behavior, supported by enforcement mechanisms that detect and penalize violations. Motivated by this, we study norm enforcement mechanisms for language model agents. We find that simple enforcement mechanisms are exploited by misaligned agents for competitive advantage, even when they are not explicitly trained or prompted to do so. We thus turn our attention to designing more robust mechanisms, and identify two key ingredients: estimating each agent's reliability over time, and updating this estimate with escalating penalties for repeated misbehavior. Across three simulated environments and a variety of agent populations, mechanisms built on these principles resist exploitation, while still penalizing norm violations at comparable or lower cost than baselines. Our results position norm enforcement mechanisms as scalable levers for shaping agents' behavior, but only when designed to anticipate becoming part of the system they govern. Our code and data are available at https://yaowenye.com/norm-enforcement.
- Abstract(参考訳): AIエージェントは、さまざまな目標を追求し、報酬を求めて競争する共有環境にますます配置される。
例えば、マーケティング担当者はソーシャルメディア上でのエンゲージメント競争の結果、誤解を招くコンテンツを投稿することができる。
人間社会は、違反を検知し罰する執行機構によって支持される、許容される行動を制限する規範を通じてそのような問題に対処する。
そこで本研究では,言語モデルエージェントの規範執行機構について検討する。
単純な執行機構は、明示的に訓練されていない場合や、そのように指示されていなくても、競争上の優位性のために、不正に調整されたエージェントによって悪用されることがわかりました。
そこで我々は、より堅牢なメカニズムの設計に注意を向け、各エージェントの信頼性を時間とともに見積もり、繰り返しの誤動作に対する罰則をエスカレートしてこの見積を更新する2つの重要な要素を特定した。
3つのシミュレートされた環境と様々なエージェント集団にまたがって、これらの原則に基づいて構築されたメカニズムは搾取に抵抗する一方で、標準違反をベースラインよりも同等または低いコストで罰する。
本研究は,標準執行機構をエージェントの動作を形作るスケーラブルなレバーとして位置づけるが,それらが支配するシステムの一部となることを期待する設計の場合のみである。
私たちのコードとデータはhttps://yaowenye.com/norm-enforcement.comで公開されています。
関連論文リスト
- Incentive Aware AI Regulations: A Credal Characterisation [14.228416693145649]
高度なMLアプリケーションは厳格な規制を要求するが、戦略的なMLプロバイダは開発コストを下げるためにそれらを回避していることが多い。
モデルから経験的証拠をマーケットシェアのライセンスにマッピングするフレームワークである。
非コンプライアンス分布の集合が不規則な確率測度の集合を形成する場合に限って、その機構が完全な市場結果を持つことを証明する。
論文 参考訳(メタデータ) (2026-03-05T13:42:19Z) - OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage [59.3826294523924]
オーケストレータ設定として知られる,一般的なマルチエージェントパターンのセキュリティ脆弱性について検討する。
本報告では,フロンティアモデルの攻撃カテゴリに対する感受性を報告し,推論モデルと非推論モデルの両方が脆弱であることが確認された。
論文 参考訳(メタデータ) (2026-02-13T21:32:32Z) - Institutional AI: A Governance Framework for Distributional AGI Safety [1.3763052684269788]
AIモデルのコア特性から生じる3つの構造的問題を同定する。
ソリューションはInstitutional AIであり、AIエージェント集団の効果的なガバナンスの問題としてアライメントを扱うシステムレベルのアプローチである。
論文 参考訳(メタデータ) (2026-01-15T17:08:26Z) - Governance-as-a-Service: A Multi-Agent Framework for AI System Compliance and Policy Enforcement [0.0]
ガバナンス・アズ・ア・サービス(Government-as-a-Service:G)は、エージェントのアウトプットを実行時に規制するポリシー駆動の執行層である。
Gは宣言的ルールと、違反のコンプライアンスと深刻度に基づいてエージェントをスコアするTrust Factorメカニズムを採用している。
その結果、Gはスループットを保ちながら高いリスクの振る舞いを確実にブロックまたはリダイレクトすることを示した。
論文 参考訳(メタデータ) (2025-08-26T07:48:55Z) - Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards
and Ethical Behavior in the MACHIAVELLI Benchmark [61.43264961005614]
我々は、50万以上のリッチで多様なシナリオを含む134個のChoose-Your-Own-Adventureゲームのベンチマークを開発する。
我々は、エージェントの傾向をパワー・シーキングと評価し、不使用を生じさせ、倫理的違反を犯す。
以上の結果から,エージェントは有能かつ道徳的に行動できることが示唆された。
論文 参考訳(メタデータ) (2023-04-06T17:59:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。