論文の概要: Macro-Prudential AI Governance: A Two-Layer Early Warning and Response System for Frontier AI
- arxiv url: http://arxiv.org/abs/2607.03542v1
- Date: Fri, 03 Jul 2026 18:01:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:37:25.74318
- Title: Macro-Prudential AI Governance: A Two-Layer Early Warning and Response System for Frontier AI
- Title(参考訳): マクロプルーデンシャルAIガバナンス:フロンティアAIのための2層早期警戒応答システム
- Abstract要約: 本稿では,内部フロンティアAIのためのマクロプルーデンシャル早期警告応答システム(MEWRS)を提案する。
MEWRSは、フロンティアAIセクター全体で相関リスクの蓄積を検出し、カスケードが展開する前にコミットされたオフランプを生成するように設計されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier-AI governance today faces a problem structurally analogous to the one banking regulation faced pre-2008, and which post-2008 reforms (Basel III, Dodd-Frank) have since addressed. Two gaps recur: discovering a risk is not tantamount to acting on it, and individual-model review is unlike managing correlated build-up across the sector. Drawing on the Basel III framework and the U.S. financial-stability architecture, I propose a macro-prudential early warning and response system ("MEWRS") for internal frontier AI. These are systems deployed for labs' own internal research, testing, and production workflows, as distinct from externally released products. Layer A adapts the finder-coordinator-defender early-warning model to route structured reports on dual-use capabilities, autonomy indicators, and security compromises through a government clearinghouse to domain-specific defender working groups. Layer B calibrates operational controls via three quantitative buffer metrics, namely Effective Compute-at-Risk (ECAR), Cumulative Red-Team Hours (CRTH), and an Alignment Robustness Score (ARS), so that faster capability scaling automatically triggers stronger safeguards, analogously to how risk-weighted assets drive capital ratios under Basel III. I outline the reporting schema, map six Basel III mechanisms onto AI-governance analogues, identify seven failure modes with concrete mitigations, and sketch an exercise-based validation plan. MEWRS is designed to detect correlated risk build-ups across the frontier-AI sector and create pre-committed off-ramps before a cascade unfolds.
- Abstract(参考訳): 今日のフロンティア・AIガバナンスは、2008年以前の銀行規制と構造的に類似した問題に直面しており、2008年以降の改革(Basel III, Dodd-Frank)に対処している。
2つのギャップが再帰する: リスクを発見することは、それに取り組む上では重要ではなく、個別のモデルレビューは、セクター全体で相関したビルドアップを管理するのとは違う。
本稿では,Basel IIIフレームワークと米国金融安定アーキテクチャに基づいて,内部フロンティアAIのためのマクロプルーデンシャル早期警告応答システム(MEWRS)を提案する。
これらは研究室の内部調査、テスト、生産ワークフローのためにデプロイされたシステムであり、外部からリリースされた製品とは別物である。
レイヤAはファインダ-コーディネータ-ディフェンダ早期警戒モデルを適用して、二重利用能力、自律性指標、セキュリティ上の妥協に関する構造化されたレポートを、政府のクリアリングハウスからドメイン固有のディフェンダワーキンググループにルーティングする。
レイヤBは、ECAR(Effective Compute-at-Risk)、CRTH(Cumulative Red-Team Hours)、Arignment Robustness Score(Arignment Robustness Score)という3つの定量バッファメトリクスによる運用制御を校正する。
レポートスキーマの概要,6つのBasel IIIメカニズムをAI-Governanceアナログにマッピングし,具体的な緩和による7つの障害モードを特定し,エクササイズベースの検証計画をスケッチします。
MEWRSは、フロンティアAIセクター全体で相関リスクの蓄積を検出し、カスケードが展開する前にコミットされたオフランプを生成するように設計されている。
関連論文リスト
- SHARC: SHAP-Based Interpretability in Machine Learning Risk Models for Regulatory Capital under ICAAP and CCAR [0.0]
本稿では,Hybrid GPR-HSアーキテクチャに関する説明可能性フレームワークとそのストレステスト拡張について述べる。
ストレストバリュー・アット・リスクをベースライン、平均駆動、ボラティリティ駆動のコンポーネントに分解することで、シナリオ設計と資本成果の透過的な結合を可能にします。
SHARCは、FRTB、ICAAP Pillar 2、CCARの透明性要件と完全に監査可能で一貫性のあるハイブリッドGPR-HSフレームワークである。
論文 参考訳(メタデータ) (2026-07-06T16:45:11Z) - The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements [4.431419229831417]
エージェント型大規模言語モデルシステムは、パブリックドメインにますますデプロイされている。
これらのシステムを構築するために使用されるフレームワークが、アーキテクチャレベルの構造的安全性を保証するかどうかを問う。
論文 参考訳(メタデータ) (2026-06-11T01:46:26Z) - TRUST: A Framework for Decentralized AI Service v.0.1 [47.384270414446604]
大規模推論モデル (LRM) とマルチエージェントシステム (MAS) は, 信頼性の高い検証を必要とする。
TRUST(Transparent, Robust, and Unified Services for Trustworthy AI)は,3つのイノベーションを備えた分散フレームワークである。
我々は、悪質な俳優が損失を被っている間、正直な監査人の利益を確実に確保する安全利益理論を証明する。
論文 参考訳(メタデータ) (2026-04-29T19:32:58Z) - ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - A Dual-Path Generative Framework for Zero-Day Fraud Detection in Banking Systems [0.2864713389096699]
高周波銀行環境は、低遅延詐欺検出と規制説明可能性の間に重要なトレードオフに直面している。
伝統的な規則に基づく差別的モデルは、過度の階級不均衡と歴史的な前例の欠如のために「ゼロデイ」攻撃に苦しむ。
本稿では,オフライン学習からリアルタイムな異常検出を分離するデュアルパス生成フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T10:20:40Z) - BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search [72.87861928940929]
バウンダリ・アウェア・ポリシー・オプティマイゼーション(BAPO)は、信頼性の高い境界認識を精度を損なうことなく育成する新しいRLフレームワークである。
BAPOは2つの重要な要素を導入する: (i) グループベースの境界対応報酬(i) 推論が限界に達したときのみIDK応答を促進させる) 適応報酬変調器(ii) 早期探索中にこの報酬を戦略的に停止させ、モデルがIDKをショートカットとして利用するのを防ぐ。
論文 参考訳(メタデータ) (2026-01-16T07:06:58Z) - Automating Supply Chain Disruption Monitoring via an Agentic AI Approach [49.77982322940809]
我々は、自律的に監視し、分析し、拡張されたサプライネットワークにまたがる破壊に応答する、最小限の教師付きエージェントAIフレームワークを導入する。
F1スコアは0.962から0.991の間であり、破壊1回あたり0.0836ドルのコストで平均3.83分でエンドツーエンドの分析を行う。
論文 参考訳(メタデータ) (2026-01-14T18:28:31Z) - The Agentic Regulator: Risks for AI in Finance and a Proposed Agent-based Framework for Governance [6.107950696680386]
現在のモデルリスクフレームワークは、静的で明確に定義されたアルゴリズムとワンタイム検証を前提としている。
我々はこれらの技術を、複数の時間スケールに沿って伝播する分散アンサンブルとしてモデル化する。
我々は、監視を「規制ブロック」の4つの層に分解するモジュラーガバナンスアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-12-12T05:57:32Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Building a Foundational Guardrail for General Agentic Systems via Synthetic Data [76.18834864749606]
LLMエージェントは、計画段階で介入するマルチステップタスクを計画できる。
既存のガードレールは主にポスト・エグゼクティブ(英語版)を運用しており、スケーリングが困難であり、計画レベルで制御可能な監督を行う余地がほとんどない。
我々は、良性軌道を合成し、カテゴリーラベル付きリスクを困難に注入し、自動報酬モデルを介して出力をフィルタリングする制御可能なエンジンであるAuraGenを紹介する。
論文 参考訳(メタデータ) (2025-10-10T18:42:32Z) - Governance-as-a-Service: A Multi-Agent Framework for AI System Compliance and Policy Enforcement [0.0]
ガバナンス・アズ・ア・サービス(Government-as-a-Service:G)は、エージェントのアウトプットを実行時に規制するポリシー駆動の執行層である。
Gは宣言的ルールと、違反のコンプライアンスと深刻度に基づいてエージェントをスコアするTrust Factorメカニズムを採用している。
その結果、Gはスループットを保ちながら高いリスクの振る舞いを確実にブロックまたはリダイレクトすることを示した。
論文 参考訳(メタデータ) (2025-08-26T07:48:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。