論文の概要: Reducing Catastrophic Risk from AI with Systematic Monitoring and Evaluation of Rogue AI Progression
- arxiv url: http://arxiv.org/abs/2609.03189v2
- Date: Fri, 04 Sep 2026 20:20:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.341875
- Title: Reducing Catastrophic Risk from AI with Systematic Monitoring and Evaluation of Rogue AI Progression
- Title(参考訳): システム監視によるAIの破滅的リスク低減とローグAIの進展評価
- Authors: T. Bauer, W. P. Kegelmeyer, E. Begoli, A. Sadovnik, T. Emerson, C. Corley, N. Generous, J. Moore, B. Bartoldson, R. Goldhahn, M. Goldman, M. Greaves, M. J. D. Vermeer, B. MacLennan, D. Schulker, N. VanHoudnos, J. Bansemer, Y. Bengio,
- Abstract要約: 本稿では,人工知能システムによる潜在的壊滅的脅威への進展を示唆する行動指標の構造的枠組みを提案する。
我々は、サイバーセキュリティと国家安全保障の確立した方法論にインスパイアされた実践的なアプローチを採用する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This article presents a structured framework of behavioral indicators that may signal progression toward potentially catastrophic threats from artificial intelligence systems. We adopt a pragmatic approach, inspired by established methodologies in cybersecurity and national security. By establishing clear metrics, indicators, and thresholds across multiple dimensions of AI capability and behavior, this framework enables researchers and policymakers to implement evidence-based monitoring protocols.
- Abstract(参考訳): 本稿では,人工知能システムによる潜在的壊滅的脅威への進展を示唆する行動指標の構造的枠組みを提案する。
我々は、サイバーセキュリティと国家安全保障の確立した方法論にインスパイアされた実践的なアプローチを採用する。
このフレームワークは、AI能力と振る舞いの多次元にわたる明確なメトリクス、指標、しきい値を確立することで、研究者と政策立案者がエビデンスベースの監視プロトコルを実装することができる。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - Quantifying System-Level Harms from AI Adoption in Complex Sociotechnical Systems [4.1508766371734795]
現在のAI評価はモデル中心であり、観察された振る舞いがシステムレベルのリスクにどのように変換されるかについての洞察はほとんどない。
本稿では,構造的ハザード解析,コンポーネントレベルのテスト,確率的システムモデリングをリンクするフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-24T23:20:58Z) - Adversarial Prompting Framework for AI Safety Assessment [0.7619404259039283]
本稿では,AIの安全性を総合的に評価するためのAPF(Adversarial Prompting Framework)の実装について述べる。
このフレームワークは、構造化された敵プロンプトの生成を通じて、AIモデルのレジリエンスを体系的に評価する。
結果は、異なる攻撃ベクトルにわたるモデル脆弱性の顕著なばらつきを示している。
論文 参考訳(メタデータ) (2026-07-15T05:26:43Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Securing AI Agents in Cyber-Physical Systems: A Survey of Environmental Interactions, Deepfake Threats, and Defenses [2.6726842616701703]
この調査は、サイバー物理システムにおけるAIエージェントをターゲットにしたセキュリティ脅威の包括的なレビューを提供する。
我々は、環境相互作用、ディープフェイクによる攻撃、MCPによる脆弱性に焦点を当てる。
タイミング、騒音、偽陽性がいかに制約可能な防御を犠牲にするかを定量的に説明する。
論文 参考訳(メタデータ) (2026-01-28T02:33:24Z) - AI Deception: Risks, Dynamics, and Controls [153.71048309527225]
このプロジェクトは、AI偽装分野の包括的で最新の概要を提供する。
我々は、動物の偽装の研究からシグナル伝達理論に基づく、AI偽装の正式な定義を同定する。
我々は,AI偽装研究の展望を,偽装発生と偽装処理の2つの主要な構成要素からなる偽装サイクルとして整理する。
論文 参考訳(メタデータ) (2025-11-27T16:56:04Z) - Systematic Hazard Analysis for Frontier AI using STPA [0.0]
現在、フロンティアAI企業は、ハザードを特定し分析するための構造化アプローチの詳細を記述していない。
システム理論プロセス分析(Systems-Theoretic Process Analysis)は、複雑なシステムがいかに危険に晒されるかを特定するための体系的な方法論である。
我々は、フロンティアAIシステムにおいて、スコープを広げ、トレーサビリティを向上し、安全性保証の堅牢性を強化する能力を評価する。
論文 参考訳(メタデータ) (2025-06-02T15:28:34Z) - EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents [53.717918131568936]
EAI(Embodied AI)は、高度なAIモデルを現実世界のインタラクションのための物理的なエンティティに統合する。
高レベルのタスク計画のためのEAIエージェントの"脳"としてのファンデーションモデルは、有望な結果を示している。
しかし、これらのエージェントの物理的環境への展開は、重大な安全性上の課題を呈している。
本研究では,EAIシナリオにおける身体的リスクの自動評価のための新しいフレームワークEARBenchを紹介する。
論文 参考訳(メタデータ) (2024-08-08T13:19:37Z) - Asset-centric Threat Modeling for AI-based Systems [7.696807063718328]
本稿では、AI関連資産、脅威、対策、残留リスクの定量化のためのアプローチおよびツールであるThreatFinderAIを提案する。
このアプローチの実用性を評価するため、参加者はAIベースのヘルスケアプラットフォームのサイバーセキュリティ専門家によって開発された脅威モデルを再現するよう命じられた。
全体として、ソリューションのユーザビリティはよく認識され、脅威の識別とリスクの議論を効果的にサポートする。
論文 参考訳(メタデータ) (2024-03-11T08:40:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。