論文の概要: Harmonizing AI Safety Thresholds
- arxiv url: http://arxiv.org/abs/2607.16112v1
- Date: Fri, 17 Jul 2026 16:45:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.909422
- Title: Harmonizing AI Safety Thresholds
- Title(参考訳): AI安全性の閾値を調和させる
- Authors: Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey,
- Abstract要約: 3つのリスク領域にまたがる調和しきい値の導出手法を開発する。
誤用リスクに対して、私たちは主要なプリミティブとして期待される害を捉え、明確なリスクモデリングアプローチを使用します。
自動AIR&Dでは、予測される害ではなく、観測されたAI進捗率に基づいて、提案したしきい値に基づいています。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Frontier AI companies have published capability thresholds that differ substantially, making it difficult for third parties to verify whether a threshold has been crossed or to compare requirements across companies. Moreover, without common minimum thresholds, risk mitigation may be inconsistent, creating a potential race to the bottom in safety standards. We develop a methodology for deriving harmonized thresholds across three risk domains. For misuse risks (cyber and biological), we take expected harm as the key primitive and use an explicit risk-modeling approach that accounts for risk channels and model release conditions. For automated AI R&D, we base our proposed threshold on the observed rate of AI progress rather than expected harm. Our analysis expands upon prior work and highlights existing empirical gaps and limitations.
- Abstract(参考訳): 最先端のAI企業は、大きく異なる機能しきい値を公開したため、サードパーティがしきい値が越えられたか、あるいは企業間で要求を比較することが難しくなっている。
さらに、一般的な最低限の閾値がなければ、リスク軽減は矛盾する可能性がある。
3つのリスク領域にまたがる調和しきい値の導出手法を開発する。
誤用リスク(サイバーと生物学的)については、主要なプリミティブとして期待される害を捉え、リスクチャネルとモデルリリース条件を考慮に入れた明確なリスクモデリングアプローチを使用します。
自動AIR&Dでは、予測される害ではなく、観測されたAI進捗率に基づいて、提案したしきい値に基づいています。
我々の分析は、以前の作業にもとづき、既存の経験的ギャップと限界を強調します。
関連論文リスト
- Toward Risk Thresholds for AI-Enabled Cyber Threats: Enhancing Decision-Making Under Uncertainty with Bayesian Networks [0.3151064009829256]
我々は、AIサイバーリスク閾値の開発と評価のための構造化アプローチを提案する。
まず、既存の業界におけるサイバーしきい値を分析し、共通しきい値要素を同定する。
第2に,AI可能なサイバーリスクをモデル化するためのツールとしてベイズネットワークを提案する。
論文 参考訳(メタデータ) (2026-01-23T23:23:12Z) - Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment [49.2305683068875]
本稿では,リスク認識を政策最適化プロセスに組み込んだ新しいアライメント手法であるリスク対応ステップワイドアライメント(RSA)を提案する。
RSAは、過剰なモデルシフトによって引き起こされるリスクを基準方針から緩和し、低確率で高影響の有害な振る舞いを明示的に抑制する。
実験により, 本手法は高い安全性を確保しつつ, 高い安全性を達成できることが確認された。
論文 参考訳(メタデータ) (2025-12-30T14:38:02Z) - Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse [50.87630846876635]
我々は9つの詳細なサイバーリスクモデルを開発する。
各モデルはMITRE ATT&CKフレームワークを使用して攻撃をステップに分解する。
個々の見積もりはモンテカルロシミュレーションによって集約される。
論文 参考訳(メタデータ) (2025-12-09T17:54:17Z) - The Role of Risk Modeling in Advanced AI Risk Management [33.357295564462284]
急速に進歩する人工知能(AI)システムは、新しい、不確実で、潜在的に破滅的なリスクをもたらす。
これらのリスクを管理するには、厳格なリスクモデリングの基盤となる成熟したリスク管理インフラストラクチャが必要です。
先進的なAIガバナンスは、同様の二重アプローチを採用するべきであり、検証可能な、確実に安全なAIアーキテクチャが緊急に必要である、と私たちは主張する。
論文 参考訳(メタデータ) (2025-12-09T15:37:33Z) - RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration [81.38705556267917]
大規模言語モデル(LLM)の既存の安全性評価手法は、固有の制約に悩まされている。
リスク概念空間を再構築する理論的枠組みを導入する。
マルチエージェント協調評価フレームワークRADARを提案する。
論文 参考訳(メタデータ) (2025-09-28T09:35:32Z) - Systematic Hazard Analysis for Frontier AI using STPA [0.0]
現在、フロンティアAI企業は、ハザードを特定し分析するための構造化アプローチの詳細を記述していない。
システム理論プロセス分析(Systems-Theoretic Process Analysis)は、複雑なシステムがいかに危険に晒されるかを特定するための体系的な方法論である。
我々は、フロンティアAIシステムにおいて、スコープを広げ、トレーサビリティを向上し、安全性保証の堅牢性を強化する能力を評価する。
論文 参考訳(メタデータ) (2025-06-02T15:28:34Z) - Adapting Probabilistic Risk Assessment for AI [0.0]
汎用人工知能(AI)システムは、緊急リスク管理の課題を示す。
現在の手法は、しばしば選択的なテストとリスク優先順位に関する未文書の仮定に依存します。
本稿では,AIフレームワークの確率的リスクアセスメント(PRA)を紹介する。
論文 参考訳(メタデータ) (2025-04-25T17:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。