論文の概要: Exploring Systems-Thinking Approaches to Loss of Control Risk
- arxiv url: http://arxiv.org/abs/2606.13474v1
- Date: Thu, 11 Jun 2026 15:27:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.885171
- Title: Exploring Systems-Thinking Approaches to Loss of Control Risk
- Title(参考訳): 制御リスクの損失に対するシステムシンキングアプローチの探索
- Authors: Aurelio Carlucci, Sean P. Fillingham, James Walpole, Jakub Kryś,
- Abstract要約: コーディングと研究のためのエージェントAIシステムの内部展開は、モデル行動を超えた社会技術制御問題を生み出す。
我々は、内部デプロイの損失を、AIによる変更を確実に制限、監査、リバース、または停止することができないものとして扱います。
確立されたシステムセーフティ手法が、モデルレベルの評価が見逃す可能性のあるリスクを識別できるかどうかを問う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Internal deployment of agentic AI systems for coding and research creates a sociotechnical control problem that extends beyond model behaviour. We treat internal-deployment Loss of Control as the inability to reliably constrain, audit, reverse, or halt AI-mediated changes to code, infrastructure, evaluation, or deployment processes in time to prevent serious organisational or societal harms. We ask whether established systems-safety methods can identify risks that model-level evaluations may miss. Using a generic frontier-lab coding-agent scenario reconstructed from public materials, we apply STECA, STPA, and FRAM. The analyses surface complementary findings: published frameworks can leave governance responsibilities and feedback loops externally unverifiable; delays in monitoring and intervention can make otherwise valid control actions ineffective; and routine operational variability can gradually erode the calibration and independence of safeguards. We argue that frontier-AI risk management should pair model-focused evaluations with systems-level hazard analysis and operational assurance that tracks whether controls remain effective over time.
- Abstract(参考訳): コーディングと研究のためのエージェントAIシステムの内部展開は、モデル行動を超えた社会技術制御問題を生み出す。
我々は、組織や社会の深刻な害を防ぐために、コード、インフラストラクチャ、評価、デプロイメントプロセスへのAIによる変更を確実に制限、監査、反転、停止することができないとして、内部デプロイメントの損失を扱います。
確立されたシステムセーフティ手法が、モデルレベルの評価が見逃す可能性のあるリスクを識別できるかどうかを問う。
公開資料から再構成した汎用フロンティアラブ符号化エージェントシナリオを用いて,STECA,STPA,FRAMを適用した。
公開されたフレームワークは、ガバナンスの責任とフィードバックループを外部から検証できないままにし、監視と介入の遅延は、他の方法では有効なコントロールアクションを無効にする。
我々は、フロンティアAIリスクマネジメントは、システムレベルのハザード分析と、時間とともにコントロールが有効であるかどうかを追跡する運用保証と、モデルに焦点を当てた評価を組み合わせるべきである、と論じる。
関連論文リスト
- Position: AI Safety Requires Effective Controllability [7.789894640525689]
我々は、AIの安全性は第一級の目的として制御性を必要とすると論じている。
OpenClawベースのエージェントによる実験では、現在のアライメントとガードレール機構がリスクを低減しているが、永続的で権威的で強制可能なランタイムコントロールの提供に失敗することが多い。
論文 参考訳(メタデータ) (2026-05-26T14:53:24Z) - Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability [79.08785366532287]
部分観測可能性下でのリスク感応制御のための軽量なリスクゲート強化学習近似を提案する。
安全クリティカルな部分観測可能な2つの領域 – 自動グルコース調節と安全制約ナビゲーション – でアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-14T01:23:09Z) - STAMP/STPA informed characterization of Factors Leading to Loss of Control in AI Systems [0.0]
コントロールの喪失を議論し、特徴付けるための、より構造化されたフレームワークの提供に着手しました。
我々は、この枠組みを用いて、AIを含む社会技術システムの安全な運用に責任を持つ人々を支援し、制御の喪失につながる因果的要因を特定する。
論文 参考訳(メタデータ) (2025-12-19T14:07:32Z) - How frontier AI companies could implement an internal audit function [0.0]
内部監査は、安全管理を強化する上で中心的な役割を果たす可能性がある。
本稿では、フロンティアAI開発者に有意義な保証を提供するために、内部監査機能を設計する方法について検討する。
論文 参考訳(メタデータ) (2025-12-16T20:36:58Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Systematic Hazard Analysis for Frontier AI using STPA [0.0]
現在、フロンティアAI企業は、ハザードを特定し分析するための構造化アプローチの詳細を記述していない。
システム理論プロセス分析(Systems-Theoretic Process Analysis)は、複雑なシステムがいかに危険に晒されるかを特定するための体系的な方法論である。
我々は、フロンティアAIシステムにおいて、スコープを広げ、トレーサビリティを向上し、安全性保証の堅牢性を強化する能力を評価する。
論文 参考訳(メタデータ) (2025-06-02T15:28:34Z) - Leveraging Traceability to Integrate Safety Analysis Artifacts into the
Software Development Process [51.42800587382228]
安全保証ケース(SAC)は、システムの進化中に維持することが困難である。
本稿では,ソフトウェアトレーサビリティを活用して,関連するシステムアーチファクトを安全解析モデルに接続する手法を提案する。
安全ステークホルダーがシステム変更が安全性に与える影響を分析するのに役立つように、システム変更の合理性を設計する。
論文 参考訳(メタデータ) (2023-07-14T16:03:27Z) - Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions [60.26921219698514]
CBFをベースとした安全クリティカルコントローラのモデル不確実性を考慮した再構成を提案する。
次に、結果の安全制御器のポイントワイズ実現可能性条件を示す。
これらの条件を利用して、イベントトリガーによるオンラインデータ収集戦略を考案する。
論文 参考訳(メタデータ) (2022-08-23T05:02:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。