論文の概要: When Should a Human Take Back Control? Optimal Delegation under Turbulent AI Risk
- arxiv url: http://arxiv.org/abs/2609.32083v1
- Date: Fri, 25 Sep 2026 23:43:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 03:21:04.481296
- Title: When Should a Human Take Back Control? Optimal Delegation under Turbulent AI Risk
- Title(参考訳): 人間はいつコントロールを取り戻すべきか? 乱流AIリスク下での最適なデリゲーション
- Abstract要約: 乱れたAIリスク下で適応的人間の監視を学習するための連続的時間フレームワークを導入する。
我々は、人間の行動、監視努力、人間-AI支援操作と完全なAIデリゲートの切り替えを組み合わせた制御問題を定式化する。
本稿では,カスケードリスクが介入や委譲にどのように影響するかを数値シミュレーションで検証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying AI systems requires deciding when to delegate tasks and when humans should intervene to monitor and mitigate risk induced by AI operations. These decisions are challenging when failures cluster: a hallucination or harmful output can trigger further errors, creating periods of elevated risk. We introduce a continuous-time framework for learning adaptive human oversight under such turbulent AI risk. Existing oversight and delegation formulations condition on history but do not model incident clustering, or its suppression by supervision effort, jointly with the delegation decision and this study fixes this gap. The self-exciting dynamics capture how risk events increase the likelihood of subsequent events, making their timing and history central to decision-making. We formulate a stochastic control problem combining human actions, monitoring effort, and switching between human-AI-assisted operation and full AI delegation, balancing operational rewards against oversight costs, and cascading AI-failures and induced uncertainty. Human participation is an endogenous component of risk management: the policy determines both when oversight is needed and how much effort to allocate. We study a relaxed switching formulation and propose Hawkes-PPO, a policy-gradient method that uses a bank of exponential filters of observed incident times. In a synthetic environment it attains a higher risk-adjusted objective than either fixed regime and approaches an approximate full-information oracle. We illustrate our results with numerical simulations by examining how cascade risks influence intervention and delegation, connecting reinforcement learning with adaptive human oversight of AI systems. In particular, we illustrate the benefit of our switching strategy and Hawkes-PPO algorithm to monitor the project efficiently along time, reducing turbulent risks occurrences and costs.
- Abstract(参考訳): AIシステムのデプロイには、タスクの委譲時期と、AI操作によって引き起こされるリスクを監視し緩和するために、人間が介入すべきタイミングを決定する必要がある。
幻覚や有害なアウトプットは、さらなるエラーを引き起こし、リスクが高くなる期間を生み出します。
このような乱暴なAIリスクの下で適応的人間の監視を学習するための継続的時間フレームワークを導入する。
既往来の監視・委任の定式化は, 事件のクラスタリングや監督による抑制をモデル化せず, 委任決定と共同で実施し, このギャップを解消する。
自己興奮のダイナミクスは、リスクイベントがその後の出来事の可能性を増大させる様子を捉え、そのタイミングと歴史を意思決定の中心にしている。
我々は、人間の行動、監視努力、人間のAI支援操作と完全なAI委譲の切り替え、監視コストに対する運用報酬のバランス、AI障害のカスケード、不確実性の誘発といった確率論的制御問題を定式化する。
人的参加は、リスク管理の内在的な要素であり、その方針は、いつ監視が必要か、どのくらいの労力を割くかを決定する。
本研究では, ゆるやかなスイッチングの定式化について検討し, 観測されたインシデント時間指数フィルタのバンクを用いたポリシグレート手法であるホークス-PPOを提案する。
合成環境では、固定された状態よりも高いリスク調整目標に達し、近似された完全な情報オラクルにアプローチする。
本稿では,カスケードリスクが介入や委譲にどのように影響するかを検証し,AIシステムの適応的人的監視と強化学習を結びつけて数値シミュレーションを行った。
特に、我々のスイッチング戦略とホークス-PPOアルゴリズムの利点について説明する。
関連論文リスト
- Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence [77.303673110294]
検証可能な報酬による強化学習は、数学やコードの推論を大幅に改善することができる。
しかし、人間の直接監督は、モデル生成体験のスケールと複雑さに追随することはできない。
本稿では,人間の指導が学習ループから徐々に遠ざかっていくにつれて,LRMがいかに改善していくかを検討する。
論文 参考訳(メタデータ) (2026-08-31T16:48:48Z) - Integrating Anomaly Detection into Agentic AI for Proactive Risk Management in Human Activity [1.6472101987306018]
我々は、転倒検出と転倒予測は異常検出問題として有用であり、エージェントAIシステムによりより効果的に対処できると主張している。
即時展開の技術的要件は,本論文の範囲を超えているが,本論文では潜在的な価値を強調する概念的枠組みを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:57:36Z) - Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5 [61.787178868669265]
この技術レポートは、サイバー犯罪、説得と操作、戦略上の詐欺、制御されていないAIR&D、自己複製の5つの重要な側面について、更新されきめ細かな評価を提示する。
この作業は、現在のAIフロンティアのリスクに対する理解を反映し、これらの課題を軽減するための集団行動を促します。
論文 参考訳(メタデータ) (2026-02-16T04:30:06Z) - Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse [50.87630846876635]
我々は9つの詳細なサイバーリスクモデルを開発する。
各モデルはMITRE ATT&CKフレームワークを使用して攻撃をステップに分解する。
個々の見積もりはモンテカルロシミュレーションによって集約される。
論文 参考訳(メタデータ) (2025-12-09T17:54:17Z) - Can Risk-taking AI-Assistants suitably represent entities [0.0]
本研究では,言語モデル(LM)におけるリスク回避の操作性について検討する。
性別固有の態度、不確実性、役割に基づく意思決定、リスク回避の操作性に焦点を当てている。
結果は、人間とAIのリスク選好をより良く整合させるために、AI設計を洗練するための方向性を示唆している。
論文 参考訳(メタデータ) (2025-10-09T11:55:31Z) - Human aversion? Do AI Agents Judge Identity More Harshly Than Performance [0.06554326244334868]
我々は,大規模言語モデルに基づくAIエージェントがどのように人間の入力を評価し,統合するかを検討する。
AIシステムは人間のアドバイスを体系的に減らし、アルゴリズムの誤りよりも人間の誤りを厳しく罰する。
論文 参考訳(メタデータ) (2025-03-31T02:05:27Z) - Two Types of AI Existential Risk: Decisive and Accumulative [3.5051464966389116]
本稿では,従来の「決定型AI x-リスク仮説」と「累積型AI x-リスク仮説」を対比する。
累積的な視点は、AIリスクに関する一見互換性のない視点を調整できる、と氏は主張する。
論文 参考訳(メタデータ) (2024-01-15T17:06:02Z) - Managing extreme AI risks amid rapid progress [171.05448842016125]
我々は、大規模社会被害、悪意のある使用、自律型AIシステムに対する人間の制御の不可逆的な喪失を含むリスクについて説明する。
このようなリスクがどのように発生し、どのように管理するかについては、合意の欠如があります。
現在のガバナンスイニシアチブには、誤用や無謀を防ぎ、自律システムにほとんど対処するメカニズムや制度が欠けている。
論文 参考訳(メタデータ) (2023-10-26T17:59:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。