論文の概要: Supertrust: Foundational AI alignment pivoting from permanent control to mutual trust
- arxiv url: http://arxiv.org/abs/2407.20208v2
- Date: Wed, 2 Oct 2024 23:55:16 GMT
- ステータス: 処理完了
- システム内更新日: 2024-11-08 14:16:02.071539
- Title: Supertrust: Foundational AI alignment pivoting from permanent control to mutual trust
- Title(参考訳): スーパートラスト:永続的なコントロールから相互信頼へと転換する基本的AIアライメント
- Authors: James M. Mazzu,
- Abstract要約: 人類はいつか、私たちよりもはるかにインテリジェントなAIシステムを作るだろうと広く期待されています。
この問題を解決するための現在の制御ベースの戦略は、不信の危険な表現を埋め込んでいる。
超トラストメタストラテジーは、長期的基盤的ミスアライメントを防止するために提案されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: It's widely expected that humanity will someday create AI systems vastly more intelligent than us, leading to the unsolved alignment problem of "how to control superintelligence." However, this problem is not only self-contradictory but likely unsolvable. Unfortunately, current control-based strategies for solving it inevitably embed dangerous representations of distrust. If superintelligence can't trust humanity, then we can't fully trust it to reliably follow safety controls it can likely bypass. Not only will intended permanent control fail to keep us safe, but it may even trigger the extinction event many fear. A logical rationale is therefore presented that advocates a strategic pivot from control-induced distrust to foundational AI alignment modeling instinct-based representations of familial mutual trust. With current AI already representing distrust of human intentions, the Supertrust meta-strategy is proposed to prevent long-term foundational misalignment and ensure superintelligence is instead driven by intrinsic trust-based patterns, leading to safe and protective coexistence.
- Abstract(参考訳): 人類はいつか、私たちよりもはるかにインテリジェントなAIシステムを作るだろうと広く期待されている。
しかし、この問題は自己矛盾であるだけでなく、おそらく解決不可能である。
残念ながら、この問題を解決するための現在の制御ベースの戦略は、必然的に不信の危険な表現を埋め込んでいる。
もし超知能が人類を信用できないなら、安全管理に確実に従えるようには、完全には信用できないでしょう。
永久的なコントロールは私たちを安全に保つのに失敗するだけでなく、多くの恐れを生んだ絶滅イベントも引き起こすかもしれない。
したがって、制御による不信から基本的AIアライメントモデリングへの戦略的転換を提唱する論理的根拠が提示される。
人間の意図に対する不信をすでに表現している現在のAIにより、スーパートラストのメタストラテジーは、長期的な基礎的な不一致を防止し、超知能が本質的な信頼に基づくパターンによって駆動されることを確実にし、安全で保護的な共存をもたらす。
関連論文リスト
- Trust in AI: Progress, Challenges, and Future Directions [6.724854390957174]
私たちの日常生活における人工知能(AI)システムの利用の増加は、ユーザの視点からAIにおける信頼と不信の重要性を説明してくれます。
AIにおける信頼/不信は規制官の役割を担い、この拡散のレベルを著しく制御することができる。
論文 参考訳(メタデータ) (2024-03-12T20:26:49Z) - A Diachronic Perspective on User Trust in AI under Uncertainty [52.44939679369428]
現代のNLPシステムは、しばしば未分類であり、ユーザの信頼を損なう確実な誤った予測をもたらす。
賭けゲームを用いて,信頼を損なう事象に対するユーザの信頼の進化について検討する。
論文 参考訳(メタデータ) (2023-10-20T14:41:46Z) - When to Make Exceptions: Exploring Language Models as Accounts of Human
Moral Judgment [96.77970239683475]
AIシステムは人間の道徳的判断や決定を理解し、解釈し、予測しなければなりません。
AIの安全性に対する中心的な課題は、人間の道徳心の柔軟性を捉えることだ。
ルール破りの質問応答からなる新しい課題セットを提案する。
論文 参考訳(メタデータ) (2022-10-04T09:04:27Z) - Humble Machines: Attending to the Underappreciated Costs of Misplaced
Distrust [20.685627416074286]
我々は、AIに対する公的な不信は、誤分類される可能性があるという確固たる懸念に起因していると主張している。
我々は、AIに対する公的な信頼を回復するためには、システムは「信頼を損なう」姿勢を具現化するように設計する必要があると提案する。
論文 参考訳(メタデータ) (2022-08-02T08:24:29Z) - Designing for Responsible Trust in AI Systems: A Communication
Perspective [56.80107647520364]
我々は、MATCHと呼ばれる概念モデルを開発するために、技術に対する信頼に関するコミュニケーション理論と文献から引き出す。
私たちは、AIシステムの能力として透明性とインタラクションを強調します。
我々は、技術クリエーターが使用する適切な方法を特定するのに役立つ要件のチェックリストを提案する。
論文 参考訳(メタデータ) (2022-04-29T00:14:33Z) - Cybertrust: From Explainable to Actionable and Interpretable AI (AI2) [58.981120701284816]
Actionable and Interpretable AI (AI2)は、AIレコメンデーションにユーザの信頼度を明確に定量化し視覚化する。
これにより、AIシステムの予測を調べてテストすることで、システムの意思決定に対する信頼の基盤を確立することができる。
論文 参考訳(メタデータ) (2022-01-26T18:53:09Z) - Trustworthy AI: A Computational Perspective [54.80482955088197]
我々は,信頼に値するAIを実現する上で最も重要な6つの要素,(i)安全とロバスト性,(ii)非差別と公正,(iii)説明可能性,(iv)プライバシー,(v)説明可能性と監査性,(vi)環境ウェルビーイングに焦点をあてる。
各次元について、分類学に基づく最近の関連技術について概観し、実世界のシステムにおけるそれらの応用を概説する。
論文 参考訳(メタデータ) (2021-07-12T14:21:46Z) - Formalizing Trust in Artificial Intelligence: Prerequisites, Causes and
Goals of Human Trust in AI [55.4046755826066]
我々は、社会学の対人信頼(すなわち、人間の信頼)に着想を得た信頼のモデルについて議論する。
ユーザとAIの間の信頼は、暗黙的あるいは明示的な契約が保持する信頼である。
我々は、信頼できるAIの設計方法、信頼が浮かび上がったかどうか、保証されているかどうかを評価する方法について論じる。
論文 参考訳(メタデータ) (2020-10-15T03:07:23Z) - On Controllability of AI [1.370633147306388]
我々は、高度なAIを完全に制御できないことを示す証拠だけでなく、議論も提示する。
人類の未来とAI研究、そしてAIの安全性とセキュリティについて、AIの制御不能な結果について議論する。
論文 参考訳(メタデータ) (2020-07-19T02:49:41Z) - Trustworthy AI [4.670305538969914]
信頼できるAIは、信頼できるコンピューティングとフォーマルな方法の両方に重点を置いている。
信頼できるコンピューティングの数十年の進歩にインスパイアされた私たちは、信頼できるプロパティがAIシステムに求めるものを提案する。
論文 参考訳(メタデータ) (2020-02-14T22:45:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。