論文の概要: The Undecidability of Artificial General Intelligence (AGI) Alignment
- arxiv url: http://arxiv.org/abs/2606.28639v1
- Date: Fri, 26 Jun 2026 22:51:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.628381
- Title: The Undecidability of Artificial General Intelligence (AGI) Alignment
- Title(参考訳): 人工知能(AGI)アライメントの不確定性
- Abstract要約: 本稿では,AGI(Artificial General Intelligence)の安全性の基本的な数学的限界を確立する。
AGIアライメントの非可視性理論と有限構造的非可視性理論という2つの中心的不可視性結果を通してこの境界を定式化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This article establishes the foundational mathematical limits of Artificial General Intelligence (AGI) safety, proving that the core barrier is not the impossibility of an aligned state, but its structural unverifiability. We formalize this boundary through two central impossibility results: the Unverifiability Theorem of Alignment and the Theorem of Finite Structural Unverifiability of AGI Alignment. We ground this boundary at Trakhtenbrot's Wall, demonstrating that contemporary engineering defenses relying on finite hardware or halting architectures fail to escape logical obstructions. This failure manifests as an inescapable triad of containment failures: open domains yield fundamental undecidability (Rice and Gödel); universal finite verification collapses into algorithmic incomputability (Trakhtenbrot); and particular bounded environments trap the supervisor within intractable bounds in the worst case. As a direct structural corollary of these results, we derive the Soundness--Completeness--Tractability Trilemma, establishing that the mutual incompatibility of these three properties is a necessary consequence of descriptive complexity rather than an empirical anomaly. Finally, we map these theoretical bounds onto practical AI engineering, demonstrating that modern containment strategies are not temporary patches, but mandatory sacrifices of logical expressivity required to secure decidable fragments of safety.
- Abstract(参考訳): 本稿では,AGI(Artificial General Intelligence)の安全性の基本的な数学的限界を確立し,コアバリアが整合状態の不合理性ではなく,構造的不合理性であることを証明した。
AGIアライメントの非可視性理論と有限構造的非可視性理論という2つの中心的不可視性結果を通してこの境界を定式化する。
我々は、この境界線をトラクテンブロットの壁(Trakhtenbrot's Wall)に置き、有限ハードウェアや停止アーキテクチャに依存する現代のエンジニアリングディフェンスが論理的妨害から逃れることができないことを実証した。
開領域は基本的不決定性(ライスとゲーデル)、普遍的有限検証はアルゴリズム的不計算性(トラクテンブロット)に崩壊する。
これらの結果の直接的な構造的系として、音性-完備性-トランクタビリティ・トリレムマ(英語版)を導出し、これらの3つの性質の相互不整合性は経験的異常というよりも記述的複雑性の必然的な結果であることを示す。
最後に、これらの理論的境界を実践的なAIエンジニアリングにマップし、現代の封じ込め戦略が一時的なパッチではなく、決定可能な安全性の断片を確保するために必要な論理的表現性の強制的な犠牲であることを実証する。
関連論文リスト
- Partial Identification under Causal Orders by Linear Programming [46.16293902963101]
反事実探索が関連する変数に対する部分的トポロジカル順序を誘導することを示す。
これにより、任意の反ファクトクエリとネストされた反ファクトクエリのバウンダリングが可能になる。
論文 参考訳(メタデータ) (2026-08-25T11:42:38Z) - Unsupervised Disentanglement Without Compromises : How Functional Orthogonality Enforces Identifiability [46.784084625532984]
本稿では,機能的観点からの非教師付き非教師付き非教師付き表現学習について検討する。
この条件は一般非線形生成モデルの識別可能性を示す。
論文 参考訳(メタデータ) (2026-06-19T12:47:07Z) - Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance [48.34904668359272]
大規模言語モデルに対するアドリアック攻撃は、広範な研究にもかかわらず、実用的影響が限られている。
本稿では,Greedy Coordinate Diffusion(GCD)について紹介する。
GCDは、敵の本来の意図に低い難易度と高い意味的固執を維持している。
論文 参考訳(メタデータ) (2026-06-14T01:18:53Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Trustworthy Agentic AI Requires Deterministic Architectural Boundaries [2.378211191937908]
現在のエージェントAIアーキテクチャは、高度な科学領域のセキュリティと要求と根本的に相容れない。
3つのメカニズムを通じてセキュリティを強制するトリニティ・ディフェンス・アーキテクチャを導入する。
疑わしい証明と決定論的調停がなければ、Lethal Trifecta'(信頼できない入力、特権データアクセス、外部アクション能力)は、認証セキュリティをエクスプロイト発見の問題にします。
論文 参考訳(メタデータ) (2026-02-10T16:33:40Z) - Non-Resolution Reasoning (NRR): A Computational Framework for Contextual Identity and Ambiguity Preservation [0.0]
現在の人工知能システムは、曖昧さを早期に解決する、基本的なアーキテクチャ上の限界を示す。
この早期のセマンティック崩壊は、標準的なニューラルネットワークに埋め込まれた古典的なアイデンティティの仮定に由来する。
あいまいさ保持を有効な推論モードとして扱う計算フレームワークであるNon-Resolution Reasoning (NRR)を提案する。
論文 参考訳(メタデータ) (2025-12-15T16:14:32Z) - Mutual Information Free Topological Generalization Bounds via Stability [46.63069403118614]
既存の戦略から離れる新しい学習理論フレームワークを導入する。
トラジェクトリ安定アルゴリズムの一般化誤差をTDA項で上界化できることを示す。
論文 参考訳(メタデータ) (2025-07-09T12:03:25Z) - On the Mathematical Impossibility of Safe Universal Approximators [0.0]
破滅的故障は有用な計算システムでは不可能な特徴であることを示す。
我々はこれを3段階の議論を通じて証明し、任意の種類の普遍近似器アーキテクチャのエスケープルートを残さない。
論文 参考訳(メタデータ) (2025-07-03T01:05:24Z) - The Alignment Trap: Complexity Barriers [0.0]
本稿は、AIアライメントは単に難しいだけでなく、基本的な論理的矛盾に基づくものである、と論じる。
私たちは、すべての必要な安全ルールを列挙できないため、マシンラーニングを正確に使用しています。
このパラドックスは、5つの独立した数学的証明によって確認される。
論文 参考訳(メタデータ) (2025-06-12T02:30:30Z) - Effective AGM Belief Contraction: A Journey beyond the Finitary Realm (Technical Report) [1.6590638305972631]
非有限論理におけるAGM収縮の計算可能性について検討する。
このような論理には無限に多くの計算不能な AGM 縮約関数が存在することを示す。
ファイニシャル領域を超えて計算可能性を制御するための新しいアプローチを提案する。
論文 参考訳(メタデータ) (2024-09-13T20:03:53Z) - A Causal Inspired Early-Branching Structure for Domain Generalization [46.55514281988053]
ドメイン不変セマンティック表現の学習は、ドメインの一般化を達成するために不可欠である。
標準的なトレーニングは、しばしば絡み合った意味とドメイン固有の特徴をもたらす。
これまでの研究は、因果的な観点から問題を定式化することを示唆している。
基本的なフレームワークを補完する2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-13T16:04:29Z) - Logical blocks for fault-tolerant topological quantum computation [55.41644538483948]
本稿では,プラットフォームに依存しない論理ゲート定義の必要性から,普遍的なフォールトトレラント論理の枠組みを提案する。
資源オーバーヘッドを改善するユニバーサル論理の新しいスキームについて検討する。
境界のない計算に好適な論理誤差率を動機として,新しい計算手法を提案する。
論文 参考訳(メタデータ) (2021-12-22T19:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。